A tecnologia ChatGPT da OpenAI se tornou viral em menos de um ano e já impacta os modos de trabalho e o futuro da indústria.
A tecnologia ChatGPT da OpenAI se tornou viral em menos de um ano e já impacta os modos de trabalho e o futuro da indústria. Em algumas das maiores empresas mundiais, quase metade dos funcionários já usa esse tipo de tecnologia no dia a dia. Inúmeras empresas investiram na área de IA, correndo para lançar novos produtos, especialmente na internet, educação, jogos e outros setores em crescimento.
É sabido que os dados usados para treinar grandes modelos de linguagem (LLM) e outros modelos de transformação que sustentam produtos como ChatGPT, Stable Diffusion e Midjourney originavam-se de fontes humanas. Essas fontes incluem livros, artigos, fotografias e outras obras totalmente originais do ser humano.
O tamanho dos parâmetros dos modelos em grande escala não para de crescer, passando de bilhões para dezenas de bilhões, depois para centenas de bilhões. A essa explosão soma-se a quantidade de dados necessários para treinar a IA, que aumenta exponencialmente. Tomemos o exemplo do GPT da OpenAI: do GPT-1 ao GPT-3, o tamanho do conjunto de dados de treinamento passou de 4,5 GB para 570 GB.
Recentemente, na conferência Data+AI organizada pela Databricks, Marc Andreessen, fundador da a16z, estimou que os dados massivos acumulados pela internet nas últimas duas décadas são uma razão importante para o surgimento de uma nova onda de IA. Ele considera os dados como excelentes fontes de material de aprendizado para o treinamento da IA.
No entanto, apesar da enorme quantidade de dados úteis e inúteis deixados pelos usuários na web, esses dados podem em breve se esgotar para o treinamento da IA.
Um artigo publicado pela Epoch, uma organização de pesquisa e previsão em inteligência artificial, prevê que os dados textuais de alta qualidade serão esgotados entre 2023 e 2027.
Embora a equipe de pesquisa reconheça que os métodos de análise apresentam sérias limitações e que as imprecisões do modelo são altas, é difícil negar que a IA consome conjuntos de dados a um ritmo alarmante.
Recentemente, pesquisadores da University of Cambridge, University of Oxford, University of Toronto e outras universidades publicaram um artigo destacando que o uso de conteúdo gerado por IA para treinar IA pode levar ao colapso dos novos modelos.
Os pesquisadores concluíram: «O aprendizado a partir de dados gerados por outros modelos leva ao colapso do modelo – um processo de degradação no qual o modelo esquece a verdadeira distribuição de dados subjacente ao longo do tempo. Esse processo é inevitável, mesmo em uma situação de treinamento ideal por um longo período.»
Qual é a razão pela qual o uso de «dados gerados» para treinar a IA provoca o colapso do modelo? Existe uma maneira de impedi-lo?
Neste estágio, a IA ainda está na imitação primitiva do pensamento humano e seu núcleo continua sendo um programa estatístico. Os pesquisadores acreditam que o treinamento da IA com conteúdo gerado por IA produzirá um «erro de aproximação estatística». De fato, durante o processo estatístico, o conteúdo com maior probabilidade é mais reforçado, e o conteúdo com menor probabilidade é continuamente ignorado, o que é a principal causa do colapso do modelo.
Isso afeta o desempenho, a confiabilidade e a segurança do modelo. Os pesquisadores alertam que o colapso do modelo é um fenômeno grave que requer a atenção dos desenvolvedores de LLM e dos usuários. «Acreditamos que esse problema se tornará um dos principais desafios para a comunidade de aprendizado de máquina nos próximos anos», disseram.
Mas nem toda esperança está perdida.
A primeira abordagem é o isolamento dos dados. Para lidar com o colapso do modelo, a equipe de pesquisa sugere separar as fontes de dados propriamente gerados por humanos do conteúdo gerado por IA para evitar a contaminação dos dados limpos pela IA generativa (AIGC).
A segunda é o uso de dados sintéticos. Na verdade, os dados gerados especificamente para IA já são amplamente utilizados para o treinamento de IA. Para alguns profissionais, a preocupação atual sobre dados gerados por IA levarem ao colapso do modelo pode ser exagerada. Portanto, o chave é estabelecer um sistema eficaz para confirmar a parte válida dos dados gerados por IA e fornecer feedback baseado na eficácia do modelo treinado. O uso de dados sintéticos pela OpenAI para o treinamento de modelos tornou-se um consenso na indústria de IA.
Em conclusão, apesar do problema do esgotamento dos dados humanos, o treinamento da IA não está sem soluções. Através do isolamento dos dados e do uso de dados sintéticos, o problema do colapso do modelo pode ser efetivamente superado e o desenvolvimento contínuo da IA pode ser garantido.

