• Tumblr e WordPress.com estão atualmente em negociações para fornecer dados de usuários a empresas de IA como OpenAI e Midjourney.
  • The New York Times está atualmente processando a OpenAI por supostamente usar seu vasto arquivo sem autorização para treinar chatbots.

O uso de dados extraídos da Internet tornou-se um assunto controverso, com empresas explorando conteúdo público para treinar seus poderosos modelos generativos. Essa prática desencadeou batalhas legais, pois organizações como The New York Times eGetty Imagesexpressaram preocupações sobre o uso não autorizado de seu conteúdo.

Batalhas legais sobre o uso de dados

Um dos casos marcantes envolve a OpenAI, que está atualmente sendo processada pelo The New York Times por supostamente usar o arquivo do jornal sem autorização para treinar chatbots. Em resposta, a OpenAI acusou o Times de recorrer a táticas duvidosas para provar suas alegações. Da mesma forma, a Getty Images entrou com uma ação contraStable Diffusionpor violação de direitos autorais relacionada ao uso de seu conteúdo visual.

As implicações dos sistemas de IA que exploram o trabalho de jornalistas, músicos e fotógrafos vão além das disputas legais. A busca por grandes quantidades de dados de treinamento levantou preocupações sobre a potencial exploração de criadores de conteúdo online. Plataformas como Tumblr e WordPress.com supostamente estiveram em negociações para vender dados de usuários a empresas de IA como OpenAI e Midjourney, levantando questões sobre privacidade de dados e propriedade.

Leia também:O chatbot Bard do Google recebe a atualização Gemini Pro globalmente

Parcerias no compartilhamento de dados

Enquanto algumas entidades optaram por litígios, outras escolheram estabelecer parcerias. A Associated Press licenciou parte de seu arquivo para a OpenAI, enquanto a Shutterstock assinou um acordo de seis anos com a empresa de IA para fornecer acesso à sua vasta biblioteca de fotos, vídeos e música.

O Reddit, conhecido por sua riqueza em conteúdo gerado por usuários, recentemente fechou um acordo com o Google, concedendo ao gigante da tecnologia acesso à sua API para treinamento de modelos de IA. Essa medida destaca o valor das contribuições dos usuários às plataformas e as considerações éticas em torno do uso dos dados.

Leia também:OpenAI lança a GPT Store para chatbots de IA pessoais sem codificação

Práticas generalizadas de treinamento de dados

A prática generalizada de treinar modelos de IA com dados públicos da Internet vai além dos acordos específicos mencionados no artigo. Uma investigação recente do Washington Post revelou um tesouro de dados extraídos de várias fontes, incluindo fóruns online, plataformas de crowdfunding e sites de mídia social. Empresas como Meta, anteriormente Facebook, também exploraram postagens públicas de suas plataformas para melhorar as capacidades de IA.

O debate sobre a propriedade dos dados e o consentimento permanece sem solução. Os criadores de conteúdo, sejam blogs de nicho ou plataformas populares de mídia social, enfrentam a perspectiva de ver seu trabalho ser mercantilizado para fins de treinamento de IA. O equilíbrio entre inovação e práticas éticas de dados é crucial para moldar o futuro do desenvolvimento da IA e seu impacto nos ecossistemas digitais.