• Automattic está prestes a finalizar um acordo para fornecer dados para o treinamento de modelos de empresas de IA.
  • Os acordos de treinamento de dados de IA se tornaram uma oportunidade lucrativa para sites que lutam para se manter à tona no cenário escorregadio da publicação online atual.

TumblreWordPress.comestão prestes a fechar acordos para vender dados de usuários para as empresas de inteligência artificialOpenAIeMidjourney. De acordo com relatos da 404 Media, a Automattic, empresa-mãe das duas plataformas, está finalizando um acordo para fornecer dados para o treinamento de modelos de IA.

Natureza problemática dos dados no acordo

A natureza exata dos dados a serem incluídos no acordo permanece incerta, mas uma comunicação interna supostamente do gerente de produto do Tumblr, Cyle Gage, levantou preocupações sobre a abrangência dos dados que estão sendo preparados para a transferência. O relatório indica que os dados podem ter incluído informações privadas ou relacionadas a parceiros que não deveriam fazer parte do acordo. Isso teria incluído postagens privadas em artigos de blog públicos, blogs excluídos ou suspensos, perguntas não respondidas, respostas privadas, conteúdo explícito e material de blogs parceiros premium.

Leia também:OpenAI corrige a 'preguiça' do GPT-4 com novas atualizações

Resposta e compromisso da Automattic

Quando contatada para comentar, a Automattic respondeu com uma declaração publicada, enfatizando que apenas conteúdos públicos hospedados no WordPress.com e no Tumblr de sites que não optaram por não participar serão compartilhados. A empresa também destacou seu compromisso em respeitar todas as configurações de exclusão e anunciou sua intenção de lançar uma nova ferramenta de exclusão destinada a permitir que os usuários bloqueiem terceiros, incluindo empresas de IA, de treinar com seus dados.

Defesa pela exclusão de dados de usuários

Uma suposta FAQ interna preparada pela Automattic para a nova ferramenta de exclusão sugere que a empresa advogará ativamente pela exclusão de dados a pedido do usuário. Embora a linguagem usada no documento para descrever esse processo como 'solicitar' e 'defender' possa causar estranheza, Andrew Spittle, responsável pela IA na Automattic, disse estar confiante de que as empresas de IA atenderão a essas solicitações com base em conversas anteriores.

Leia também:O CEO da OpenAI, Sam Altman, e o presidente da Câmara dos Representantes dos EUA navegam pelos desafios da regulamentação de IA no Capitólio

Desafios enfrentados por Tumblr e WordPress.com

O contexto desses acordos potenciais é o cenário em rápida evolução da publicação online, onde os sites buscam novas fontes de receita para se manter à tona. O Tumblr, em particular, enfrentou seus desafios, tendo supostamente reduzido sua equipe ao mínimo no final de 2023. Esse contexto destaca a importância de tais acordos de dados para plataformas como Tumblr e WordPress.com.

Em um contexto industrial mais amplo, esta notícia se soma à tendência crescente de empresas de IA buscarem explorar conteúdo gerado por usuários para treinar seus modelos. Recentemente, o Google fechou um acordo com o Reddit, e a OpenAI tem buscado ativamente parcerias para coletar conjuntos de dados para treinamento de modelos de IA.