Pular para o conteúdo principal

Perfil de empresa / Serviços de Nuvem Globais

Para treinar o GPT-4, OpenAI transcreveu mais de um milhão de horas de vídeos do YouTube

O artigo é rastreado como uma instituição de infraestrutura de internet dentro do ecossistema de infraestrutura de internet.

Para treinar o GPT-4, OpenAI transcreveu mais de um milhão de horas de vídeos do YouTube
Categoria
Empresa

O artigo é rastreado como uma instituição de infraestrutura de internet dentro do ecossistema de infraestrutura de internet.

Foco no Sinal
Governança
Tipo de conteúdo
Perfil
Domínio Primário
Mercado
Tópico
Governança
Impacto
Médio

Sinais de fontes públicas apoiam o monitoramento de impacto médio para visibilidade de infraestrutura e análise de dependências.

Confiança
Guia de pontuação de confiança
Confiança limitada (80%)

Várias fontes públicas

O artigo 'Para treinar o GPT-4, OpenAI transcreveu mais de um milhão de horas de vídeos do YouTube' é perfilado pela BTW Media porque evidências publicadas o vinculam a infraestrutura de internet, governança, dependências operacionais ou visibilidade de mercado.

  • Google confirmou relatórios não confirmados sobre a atividade no YouTube daOpenAI, afirmando que seus arquivos robots.txt e termos de uso proíbem a raspagem ou download não autorizado de conteúdo.
  • Meta enfrentou limitações na disponibilidade de dados de treinamento e preocupações com a privacidade após o escândalo da Cambridge Analytica. A empresa considerou comprar licenças de livros ou adquirir uma editora para alcançar a OpenAI, e enfrentou restrições no uso de dados de consumidores.

O Wall Street Journal afirmou no início desta semana que as empresas de IA estão enfrentando um obstáculo na coleta de dados de treinamento de alta qualidade. O New York Times detalhou algumas das maneiras como as empresas estão lidando com esse problema.

OpenAI precisa de dados de treinamento

Desesperada por dados de treinamento, a OpenAI desenvolveu o modelo de transcrição de áudio Whisper para superar os obstáculos, transcrevendo mais de um milhão de horas de vídeos do YouTube para treinar seu modelo de linguagem de última geração, GPT-4. Segundo o New York Times, a empresa sabia que isso seria problemático legalmente, mas considerou como uso justo. A porta-voz da OpenAI, Lindsay Held, disse ao The Verge que a empresa reúne conjuntos de dados 'únicos' para cada um de seus modelos para 'ajudá-los a entender o mundo' e manter sua pesquisa global competitiva.

De acordo com o artigo do Times, a empresa ficou sem dados relevantes em 2021 e mencionou a transcrição de podcasts, audiolivros e vídeos do YouTube como um plano de contingência. Na época, o Google usou informações do Quizlet, um banco de dados de jogos de xadrez, e código de computador do Github para treinar seus modelos.

Leia também:Meta nega ter permitido que a Netflix acessasse informações privadas de usuários

A resposta do Google

O porta-voz do Google, Matt Bryant, disse ao The Verge em um e-mail que a empresa 'viu relatórios não confirmados', acrescentando que 'nosso arquivo robots.txt e nossos termos de uso proíbem a raspagem ou download não autorizado de conteúdo do YouTube', refletindo os termos de uso da empresa. Bryant disse que o Google toma 'medidas técnicas e legais' para impedir tal uso não autorizado 'quando temos uma base legal ou técnica clara para fazê-lo'.

O departamento jurídico do Google pediu à equipe de privacidade da empresa que ajustasse a linguagem de sua política para expandir o tratamento de dados de consumidores, como ferramentas de escritório como o Google Docs, escreve o Times. O Google teria a intenção de publicar a nova política em 1º de julho para aproveitar a distração do fim de semana do Dia da Independência.

Leia também:Ferramenta de clonagem de voz da OpenAI imita sua voz com uma amostra de 15 segundos

A resposta da Meta

A Meta também enfrentou as limitações da disponibilidade de bons dados de treinamento e, em gravações ouvidas pelo Times, sua equipe de IA discute o problema de usar obras protegidas por direitos autorais sem permissão enquanto tenta alcançar a OpenAI. A empresa considerou medidas como pagar licenças de livros ou até mesmo adquirir uma grande editora. As reformas de privacidade da empresa após o escândalo da Cambridge Analytica também aparentemente limitaram a forma como ela usa dados de consumidores.

Google, OpenAI e o campo mais amplo do treinamento de IA lutam contra a rápida diminuição dos dados de treinamento para seus modelos, e quanto mais dados esses modelos absorvem, melhor. O Journal escreveu esta semana que até 2028, as empresas podem superar a criação de novo conteúdo.

O Journal sugere maneiras de resolver o problema dos erros de modelo, incluindo dados sintéticos ou aprendizagem por curso. No entanto, nenhum desses métodos é comprovado. As empresas podem usar tudo o que encontrarem, com ou sem permissão, mas isso é repleto de litígios.

Em resumo

  • Nome: Para treinar o GPT-4, OpenAI transcreveu mais de um milhão de horas de vídeos do YouTube
  • Base: Global
  • Foco do perfil:

O que faz

  • Registros públicos apoiam o monitoramento de seu papel, serviços e relacionamentos-chave.

Por que isso importa

  • Sinais de fontes públicas apoiam o monitoramento de impacto médio para visibilidade de infraestrutura e análise de dependências.
  • Criticidade operacional: Médio
  • Horizonte temporal: Próximo trimestre

O que assistir

  • O monitoramento foca na continuidade verificada do serviço, nas mudanças de governança e nos sinais de relacionamento.
AgoraMédio prioridade

Acompanhe atualizações verificadas de fontes, mudanças de função e evidências públicas atuais.

TrimestreMédio Sensibilidade de política

Sinais de fontes públicas apoiam o monitoramento de impacto médio para visibilidade de infraestrutura e análise de dependências.

YearPróximo trimestre Perspectiva

A relevância de longo prazo depende de mudanças verificadas nas operações, políticas e relacionamentos.

Briefing para Membros

Contexto de Perfil mais Aprofundado

Faça login com o nível de associação correto para desbloquear o briefing completo e as notas de origem.

Apenas para Strategic Circle

Strategic Circle

Aberto a todos os leitores. Desbloqueie Briefings de Perfil após se inscrever e fazer login.

Junte-se ao Strategic Circle

Somente para Leadership Alliance

Leadership Alliance

Para proprietários e gestores qualificados de ativos de IP; faça login para desbloquear os briefings da Leadership Alliance.

Junte-se ao Leadership Alliance
VoltarTodas as empresas