Pesquisadores do Google e Stanford são um registro público baseado em evidências de artigos, contexto de objeto, links de eventos e contexto de relacionamento.
Pesquisadores do Google e Stanford são rastreados como um assunto com respaldo de fontes conectado à cobertura de mercado.
Guia de pontuação de confiança
Reportagens publicadas
Um desenvolvimento recente do Google DeepMind e da Universidade Stanford apresenta o Search-Augmented Factuality Evaluator (SAFE), uma ferramenta projetada para verificar fatos em longas respostas de chatbots de IA. O SAFE utiliza um processo de várias etapas, incluindo segmentação, correção e comparação com os resultados de pesquisa do Google, alcançando uma taxa de precisão de 76% na verificação de fatos controversos. Esta inovação não apenas melhora a precisão das respostas geradas por IA, mas também apresenta vantagens econômicas, sendo mais de 20 vezes mais barata do que a anotação manual.
Independentemente da potência dos chatbots de IA atuais, eles tendem a adotar um comportamento muito criticado de fornecer aos usuários respostas um tanto convincentes, mas factualmente imprecisas. Em suma, a IA às vezes "descarrila" em suas respostas, chegando a "propagar rumores". Impedir tal comportamento em grandes modelos de IA não é uma tarefa fácil e constitui um desafio técnico. No entanto, de acordo com a mídia estrangeira Marktechpost, o Google DeepMind e a Universidade Stanford parecem ter encontrado uma solução alternativa.
Leia também: A loja GPT da OpenAI não atende às expectativas Leia também: Agências federais dos EUA agora devem ter um responsável pela IA A ferramenta é baseada no Search-Augmented Factuality Evaluator (SAFE). Os pesquisadores apresentaram uma ferramenta baseada em grandes modelos de linguagem, o Search-Augmented Factuality Evaluator (SAFE), capaz de verificar fatos em longas respostas geradas por chatbots. Seus resultados de pesquisa, bem como o código experimental e os conjuntos de dados, foram tornados públicos, clique aqui para ver.
O sistema analisa, processa e avalia as respostas geradas pelos chatbots em quatro etapas para verificar a precisão e autenticidade: segmentação das respostas em elementos individuais para verificação, correção do conteúdo acima e, em seguida, comparação com os resultados de pesquisa do Google. Em seguida, o sistema também verifica a relevância de cada fato em relação à pergunta original. Os pesquisadores criaram um conjunto de dados chamado LongFact para avaliar seu desempenho.
Para avaliar seu desempenho, os pesquisadores criaram um conjunto de dados chamado LongFact contendo cerca de 16.000 fatos e testaram o sistema em 13 grandes modelos de linguagem de Claude, Gemini, GPT e PaLM-2. Os resultados mostram que na análise direcionada de 100 fatos controversos, a precisão de julgamento do SAFE atinge 76% após um exame mais aprofundado. Ao mesmo tempo, a estrutura também apresenta vantagens econômicas: é mais de 20 vezes mais barata do que a anotação manual.
Briefing de Sinal
- Sinal: Pesquisadores do Google e Stanford lançam ferramenta de verificação de fatos com IA
- Tipo de Sinal: Mercado
- Região: Global
- Classe de Mercado: Tendências Institucionais Globais
Presença Operacional
- As fontes publicadas devem identificar as partes afetadas, a abrangência operacional e a exposição de mercado antes que este mapa de tendências seja considerado completo.
Contexto de Mercado
- Relevância operacional: Médio
- Horizonte temporal: Próximo trimestre
O que assistir
- Fique atento a declarações oficiais, atualizações regulatórias, exposição de clientes ou parceiros e divulgações de acompanhamento.
Briefing para Membros
Contexto de Tendência Aprofundado
Faça login com o nível de associação correto para desbloquear o briefing completo e as notas de origem.
Apenas para Strategic Circle
Strategic Circle
Aberto a todos os leitores. Desbloqueie Briefings de tendências após se inscrever e fazer login.
Junte-se ao Strategic CircleSomente para Leadership Alliance
Leadership Alliance
Para operadores, investidores e equipes de políticas que precisam de evidências de relacionamento, caminhos de falha e notas de origem. Faça login para desbloquear.
Junte-se ao Leadership Alliance
