• Search-Augmented Factuality Evaluator (SAFE) é um método que utiliza um grande modelo de linguagem (LLM) para decompor o texto gerado em fatos individuais.
  • Este sistema de IA “super-humano” pode melhorar a verificação de fatos, a eficiência de custos e a precisão.
  • Gary Marcus, um eminente pesquisador de IA, sugeriu que “super-humano” poderia simplesmente significar melhor que um trabalhador mal pago, em vez de um verdadeiro verificador de fatos especialista.

Google DeepMind revelou um sistema de IA “super-humano” capaz de superar verificadores de fatos humanos na avaliação da precisão de informações geradas por grandes modelos de linguagem.

Search-Augmented Factuality Evaluator (SAFE)

Este estudo, intitulado “Long-form factuality in large language models”, apresenta SAFE como um método para decompor o texto gerado em fatos individuais usando grandes modelos de linguagem. Em seguida, utiliza os resultados do Google Search para determinar a precisão de cada afirmação.

Os pesquisadores compararam SAFE a anotadores humanos em um conjunto de dados contendo cerca de 16.000 fatos e descobriram que as avaliações do SAFE correspondiam às avaliações humanas em 72% dos casos. Ainda mais impressionante, quando as avaliações do SAFE e dos humanos divergiam, o julgamento do SAFE estava correto em 76% dos casos.

Leia também:Microsoft contrata cofundador do DeepMind, Mustafa Suleyman, como CEO de sua nova unidade de IA

O desempenho “super-humano” gera controvérsia

Enquanto os pesquisadores afirmam que agentes de grandes modelos de linguagem podem atingir desempenhos de avaliação “super-humanos”, alguns especialistas questionam o real significado de “super-humano” nesse contexto.

O pesquisador de IA Gary Marcus sugere que “super-humano” poderia simplesmente significar melhor que um trabalhador mal pago, em vez de um verdadeiro verificador de fatos especialista.

Marcus argumenta que comparar o SAFE a verificadores de fatos especialistas humanos é crucial para realmente demonstrar seu desempenho super-humano.

Vantagens do SAFE

Uma vantagem óbvia do SAFE é o custo – os pesquisadores descobriram que o uso do sistema de IA era cerca de 20 vezes mais barato do que recorrer a verificadores de fatos humanos. À medida que o volume de informações continua a crescer, é cada vez mais importante adotar uma abordagem de baixo custo e alto rendimento.

A equipe do DeepMind também usou o SAFE para avaliar a precisão factual de 4 famílias (Gemini, GPT, Claude e PaLM-2) de 13 modelos de linguagem de ponta. Eles descobriram que modelos maiores geralmente produzem menos erros factuais.

No entanto, mesmo os modelos mais performáticos ainda produziram um grande número de declarações falsas.

Isso destaca o risco de uma dependência excessiva de modelos de linguagem que podem expressar fluentemente informações imprecisas. Ferramentas de verificação automática de fatos como o SAFE podem desempenhar um papel chave na mitigação desses riscos.