• Anthropic anuncia um programa para financiar o desenvolvimento de novos benchmarks para avaliar o desempenho e o impacto dos modelos de IA.
  • Anthropic acredita que o desenvolvimento de avaliações de alta qualidade relacionadas à segurança continua difícil e que a demanda supera a oferta.

NOSSA OPINIÃO
Considerando os interesses comerciais da empresa, a imparcialidade dos projetos financiados pela Anthropic pode ser comprometida. Além disso, para alguns dos riscos de IA «catastróficos» e «enganosos» mencionados pela Anthropic, alguns especialistas acreditam que isso pode desviar a atenção de questões regulatórias mais urgentes da IA atual.
–Zora Lin, jornalista da BTW

O que aconteceu

Anthropicanunciou na segunda-feira o lançamento de uma nova iniciativa para financiar novos benchmarks para avaliar o desempenho e o impacto dos modelos de IA, como os modelos generativos como oClaude.

De acordo com uma postagem oficial no blog da Anthropic, a empresa fornecerá apoio financeiro a organizações terceiras para desenvolver ferramentas para "medir eficazmente as capacidades avançadas dos modelos de inteligência artificial". As organizações interessadas podem enviar suas inscrições, e as avaliações serão realizadas de forma contínua.

A iniciativa da Anthropic surge em meio a críticas crescentes aos benchmarks existentes para modelos de IA, como a avaliação MLPerf realizada duas vezes por ano pela entidade sem fins lucrativos MLCommons. É amplamente aceito que os benchmarks mais populares usados para avaliar modelos de IA avaliam mal a forma como as pessoas comuns realmente usam os sistemas de IA no dia a dia.

Anthropic espera incentivar a comunidade de pesquisa em IA a propor benchmarks mais exigentes, focados em seu impacto social e segurança, e pede uma reformulação dos métodos existentes.

Leia também:Quem é Dario Amodei? CEO da Anthropic, o guardião da segurança da IA

Leia também:Schneider e NVIDIA projetarão um data center de referência para IA

Por que é importante

O investimento da Anthropic visa elevar todo o campo da segurança da IA, fornecendo ferramentas valiosas para todo o ecossistema.

A inovação em benchmarks enfatiza não apenas o desempenho técnico do modelo, mas também seu impacto social e segurança. Graças a esse novo benchmark, os pesquisadores podem avaliar melhor os problemas sociais e de segurança da IA, fornecer suporte sólido para a construção de sistemas de IA mais confiáveis e contribuir para aumentar a confiança do público na tecnologia de IA.

Ao fornecer apoio financeiro, a Anthropic incentiva organizações terceiras a participar do desenvolvimento de novas ferramentas de benchmarking, o que atrairá mais inovadores e empreendedores para o campo da inteligência artificial e promoverá sua prosperidade.