• Anthropic は、AI モデルのパフォーマンスと影響を評価するための新しいベンチマークの開発に資金を提供するプログラムを発表した。
  • Anthropic は、セキュリティに関連する高品質な評価の開発は依然として困難であり、需要が供給を上回っていると見ている。

当社の見解
企業の商業的利益を考慮すると、Anthropic が資金提供するプロジェクトの公平性は損なわれる可能性がある。さらに、Anthropic が言及する「破滅的」および「欺瞞的」な AI リスクの一部について、一部の専門家は、それが現在の AI のより緊急な規制問題から注意をそらす可能性があると見ている。
–Zora Lin, BTW ジャーナリスト

何が起きたのか

Anthropicは月曜日に、Claudeのような生成モデルを含む、AI モデルのパフォーマンスと影響を評価するための新しいベンチマークに資金を提供する新たなイニシアチブを発表した。

Anthropic の公式ブログ記事によると、同社は「人工知能モデルの高度な能力を効果的に測定する」ためのツールを開発する第三者組織に財政的支援を提供する。関心のある組織は申請を提出することができ、評価は継続的に実施される。

Anthropic のイニシアチブは、非営利団体 MLCommons が年 2 回実施する MLPerf 評価など、AI モデルの既存ベンチマークに対する批判の高まりを受けたものである。AI モデルの評価に使用される最も一般的なベンチマークは、一般の人々が日常的に AI システムを実際にどのように使用しているかを適切に評価していないことが広く認識されている。

Anthropic は、AI 研究コミュニティが社会的影響とセキュリティに焦点を当てた、より要求の厳しいベンチマークを提案することを奨励し、既存の手法の全面的な見直しを呼びかけている。

こちらもお読みください:Dario Amodei とは?Anthropic の CEO、AI 安全性の守護者

こちらもお読みください:Schneider と NVIDIA、AI 向け参照データセンターを設計へ

なぜ重要なのか

Anthropic の投資は、エコシステム全体に貴重なツールを提供することで、AI セキュリティ分野全体を向上させることを目指している。

ベンチマークの革新は、モデルの技術的性能だけでなく、その社会的影響とセキュリティにも重点を置いている。この新しいベンチマークにより、研究者は AI の社会的およびセキュリティ上の問題をより適切に評価し、より信頼性の高い AI システムの構築を強力に支援し、AI 技術に対する一般の信頼を高めることに貢献できる。

財政的支援を提供することで、Anthropic は第三者組織が新しいベンチマークツールの開発に参加することを奨励しており、これにより AI 分野にさらなるイノベーターや起業家が集まり、その繁栄が促進されるだろう。