- 月曜日に公開された、Anthropic が AI モデルの性能と影響を評価できる新しいベンチマークの開発に資金を提供するプログラムを開始した。
- Anthropic が創出を目指す新しいベンチマークは、AI の安全性と社会的影響に重点を置いているが、AI 競争における同社の商業的野心を考慮すると、その行動には他の目的があるかもしれない。
当社の見解
Anthropic は AI ベンチマーク開発プログラムを立ち上げ、モデルの性能と影響を評価するためにサードパーティ組織に資金を提供し、AI 安全性の向上を目指している。しかし、その商業的野心には議論の余地があり、AI リスクに対する認識には異なる見解が存在する。取り組みは称賛に値するが、これらのベンチマークの普遍的な適用範囲はまだ観察段階にあり、その価値は継続的に評価される必要がある。
–Jasmine Zhang, BTW ジャーナリスト
経緯
Anthropicは、AI モデルの性能と影響を評価するための新しいベンチマークの開発に資金を提供するプログラムの開始を発表した。月曜日に発表されたこの計画は、AI モデルの高度な能力を効果的に測定できるサードパーティ組織に財政的支援を提供する。
Anthropic は公式ブログで、この投資は AI 安全性分野全体を強化し、エコシステム全体に利益をもたらす貴重なツールを提供することを目的としていると述べた。安全性に関連する高品質な評価の開発は依然として困難であり、需要は供給を大きく上回っている。現在の AI ベンチマークには、一般の人々が実際にシステムをどのように利用しているかを反映しにくい欠点があり、また一部の古いベンチマークが主張する内容を実際に測定しているかどうかも議論の的となっている。
Anthropic が提案する解決策は、新しいツール、インフラ、方法を通じて、AI の安全性と社会的影響に焦点を当てた要求の厳しいベンチマークを作成することである。同社は、サイバー攻撃、大量破壊兵器の改良、人間の操作や欺瞞といった能力をテストするためのモデルの開発と評価を特に呼びかけている。国家安全保障と防衛に関する AI リスクについては、Anthropic は「早期警戒システム」の開発を約束したが、ブログでは具体的な詳細を明らかにしていない。
あわせて読みたい:Schneider と NVIDIA が AI 向け「ベンチマーク」データセンターデザインを構築
あわせて読みたい:Anthropic、最新モデルがクラス最高と主張
なぜ重要なのか
現在、人工知能の研究、開発、規制はいずれも急速な発展段階にある。Anthropic が新しい AI ベンチマークを支援する取り組みは革新的であり、ある程度、見返りを求めないものであり、確かに称賛に値する。
しかし、AI 競争における同社の商業的野心を考慮すると、Anthropic が提供する新しいベンチマークには懐疑的でなければならない点に留意すべきである。
AI コミュニティの一部では、Anthropic が言及する AI の「破滅的」かつ「欺瞞的」なリスクに異議を唱える声もある。多くの専門家は、AI が短期的に世界を終わらせ、人類を凌駕する能力を獲得するという証拠はほとんどないと主張している。したがって、Anthropic が新しい AI ベンチマークを作成する努力が普遍的な適用範囲を持つかどうか、その行動に利益を得るための利己的な関心があるかどうか、そして新しいベンチマークの検出結果が基準値としての価値を持つかどうかについては、まだ議論の余地がある。

