• Anthropic объявляет о программе финансирования разработки новых бенчмарков для оценки производительности и влияния моделей ИИ.
  • Anthropic считает, что разработка качественных оценок, связанных с безопасностью, остаётся сложной задачей, а спрос превышает предложение.

НАШЕ МНЕНИЕ
С учётом коммерческих интересов компании беспристрастность проектов, финансируемых Anthropic, может оказаться под вопросом. Кроме того, по мнению некоторых экспертов, упоминаемые Anthropic «катастрофические» и «обманчивые» риски ИИ могут отвлекать внимание от более насущных проблем регулирования современного ИИ.
– Zora Lin, журналистка BTW

Что произошло

Anthropicобъявила в понедельник о запуске новой инициативы по финансированию новых бенчмарков для оценки производительности и влияния моделей ИИ, в том числе генеративных моделей, таких какClaude.

Согласно официальному сообщению в блоге Anthropic, компания окажет финансовую поддержку сторонним организациям для разработки инструментов, позволяющих «эффективно измерять передовые возможности моделей искусственного интеллекта». Заинтересованные организации могут подать заявки, а оценки будут проводиться на постоянной основе.

Инициатива Anthropic стала ответом на растущую критику существующих бенчмарков для моделей ИИ, таких как оценка MLPerf, проводимая два раза в год некоммерческой организацией MLCommons. Широко признано, что самые популярные бенчмарки, используемые для оценки моделей ИИ, плохо оценивают то, как обычные люди на самом деле используют системы ИИ в повседневной жизни.

Anthropic надеется стимулировать исследовательское ИИ-сообщество предлагать более строгие бенчмарки, ориентированные на социальное воздействие и безопасность, и призывает к пересмотру существующих методов.

Читайте также:Кто такой Dario Amodei? Генеральный директор Anthropic, хранитель безопасности ИИ

Читайте также:Schneider и NVIDIA разработают эталонный дата-центр для ИИ

Почему это важно

Инвестиции Anthropic направлены на повышение уровня всей области безопасности ИИ и предоставление ценных инструментов для всей экосистемы.

Инновации в области бенчмарков делают акцент не только на технической производительности модели, но и на её социальном влиянии и безопасности. Благодаря новым бенчмаркам исследователи смогут лучше оценивать социальные проблемы и проблемы безопасности ИИ, обеспечивать прочную основу для создания более надёжных систем ИИ и способствовать росту доверия общества к технологиям ИИ.

Оказывая финансовую поддержку, Anthropic поощряет сторонние организации участвовать в разработке новых инструментов бенчмаркинга, что привлечёт больше новаторов и предпринимателей в сферу искусственного интеллекта и будет способствовать её процветанию.