- Индекс галлюцинаций опирается на фирменную метрику оценки Galileo — соответствие контексту, — оценивая неточности выходных данных при разной длине входных запросов.
- Закрытые модели, такие как Claude 3.5 Sonnet и Gemini 1.5 Flash, лидируют в индексе благодаря собственным обучающим данным.
НАШЕ МНЕНИЕ
Индустрия ИИ по-прежнему сталкивается с галлюцинациями как с серьёзным препятствием для готовых к промышленному использованию продуктов генеративного ИИ. Опубликованный Galileo индекс галлюцинаций даёт комплексную оценку моделей генеративного ИИ, уделяя особое внимание тому, как они справляются с галлюцинациями. Он также даёт компаниям ценные ориентиры при выборе подходящей модели с учётом их конкретных потребностей и бюджетных ограничений.
– Lia XU, корреспондент BTW
Что произошло?
Galileo, ведущий разработчик в области генеративного ИИ, опубликовал свой последнийиндекс галлюцинаций. В нём оцениваются 22 известныебольшие языковые модели генеративного ИИ (LLM)от ведущих компаний, включая OpenAI, Anthropic, Google и Meta. В этом году индекс расширен на 11 новых моделей, что отражает стремительный рост как открытых, так и закрытых LLM за последние восемь месяцев.
Индекс показал, что Claude 3.5 Sonnet от Anthropic стал лучшей моделью по совокупным результатам. При этом особенно примечательны результаты Google: его открытая модель Gemma-7b показала слабые результаты, а закрытая Gemini 1.5 Flash стабильно держалась в верхней части рейтинга.
Индустрия ИИ по-прежнему воспринимает галлюцинации как серьёзное препятствие для готовых к промышленному использованию продуктов генеративного ИИ. Индекс галлюцинаций даёт компаниям ценные сведения, помогая выбрать подходящую модель под их конкретные задачи и бюджетные ограничения. Эти изменения иллюстрируют динамичный ландшафт генеративного ИИ и продолжающиеся усилия по решению проблем, связанных с галлюцинациями ИИ.
Читайте также:BNP Paribas объединяется с Mistral AI для внедрения LLM
Читайте также:10 ИИ-приложений для самодиагностики заболеваний
Почему это важно
Галлюцинации ИИ могут приводить к генерации неверной или вводящей в заблуждение информации, что подрывает надёжность систем искусственного интеллекта. Поэтому индекс галлюцинаций Galileo может помочь оценивать и улучшать модели. Разработчики смогут создавать более надёжные ИИ-приложения, на которые компании могли бы полагаться при решении критически важных задач.
Оценка моделей по производительности и экономической эффективности необходима компаниям, которые планируют внедрять решения на основе генеративного ИИ. Баланс между стоимостью и производительностью критически важен для организаций, работающих в условиях бюджетных ограничений.
Пока индустрия ИИ рассматривает галлюцинации как серьёзное препятствие для готовых к промышленному использованию продуктов генеративного ИИ, понимание этих вызовов необходимо бизнесу. Индекс галлюцинаций — важный ресурс для понимания конкурентного ландшафта моделей генеративного ИИ: он показывает сильные и слабые стороны разных моделей и одновременно отражает текущие проблемы отрасли.

