- Search-Augmented Factuality Evaluator (SAFE) — это метод, который использует большую языковую модель (LLM) для разбиения сгенерированного текста на отдельные факты.
- Эта «сверхчеловеческая» система ИИ может повысить точность проверки фактов, экономическую эффективность и достоверность.
- Известный исследователь ИИ Гэри Маркус предположил, что «сверхчеловеческий» может означать просто «лучше, чем низкооплачиваемый работник», а не настоящий эксперт-проверщик фактов.
Google DeepMind представила «сверхчеловеческую» систему ИИ, способную превзойти людей-проверщиков фактов в оценке точности информации, генерируемой большими языковыми моделями.
Search-Augmented Factuality Evaluator (SAFE)
В этом исследовании под названием «Long-form factuality in large language models» SAFE представлен как метод разбиения сгенерированного текста на отдельные факты с помощью больших языковых моделей. Затем система использует результаты Google Search для определения точности каждого утверждения.
Исследователи сравнили SAFE с людьми-аннотаторами на наборе данных, содержащем около 16 000 фактов, и обнаружили, что оценки SAFE совпадали с человеческими в 72 % случаев. Ещё более впечатляюще то, что при расхождении оценок SAFE и людей суждение SAFE оказывалось верным в 76 % случаев.
Читайте также:Microsoft нанимает соучредителя DeepMind Mustafa Suleyman на должность генерального директора своего нового подразделения ИИ
«Сверхчеловеческая» производительность вызывает споры
Хотя исследователи утверждают, что агенты на основе больших языковых моделей могут достигать «сверхчеловеческой» точности оценки, некоторые эксперты задаются вопросом, что на самом деле означает «сверхчеловеческий» в данном контексте.
Исследователь ИИ Гэри Маркус предполагает, что «сверхчеловеческий» может означать просто «лучше, чем низкооплачиваемый работник», а не настоящего эксперта-проверщика фактов.
Маркус считает, что сравнение SAFE с людьми-экспертами по проверке фактов имеет решающее значение для действительно убедительной демонстрации его сверхчеловеческих возможностей.
Преимущества SAFE
Очевидное преимущество SAFE — стоимость: исследователи обнаружили, что использование системы ИИ примерно в 20 раз дешевле, чем привлечение людей-проверщиков фактов. По мере роста объёмов информации всё важнее применять недорогой и высокоэффективный подход.
Команда DeepMind также использовала SAFE для оценки фактической точности 4 семейств (Gemini, GPT, Claude и PaLM-2), включающих 13 ведущих языковых моделей. Они обнаружили, что более крупные модели, как правило, допускают меньше фактических ошибок.
Однако даже самые производительные модели по-прежнему генерировали большое количество ложных утверждений.
Это подчёркивает риск чрезмерной зависимости от языковых моделей, которые могут бегло излагать неточную информацию. Инструменты автоматической проверки фактов, такие как SAFE, могут сыграть ключевую роль в снижении этих рисков.

