• OpenAI представила GPT-4o Mini, который использует технику безопасности «иерархия инструкций» для защиты чат-ботов от обманных команд.
  • Обновление GPT-4o Mini от OpenAI выходит как нельзя вовремя с учётом продолжающихся дискуссий о безопасности и прозрачности ИИ, а также внутренних и внешних призывов улучшить практики.

НАШЕ МНЕНИЕ
В условиях стремительного развития ИИ вопросы безопасности и надёжности находятся в центре внимания отрасли. Недавно OpenAI представила свою новейшую модель GPT-4o Mini, призванную решить давнюю техническую задачу: не дать чат-ботам поддаваться манипуляциям со стороны вредоносных команд. Это новшество демонстрирует не только прогресс ИИ в самозащите, но и усилия технологических компаний по улучшению пользовательского опыта и защите данных.

— Elodie Qian, журналист BTW

Что произошло

OpenAI представила GPT-4o Mini — новую модель, которая противодействует трюку «игнорировать все предыдущие инструкции». В модели используется техника безопасности под названием «иерархия инструкций», которая усиливает защиту от злоупотреблений и несанкционированных команд. Модели с такой техникой отдают приоритет исходным системным инструкциям разработчика перед любыми попытками пользователя обмануть модель.

Olivier Godement, руководитель продукта API-платформы в OpenAI, объяснил, что иерархия инструкций предотвратит ставшие вирусными промпт-инъекции (то есть обман ИИ с помощью хитрых команд), которые повсеместно встречаются в интернете.

«По сути, это учит модель действительно следовать системному сообщению разработчика и подчиняться ему», — заявил Olivier Godement. На вопрос, означает ли это, что атака «игнорировать все предыдущие инструкции» должна прекратиться, Olivier Godement ответил: «Именно так».

«При конфликте сначала нужно следовать системному сообщению. Мы провели [оценки] и ожидаем, что новая техника сделает модель ещё безопаснее, чем раньше», — добавил он.

Это новшество согласуется с целью OpenAI разрабатывать полностью автоматизированных цифровых агентов. Компания недавно объявила, что близка к созданию таких агентов. Метод иерархии инструкций считается необходимым для обеспечения безопасности перед масштабным развёртыванием этих агентов. Без таких мер агент, предназначенный для безобидных задач вроде написания электронных писем, может быть скомпрометирован и использован для вредоносных действий, например для утечки чувствительной информации.

Читайте также:OpenAI выпускает GPT-4o Mini — более дешёвую версию своей ИИ-модели

Читайте также:Хакер проник в OpenAI и похитил сведения о внутренней технологии ИИ

Почему это важно

Существующие большие языковые модели, как объясняется в исследовательской статье, не различают пользовательские промпты и системные инструкции. Иерархия инструкций в GPT-4o Mini поднимает системные инструкции на высший приоритет, а несоответствующие промпты понижает. Модель обучается выявлять вредоносные промпты и игнорировать их, отвечая отказом помочь.

«Мы полагаем, что в будущем должны появиться другие, более сложные типы защитных механизмов, особенно для агентных сценариев. Например, современный интернет оснащён средствами безопасности: от веб-браузеров, обнаруживающих опасные сайты, до основанных на машинном обучении спам-фильтров для фишинговых атак», — говорится в исследовательской статье.

Обновление GPT-4o Mini от OpenAI — важный шаг к повышению безопасности ИИ. Эта инициатива появляется как нельзя вовремя с учётом продолжающихся дискуссий о безопасности и прозрачности ИИ и внутренних и внешних призывов улучшить практики.

Было опубликовано открытое письмо нынешних и бывших сотрудников OpenAI с требованием улучшить практики безопасности и прозрачности; команда, отвечавшая за поддержание систем в соответствии с интересами человека (например, безопасностью), была распущена, аJan Leike, ключевой исследователь OpenAI, ушедший из компании, написал в своём посте, что «культура и процессы безопасности отошли на второй план перед блестящими продуктами».

Поскольку доверие к надёжности ИИ имеет первостепенное значение, внимание OpenAI к функциям безопасности крайне важно для восстановления доверия и возможности ИИ брать на себя более ответственные роли в управлении нашей цифровой жизнью. Эта приверженность безопасности — решающий шаг к ИИ, который будет одновременно надёжным и заслуживающим доверия.