• OpenAI проводит мероприятие, на котором в понедельник может быть анонсирован новый мультимодальный цифровой ассистент.
  • Мультимодальность позволит ассистенту использовать визуальные подсказки в качестве запросов — например, распознавать и интерпретировать уличную табличку.
  • Это создаёт прямую угрозу Google Assistant и недавно выпущенному Gemini — цифровым ассистентам Google.

OpenAI, как сообщает новостной сайт The Information, уже демонстрирует некоторым своим клиентамновую мультимодальную ИИ-модель, которая умеет распознавать объекты и общаться с пользователем. Издание утверждает, что узнало об этом от анонимных источников, и предполагает, что сегодня компания может представить предварительную версию модели.

Новая мультимодальная ИИ-модель

Мультимодальность означает способность ИИ обрабатывать не только текстовые входные данные. Такой цифровой ассистент сможет подключаться к камере, анализировать данные из внешнего мира и затем отвечать с дополнительными подробностями о том, что увидел. Например, можно попросить ChatGPT распознать и перевести табличку, на которую вы наводите камеру, если она написана на незнакомом языке. После этого ИИ вступит с вами в диалог.

Если это кажется знакомым, то потому, что Google Lens, Google Assistant и — совсем недавно — Google Gemini уже умеют это делать. ChatGPT тоже на это способен, хотя и не через единый интерфейс.

По сообщениям, новая модель быстрее и точнее интерпретирует изображения и аудио, чем отдельные модели транскрибации и синтеза речи. The Information утверждает, что модель «теоретически» может помогать студентам с математикой или переводить таблички в реальном мире, а также помогать операторам поддержки клиентов «лучше понимать интонацию звонящих и распознавать сарказм».

Иными словами, это прямой конкурент Gemini (а значит, и Google Assistant с Siri от Apple).

По данным источников, близких к изданию, модель может «лучше отвечать на некоторые типы вопросов», чем GPT-4 Turbo, но по-прежнему способна уверенно ошибаться.

Читайте также:Как работают автономные транспортные средства?

Читайте также:OpenAI борется с дезинформацией благодаря технологическому сотрудничеству

Предположения об OpenAI

Разработчик Ananay Arora опубликовал скриншот кода, связанного со звонками, что говорит о возможной подготовке OpenAI новой встроенной функции ChatGPT. Arora также обнаружил доказательства того, что OpenAI создала серверы для аудио- и видеозвонков в реальном времени.

Кроме того, Altman заявил, что компания не выпускает новый поисковик на основе ИИ. Однако если отчёт The Information точен, он всё равно может охладить ожидания от конференции для разработчиков Google I/O.