Автор изображения: Rawpixel via Freepik
OpenAI выпустила ряд революционных улучшений, включая две ключевые функции: голосовое взаимодействие и распознавание изображений.
Буквальное общение с ChatGPT
Одно из самых значимых улучшений — добавление голосового взаимодействия в ChatGPT, позволяющего пользователям вести разговоры с ИИ голосом. Выберите один из пяти реалистичных синтетических голосов, каждый из которых создан для естественного общения. Это как телефонный разговор в реальном времени с чат-ботом: ChatGPT быстро отвечает на ваши устные вопросы.
В основе технологии лежат две отдельные модели. Whisper от OpenAI, существующая модель распознавания речи, преобразует речь в текст, который затем передаётся в ChatGPT. В свою очередь, новая модель синтеза речи превращает ответы ChatGPT в устную речь.
На недавней демонстрации Джоан Джанг, менеджер по продуктам OpenAI, представила линейку синтетических голосов. Эти голоса были тщательно созданы путём обучения модели синтеза речи на голосах нанятых актёров. OpenAI даже рассматривает будущее, в котором пользователи смогут создавать собственные персонализированные голоса. Главным критерием при создании этих голосов было обеспечить их приятность и лёгкость восприятия на слух.
Это достижение выходит за пределы ChatGPT: OpenAI делится своей моделью синтеза речи с другими компаниями, включая Spotify. Например, Spotify использует эту технологию синтетических голосов для перевода подкастов знаменитостей на несколько языков, используя синтетические версии голосов ведущих.
Распознавание изображений теперь доступно
Ещё одно революционное дополнение к ChatGPT — распознавание изображений. Эта функция, которую OpenAI анонсировала вместе с выходом GPT-4, теперь позволяет пользователям загружать изображения в приложение и задавать вопросы об их содержимом. Это означает, что вы можете спрашивать ChatGPT о визуальном контенте.
В практической демонстрации Рауль Пури, учёный, работающий над GPT-4, загрузил фотографию математической задачи и попросил ChatGPT найти решение. Впечатляюще, ChatGPT дал правильные шаги. Пользователи также использовали эту функцию для решения технических проблем, загружая скриншоты и запрашивая советы.
Кроме того, возможность распознавания изображений в ChatGPT использовалась Be My Eyes, приложением, созданным для помощи людям с нарушениями зрения. Пользователи могут загружать изображения и просить чат-бота описать их, что даёт новый уровень независимости.
Однако OpenAI полностью осознаёт потенциальные риски этих обновлений, особенно при сочетании различных моделей ИИ. Например, пользователи не могут задавать вопросы о фотографиях с частными лицами. Компания признаёт необходимость бдительности для предотвращения злоупотреблений и обязуется защищать и пользователей, и тех, кто не пользуется сервисом, от вреда.
Предстоящие вызовы для ChatGPT
Эти обновления знаменуют быстрое превращение экспериментальных моделей OpenAI в практические продукты. ChatGPT Plus, премиальная версия приложения, объединяет GPT-4 и DALL-E, что делает его грозным конкурентом для голосовых ассистентов вроде Siri, Google Assistant и Alexa. То, что раньше было доступно только некоторым разработчикам ПО, теперь доступно всем за 20 долларов в месяц.
По мере того как ChatGPT расширяет свои возможности — «видеть, слышать и говорить», — есть и вызовы, которые стоит учесть. Распознавание речи может создавать проблемы с доступностью для людей с нетипичными акцентами. Кроме того, синтетические голоса имеют социальные и культурные последствия, требующие дальнейшего изучения.
OpenAI, однако, утверждает, что основные опасения решены, и считает, что эти обновления можно безопасно публиковать. Путь совершенствования и расширения возможностей ИИ продолжается, и ChatGPT идёт впереди. Хотя, безусловно, есть вызовы и вопросы, последнее обновление представляет собой важный шаг на пути к созданию более мощных и интерактивных ИИ-ассистентов.

