• Модель под названием «Voice Engine» способна практически полностью дублировать голос человека по 15-секундной аудиозаписи, говорится в блоге OpenAI, где компания поделилась результатами небольшого тестирования инструмента.
  • «Эти ограниченные запуски помогают нам оттачивать подход, меры предосторожности и размышления о том, как Voice Engine можно применять с пользой в разных отраслях», — заявили в OpenAI в своём блоге.
  • OpenAI держит инструмент под строгим контролем, пока не будут внедрены механизмы защиты, чтобы противодействовать поддельному аудио, вводящему слушателей в заблуждение.

OpenAI разработала платформу синтеза речи под названием Voice Engine, которая создаёт синтетическую речь по 15-секундному образцу голоса.

Инструмент клонирования голоса

Сгенерированная искусственным интеллектом речь может озвучивать текстовые запросы по команде — как на языке говорящего, так и на нескольких других языках.

«Эти ограниченные запуски помогают нам оттачивать подход, меры предосторожности и размышления о том, как Voice Engine можно применять с пользой в разных отраслях», — заявили в OpenAI в своём блоге.

В опубликованных OpenAI образцах можно услышать заранее написанный повествовательный контент, а также «персонализированные ответы в реальном времени», подготовленные для GPT-4.

OpenAI сообщила, что начала разрабатывать голосовой движок в конце 2022 года, и эта технология уже предоставляет готовые голоса для API синтеза речи и функции чтения вслух в ChatGPT.

Читайте также:OpenAI расширяет связи со СМИ и новостными партнёрами для обучения своего чат-бота

Проблемы безопасности

OpenAI заявляет, что работает с американскими и международными партнёрами из правительств, СМИ, индустрии развлечений, образования, гражданского общества и других сфер, чтобы учитывать их обратную связь по мере разработки.

Исследователи дезинформации опасаются широкого злоупотребления приложениями на базе ИИ в решающий предвыборный год из-за распространения дешёвых и простых в использовании инструментов клонирования голоса, которые сложно отследить.

В OpenAI признают эти проблемы и заявляют, что «из-за потенциальных злоупотреблений синтетической речью компания придерживается осторожного и взвешенного подхода к более широкому распространению».

Несколько месяцев назад политический консультант, работавший на президентскую кампанию соперника Джо Байдена от Демократической партии, признался, что стоял за автоматическими телефонными звонками, имитировавшими голос американского лидера.

Этот инцидент встревожил экспертов, которые опасаются потока дипфейк-дезинформации на базе ИИ во время президентской гонки в США в 2024 году и других ключевых выборов в мире в этом году.

«Мы внедрили комплекс мер безопасности, включая водяные знаки для отслеживания происхождения любого аудио, созданного Voice Engine, а также проактивный мониторинг его использования», — заявили в OpenAI.