- OpenAI adia o lançamento em larga escala do Voice Engine, uma IA de síntese de voz, para responder a considerações éticas e riscos de uso indevido.
- A tecnologia promete assistência à leitura e alcance global, mas apresenta riscos de roubo de identidade e falhas de segurança.
- OpenAI estabelece condições rigorosas para o uso do Voice Engine, incluindo exigências de consentimento e divulgação de vozes geradas por IA.
OpenAI revela o Voice Engine, um modelo de IA capaz de reproduzir vozes humanas a partir de pequenos trechos de áudio, mas adia o lançamento completo devido a preocupações éticas e sociais sobre possíveis abusos.
O potencial do Voice Engine
A evolução da síntese de voz tem sido notável, especialmente se comparada ao brinquedo Speak & Spell de 1978, que cativava o público com sua voz eletrônica pioneira. Hoje, os modelos de IA usando aprendizado profundo podem não apenas produzir vozes realistas, mas também imitar vozes existentes com notável precisão a partir de breves amostras de áudio.
Leia também:A loja GPT da OpenAI não atende às expectativas.
Nesse contexto, a recente apresentação do Voice Engine pela OpenAI constitui um avanço significativo. O modelo de IA pode criar uma voz sintética a partir de uma curta gravação de áudio, e a empresa compartilhou exemplos em seu site. Os usuários podem inserir texto que o Voice Engine converte em uma voz gerada por IA. No entanto, a OpenAI decidiu não prosseguir com uma distribuição em larga escala dessa tecnologia, depois de inicialmente planejar um programa piloto para desenvolvedores neste mês. Após uma reflexão cuidadosa sobre os aspectos éticos, a empresa optou por moderar suas ambições por enquanto.
OpenAI declarou: « Em conformidade com nosso compromisso com a segurança da IA e nossas diretrizes voluntárias, optamos por apresentar essa tecnologia sem distribuí-la amplamente por enquanto. Acreditamos que esta prévia do Voice Engine destacará seu potencial, ao mesmo tempo que enfatiza a importância de fortalecer as defesas sociais contra os desafios apresentados por modelos generativos cada vez mais convincentes. »
Leia também:OpenAI expande seus laços midiáticos com parceiros de notícias para treinamento de chatbots
A tecnologia de clonagem de voz não é nova; existem muitos modelos de síntese de voz por IA desde 2022, e essa tecnologia é difundida na comunidade de código aberto com ofertas como OpenVoice e XTTSv2. No entanto, a perspectiva de a OpenAI tornar sua tecnologia de voz amplamente disponível é significativa, e a relutância da empresa em fazê-lo é sem dúvida a questão mais marcante.
Os benefícios potenciais da tecnologia de voz da OpenAI são múltiplos: assistência à leitura com vozes naturais, criação de conteúdo global mantendo os sotaques nativos, opções de fala personalizadas para pessoas não verbais e ajuda a pacientes para recuperar a voz após doenças que alteram a fala.
Implicações éticas e de segurança
No entanto, a possibilidade de qualquer pessoa clonar uma voz com apenas 15 segundos de gravação levanta preocupações sobre uso indevido. Mesmo sem uma distribuição completa do Voice Engine, a clonagem de voz já causou problemas como golpes telefônicos imitando a voz de entes queridos e ligações automatizadas usando vozes clonadas de políticos como Joe Biden.
Além disso, pesquisadores e jornalistas demonstraram que a tecnologia de clonagem de voz pode comprometer contas bancárias que usam autenticação de voz, o que levou o senador Sherrod Brown de Ohio, presidente do Comitê Senatorial dos EUA de Bancos, Habitação e Assuntos Urbanos, a questionar as medidas de segurança implementadas pelos grandes bancos para combater as ameaças relacionadas à IA.
Ciente dos riscos potenciais de uma distribuição generalizada, a OpenAI implementa um conjunto de regras para mitigar esses problemas. A empresa realiza testes com parceiros selecionados desde o ano passado, como a HeyGen, que usa o modelo para traduzir a voz dos falantes para outros idiomas, preservando as características vocais originais.
Parcerias e medidas de precaução
Para usar o Voice Engine, os parceiros devem cumprir condições que proíbem 'a usurpação de identidade de qualquer indivíduo ou organização sem consentimento ou direito legal'. Eles também são obrigados a obter o consentimento informado das pessoas cujas vozes são reproduzidas e devem indicar claramente que as vozes produzidas são geradas por IA. A OpenAI também incorpora uma marca d'água em cada amostra de voz para facilitar o rastreamento de qualquer voz gerada por seu modelo.
Por enquanto, a OpenAI apresenta sua tecnologia sem se comprometer totalmente com uma distribuição em larga escala, o que poderia potencialmente causar convulsões sociais. Em vez disso, a empresa reajusta sua estratégia de marketing para parecer uma gestora responsável dessa tecnologia emergente.

