Crédito da imagem: Rawpixel via Freepik
OpenAI lançou uma série de melhorias revolucionárias, incluindo dois recursos principais: interação por voz e reconhecimento de imagem.
Conversando literalmente com o ChatGPT
Uma das melhorias mais importantes é a adição de interação por voz ao ChatGPT, que permite que os usuários tenham conversas faladas com a IA. Escolha entre cinco vozes sintéticas realistas, cada uma projetada para oferecer uma experiência de conversação natural. É como ter uma conversa telefônica em tempo real com um chatbot, com o ChatGPT respondendo rapidamente às suas perguntas orais.
A tecnologia subjacente é baseada em dois modelos distintos. O Whisper da OpenAI, um modelo de reconhecimento de voz pré-existente, converte fala em texto, que é então enviado para o ChatGPT. Inversamente, um novo modelo de síntese de voz transforma as respostas do ChatGPT em linguagem falada.
Em uma demonstração recente, Joanne Jang, gerente de produto da OpenAI, apresentou a variedade de vozes sintéticas. Essas vozes foram meticulosamente projetadas treinando o modelo de síntese de voz com vozes de atores contratados. A OpenAI até prevê um futuro onde os usuários poderão criar suas próprias vozes personalizadas. O principal critério para a criação dessas vozes foi garantir que fossem agradáveis e fáceis de ouvir.
Esse avanço se estende além do ChatGPT, já que a OpenAI compartilha seu modelo de síntese de voz com outras empresas, incluindo o Spotify. O Spotify, por exemplo, usa essa tecnologia de voz sintética para traduzir podcasts de celebridades em vários idiomas usando versões sintéticas das vozes dos podcasters.
Reconhecimento de imagem agora possível
Outra adição revolucionária ao ChatGPT é o reconhecimento de imagem. Esse recurso, que a OpenAI anunciou com o lançamento do GPT-4, agora permite que os usuários façam upload de imagens no aplicativo e perguntem sobre o conteúdo dessas imagens. Isso significa que você pode fazer perguntas ao ChatGPT sobre conteúdo visual.
Em uma demonstração prática, Raul Puri, um cientista que trabalha no GPT-4, fez upload de uma foto de um problema de matemática e pediu ao ChatGPT uma solução. Impressionantemente, o ChatGPT forneceu os passos corretos. Os usuários também usaram esse recurso para resolver problemas técnicos enviando capturas de tela e pedindo conselhos.
Além disso, a capacidade de reconhecimento de imagem do ChatGPT foi usada pelo Be My Eyes, um aplicativo projetado para ajudar pessoas com deficiência visual. Os usuários podem fazer upload de imagens e pedir ao chatbot para descrevê-las, oferecendo um novo nível de independência.
No entanto, a OpenAI está perfeitamente ciente dos riscos potenciais dessas atualizações, especialmente ao combinar diferentes modelos de IA. Por exemplo, os usuários não podem fazer perguntas sobre fotos contendo pessoas particulares. A empresa reconhece a necessidade de vigilância para evitar abusos e está comprometida em proteger tanto os usuários quanto os não usuários de danos.
Desafios futuros para o ChatGPT
Essas atualizações marcam a rápida evolução dos modelos experimentais da OpenAI em produtos práticos. O ChatGPT Plus, a versão premium do aplicativo, combina GPT-4 e DALL-E, tornando-se um concorrente formidável para assistentes de voz como Siri, Google Assistant e Alexa. O que antes era acessível apenas a alguns desenvolvedores de software agora está disponível para todos por uma assinatura mensal de US$ 20.
Enquanto o ChatGPT expande suas capacidades para "ver, ouvir e falar", há desafios a serem considerados. O reconhecimento de voz pode representar problemas de acessibilidade para pessoas com sotaques não tradicionais. Além disso, as vozes sintéticas têm implicações sociais e culturais que exigem mais exploração.
No entanto, a OpenAI afirma ter resolvido as principais preocupações e acredita que essas atualizações podem ser lançadas com segurança. A jornada para refinar e expandir as capacidades da IA continua, com o ChatGPT na liderança. Embora certamente haja desafios e questões a serem resolvidas, esta última atualização representa um passo importante em direção à criação de assistentes de IA mais poderosos e interativos.

