- A OpenAI está organizando um evento nesta segunda-feira, no qual espera-se o anúncio de um novo assistente digital multimodal.
- Com a multimodalidade, o assistente poderia usar pistas visuais, como reconhecer e interpretar uma placa ao ar livre como entrada.
- Isso representa uma ameaça direta ao Google Assistant e ao recentemente lançado Gemini, os assistentes digitais da empresa.
OpenAIapresentou, de acordo com um relatório recente do site The Information, a alguns de seus clientesum novo modelo multimodal de IAque pode reconhecer objetos e conversar com humanos. A fonte de notícias afirma ter obtido a informação de fontes anônimas e especula que pode ser uma prévia do que a empresa irá anunciar mais tarde hoje.
Novo modelo multimodal de IA
Multimodal refere-se à capacidade da IA de processar mais do que apenas texto como entrada. Este suposto assistente digital seria capaz de se conectar a uma câmera, processar dados do mundo externo e, em seguida, responder com mais detalhes sobre o que foi observado. Você poderia pedir ao ChatGPT, por exemplo, para reconhecer uma placa e traduzi-la para você, se apontar uma câmera para uma placa escrita em um idioma diferente do seu. A IA então falaria com você.
Se isso parece familiar, é porque o Google Lens, o Google Assistant e, mais recentemente, o Google Gemini já fizeram tudo isso. O ChatGPT também já pode fazer isso, embora não por meio de uma interface unificada.
De acordo com relatos, o novo modelo pode interpretar imagens e áudio de forma mais rápida e precisa do que seus modelos separados para transcrição e síntese de fala. O The Information afirma que o modelo poderia 'teoricamente' ajudar alunos de matemática ou traduzir placas reais, e seria capaz de ajudar atendentes de suporte ao cliente a 'entender melhor o tom das vozes dos chamadores ou detectar se são sarcásticos'.
Em outras palavras: um concorrente direto do Gemini (e, consequentemente, do Google Assistant e da Siri da Apple).
O modelo pode responder a 'certos tipos de perguntas' melhor do que o GPT-4 Turbo, mas às vezes ainda comete erros com plena confiança, de acordo com fontes próximas ao veículo.
Leia também:Como funcionam os veículos autônomos?
Leia também:OpenAI combate desinformação com colaboração tecnológica
Especulações sobre a OpenAI
O desenvolvedor Ananay Arora compartilhou uma captura de tela do código relacionado às chamadas mencionadas, sugerindo que a OpenAI pode estar preparando também um novo recurso integrado do ChatGPT. Arora também descobriu evidências de que a OpenAI configurou servidores para chats de áudio e vídeo em tempo real.
Além disso, Altman declarou que a empresa não está lançando um novo mecanismo de busca baseado em IA. No entanto, se o relatório do The Information for preciso, isso ainda assim pode diminuir as expectativas para a conferência de desenvolvedores Google I/O.

