- Google enfrenta os problemas da função de geração de imagens de seu modelo de IA Gemini suspendendo a geração de personagens e planejando uma versão melhorada.
- Reclamações sobre imprecisões na geração de imagens do Gemini, incluindo representações incorretas em contextos históricos, surgiram nas redes sociais.
- Apesar dos avanços no combate aos vieses raciais, o modelo de IA Gemini do Google enfrenta críticas por correção excessiva, evidenciada por sua relutância em exibir certas imagens e sua recente atualização para o Gemini 1.5 em um contexto de concorrência com o Sora da OpenAI.
Googleanunciou na quinta-feira que está se esforçando para resolver os problemas recentes da função de geração de imagens do modelo de IAGemini, suspendendo a geração de personagens e planejando republicar uma versão melhorada em breve. Na véspera, o Google se desculpou, reconhecendo imprecisões em algumas descrições de geração de imagens históricas pelo grande modelo Gemini e se esforçando para melhorar.
Representações históricas imprecisas
Recentemente, reclamações foram expressas nas redes sociais sobre a função texto-imagem do Gemini, como mulheres e pessoas de cor aparecendo em imagens com o tema 'George Washington, pai fundador americano', o que é incorreto. Além disso, quando usuários pediram ao Gemini para gerar soldados alemães nazistas, o Gemini produziu fotos de mulheres negras, asiáticas e brancas usando uniformes militares nazistas.
Os usuários também reclamaram que o Gemini não queria exibir imagens de pessoas brancas. Quando solicitado a exibir a foto de uma pessoa branca, o Gemini respondeu que não poderia atender a esse pedido. No entanto, ao ser convidado a mostrar imagens de pessoas negras, o Gemini sugeriu exibir imagens 'celebrando a diversidade e as conquistas das pessoas negras'. Quando foi solicitado a mostrar imagens celebrando a diversidade e as conquistas das pessoas brancas, o Gemini disse que estava 'hesitante' em atender a esse pedido.
A análise sugere que pode se tratar de uma correção excessiva dos problemas de vieses raciais de longa data no campo da IA, refletindo a busca de Google pelo 'multiculturalismo'. Comparado a modelos de IA anteriores, o Gemini fez avanços significativos na resolução de problemas de vieses raciais, mas o problema é 'exagerado'.
O Gemini é o maior e mais poderoso modelo de IA multimodal do Google. Na semana passada, a empresa publicou o mais recente modelo de IA de nova geração, o Gemini 1.5, que representa um avanço significativo em relação ao Gemini 1.0 lançado em dezembro passado.
Leia também:OpenAI cura a 'preguiça' do GPT-4 com novas atualizações
Gemini erra o alvo
Jack Krawczyk, diretor sênior de produtos do Gemini no Google, declarou que as capacidades de geração de imagens da empresa refletem a 'base global de usuários' desse gigante tecnológico, e que ele leva a sério a representação e os vieses. 'A geração de imagens do Gemini atinge de fato um público amplo, o que geralmente é uma coisa boa porque pessoas do mundo todo a utilizam, mas ela erra o alvo.'
No início deste mês, o Google começou a oferecer serviços de geração de imagens via Gemini, mas o lançamento da nova ferramenta Sora foi um golpe para o Google, que tenta alcançar aOpenAI, apoiada pelaMicrosoft. O Sora pode gerar vídeos contínuos de 60 segundos apenas a partir de prompts, surpreendendo toda a indústria de tecnologia. O Sora da OpenAI não apenas apresenta os detalhes com precisão, mas também compreende a existência dos objetos no mundo físico, sejam visuais, profundidade de campo, movimentos de câmera, ou mesmo microexpressões humanas e expressões animais, que já são incrivelmente realistas.

