- Todos os modelos Gemini são capazes de processar e usar mais do que apenas palavras. Eles foram pré-treinados e ajustados em uma variedade de arquivos de áudio, imagens e vídeos, uma vasta base de código e texto em diferentes idiomas.
- Os aplicativos e modelos do Gemini também são totalmente independentes do Imagen 2 e podem ser usados em algumas ferramentas e ambientes de desenvolvimento da empresa.
- Como os modelos Gemini são multimodais, eles podem teoricamente realizar uma gama de tarefas multimodais.
O Google está tentando causar sensação com o Gemini, um conjunto emblemático de modelos, aplicativos e serviços de IA generativa. Mas embora o Gemini pareça promissor em alguns aspectos, como revela nossa análise informal, ele teve resultados ruins em outras áreas. Então, o que é o Gemini? Como usá-lo? Como ele se compara aos concorrentes?
O que é o Gemini?
Gemini é a tão aguardada família de modelos GenAI de nova geração, desenvolvida pelo laboratório de pesquisa em IA do Google, DeepMind e Google Research. Ela vem em três versões:
- Gemini Ultra, o modelo principal do Gemini
- Gemini Pro, um modelo Gemini 'vivo'
- Gemini Nano, um modelo menor e 'leve' que funciona em dispositivos móveis como o Pixel 8 Pro
Todos os modelos Gemini são treinados para ser 'naturalmente multimodais' – ou seja, capazes de processar e usar mais do que apenas palavras. Eles foram pré-treinados e ajustados em uma variedade de arquivos de áudio, imagens e vídeos, uma vasta base de código e texto em diferentes idiomas. Isso distingue o Gemini de modelos como LaMDA, o modelo do Google especificamente treinado em dados textuais. LaMDA não pode entender ou gerar nada além de texto (por exemplo, artigos, rascunhos de e-mails), mas os modelos Gemini podem.
Qual é a diferença entre o aplicativo Gemini e o modelo Gemini?
Mais uma vez, o Google mostrou sua falta de habilidade em estratégia de marca ao não deixar claro desde o início que o Gemini era distinto do aplicativo Gemini (anteriormente Bard) nas plataformas web e móveis. O aplicativo Gemini é apenas uma interface para acessar um determinado modelo – pode-se imaginá-lo como um cliente Google GenAI.
Aliás, os aplicativos e modelos do Gemini também são totalmente distintos do Imagen 2, o modelo de geração de imagem a partir de texto do Google que pode ser usado em algumas ferramentas e ambientes de desenvolvimento da empresa. Não se preocupe, vocês não são os únicos confusos.
O que o Gemini pode fazer?
Como os modelos Gemini são multimodais, eles podem teoricamente realizar uma gama de tarefas multimodais, desde transcrição de voz até adicionar legendas em imagens e vídeos, passando pela criação de obras de arte. Esses recursos ainda não estão em produção (falaremos sobre isso mais tarde), mas o Google promete todos eles, e muito mais, em um futuro próximo. O Google decepcionou amplamente no lançamento inicial do Bard. Recentemente, a empresa também publicou um vídeo que supostamente demonstrava as capacidades do Gemini, mas acabou sendo amplamente adulterado e mais ou menos aspiracional.
Leia também: O chatbot Bard do Google recebe a atualização Gemini Pro em todo o mundo

