• Todos os modelos Gemini são capazes de processar e usar mais do que apenas palavras. Eles foram pré-treinados e ajustados em uma variedade de arquivos de áudio, imagens e vídeos, uma vasta base de código e texto em diferentes idiomas.
  • Os aplicativos e modelos do Gemini também são totalmente independentes do Imagen 2 e podem ser usados em algumas ferramentas e ambientes de desenvolvimento da empresa.
  • Como os modelos Gemini são multimodais, eles podem teoricamente realizar uma gama de tarefas multimodais.

O Google está tentando causar sensação com o Gemini, um conjunto emblemático de modelos, aplicativos e serviços de IA generativa. Mas embora o Gemini pareça promissor em alguns aspectos, como revela nossa análise informal, ele teve resultados ruins em outras áreas. Então, o que é o Gemini? Como usá-lo? Como ele se compara aos concorrentes?


O que é o Gemini?

Gemini é a tão aguardada família de modelos GenAI de nova geração, desenvolvida pelo laboratório de pesquisa em IA do Google, DeepMind e Google Research. Ela vem em três versões:

  • Gemini Ultra, o modelo principal do Gemini
  • Gemini Pro, um modelo Gemini 'vivo'
  • Gemini Nano, um modelo menor e 'leve' que funciona em dispositivos móveis como o Pixel 8 Pro
    Todos os modelos Gemini são treinados para ser 'naturalmente multimodais' – ou seja, capazes de processar e usar mais do que apenas palavras. Eles foram pré-treinados e ajustados em uma variedade de arquivos de áudio, imagens e vídeos, uma vasta base de código e texto em diferentes idiomas. Isso distingue o Gemini de modelos como LaMDA, o modelo do Google especificamente treinado em dados textuais. LaMDA não pode entender ou gerar nada além de texto (por exemplo, artigos, rascunhos de e-mails), mas os modelos Gemini podem.

Qual é a diferença entre o aplicativo Gemini e o modelo Gemini?

Mais uma vez, o Google mostrou sua falta de habilidade em estratégia de marca ao não deixar claro desde o início que o Gemini era distinto do aplicativo Gemini (anteriormente Bard) nas plataformas web e móveis. O aplicativo Gemini é apenas uma interface para acessar um determinado modelo – pode-se imaginá-lo como um cliente Google GenAI.

Aliás, os aplicativos e modelos do Gemini também são totalmente distintos do Imagen 2, o modelo de geração de imagem a partir de texto do Google que pode ser usado em algumas ferramentas e ambientes de desenvolvimento da empresa. Não se preocupe, vocês não são os únicos confusos.

O que o Gemini pode fazer?

Como os modelos Gemini são multimodais, eles podem teoricamente realizar uma gama de tarefas multimodais, desde transcrição de voz até adicionar legendas em imagens e vídeos, passando pela criação de obras de arte. Esses recursos ainda não estão em produção (falaremos sobre isso mais tarde), mas o Google promete todos eles, e muito mais, em um futuro próximo. O Google decepcionou amplamente no lançamento inicial do Bard. Recentemente, a empresa também publicou um vídeo que supostamente demonstrava as capacidades do Gemini, mas acabou sendo amplamente adulterado e mais ou menos aspiracional.

Leia também: O chatbot Bard do Google recebe a atualização Gemini Pro em todo o mundo