O interesse por modelos de IA generativa explodiu, impulsionado pelos avanços em processamento
de linguagem natural e geração de imagens.
O interesse por modelos de IA generativa explodiu, impulsionado pelos avanços em processamento
de linguagem natural e geração de imagens.META, um player de destaque no campo da pesquisa em IA,
apresentou o CM3leon, um modelo multimodal de ponta. Multimodal significa
que a IA é capaz tanto de geração texto-imagem quanto imagem-texto.
A abordagem única do CM3leon combina uma receita oriunda de modelos de linguagem textuais.
O modelo da Meta utilizará pré-treinamento em larga escala com recuperação aumentada e etapas de
ajuste fino supervisionado multitarefa.
Melhores desempenhos em geração de imagens
Embora treinado com cinco vezes menos recursos computacionais que os métodos
anteriores baseados em transformadores, o CM3leon atinge desempenho de ponta em geração
texto-imagem. Notavelmente, ele demonstra a versatilidade dos modelos autorregressivos enquanto
mantém baixos custos de treinamento e inferência eficiente.
Este modelo baseado em tokenização vai além das abordagens convencionais de geração texto-imagem. Ele
pode gerar sequências complexas de texto e imagens condicionadas por conteúdo arbitrário.
Ao contrário de outros modelos especializados em geração de imagens, o ajuste fino
em larga escala por instruções multitarefa do CM3leon melhora significativamente o desempenho em diversas tarefas
visão-linguagem, como geração de legendas de imagens e resposta visual a perguntas.
Fornecimento ético de dados de imagens
A Meta anunciou a adoção de uma abordagem ética para o fornecimento de dados de imagens, utilizando apenas
imagens licenciadas da Shutterstock para evitar problemas de propriedade e atribuição.
Essa metodologia socialmente responsável distingue o CM3leon de seus concorrentes.
Em uma comparação com benchmarks amplamente utilizados, o CM3leon obtém uma pontuação FID
impressionante de 4,88, superando o modelo Parti do Google e estabelecendo um novo padrão para geração
texto-imagem. Uma pontuação deFrechet Inception Distance (FID)de 0,0 indica uma pontuação
perfeita. O CM3leon mostra capacidade de gerar objetos composicionais complexos, como evidenciado
por exemplos como um cacto em vaso usando óculos de sol e chapéu.
Desafios permanecem
Embora a promessa do CM3leon seja inegável, alguns desafios precisam ser enfrentados. Como em qualquer modelo de IA, os vieses potenciais nos dados são uma preocupação, pois os resultados do modelo podem refletir
os vieses presentes em seus dados de treinamento.
Além disso, embora o CM3leon possa gerar imagens de alta qualidade, os resultados podem variar dependendo da complexidade dos prompts e da qualidade dos dados de treinamento.
Além disso, o CM3leon ainda requer recursos computacionais significativos, o que pode
limitar a acessibilidade para pequenas organizações e indivíduos. Embora ele
demonstre notáveis capacidades de generalização, pode ter limitações para
gerar conteúdo totalmente novo fora de seus dados de treinamento.
Embora o CM3leon mostre grande potencial, sua disponibilidade atual é limitada a fins de pesquisa.
À medida que progride, pode se tornar um elemento revolucionário no campo da IA generativa,
revolucionando tanto a geração de imagens quanto de texto. Se você deseja saber mais sobre a arquitetura do CM3leon, podeacessar o artigo de pesquisa oficial da Meta aqui.

