• A Meta Platforms publicou as primeiras versões de seu mais recente modelo de linguagem de grande porte, Llama 3, com novas capacidades de codificação de computador e a capacidade de processar comandos de imagem. Os modelos serão integrados ao assistente virtual Meta AI, que a empresa apresenta como o mais sofisticado entre seus pares gratuitos.
  • As versões do Llama 3 previstas para serem publicadas nos próximos meses também serão capazes de "multimodalidade", o que significa que podem gerar tanto texto quanto imagens, enquanto a Meta se esforça para alcançar a líder do mercado de IA generativa, OpenAI.
  • O modelo Llama 2 é incapaz de compreender o contexto básico; a Meta reduz esses problemas no Llama 3 usando "dados de alta qualidade" para permitir que o modelo reconheça nuances. A demanda por dados para modelos de IA generativa tornou-se uma grande fonte de tensão no desenvolvimento da tecnologia.

A Meta Platforms publicou as primeiras versões de seu mais recente modelo de linguagem de grande porte, Llama 3, com novas capacidades de codificação de computador e a capacidade de processar comandos de imagem. O gerador de imagens integrado atualizará as imagens em tempo real enquanto os usuários inserem prompts, enquanto a empresa tenta alcançar a líder do mercado de IA generativa, OpenAI.
Veja o vídeo explicativo do CEO Mark Zuckerberg.

Visando um modelo de IA commultimodalidade

As versões do Llama 3 previstas para serem publicadas nos próximos meses também serão capazes de "multimodalidade", o que significa que podem gerar tanto texto quanto imagens, embora por enquanto o modelo produza apenas texto, disse Chris Cox, diretor de produtos da Meta, em uma entrevista.

Os modelos serão integrados ao assistente virtualMeta AI, que a empresa apresenta como o mais sofisticado entre seus pares gratuitos. Raciocínio mais avançado, como a capacidade de elaborar planos mais longos em várias etapas, seguirá nas versões posteriores.

Leia também:Meta revela chip MTAI "tudo-em-um" 3 vezes mais rápido que o anterior

A inclusão de imagens no treinamento do Llama 3 melhoraria uma atualização implantada este ano para os óculos inteligentes Ray-Ban Meta, uma parceria com o fabricante de óculosEssilor Luxoticca, permitindo que o Meta AI identifique objetos vistos pelo usuário e responda a perguntas sobre eles, disse Chris Cox.

Crise de dados para treinamento de modelos de IA

O modelo Llama 2 é incapaz de compreender o contexto básico; a Meta reduz esses problemas no Llama 3 usando "dados de alta qualidade" para permitir que o modelo reconheça nuances. A rival Google encontrou problemas semelhantes e recentemente suspendeu o uso de sua ferramenta de geração de imagens Gemini AI após ser criticada por representações imprecisas de figuras históricas.

O CEO da Meta, Mark Zuckerberg, afirmou que a maior versão do Llama 3 está atualmente sendo treinada com 400 bilhões de parâmetros e já obtém uma pontuação de 85 no Massive Multitask Language Understanding, citando métricas usadas para avaliar a força e o desempenho de modelos de IA.

Leia também:Representante dos EUA propõe projeto de lei obrigando empresas de IA a divulgar dados de treinamento

A demanda voraz por dados para modelos de IA generativa tornou-se uma grande fonte de tensão no desenvolvimento da tecnologia. A Meta não detalhou os conjuntos de dados utilizados, embora tenha fornecido ao Llama 3 sete vezes mais dados que ao Llama 2, e usado dados "sintéticos" ou criados por IA para melhorar áreas como codificação e raciocínio.