- Concorrência com o Google Gemini: A escala de parâmetros do MM1 compete com as primeiras versões dos modelos de IA do Google.
- Aprendizado contextual inovador: A capacidade do MM1 de entender e responder a novas solicitações com base no contexto atual da conversa.
A Apple apresentou o MM1, uma nova geração de modelos multimodais capazes de interagir perfeitamente com imagens e texto, abrindo caminho para uma experiênciaSiri e iMessagemais intuitiva e responsiva.
MM1: a inovadora IA multimodal
A Apple apresentou o MM1, um conjunto inovador de modelos multimodais de IA que podem processar tanto imagens visuais quanto dados textuais. Esses modelos possuem um número impressionante de parâmetros, até 30 bilhões, tornando-os sérios concorrentes das primeiras iterações dos modelos Gemini do Google.
Leia também:Anthropic afirma que seu mais recente modelo de IA supera o GPT-4
Os modelos MM1 são capazes de interpretar e executar instruções que envolvem elementos visuais e textuais. Por exemplo, a IA pode calcular o custo combinado de duas bebidas analisando as informações de preço exibidas em um cardápio.
Uma das características notáveis do MM1 é sua capacidade de aprendizado contextual. Isso permite que o modelo entenda e responda a perguntas com base nas informações contextuais do discurso em andamento, sem necessidade de retreinamento específico ou ajuste fino para cada nova consulta ou tarefa.
Essa capacidade de aprendizado contextual pode permitir que o modelo gere descrições detalhadas de imagens ou responda a perguntas sobre o conteúdo de mensagens baseadas em imagens, mesmo sem ter sido exposto a conteúdos semelhantes anteriormente.
Leia também:Apple apresentará os 'avanços do visionOS' na WWDC 2024
Melhoria da experiência do usuário
Em termos de melhoria da experiência do usuário, as capacidades multimodais de compreensão do MM1 podem ser usadas pela Apple para melhorar o desempenho de seu assistente de voz Siri. Isso permitiria que o Siri respondesse a perguntas baseadas em dados visuais, como perguntas baseadas em imagens. Além disso, o MM1 poderia ajudar a interpretar o contexto de imagens e mensagens de texto compartilhadas via iMessage, oferecendo aos usuários sugestões de resposta mais relevantes.

