• Google Gemini に対抗:MM1 のパラメータ規模は、Google の AI モデルの初期バージョンと競合します。
  • 革新的な文脈学習:現在の会話の文脈に基づいて新しい問い合わせを理解し応答する MM1 の能力。

Apple は、画像とテキストをシームレスに解釈し対話できる新世代のマルチモーダルモデル MM1 を発表し、より直感的で応答性の高いSiri と iMessageの体験への道を開きました。

MM1:先駆的なマルチモーダル AI

Apple は、視覚画像とテキストデータの両方を処理できる革新的なマルチモーダル AI モデルのスイートである MM1 を発表しました。これらのモデルは最大 300 億という驚異的なパラメータ数を誇り、Google の Gemini モデルの初期バージョンに対する強力な競合となります。

関連記事:Anthropic、最新 AI モデルが GPT-4 を上回ると主張

MM1 モデルは、視覚要素とテキスト要素の両方を含む指示を解釈し実行できます。例えば、メニューに表示された価格情報を分析することで、AI は 2 つの飲み物の合計コストを計算できます。

MM1 の注目すべき特徴の 1 つは、文脈学習能力です。これにより、モデルは現在の会話に含まれる文脈情報に基づいて要求を理解し応答することができ、新しい問い合わせやタスクごとに特別な再訓練や微調整を必要としません。

この文脈学習能力により、以前に類似コンテンツに触れたことがない場合でも、画像の詳細な説明を生成したり、写真ベースのメッセージの内容に関する質問に答えたりできる可能性があります。

関連記事:Apple、WWDC 2024 で「visionOS の進歩」を発表へ

ユーザー体験の向上

ユーザー体験の向上という点では、MM1 のマルチモーダル理解能力を Apple が活用し、音声アシスタント Siri のパフォーマンスを向上させることが考えられます。これにより、Siri は画像に基づく質問など、視覚データに基づいた質問への回答を提供できるようになります。さらに、MM1 は iMessage で共有される画像やテキストメッセージの文脈を解釈するのに役立ち、ユーザーにより適切な返信候補を提供することができます。