- Meta Platforms は、最新の大規模言語モデル「Llama 3」の初期バージョンを公開しました。このモデルは、コンピューターコーディングの新機能と画像コマンドの処理能力を備えています。これらのモデルは、同社が無料の競合製品の中で最も洗練されていると称する仮想アシスタント「Meta AI」に統合される予定です。
- 今後数か月以内に公開予定の Llama 3 のバージョンは、「マルチモーダル」機能を備え、テキストと画像の両方を生成できるようになります。Meta は生成 AI 市場のリーダーである OpenAI に追いつこうとしています。
- 従来の Llama 2 は基本的な文脈理解ができませんでしたが、Meta は Llama 3 で高品質なデータを使用することでこの問題を軽減し、モデルがニュアンスを認識できるようにしています。生成 AI モデル用のデータ需要は、技術開発における主要な緊張要因となっています。
Meta Platforms は、最新の大規模言語モデル「Llama 3」の最初のバージョンを公開しました。このモデルは、コンピューターコーディングの新機能と画像コマンドの処理能力を備えています。内蔵画像生成ツールは、ユーザーがプロンプトを入力している間、リアルタイムで画像を更新し、生成 AI 市場のリーダーである OpenAI に追いつくことを目指しています。
Mark Zuckerberg CEO による解説動画をご覧ください。
マルチモーダル対応 AI モデルを目指す
今後数か月以内に公開予定の Llama 3 のバージョンも「マルチモーダル」機能を備え、テキストと画像の両方を生成できるようになる予定ですが、現時点ではテキスト出力のみであると、Meta の製品責任者 Chris Cox はインタビューで述べています。
モデルは仮想アシスタントMeta AIに統合され、同社はこれを無料の競合製品の中で最も高度なものと位置付けています。複数ステップにわたる長期的な計画を作成する能力など、より高度な推論機能は後続バージョンで提供される予定です。
関連記事:Meta、従来比 3 倍高速なオールインワン MTAI チップを発表
Llama 3 のトレーニングに画像を含めることで、今年展開予定のスマートグラス「Ray-Ban Meta」のアップデートが強化されると、Chris Cox は述べています。これは眼鏡メーカーEssilor Luxoticcaとのパートナーシップによるもので、Meta AI が装着者に見える物体を識別し、それに関する質問に答えることを可能にします。
AI モデル訓練データの危機
従来の Llama 2 は基本的な文脈理解ができませんでしたが、Meta は Llama 3 で「高品質なデータ」を使用することで、モデルがニュアンスを認識できるようにし、これらの問題を軽減しています。競合の Google も同様の問題に直面し、歴史的人物の不正確な描写で批判を受けた後、画像生成ツール「Gemini AI」の使用を最近停止しました。
Meta の CEO、Mark Zuckerberg は、Llama 3 の最大バージョンは現在 4000 億のパラメータで訓練されており、AI モデルの強度と性能を評価する指標として、大規模マルチタスク言語理解(Massive Multitask Language Understanding)で既に 85 点のスコアを獲得していると述べました。
関連記事:米国議員、AI 企業に訓練データ開示を義務付ける法案を提出
生成 AI モデルのための膨大なデータ需要は、技術開発における大きな緊張源となっています。Meta は、Llama 3 に Llama 2 の 7 倍のデータを提供し、コーディングや推論などの分野を改善するために AI が生成した「合成データ」を使用したとしていますが、使用したデータセットの詳細は明らかにしていません。

