• Apple は、ユーザーがテキストで説明するだけで写真を編集できる MGIE を、UC Santa Barbara と提携して発表しました。
  • MGIE は、ユーザーのテキスト指示を活用し、視覚的な編集を生成することで、より効率的で柔軟な編集を実現します。
  • しかし、MGIE の今後の応用はまだ不透明です。

Apple の研究者たちは、ユーザーが写真編集ソフトウェアを使わずに、簡単な言葉で写真をどのように編集したいかを説明できる新しいモデルを発表しました。


新しいモデル

Apple の研究者たちは、UC Santa Barbara と協力し、テキストで写真編集を記述できる革新的なモデル MGIE を発表しました。この MLLM(マルチモーダル大規模言語モデル)を用いた編集モデルは、写真の切り抜き、リサイズ、反転、フィルタ適用に対応し、基本的な作業から複雑な作業まで行えます。ユーザーの指示を解釈し、視覚的な編集を実行することで、MGIE はユーザーが望む変更を入力するだけで編集を可能にします。

関連記事:Apple、年内に生成 AI の革新的な機能を発表へ

よりスマートな応答

MGIE で写真を編集するには、編集したい画像を渡すだけです。例えば、ペパロニピザの写真を編集する場合、「より健康的にして」と入力すると、野菜のトッピングが追加されます。サハラ砂漠のトラの写真が暗い場合は、「より多くの光をシミュレートするためにコントラストを追加して」と指示すると、写真が明るくなります。

依然として不透明

Apple は MGIE を GitHub で公開し、Hugging Face Spaces でウェブデモを公開しましたが、今後の具体的な展開はまだ明らかになっていません。この技術は、OpenAI の DALL-E 3 など、テキスト入力を用いて画像編集を行う他のプラットフォームと似ています。