• Imagen 3 は、詳細で創造的な指示で優れた性能を発揮する、フォトリアルな画像生成 AI です。
  • Google は、競争の激しい AI 画像生成市場でリードを維持する戦略の一環として、Imagen 3 を発表しました。
  • Imagen 3 と Vertex AI の統合により、高度な画像生成機能がより広範なユーザーに提供され、あらゆる業界のさまざまなアプリケーションが向上することが期待されます。

Google は、非公開プレビューとして利用可能な、これまでで最も高品質なテキスト画像生成モデルImagen 3を発表しました。この新しいモデルは、前例のない詳細さ、自然言語理解の向上、そしてテキストレンダリング能力の向上を約束します。

改善点と競争上の優位性

Google DeepMind のシニアリサーチディレクターである Douglas Eck は、同社の開発者会議 I/O で Imagen 3 の進歩を強調しました。「これは当社のこれまでで最も高性能な画像生成モデルです」と Eck は述べました。「Imagen 3 はよりフォトリアルで、細部が豊かになり、視覚的なアーティファクトや歪みが少なくなっています。自然な文章の指示を理解し、創造的で詳細な指示を与えるほど、より良い結果が得られます。そして Imagen 3 は、長い指示の中の小さな詳細も忘れずに取り入れます。さらに、常に画像生成モデルの課題だったテキストレンダリングにおいても、当社のこれまでで最高のモデルです。」

関連記事:Google、デスクトップ版 Chrome に AI モデル Gemini Nano を追加

Imagen 3 の発表は、Vertex AI での Imagen 2 のリリースから 6 か月後に行われました。この動きは、OpenAI の DALL-E、Midjourney、Adobe の Firefly、Meta の AI、Microsoft の Designer などのライバルも画像生成技術で革新を続ける競争の激しい AI 環境で、Google が優位に立つための戦略の一環です。Google が 4 月にモデル向けにテキストからライブへの変換機能を展開したことも、AI 画像生成市場での支配へのコミットメントを示しています。

Imagen 3 は現在、一部のユーザー向けに非公開プレビューとして提供されており、開発者がウェイティングリストに登録できるようになった時点で、より広範な展開が予定されています。Vertex AI との統合により、高度な画像生成機能がより多くのユーザーに提供され、あらゆる業界の多様なアプリケーションが向上することが期待されています。

関連記事:Google、5 倍高速な AI チップ Trillium を発表

論争への対応

この分野での進歩にもかかわらず、Google は困難に直面してきました。今年初め、同社は AI が生成した画像が歴史上の人物や出来事を不正確に描写したことで批判され、AI が「行き過ぎたポリコレ」であるという非難につながりました。Google はこれらの出来事について謝罪し、CEO の Sundar Pichai は Bloomberg の Emily Chang とのインタビューで、モデルの改善へのコミットメントを改めて表明しました。