• DALL-E は 2021 年 1 月に初めてリリースされ、Stability AI や Midjourney の他のテキスト画像生成 AI プラットフォームよりも先に登場しました。
  • DALL-E 2 が 2022 年にリリースされた際、OpenAI は、DALL-E が写実的な露骨な画像を生成できることや写真生成時にバイアスを示すとの批判を受け、プラットフォームへのアクセスを制御するためにウェイトリストを導入しました。
  • 2023 年 9 月、OpenAI は DALL-E シリーズの最新作である DALL-E 3 を発表しました。これは、以前のモデルよりも「はるかに多くのニュアンスと詳細」を理解できるとされています。

DALL-Eは、サルバドール・ダリと「ポン」を組み合わせた名前に由来し、OpenAI が開発した革新的な AI モデルで、芸術と創造性に対する考え方を一変させました。本記事では、DALL-E のリリース時期と歴史を辿り、その誕生から現在に至るまで、人間の想像力と人工知能の境界を曖昧にするツールとしての進化を探ります。

DALL-E の誕生

DALL-E の歴史は 2021 年初頭、OpenAIが初めてこのモデルを公開したときに始まりました。最初のリリースは、AI がテキストによる説明から複雑な画像を理解し生成する可能性を示した、AI 史における重要な瞬間となりました。DALL-E 1.0 は、大量の画像と関連テキストのデータセットでトレーニングされ、入力されたプロンプトに対応する、非常に詳細でしばしば超現実的な画像を作成することができました。

巻き起こった熱狂

リリース後、DALL-E は急速に広く注目を集めました。アーティスト、デザイナー、一般の人々は、AI が想像力に富み技術的にも優れた画像を生成する能力に魅了されました。モデルの出力は、コンセプトの奇抜な解釈から、歴史的な場面や抽象的な概念を驚くほど正確に表現したものまで多岐にわたりました。

関連記事:AI:機会と脅威

DALL-E シリーズの進化

DALL-E の 3 つのモデル — DALL-E 2 と DALL-E 3 — は、自然言語からデジタル画像を生成することを可能にするディープラーニング技術を用いて作成されたテキスト画像モデルです。しかし、多くの違いがあります。例えば、2021 年に OpenAI がブログ記事で初めて公開した DALL-E の最初のバージョンは、GPT-3 の修正版を使用してテキストから画像を作成していました。

Discrete Variational Auto-Encoder(dVAE)技術は、DALL-E 1 で特に使用されました。Vector Quantised Variational AutoEncoder は、Alphabet の DeepMind 部門の研究で使用され、この技術の基礎となりました。

2022 年、その 1 年後に OpenAI は DALL-E の後継である DALL-E 2 を発表しました。DALL-E 2 は、アイデア、特徴、スタイルを組み合わせて、より高解像度でリアルな画像を生成しました。

DALL-E 2 は、この成果を達成するために使用される方法を改善しました。例えば、4 億枚のラベル付き画像でトレーニングされた Contrastive Language-Image Pre-training(CLIP)モデルは、DALL-E 2 が使用する安定拡散モデルにデータ統合を提供し、より高品質な画像の生成を実現します。このモデル(CLIP)は、生成された画像に最適なキャプションを決定し、DALL-E の出力評価を支援します。

そして昨年、2023 年 9 月に OpenAI は DALL-E シリーズの最新作、DALL-E 3 を発表しました。OpenAI チームによると、DALL-E 3 は以前のモデルよりも「はるかに多くのニュアンスと詳細」を理解できます。具体的には、このモデルは複雑なプロンプトをより高い精度で追跡し、より一貫性のある画像を生成します。また、OpenAI の別の生成 AI ソリューションである ChatGPT とも統合されています。

関連記事:Perplexity AI への投資方法

アート界への影響

DALL-E がアート界に与えた影響は大きいものでした。創造性の本質、著作者性、そして創作プロセスにおけるテクノロジーの役割についての議論を巻き起こしました。一部のアーティストは DALL-E を共同作業のツールとして採用し、アイデアを生成したり、手作業では不可能な作品を作り出すために使用しています。一方で、AI が人間のアーティストに取って代わる可能性や、創作活動における AI 利用の倫理的影響について懸念を示す声もあります。

商業的・倫理的考察

DALL-E の能力が発展するにつれて、商業的な可能性も高まりました。企業は、DALL-E を広告、製品デザイン、その他の分野でどのように活用できるかを模索し始めました。しかし、これらの商業的応用は、AI が生成したコンテンツの所有権や、ディープフェイクの作成や知的財産権の侵害などの悪用の可能性に関する倫理的な問題を提起しました。

DALL-E と AI アートの未来

将来を見据えると、DALL-E や類似の AI モデルは進化を続け、より洗練され、ユーザーの入力に対してより応答性が高くなると予想されます。AI アートが主流になるにつれて、その使用を規制するための新しい規範、法律、倫理ガイドラインが出現するでしょう。

DALL-E の歩みは、革新的なコンセプトから具体的なアプリケーションを備えたツールへと至る過程であり、AI 技術の急速な進歩を物語っています。アートと AI の交差点を探求し続ける中で、DALL-E は私たちに、その計り知れない可能性と重要な課題を思い起こさせます。創造的な補助ツールとして、研究ツールとして、あるいは哲学的思索の源として使用されるにせよ、DALL-E は、人間の革新の継続的な歴史と、創造性そのものの本質を理解しようとする私たちの探求において、注目すべき一章を成しています。