OpenAI は、DALL-E と GPT モデルの先行研究に基づく、驚くべき新しい生成ビデオモデル「Sora」を発表しました。Sora は、テキスト指示から最大 60 秒のビデオを生成でき、複数のキャラクター、特定のアクションタイプ、詳細な背景を持つシーンを提供します。また、Sora は生成された 1 つのビデオ内で複数のショットを作成することも可能です。人工知能モデルの世界的リーダーである OpenAI は、テキスト指示から短いビデオを即座に生成できる「Sora」というモデルを発表しました。2023 年初頭、マルチモーダル AI モデルの激しい競争の中で、Google、Meta、そして Runway や Pika Labs のようなスタートアップも同様のモデルを発表していました。しかし、OpenAI が実演したビデオは、その高品質さから引き続き注目を集めています。あわせて読みたい: OpenAI、新アップデートで GPT-4 の「怠惰」を解消。Sora は現実世界と相互作用することができます。現在、Sora に関する情報は OpenAI の公式ウェブサイトで限定的に公開されています。OpenAI は、モデルトレーニングのソースデータの背景を公に文書化しており、次のように述べるにとどめています。「私たちは、動きのある物理世界を理解しシミュレートすることを AI

に学習させ、現実世界との相互作用を必要とする問題を人々が解決するのを支援するモデルを訓練することを目的としています。」OpenAI は、Sora がテキストの説明から最大 60 秒のビデオを生成し、複数のキャラクター、特定のアクションタイプ、正確な背景ディテールを持つシーンを提供できると述べています。また、Sora は生成されたビデオ内で複数のショットを作成し、キャラクターや視覚スタイルを際立たせることができます。さらに、Sora は一度に全体のビデオを生成したり、生成されたビデオを延長して長くすることもできます。OpenAI は次のように述べています。「モデルに一度に複数のフレームを生成させることで、被写体が一時的に視界から消えても一貫性を保つという困難な問題を解決しています。」OpenAI はまた、現在の Sora モデルには弱点があることを認識しています。複雑なシーンでの物理現象を正確にシミュレートするのが苦手であり、特定の因果関係を理解できない場合があります。例えば、クッキーを一口かじったのに、かじった後もクッキーに跡が残らないといったことが起こり得ます。また、モデルは左右といった空間的な詳細を混同する可能性があり、特定のカメラ軌道を追跡するなど、時間経過に伴う出来事を正確に描写するのが難しい場合があります。安全性についての懸念はありません。OpenAI のサム・アルトマン CEO が繰り返し取り上げてきた AI の安全性問題について、OpenAI

は次のように述べています。「現在、Sora は、大規模 AI モデルの潜在的に有害な出力に対して『レッドチームテスト』を行うレッドチーマーに提供され、重要な領域での危害やリスクを評価しています。また、一部のビジュアルアーティスト、デザイナー、映画製作者にもアクセスを許可し、モデルを改善してクリエイティブ専門家にとって最大限に役立つものにするためのフィードバックを収集しています。」OpenAI は、Sora が DALL-E と GPT モデルの先行研究に基づいていると説明しています。DALL·E 3 の技術を採用しており、生成されたビデオでユーザーのテキスト指示により忠実に従うことが可能になっています。ゼロからビデオを生成するだけでなく、このモデルは既存の静止画像からビデオを生成し、画像のコンテンツを正確かつ細やかにアニメーション化することもできます。また、既存のビデオを抽出し、不足しているフレームを延長または補完することも可能です。現在、OpenAI のウェブサイトは、Sora によって生成された 48 本の実演ビデオで更新されており、鮮やかな色彩とリアルな効果が披露されています。