• Veo は、フォトリアリズムからシュールレアリスム、アニメーションまで、多様なスタイルで 60 秒を超える高品質な 1080p 動画を作成できます。
  • Veo は比類のない創造的制御を提供し、映像用語を解釈してテキストから正確な動画編集を可能にし、AI 生成動画を編集できます。
  • Google は、トレーニングデータセットに包括的なキャプションを統合し、高忠実度を活用することでパフォーマンスを向上させました。

Google は水曜日、年次開発者会議 I/O において、AI 研究部門 DeepMind が開発した先進的な生成 AI 動画モデルVeoを発表しました。Veo は、AI 生成アニメーションのリアリズムと品質でOpenAI の Soraと競合することを目指しています。

高品質な動画生成

Veo は、60 秒を超える高品質な 1080p の動画クリップを作成できます。ソーシャルネットワーク X での DeepMind の投稿によると、Veo はフォトリアリズムからシュールレアリスム、アニメーションまで、多様な映像スタイルを扱えます。このモデルはテキストから動画、動画から動画、画像から動画への変換をサポートしており、経験豊富な映画制作者、新進クリエイター、教育者など、誰もが動画制作を利用できるようにします。

関連記事:Google、5 倍高速な AI チップ Trillium を発表

関連記事:Google と HP、3D ビデオ会議プラットフォーム Project Starline を発表

注目すべきコラボレーションとして、Childish Gambino としても知られるポリマスアーティストの Donald Glover が、自身のクリエイティブスタジオ Gilga を通じて Veo の能力をテストしました。このパートナーシップは、テキストによる説明から、現実と見分けがつかないほどの驚くべき動画を生成するこのモデルの可能性を強調しています。リアルに泳ぐクラゲやネオンの都市景観などの例があり、Veo が高品質でリアルな動画を制作する能力を示しています。

前例のない創造的制御

Google のプロダクト管理担当副社長 Eli Collins と、研究担当シニアディレクターDouglas Eck は、Veo の前例のない創造的制御のレベルを強調しました。このモデルは「タイムラプス」や「空撮」などの映像用語を理解し、テキストによる説明から正確で高品質な動画編集を可能にします。Veo は、AI 生成動画やユーザーがアップロードしたクリップを編集でき、高度な潜在拡散トランスフォーマーによりフレーム間の一貫性を維持します。この技術は矛盾を減らし、キャラクター、オブジェクト、スタイルの安定性を保ちます。

パフォーマンス向上のため、Google はトレーニングデータに詳細なキャプションを追加し、高品質の圧縮動画表現を使用しました。これらの改善により、全体的な動画品質が向上し、生成時間が短縮されます。さらに、すべての Veo 動画には、Google のコンテンツ識別情報追跡用の電子透かしSynthIDが組み込まれており、AI 生成であることを検出可能にしています。