• يمكن لـ Veo إنشاء مقاطع فيديو عالية الجودة بدقة 1080p تتجاوز 60 ثانية بأنماط متنوعة، من التصوير الواقعي إلى السريالية والرسوم المتحركة.
  • يقدم Veo تحكمًا إبداعيًا لا مثيل له، من خلال تفسير المصطلحات السينمائية لتحرير فيديو دقيق من النص، ويمكنه تحرير مقاطع الفيديو المولدة بواسطة الذكاء الاصطناعي.
  • حسنت Google الأداء من خلال دمج التسميات التوضيحية الكاملة في مجموعة بيانات التدريب والاستفادة من الدقة العالية.

كشفت Google يوم الأربعاء عنVeo، نموذج الذكاء الاصطناعي التوليدي المتقدم للفيديو الذي طورته قسم الذكاء الاصطناعي DeepMind، خلال مؤتمر المطورين السنوي I/O. يهدف Veo إلى منافسةSora من OpenAIمن حيث الواقعية وجودة الصور المتحركة المولدة بالذكاء الاصطناعي.

إنشاء فيديوهات عالية الجودة

يمكن لـ Veo إنشاء مقاطع فيديو عالية الجودة بدقة 1080p تتجاوز 60 ثانية. وفقًا لمنشور من DeepMind على شبكة التواصل الاجتماعي X، يمكن لـ Veo التعامل مع أنماط سينمائية متنوعة، من التصوير الواقعي إلى السريالية والرسوم المتحركة. يدعم هذا النموذج التحويلات من نص إلى فيديو، ومن فيديو إلى فيديو، ومن صورة إلى فيديو، مما يجعل إنتاج الفيديو في متناول الجميع، سواء كانوا صانعي أفلام متمرسين أو مبدعين ناشئين أو معلمين.

اقرأ أيضًا:تطلق Google شريحة الذكاء الاصطناعي Trillium، الأسرع بخمس مرات

اقرأ أيضًا:تطلق Google وHP منصة مؤتمرات الفيديو ثلاثية الأبعاد Project Starline

في تعاون بارز، اختبر الفنان متعدد المواهب دونالد جلوفر، المعروف أيضًا باسم Childish Gambino، قدرات Veo عبر استوديو الإبداع الخاص به، Gilga. تؤكد هذه الشراكة إمكانات النموذج في إنشاء مقاطع فيديو مذهلة، تكاد لا يمكن تمييزها عن الواقع، من الأوصاف النصية. من بين الأمثلة، قنديل البحر يسبح بشكل واقعي ومشاهد حضرية نيون، مما يدل على قدرة Veo على إنتاج فيديوهات عالية الجودة وواقعية.

تحكم إبداعي غير مسبوق

أكد نائب رئيس إدارة المنتجات في Google، Eli Collins، ومدير الأبحاث الرئيسي، Douglas Eck، على مستوى التحكم الإبداعي غير المسبوق في Veo. يفهم النموذج مصطلحات سينمائية مثل «تسريع» و«لقطات جوية»، مما يتيح تحرير فيديو دقيق وعالي الجودة من الأوصاف النصية. يمكن لـ Veo تحرير مقاطع الفيديو المولدة بالذكاء الاصطناعي أو المقاطع التي تم تحميلها من قبل المستخدمين، مع الحفاظ على الاتساق بين الإطارات بفضل محولات الانتشار الكامنة المتقدمة. تقلل هذه التقنية من التناقضات وتحافظ على استقرار الشخصيات والأشياء والأنماط.

لتحسين الأداء، أضافت Google تسميات توضيحية مفصلة إلى بيانات التدريب واستخدمت تمثيلات فيديو مضغوطة عالية الجودة. تعمل هذه التحسينات على زيادة جودة الفيديو الإجمالية وتقليل وقت التوليد. بالإضافة إلى ذلك، جميع فيديوهات Veo مدمجة معSynthID، العلامة المائية لتتبع بيانات اعتماد المحتوى من Google، مما يضمن إمكانية اكتشافها على أنها مولدة بالذكاء الاصطناعي.