• Veo может создавать видео высокого качества в формате 1080p длительностью более 60 секунд в различных стилях — от фотореализма до сюрреализма и анимации.
  • Veo обеспечивает беспрецедентный творческий контроль, интерпретируя кинематографические термины для точного видеомонтажа на основе текста, а также умеет редактировать видео, созданные ИИ.
  • Google повысил производительность за счёт добавления подробных описаний в обучающий набор данных и использования высокой точности.

В среду на ежегодной конференции разработчиков I/O компания Google представилаVeo— свою передовую генеративную видеомодель, разработанную подразделением искусственного интеллекта DeepMind. Veo призван конкурировать сSora от OpenAIпо реалистичности и качеству анимированных изображений, создаваемых ИИ.

Создание видео высокого качества

Veo способен создавать видеоклипы высокого качества в формате 1080p продолжительностью более 60 секунд. Согласно публикации DeepMind в социальной сети X, Veo умеет работать с различными кинематографическими стилями — от фотореализма до сюрреализма и анимации. Эта модель поддерживает преобразования «текст в видео», «видео в видео» и «изображение в видео», делая производство видео доступным для всех: от опытных кинематографистов до начинающих авторов и преподавателей.

Читайте также:Google выпускает чип для ИИ Trillium, который в пять раз быстрее

Читайте также:Google и HP запускают платформу 3D-видеоконференций Project Starline

В рамках примечательного сотрудничества художник-полимат Дональд Гловер, также известный как Childish Gambino, протестировал возможности Veo через свою креативную студию Gilga. Это партнёрство подчёркивает способность модели создавать впечатляющие видео, почти неотличимые от реальности, на основе текстовых описаний. Среди примеров — реалистично плавающие медузы и неоновые городские пейзажи, демонстрирующие способность Veo создавать реалистичные видео высокого качества.

Беспрецедентный творческий контроль

Вице-президент Google по управлению продуктами Эли Коллинз и старший директор по исследованиям Дуглас Эк подчеркнули беспрецедентный уровень творческого контроля Veo. Модель понимает такие кинематографические термины, как «ускоренная съёмка» и «съёмка с воздуха», что позволяет точно и качественно монтировать видео на основе текстовых описаний. Veo умеет редактировать видео, созданные ИИ, или клипы, загруженные пользователями, сохраняя согласованность кадров благодаря передовым латентным диффузионным трансформерам. Эта технология снижает расхождения и поддерживает стабильность персонажей, объектов и стилей.

Чтобы повысить производительность, Google добавил подробные описания к обучающим данным и использовал сжатые видеопредставления высокого качества. Эти улучшения повышают общее качество видео и сокращают время генерации. Кроме того, все видео Veo снабженыSynthID— водяным знаком Google для отслеживания идентификационной информации о контенте, что гарантирует возможность их распознавания как созданных ИИ.