- Предоставление OpenAI Sora независимым тестировщикам безопасности демонстрирует её стремление противодействовать возможному злоупотреблению фотореалистичными поддельными видео.
- Опираясь на флагманскую модель генерации изображений по тексту от OpenAI и трансформерную нейросеть, команда Sora представила новый подход к генерации видео по текстовым описаниям.
OpenAIнедавно представила революционную модель генерации видео под названиемSora, продемонстрировав способность превращать короткие текстовые описания в детализированные видеоролики высокого разрешения длительностью до минуты. Эта инновационная технология знаменует значительный прогресс в области генерации видео по тексту и отражает стремление OpenAI создавать системы ИИ, способные понимать сложные взаимодействия в окружающем мире.
Осторожность OpenAI в представлении передовой технологии
Тим Брукс, исследователь в OpenAI, подчеркнул важность создания моделей, способных понимать видеоконтент, отметив потенциальные последствия для будущего развития ИИ. Решение компании представить Sora в условиях строгой секретности говорит о её осторожном подходе к раскрытию этой передовой технологии.
В то время как предыдущие модели генерации видео часто выдавали прерывистые и зернистые результаты, Sora выделяется высоким разрешением и вниманием к деталям. OpenAI продемонстрировала способность Sora создавать видео с взаимодействием трёхмерных объектов и плавными переходами между сценами, что подтверждает прогресс в обработке окклюзии — распространённой проблемы существующих моделей.
Читайте также:OpenAI «лечит лень» GPT-4 с помощью новых обновлений
Улучшение долгосрочной согласованности в Sora
Несмотря на впечатляющие возможности, у Sora есть ограничения. Брукс признал, что есть пространство для улучшения долгосрочной согласованности: модель может терять целостность, когда объекты надолго выходят из кадра. Решение OpenAI предоставить Sora сторонним тестировщикам безопасности отражает её стремление противодействовать возможному злоупотреблению фотореалистичными поддельными видео.
DALL·E 3— модель генерации изображений по тексту, разработанная OpenAI с использованием методов глубокого обучения для создания цифровых изображений на основе описаний на естественном языке. Комбинируя элементы DALL-E 3, флагманской модели генерации изображений по тексту от OpenAI, с трансформерной нейросетью, команда Sora представила новый подход к генерации видео по текстовым описаниям. Этот уникальный метод позволяет Sora обрабатывать видеоданные сегментами, что даёт возможность обучать модель на разнообразных типах видео с разным разрешением, длительностью и ориентацией.
Баланс инноваций и ответственного использования
Сэм Грегори, исполнительный директор Witness, высоко оценил техническую инновацию Sora, но предупредил о рисках, связанных с технологией генерации видео. Он подчеркнул возможность дезинформации и злоупотреблений при манипуляции реалистичным видеоконтентом и настаивал на важности упреждающих защитных мер при создании и распространении контента.
OpenAI решает задачи ответственного развёртывания Sora: компания внедрила фильтры для блокировки запросов на нежелательный контент и планирует интегрировать в результаты модели механизмы обнаружения поддельных изображений и стандартные для отрасли метки метаданных. Несмотря на эти меры, развитие сферы создания синтетического контента создаёт постоянные проблемы с поддержанием целостности контента и снижением рисков злоупотреблений.

