• Sora — модель генерации видео, выпущенная OpenAI. Она способна создавать реалистичные видео по текстовому описанию и привлекла к себе широкое внимание и дискуссии.
  • Хотя Sora — важный шаг в области искусственного интеллекта, говорить о полной замене людей или нарушении реальности пока преждевременно: ключевая задача — построение точных и обобщаемых моделей мира.
  • ИИ — это инструмент, технология, созданная людьми для решения задач. Пока у ИИ нет самосознания, он не обретёт «оригинальности» — он лишь упорядочивает уже существующие человеческие знания.

OpenAI выпустила модель «текст-в-видео»Soraв первые часы 16 февраля, что вызвало волну потрясения и восхищения в технологических и медийных кругах. Видео со взрывами, сгенерированные Sora и опубликованные на сайте OpenAI, мгновенно разошлись по сети. Чтобы получить видео, достаточно ввести текстовое описание — и Sora создаст ролик длиной до 60 секунд с детализированными сценами, живой мимикой персонажей и сложными движениями камеры, которые почти невозможно отличить от реальности. Пользователи заговорили о том, что ИИ переворачивает кино, короткие видео и игры; некоторые даже преувеличивали: «реального мира больше не существует!» Перспектива замены людей искусственным интеллектом казалась всё ближе.

Это событие заставляет восхищаться новой волной технологической революции, которую запускает Sora. Возможно, она скоро снизит барьер для обычных людей: сложная съёмка и монтаж отойдут на второй план, а воображение и креативность станут главным источником конкурентоспособности видеоконтента. В результате «компании из одного человека» и очень маленькие команды смогут создавать фильмы и видеоматериалы, которые раньше требовали огромных трудозатрат и бюджета. Технологическая волна вызывает и восхищение, и ожидания, и тревоги о замене людей и нарушении привычного порядка.

Читайте также:20 технологических гигантов обязались бороться с вмешательством ИИ в выборы

Sora не понимает физический мир и не имеет «модели мира»

Однако в последние дни я замечаю, что учёные и многие ведущие специалисты отрасли обсуждают прежде всего проблему «модели мира» у Sora. Видео, созданные Sora, выглядят крайне реалистично и согласованно, некоторые почти неотличимы от снятых человеком. Это непростая задача: машина должна понимать структуру реального мира, детали, траектории движения и изменения света и тени, не нарушая человеческого восприятия. Некоторые считают, что Sora понимает физический мир и обладает зачатками «модели мира». Модель мира ИИ можно представить как его ментальную модель — то, как система понимает и прогнозирует себя и внешний мир.

Пример с моделью мира человека: слово «модель» означает, что все знания не хранятся как набор фактов, а организованы в структуру, отражающую мир и всё, что в нём есть. Мы не запоминаем набор фактов о каждом объекте, а строим в голове бесчисленные модели — например, «городских ворот» или «тазобедренного сустава»; у каждой модели есть форма, устройство и то, как части движутся и работают вместе. Чтобы распознать объект, мы знаем, как он выглядит и каков он на ощупь; чтобы достичь цели, мы понимаем, как объекты обычно ведут себя при взаимодействии — например, какие следы укуса остаются на яблоке.

При этом многие учёные считают, что Sora не понимает физический мир и не имеет «модели мира».

Лауреат премии ТьюрингаYann LeCunсчитает, что генерация реалистичных видео по описанию не обязательно означает понимание физического мира; процесс генерации видео отличается от причинных предсказаний на основе модели мира.

Francois Chollet, автор фреймворка глубокого обучения «Keras» и исследователь ИИ в Google, допускает, что такие модели, как Sora, могут содержать «физическую модель», но вопрос в том, насколько она точна и способна ли обобщаться на новые ситуации, а не просто интерполировать данные обучения.

У видео Sora действительно есть недостатки: например, в ролике от первого лица, где муравьи ползают по гнезду, при ближайшем рассмотрении видно только четыре лапки; в видео с бегуном на беговой дорожке человек движется в противоположную сторону; а в видео «большая утка идёт по улицам Бостона» утка наступает на человека.

Jim Fan, старший научный сотрудник Nvidia, предлагает два возможных объяснения: (1) в модели может не хватать понимания физики, и она просто склеивает случайные пиксели; (2) модель пытается построить внутренний физический движок, но делает это плохо.

Инсайдеры отрасли считают, что Sora использует подход «грубой силы» — большие объёмы данных, большие модели и огромные вычислительные мощности, а в основе лежат модели мира, проверенные в играх, автономном вождении и робототехнике; на них строится модель «текст-в-видео», способная симулировать мир.

Однако это похоже на изучение законов мира через массовое «чтение картинок»: подход разумный, но так не усвоить законы, выводимые физикой, например законы Ньютона.

В конечном счёте люди изобрели самолёт не потому, что подражали птицам, а потому, что поняли аэродинамику. Sora — действительно ещё один важный шаг в ИИ: она обещает заметно упростить работу, уменьшить «инструментальную» роль человека и частично взять на себя некоторые задачи. Но настоящая замена людей или разрушение реальности пока преждевременны.

Читайте также:Может ли ИИ-чатбот заменить 700 человек?


Быстрый тест

Сколько длятся видео, созданные Sora?

A. 60 секунд

B. 2 минуты

C. 4 минуты

D. 10 минут

Правильный ответ — в конце статьи.


AIGC может стать мощным инструментом для по-настоящему оригинальных создателей контента

Дальнейшее развитие AIGC (включая, но не ограничиваясь Sora) будет подталкивать перестройку отрасли в сторону большего разнообразия. Можно использовать упрощённую аналитическую модель и разделить способности «прирождённых» интернет-создателей на два направления. Первое — чувствительность к актуальным темам, то есть умение следить за модными сюжетами и трендами. Несомненно, в любой момент основная доля трафика в соцсетях приходится на очень небольшое число актуальных тем. Умение ловить эти темы определяет краткосрочную «взрывную» популярность автора или, если говорить модным языком, его «вирусный потенциал».

Второе — тональность контента, то есть его уникальность и незаменимость. Контент некоторых авторов невозможно забыть: он несёт яркий личный отпечаток, который не может скопировать ни один конкурент. Достаточно незаменимая тональность определяет долгосрочную устойчивость автора — то, что можно назвать «живучестью» или «лояльностью аудитории».

AIGC пойдёт на пользу нишевым создателям, которые сильны именно в тональности контента и постепенно набирают популярность, но осложнит жизнь тем, кто зарабатывает на ловле актуальных тем и быстрых трендов. В эпоху AIGC погоня за актуальными темами перестанет быть базовым конкурентным преимуществом: порог входа в неё снизится. Поэтому значение тональности контента ещё вырастет и может стать единственной выигрышной картой.

Своевременное освещение актуальных тем станет в основном задачей ИИ, а главной конкуренцией — эффективность AIGC, поэтому выделиться будет сложно. Зато для авторов, чьё базовое преимущество — тональность, AIGC может стать новым мощным оружием. У интернет-пользователей сохранится естественная тяга к актуальным темам, но всё чаще они будут требовать не просто оперативный контент, а оригинальные интерпретации и глубокий анализ.

Примерно так же, как болельщики переключили внимание с быстрой и полной новостной ленты на глубокий разбор матчей и интерактивные развлекательные шоу. Качественные нишевые авторы могут работать вместе с ИИ: первые отвечают за тональность — за так называемые «озарения», вторые — за повторяющиеся задачи, то, что в контент-индустрии называют рутинной работой.

ИИ предстоит долгий путь

Sora меняет правила игры. Зная, как устроен Голливуд, они почти наверняка попытаются использовать её для замены людей. Но это инструмент: кто-то возьмёт его в руки и добьётся результата, а кто-то нет. Я ещё не видел ИИ, полного человеческих эмоций; пока всё это довольно пугающе. Полной угрозой это станет только тогда, когда ИИ сможет вызывать у людей эмоции.

Lee Romaire, креативный продюсер, лауреат премии «Эмми»

ИИ — это инструмент, технологическое средство, созданное людьми для решения задач. Пока у ИИ нет самосознания, он не будет обладать «оригинальностью», а будет лишь собирать и упорядочивать уже существующие человеческие знания. Даже продвинутые генеративные ИИ вроде ChatGPT не исключение.

Lee Romaire, лауреат премии «Эмми», поделился своим мнением: «Sora меняет правила игры. Зная, как устроен Голливуд, они почти наверняка попытаются использовать её для замены людей. Но это инструмент: кто-то возьмёт его в руки и добьётся результата, а кто-то нет. Я ещё не видел ИИ, полного человеческих эмоций; пока всё это довольно пугающе. Полной угрозой это станет только тогда, когда ИИ сможет вызывать у людей эмоции.»

OpenAI уже раскрыла технические детали Sora, показав, что её технологическая дорожная карта наследует ранее выпущенной модели «текст-в-изображение». Инновации есть, но они не революционны. По крайней мере в текущих условиях вряд ли стоит ждать от Sora настоящей «оригинальности»: эффективность и убедительность генерируемых видео по-прежнему сильно зависят от индивидуальной «настройки» пользователя.


Правильный ответ — A.