Сегодня хочу разобрать тему нейросетей для генерации видео. В соцсетях довольно много вижу нейрослоп-сериалов и думаю, что должен что-то сказать по этому поводу.
Я, конечно, не AI-инженер, но примерно понимаю, как это всё работает. В этой статье я разберу, как работают диффузорные ИИ-модели, чем они хороши и чем плохи, а также как можно было бы решить их проблемы.
Диффузоры
Существуют различные нейросети для генерации видео: Seedance, Runway, Kling AI и так далее. Их всех объединяет то, что они являются диффузорами — то есть они как «угадайки» предсказывают, где и какого цвета должен быть следующий пиксель.

Процесс на примере изображений (пошагово):
Прямая диффузия (добавление шума): Нейросеть берёт исходное изображение и шаг за шагом добавляет к нему случайный шум, пока изображение полностью не станет «белым шумом».
Обучение: Модели показывают этот «белый шум», и её задачей становится угадать, какой шум был добавлен на конкретном шаге.
Обратная диффузия (генерация): Модель начинает удалять шум шаг за шагом, проясняя конкретный объект.
Плюсы таких моделей: высокая детализация, разнообразие генераций и точное управление (промты / ControlNet).
Минусы: медленная скорость и артефакты.
Артефакты
Самая главная проблема, на мой взгляд. Я уже не раз видел новости, где студии пытаются создать полнометражные фильмы с помощью ИИ-инструментов...
Чего только стоят выражения лиц персонажей и их топорная мимика. Нейросеть генерирует предметы, проходящие сквозь друг друга, генерирует по шесть, а то и больше пальцев на руках, ну и пространство вокруг главных объектов постоянно меняется.
Студии, конечно, редактируют результаты, которые выдаёт ИИ, большинство артефактов получается купировать, но, по моим наблюдениям, пространство, в котором происходят действия, всегда меняется, а мимика выглядит неживой.
3D + нейросеть
Именно из-за этих архитектурных ограничений пикселей рождается идея совместить ИИ с классической трёхмерной графикой. Проблему с неестественностью объектов может решить 3D-моделинг. Готовые смоделированные объекты не могут просто размазаться во время движения, поэтому я считаю, что если хочется создать продукт, который будет не стыдно показывать на публику, нужно соединить ИИ-инструменты и 3D. Некоторые сервисы уже существуют по отдельности:
Tripo AI — генератор 3D-моделей.
ActorCore AccuRIG — приложение для авториггинга.
AutoRemesher 1.0 — инструмент для автоматической квадро-ретопологии.
И прочие инструменты.
Если правильно комбинировать их, то, возможно, получился бы неплохой конвейер. Опять же, вопрос в том, сколько времени будет занимать генерация видео через такой конвейер. Помимо генерации самих объектов, ретопологии и авториггинга, нужно учесть, что в качественных видео очень много мелких деталей (так что если кто-то, такой же амбициозный, как я, захочет сделать что-то вроде такого конвейера, столкнётся со сложностями создания волос на голове).
Мой вердикт
Создать диффузионную модель для генерации видео, конечно, проще, но лично я бы не стал создавать крупные кинематографичные проекты с помощью неё. Сколько бы мы ни скормили нейронке примеров — она где-нибудь допустит артефакт.
Спасибо за прочтение.
Комментарии (8)

martyncev
21.07.2026 10:06Хотелось бы, что бы искусство оставалось искусством. Что бы актеры были живые, учились, выступали в театрах, а потом уже набравшись опыта снимались в кино. А не вот это то вот всё хайпожерное, упрощенно-вылизанное, ИИ генерированное, бездушное.

funca
21.07.2026 10:06Что бы актеры были живые, учились, выступали в театрах, а потом уже набравшись опыта снимались в кино.
Театр и кино это довольно разные направления в плане мастерства, которое требуется от актёра. Как марафон и спринт для бегунов. Первые живут сезонами по несколько часов в день в одних и тех же ролях и могут говорить шёпотом так, чтобы его было четко слышно даже в последнем ряду. У вторых сцены с посекндной нарезкой, способность выучить роль за ночь, контроль микродвижений когда тебя снимают крупным планом, а умение говорить может быть опциональным. Универсалов, у которых хорошо получается и то и другое, можно пересчитать по пальцам. Я не против ИИ когда оно к месту.

biryukovaolga
21.07.2026 10:06И хорошо, что у таких моделей есть минусы, хотелось бы, чтоб как можно дольше ИИ не могло залезть полностью в киноиндустрию, никогда не сможет ИИ передать те эмоции, которые передают актёры через экран

KRZC
21.07.2026 10:06Занятное чтиво, продолжай в том же духе! Будет что-нибудь про остальное из категорий генеративных нейросетей? Напишешь статью про GAN и VAE?
debagger
Так в чем проблема, возьмите и создайте. Вон в соседней новости "рой ИИ-агентов Cursor создал SQLite с нуля за $1339", а тут надо собрать из готовых сервисов продукт. Думаю в $100 уложитесь, а киноиндустрия эту разработку с руками оторвет.
Vegard01Vegard Автор
Звучит довольно просто, но дьявол кроется в деталях. Жаль конечно что кинематографисты до сих пор не додумались за 100$ собрать что-то подобное.