Если попросить нейросеть "сгенерируй видео" одной фразой, результат почти всегда получается случайным. Работает связка из двух моделей. Сначала генерируется один статичный лист с раскадровкой (несколько пронумерованных кадров-панелей), а затем этот лист превращается в видео покадровым промтом с таймкодами, планами и звуком. Ниже - весь метод на примере кроссовка, который оживает по ночам, плюс более продвинутая версия приёма с черновым сториборд-скетчем. Все промты внутри - рабочие, я гоняла их сама.

Раньше, чтобы снять короткий сюжетный ролик, нужны были команда, камера и монтаж. Сейчас я собрала такой ролик за вечер с помощью двух нейросетей. Одна рисует раскадровку, вторая оживляет её в видео.

Почему "сгенерируй видео" не работает

Первое, что я попробовала, было предсказуемо. Я отправила один длинный текстовый промт с описанием сюжета целиком сразу в видеомодель. Получился хаос. Герой менял внешность между секундами ролика, камера дёргалась без всякой логики, а сюжет, который я держала в голове, модель понимала по-своему.

Причина не в кривом промте. Видеомодель одновременно решает две разные задачи. Ей нужно понять, что нарисовать, и как это должно двигаться во времени. Когда обе задачи сжаты в один запрос, модель постоянно жертвует одной ради другой. Либо держит красивую картинку и теряет последовательность действий, либо честно следует сюжету и рисует случайного персонажа в каждом кадре. Сколько промт ни переписывай, это не лечится.

Поэтому я разделила процесс на два отдельных шага. Сначала идёт только композиция, без всякого движения. Это одна картинка с несколькими пронумерованными кадрами-панелями, как лист раскадровки в кино или анимации. На этом этапе решается, что вообще происходит в ролике. Кто герой, где действие, какие планы и ракурсы. Ошибиться здесь дёшево - переделать одну панель на плоской картинке в разы быстрее и дешевле, чем перегенерировать весь видеоролик.

И только когда лист устраивает, он превращается в видео. Кадр за кадром, с движением, камерой и звуком, расписанными отдельно для каждой панели.

Разница на практике огромная. Я вижу сюжет и композицию ещё до того, как трачу время и генерации на видео, и могу поправить один кадр, а не переделывать всё с нуля. Метод универсальный. Подходит для любой истории и любого визуального стиля - мультфильма, реалистичного видео, рекламного ролика. Дальше разберу его на примере, который тестировала сама. Кроссовок оживает по ночам в закрытом магазине и сбегает погулять по городу. Классический приём "оживший продукт", который легко переложить на любой товар.

Шаг 1. Сформулируйте историю в одну фразу

Прежде чем что-то писать в нейросеть, я всегда придумываю логлайн. Это одно предложение с героем, местом и событием. Это выглядит как формальность, но экономит время на всех следующих шагах, потому что заранее понятно, что вообще происходит и куда двигать камеру.

Заодно решаю три вещи. Сколько героев в кадре, где происходит действие и какая эмоция или поворот стоит в центре сюжета. Для кроссовка это звучало так. Ночью в закрытом магазине оживает кроссовок, сбегает погулять по городу, а к рассвету должен незаметно вернуться на полку.

Шаг 2. Промт для сториборда

Сториборд - это одна картинка с несколькими панелями, обычно 6-8, как страница комикса. Промт для неё складывается из простых блоков. Что за история, сколько панелей, какой стиль, что происходит в каждой панели по отдельности. Вот шаблон, который я использую каждый раз.

Сделай раскадровку из [N] пронумерованных панелей на одной странице, горизонтальный формат [16:9].

Стиль: [опишите стиль - мультфильм, реалистичное фото, рисованный, любой другой].

Персонажи должны быть узнаваемы и одинаковы на каждой панели: [опишите внешность героев - коротко, но конкретно].

Тема: [логлайн истории из шага 1]

Окружение: [где происходит действие]

Настроение: [как меняется эмоция от начала к концу]

Биты (по одной строке на панель):

1. [план камеры]. [Что происходит].

2. [план камеры]. [Что происходит].

...

Используй разные ракурсы камеры: крупный план, широкий, низкий угол, верхний, боковой, задний, 3/4 - не повторяйте один и тот же план два раза подряд.

Сохраняй чёткую последовательность и логику движения между панелями.

Без текста и подписей на изображении.

А вот промт, который я реально отправляла под историю с кроссовком:

Сделай раскадровку из 8 панелей на одной странице, сетка 4×2. Каждая отдельная панель - в соотношении сторон 3:4 (портретная ориентация).

Стиль: яркая стилизованная 3D-анимация, глянцевый рекламный рендер, атмосфера ночного города.

Персонаж: белый кроссовок с ярко-оранжевой подошвой и шнурками. Пока он "живой" и находится в приключении - на верхней части кроссовка (в районе язычка) видны два больших милых мультяшных глаза, которые придают ему характер. В самом первом и в самом последнем кадре, когда кроссовок стоит на полке как обычный товар, глаза не видны - он выглядит как самый обычный кроссовок без лица.

Внутри рамки каждой панели - только рисунок кадра, без цифр, номеров и текста. Под каждой панелью, за пределами рамки, можно разместить короткую подпись плана словами (например "общий", "крупно") - но не внутри кадра и без цифр. Порядок панелей определяется расположением на странице: слева направо, сверху вниз.

Тема: в закрытом ночном магазине кроссовок оживает, спрыгивает с полки и сбегает погулять по городу, пока никто не видит, а к открытию должен успеть вернуться на место и снова "уснуть" - глаза закрываются и исчезают.

Окружение: интерьер обувного магазина ночью, затем пустые ночные улицы с неоновыми вывесками, лужи с отражениями огней, рассвет ближе к концу.

Настроение: сначала осторожное и любопытное, в середине - азартное и весёлое приключение, в конце - лёгкая спешка и уютное возвращение.

Биты (в порядке слева направо, сверху вниз):

1. Широкий план. Тёмный магазин, ряды обуви на полках, кроссовок как обычный товар, глаз не видно.

2. Крупный план. Глаза открываются и загораются, кроссовок аккуратно спрыгивает с полки.

3. Низкий план. Крадётся мимо спящего охранника к выходу, глаза настороженно осматриваются.

4. Широкий план. Выскакивает на ночную улицу с неоновыми огнями, глаза светятся от восторга.

5. Динамичный боковой план. Приземляется прямо в лужу, глаза зажмурены от удовольствия, брызги вокруг.

6. Верхний план. Мчится по пустой улице между тенями зданий, глаза прищурены от скорости.

7. Средний план. Замечает светлеющее небо, глаза расширяются от тревоги, разворачивается и бежит обратно.

8. Широкий финальный план. Запрыгивает на полку, глаза закрываются и полностью исчезают за секунду до того, как загорается свет магазина.

Используй разные ракурсы камеры, не повторяйте один и тот же план два раза подряд. Сохраняй чёткую последовательность и логику движения между панелями.

Этот текст я загружала в модель для генерации изображений - например, ChatGPT с GPT Image. На выходе получается один лист с 8 (или сколько указано) пронумерованными кадрами. Если персонаж выглядит по-разному на разных панелях, не нужно перегенерировать весь лист. Проще попросить переделать конкретную панель, указав, что именно не так.

Шаг 3. Из сториборда в видео-промт

Когда лист устраивает, я перехожу к видео. Здесь каждая панель раскрывается в полноценный кадр с движением, камерой и звуком. Логика простая. Время делится на отрезки по числу панелей, и для каждого отрезка расписывается, что происходит.

Легко упустить одну деталь. Видеомодели надо прямо сказать, что раскадровка - референс последовательности, а не одна картинка, которую нужно скопировать целиком. Иначе есть риск получить на выходе видео, где просто показывают исходный лист. Вот шаблон.

Референс - прикреплённый лист раскадровки. Следуй порядку кадров, композиции и настроению, показанным на изображении, как последовательности ключевых кадров, а не одной картинкой.

Персонажи должны оставаться теми же на протяжении всего видео: [ключевые приметы внешности]. Чёткие черты, без искажений. Одежда и внешность не меняются между кадрами.

Стиль: [тот же стиль, что в сториборде].

КАДР 1 - [название сцены]

[Xс-Yс] [план и движение камеры]. [Что происходит - движение описывайте конкретно и плавно: "медленно", "плавно", "естественно"].

Звук: [конкретные звуки без музыки].

КАДР 2 - [название сцены]

[Xс-Yс] [план и камера]. [Что происходит].

Звук: [...]

... (по одному блоку на каждую панель)

Итог: чёткое изображение, стабильная картинка, без размытия и мерцания.

Звук: только естественные звуки сцены, без музыки и речи (если не нужны).

И промт, с которым я запускала видео про кроссовок.

И промт, с которым я запускала видео про кроссовок:

Референс - прикреплённый лист раскадровки. Следуй порядку кадров, композиции и настроению, показанным на изображении, как последовательности ключевых кадров, а не одной картинкой.

Не показывай сам лист раскадровки, рамки панелей, номера кадров или сетку в видео. Видео не должно начинаться или заканчиваться статичным показом исходного изображения раскадровки. Каждый кадр видео - это один полноэкранный живой план сцены, а не коллаж из панелей.

На видео не должно быть никаких цифр, номеров панелей, надписей, подписей или любого текста поверх изображения - ни в начале, ни в середине, ни в конце. Изображение полностью чистое, без цифр и текста.

Персонаж должен оставаться тем же на протяжении всего видео: белый кроссовок с ярко-оранжевой подошвой и шнурками. Форма и цвет не меняются между кадрами.

Пока кроссовок "живой" и находится в приключении - на язычке видны два больших мультяшных глаза. В первом и последнем кадре, когда он стоит на полке как обычный товар, глаз не видно - он выглядит как самый обычный кроссовок без лица.

Стиль: яркая стилизованная 3D-анимация, глянцевый рекламный рендер.

Формат кадра 4:5

КАДР 1 - Магазин ночью

[0-2с] Широкий план, статичная камера. Тёмный магазин, ряды обуви на полках, кроссовок неподвижен как обычный товар, глаз не видно.

Звук: тихий гул кондиционера, тишина ночного помещения.

КАДР 2 - Пробуждение

[2-3с] Крупный план, лёгкий наезд камеры. На язычке открываются и загораются глаза, кроссовок аккуратно спрыгивает с полки, мягко приземляется на пол.

Звук: тихий стук подошвы о пол.

КАДР 3 - Крадётся мимо охраны

[3-5с] Низкий план, камера следует сбоку. Осторожно, на цыпочках, проскальзывает мимо спящего охранника к выходу, глаза настороженно осматриваются по сторонам.

Звук: лёгкие шаги, тихий храп охранника.

КАДР 4 - На улице

[5-6с] Широкий план, лёгкая панорама. Выскакивает на ночную улицу с неоновыми вывесками, глаза светятся от восторга.

Звук: далёкий гул города, гудки машин.

КАДР 5 - Прыжок в лужу

[6-8с] Динамичный боковой план. Разбегается и весело прыгает прямо в лужу, глаза зажмурены от удовольствия, брызги разлетаются, отражения неона искажаются на воде.

Звук: громкий всплеск воды.

КАДР 6 - Ночная пробежка

[8-9с] Верхний план, камера следует сверху. Мчится по пустой улице между тенями зданий, глаза прищурены от скорости, набирает темп.

Звук: быстрый ритмичный стук подошвы по асфальту.

КАДР 7 - Пора возвращаться

[9-10с] Средний план. Замечает светлеющее небо, глаза расширяются от тревоги, резко разворачивается и бежит обратно.

Звук: учащённый стук шагов, лёгкий шелест ветра.

КАДР 8 - Возвращение на полку

[10-12с] Широкий финальный план, статичная камера. Запрыгивает на полку, глаза закрываются и полностью исчезают за секунду до того, как в магазине включается свет.

Звук: щелчок дверного замка, гул загорающихся ламп.

Итог: чёткое изображение, стабильная картинка, без размытия и мерцания.

Звук: только естественные звуки сцены, без музыки и речи.

Шаг 4. Генерация видео

Лист раскадровки загружается как референс-изображение в сервис генерации видео из картинки, я использовала Seedance 2 и Seedance 2 mini, и туда же вставляется видео-промт из третьего шага. Дальше выбирается формат кадра, обычно тот же, что и в раскадровке, и длительность.

Если сервис предлагает дополнительные настройки качества или режимы точности, для сцен с живыми людьми и сложной анимацией персонажей их стоит включать. У полной Seedance 2 диапазон качества идёт от 720p до 4K, и более высокое разрешение помогает модели точнее держать пропорции тела и мимику. У mini-версии потолок ниже, она ограничена 720p, поэтому для капризных сцен с людьми лучше сразу брать полную версию, а mini оставить для черновых прогонов.

Дальше остаётся смотреть результат и проверять три вещи. Не "плывёт" ли внешность героя между кадрами. Естественно ли выглядит движение. Совпадает ли композиция с раскадровкой. Если что-то из этого не так, обычно быстрее пересобрать конкретный кадр в видео-промте, чем перегенерировать весь ролик заново.

Шаг 5. Продолжение истории

Если нужен более длинный ролик или сериал, я возвращаюсь к модели, которая рисовала сториборд, прикрепляю тот же лист и прошу продолжение.

Вот лист раскадровки предыдущей сцены [прикрепите изображение]. Придумай следующие [N] панелей продолжения истории: [опишите, что происходит дальше].

Сохрани тех же персонажей, стиль и настроение.

Шаги 2-4 повторяются для новой раскадровки, и так по кусочкам собирается целый эпизод.

Продвинутый приём - грубый черновик вместо детального сториборда

Когда база освоена, я стала пробовать приём, который даёт ещё больше контроля. Вместо красивой детализированной раскадровки рисуется намеренно грубый черновик. Палочные человечки, простые чёрные линии, без лиц, одежды, теней и текстур. Отдельно добавляются красные рамки, обозначающие кадрирование камеры, и синие стрелки, обозначающие направление движения.

Логика здесь не очевидная, но она работает лучше, чем звучит на бумаге. Красивая детализированная картинка содержит много визуального шума. Текстуры, освещение, мелкие детали одежды. Видеомодель пытается воспроизвести весь этот шум наравне с композицией и движением, и где-то в этом процессе теряет главное - саму последовательность действий. Грубый скетч физически не может содержать лишних деталей, поэтому модели ничего не остаётся, кроме как считывать композицию, движение и порядок действий. Персонажи и сцена в итоге получаются более стабильными, а поправить черновик из палочек проще, чем переделывать готовый арт.

Для этого приёма отдельно готовится лист персонажей (character sheet), уже в полноценном стиле, с внешностью героев, и прикладывается вторым референсом вместе с черновым сториборд-листом.

Промт для чернового сториборда.

Создай страницу грубого рукописного превиз-сториборда, формат [16:9].

Используй максимально простой скетч-стиль:

- только палочные фигурки / силуэты без деталей лица, одежды, анатомии

- без текстур и теней

- чёрные свободные линии наброска

- красные рамки для обозначения кадрирования камеры

- синие стрелки для направления движения

- грубые режиссёрские наброски, не концепт-арт

Покажи [N] пронумерованных панелей на одной странице.

Тема: [логлайн истории]

Биты: [список по панелям, как в шаге 2]

Используй разные ракурсы камеры. Добавь короткие рукописные заметки возле панелей. Сохраняй чёткую последовательность движения между панелями.

Приоритет - читаемость, а не качество рисунка.

Пример, на котором я проверяла этот приём, другой. Мудрая сова-консультант.

Создай страницу грубого рукописного превиз-сториборда, формат 16:9.

Используй максимально простой скетч-стиль:

- только простые круглые силуэты без меха, глаз, клюва и деталей

- без текстур и теней

- чёрные свободные линии наброска

- красные рамки для обозначения кадрирования камеры

- синие стрелки для направления движения

- грубые режиссёрские наброски, не концепт-арт

Покажи 8 пронумерованных панелей на одной странице.

Тема: мудрая сова-консультант каждую ночь читает свою большую книгу в поисках ответа на вопрос, а на рассвете достаёт готовый светящийся совет.

Биты:

1. Широкий план. Сова сидит за столом ночью, книга закрыта, за окном луна.

2. Крупный план. Открывает книгу, начинает листать страницы.

3. Средний план. Внимательно вчитывается, задумчиво наклоняет голову.

4. Широкий план. Стол завален раскрытыми книгами и листами, сова ищет среди них нужную мысль.

5. Крупный план. Замечает нужную страницу, глаза загораются интересом.

6. Средний план. Аккуратно выписывает найденный ответ, он начинает мягко светиться на листе.

7. Широкий план. Убирает книги, за окном светлеет небо.

8. Крупный финальный план. Держит светящийся листок с ответом, довольно улыбается, за окном восход.

Используй разные ракурсы камеры. Добавь короткие рукописные заметки возле панелей. Сохраняй чёткую последовательность движения между панелями.

Приоритет - читаемость, а не качество рисунка.

И лист персонажа

У видео-промта для этого случая другая структура. Не по кадрам с таймкодами, а по смысловым блокам. Черновик не даёт точной картинки для покадрового описания, он даёт общий рисунок сцены, поэтому и промт описывает сцену целиком, а не режет её на секунды.

ЗАМЫСЕЛ: [одна-две фразы - какую историю рассказывает видео, с чего начинается, что переломный момент, чем заканчивается].

СТИЛЬ: [визуальный стиль итогового видео - не черновика, а финального результата: анимация, реализм и т.д., палитра, атмосфера].

МИР: [локация и её особенности].

РЕФЕРЕНСЫ: используй приложенный черновой сториборд как главный референс.

Относись к панелям как к последовательным ключевым кадрам, а не к одной картинке - превращай их в связную сцену с чёткой последовательностью.

Используй лист персонажей как референс внешности героев.

ПОДХОД К КАРТИНКЕ: соблюдай композицию и эмоциональный темп чернового сториборда. Приоритет - читаемость, направление движения в кадре и последовательность действия между битами. Движение должно быть спокойным и осмысленным, а не хаотичным.

И промт под сову целиком:

Референс - прикреплённый лист раскадровки. Следуй порядку кадров, композиции и настроению, показанным на изображении, как последовательности ключевых кадров, а не одной картинкой.

Не показывай сам лист раскадровки, рамки панелей, номера кадров или сетку в видео. Видео не должно начинаться или заканчиваться статичным показом исходного изображения раскадровки. Каждый кадр видео - это один полноэкранный живой план сцены, а не коллаж из панелей.

На видео не должно быть никаких цифр, номеров панелей, надписей, подписей или любого текста поверх изображения - ни в начале, ни в середине, ни в конце. Изображение полностью чистое, без цифр и текста.

Персонаж должен оставаться тем же на протяжении всего видео: пушистая фиолетовая сова с крупными фиолетовыми глазами, оранжевым клювом и пушистым кошачьим хвостом, как на референсе внешности. Форма и цвет не меняются между кадрами.

Стиль: мультяшная 3D-анимация, мягкое тёплое освещение, уютная ночная атмосфера кабинета.

КАДР 1 - Ночной кабинет

[0-2с] Широкий план, статичная камера. Сова сидит за столом, книга закрыта, за окном луна и звёзды.

Звук: тихий ночной шелест, потрескивание свечи.

КАДР 2 - Открывает книгу

[2-3с] Крупный план, лёгкий наезд камеры. Открывает книгу, начинает листать страницы.

Звук: шелест страниц.

КАДР 3 - Вчитывается

[3-5с] Средний план. Внимательно читает, задумчиво наклоняет голову набок.

Звук: тихое поскрипывание пера, шелест бумаги.

КАДР 4 - Поиск среди книг

[5-6с] Широкий план. Стол завален раскрытыми книгами, сова просматривает их одну за другой.

Звук: шорох страниц, лёгкий стук книг.

КАДР 5 - Находит нужное

[6-8с] Крупный план. Замечает нужную страницу, глаза загораются интересом.

Звук: короткий вдох удивления.

КАДР 6 - Записывает ответ

[8-9с] Средний план. Аккуратно выписывает найденный ответ, надпись мягко светится на листе.

Звук: тихое скрип пера по бумаге.

КАДР 7 - Наводит порядок

[9-10с] Широкий план. Убирает книги в сторону, за окном светлеет небо.

Звук: шорох закрываемых книг, тихое чириканье птиц вдали.

КАДР 8 - Рассвет и совет

[10-12с] Крупный финальный план, статичная камера. Держит светящийся листок с ответом, довольно улыбается, за окном встаёт солнце.

Звук: пение утренних птиц, тихий уютный шелест.

Итог: чёткое изображение, стабильная картинка, без размытия и мерцания.

Звук: только естественные звуки сцены, без музыки и речи.

В сервис генерации видео загружаются два файла - черновой сториборд и лист персонажей. Затем вставляется этот текст. Модель сама выстраивает движение во времени, ориентируясь на порядок и композицию, а не на конкретные секунды.

Ограничения подхода

Метод не убирает генеративную природу нейросетей, он только даёт больше точек контроля. Персонаж всё равно может "поплыть" между кадрами, особенно в длинных отрезках с быстрым движением, и это придётся ловить глазами при каждом просмотре результата, а не один раз на этапе промта. Черновой сториборд решает проблему стабильности лучше детального листа, но требует отдельного листа персонажей, а значит и лишнего шага перед генерацией.

Звук в этих промтах описывается текстом и генерируется вместе с видео, поэтому на сложные звуковые эффекты полагаться не стоит. Для музыки или реплик персонажей обычно нужен отдельный монтажный этап после генерации. И весь метод по-прежнему упирается в качество конкретной видеомодели. Чем лучше она умеет следовать референсному изображению, тем реже приходится пересобирать кадры вручную.

Итоговый чек-лист

  1. Сформулировать историю в одну фразу и решить, сколько нужно панелей.

  2. Зафиксировать внешность героев - она повторяется во всех промтах.

  3. Составить промт для сториборда по шаблону из шага 2, сгенерировать картинку.

  4. Проверить, что герои не меняются между панелями, при необходимости поправить.

  5. Составить видео-промт по шаблону из шага 3 - прописать кадры, таймкоды, действие, камеру и звук.

  6. Загрузить лист раскадровки в сервис генерации видео и сгенерировать ролик.

  7. Проверить результат и точечно доработать слабые кадры.

  8. Для продолжения - вернуться к листу раскадровки и попросить следующую сцену.

  9. Когда освоите базовый метод - попробовать черновой сториборд с рамками камеры и стрелками движения для ещё большего контроля.

За этим методом нет ничего сложнее двух промтов, отправленных по очереди. Но именно это разделение на "сначала картинка, потом движение" превращает генерацию видео из лотереи в процесс, который можно контролировать и повторить.

Комментарии (0)