Kitobni o'qish: «Как объяснить нейросети движение: практическое руководство по режиссуре генеративного видео»
К читателю
Генеративное видео похоже на продолжение работы с изображением только на первый взгляд. В статичном кадре достаточно описать, что должно находиться перед камерой. В видео нужно спроектировать изменение во времени: что делает герой, почему движется предмет, как реагирует среда, что происходит с камерой и в каком состоянии сцена должна перейти к следующему плану.
Эта книга рассматривает видеонейросеть как инструмент постановки, а промпт — как часть режиссёрского пакета. К нему добавляются география сцены, блокинг, раскадровка, аниматик, крупность, ось действия, роли референсов, временной beat sheet, монтаж, критерии приёмки и диагностика ошибок. Главный вопрос здесь не «какая формулировка сработает», а «как поставить сцену так, чтобы задача была выполнимой и проверяемой».
Книга не привязана к одному сервису. Модели, интерфейсы, лимиты и режимы быстро меняются, а принципы постановки остаются устойчивыми: начало и конец движения, причинность, траектория, перспектива, экранное направление, контакт, непрерывность сцены (continuity), монтажная логика и контроль того, что не должно изменяться.
Материал лучше пройти последовательно хотя бы один раз, а затем использовать отдельные главы и приложения как рабочий справочник. Финальный практикум объединяет весь процесс: бриф → блокинг → раскадровка → аниматик → референсы → клипы → диагностика → монтаж → звук → контроль качества и экспорт.
ЧАСТЬ I. ВРЕМЯ ВНУТРИ ПРОМПТА
Глава 1. Кадр и движение - две разные задачи
Промпт изображения отвечает на вопрос «что находится перед камерой». Промпт видео обязан ответить ещё минимум на три: что меняется, как быстро это происходит и чем заканчивается. Фраза «женщина стоит у окна в дождливую ночь» описывает состояние. Фраза «женщина медленно переводит взгляд на улицу, делает полшага ближе к стеклу и останавливается; дождь идёт за окном; камера неподвижна» уже задаёт временную структуру.
Новичок часто пытается сделать видео, просто добавив к промпту изображения слово «cinematic» или «dynamic». Для модели это почти не инструкция. Динамика должна быть наблюдаемой: повернуть голову, сделать два шага, поднять чашку, распахнуть дверь, проехать справа налево. Чем точнее глагол, тем легче понять, какой промежуточный кадр должен появиться между началом и концом.
Второе отличие - необходимость сохранять то, что двигаться не должно. Если герой меняет позу, это не означает, что вместе с ним должны меняться возраст, одежда, интерьер и время суток. Поэтому видеопромпт полезно мысленно делить на две части: «что изменить» и «что удержать».
Третье отличие - короткий горизонт времени. Генератору легче качественно выполнить одно действие за несколько секунд, чем рассказать целую сцену с пятью событиями. Длинная драматургия почти всегда надёжнее собирается из нескольких коротких клипов.
КЛЮЧЕВАЯ МЫСЛЬ. Сначала сформулируйте один главный глагол сцены. Всё остальное должно либо поддерживать его, либо оставаться неизменным.
ПРОМПТ. Исходный кадр сохраняется. Герой медленно поворачивает голову вправо к окну и останавливает взгляд. За окном идёт дождь. Камера статична. Не менять лицо, одежду, фон и освещение.
ПРАКТИКА. Возьмите любой статичный портрет. Напишите два запроса: первый - только состояние, второй - с одним глаголом и конечным состоянием. Сравните, насколько понятнее второе задание.
Движение как изменение состояния
Полезно добавить ещё одно различие: видеомодель получает не только описание картинки, но и задачу на преобразование. Поэтому хороший запрос можно проверить простым вопросом: если показать человеку первый и последний кадр без промежуточных, сможет ли он понять, что именно должно было произойти между ними? Если нет, движение описано слишком расплывчато.
Удобно мыслить четырьмя слоями. Первый — состояние героя или объекта. Второй — его изменение. Третий — реакция среды. Четвёртый — камера. Не все слои обязаны двигаться. Более того, устойчивые ролики часто получаются тогда, когда два или три слоя сознательно заморожены. Например: герой поворачивает голову; волосы едва реагируют; фон и камера неподвижны.
Фраза «сцена становится напряжённее» для модели почти бесполезна. Переводите драматургию в наблюдаемые признаки: герой прекращает движение, задерживает взгляд, чуть сильнее сжимает предмет, камера медленно приближается. Тогда эмоциональный эффект рождается из физических изменений, а не из абстрактного прилагательного.
Мини-упражнение
Возьмите три абстрактные формулировки — «становится страшно», «герой решается», «сцена оживает» — и перепишите каждую через видимые изменения. Не добавляйте больше трёх глаголов. Затем выберите один главный глагол и сделайте остальные поддерживающими.