02
Как писать видеопромпт: грамматика Cinema Worldbuilder
Разбор пакета ai-film-pipeline — набора скиллов для claude.ai под
продакшн видео в Higgsfield. Ценность не в самих скиллах, а в методологии: это единственный
известный мне свод правил, который объясняет, почему одни видеопромпты рендерятся,
а другие разваливаются.
Поправки к ролику
- В ролике «два скилла». В пакете их четыре, и они работают в связке: промпты для изображений, промпты для Seedance-видео, оркестратор и QC.
- Автор в озвучке «Джови» — в репозитории пайплайн назван Joey's CTRL: Hunters.
- Не сказано главное: пакет заточен под Higgsfield как среду запуска, а не под голый Seedance.
- «Пять режимов съёмки со своими линзами, светом и цветокором» — подтверждается.
Базовый принцип
Промпт — это производственный
документ, а не красивое предложение. Видеомодель следует физической, пространственной
и операторской логике заметно лучше, чем абстрактной поэзии. Каждый кадр должен отвечать:
кто в кадре, где именно сидит, в каком состоянии держится, что движется, что зафиксировано,
как работает камера и каким обязан быть финальный кадр.
01Плотность важнее длины
Целевой объём — 280–400 слов на одиночный кадр, многокадровые последовательности
до 600, но не больше. Короткие промпты рендерятся лучше длинных. Каждое слово должно работать;
сомневаешься — доверь визуал референсу и вырежи описание.
02Позитивные замки вместо запретов
У негативных формулировок слабее тяга. «Не дрейфуй» переводится в
«ботинки стоят на тех же отметках на земле». Запреты допустимы только как
подавление известных сбоев — например, строка про отсутствие текста в кадре.
03Одна идея на кадр
Одно доминирующее действие, одна стратегия камеры, одна мотивация света.
Не влезает — режь на многокадровую последовательность, а не утрамбовывай.
04Доверяй референсу
Не переописывай словами то, что уже видно на картинке. Прописывай только то,
что изображение не может передать: мокрые волосы, грязь на щеке, порванный рукав,
смена времени суток.
05Канон важнее плейта
Плейт несёт мир (локация, погода, свет, реквизит), канонический референс несёт
личность (лицо, тело, силуэт). Даже если персонаж уже виден на плейте, его канон-референс
всё равно прикрепляется отдельным слотом. Это ровно то правило, что не даёт личности «поплыть».
06Хронометраж никогда не по умолчанию
4–8 сек — одно сильное действие. 8–12 сек — действие плюс раскрытие. 12–15 сек —
2–3 бита с жёсткими склейками внутри промпта. Сложнее — разбивай на отдельные промпты.
Десять блоков в жёстком порядке
Порядок не меняется никогда, ни один блок
не выбрасывается и не сливается с соседним. Если блоку нечего сказать про сцену —
он всё равно присутствует, просто короче.
01Scene & MoodЧто происходит драматически. Энергия, а не геометрия.
02Frame MapПол в кадре: левая/центр/правая треть или x% , слой глубины, доля кадра, негативное пространство.
03Subject LockОтдельный блок на каждого персонажа: ориентация тела, поза, состояние, взгляд, точки контакта.
04Cross-Frame RulesНе меняются местами, не пересекают центр, не меняют глубину, дистанция держится.
05MovementЧетыре слоя движения с таймкодами по битам.
06Last FrameТочная финальная композиция + подавление текста в кадре.
07World PlateЛокация, время, погода, реквизит, палитра, плотность атмосферы.
08Sound BedТолько диегетический звук. Никакой музыки, лирики и саундтрека.
09Capture RealismАнти-пластик. Физика съёмки, а не железо.
10Camera CaptureОдна строка снизу: тело, линза, фильтр, движение, плёнка, грейд, fps, хронометраж. Никогда не дублируется.
Capture Realism — почему AI-видео выглядит пластиковым
Самый ценный кусок всего пакета. Главный провал
AI-видео — не кадрирование и не линза, а переконтрастная пластиковая картинка. Она берётся
из трёх дефолтных привычек модели, и блок бьёт по всем трём сразу.
1Глубина через взвешенную атмосферу
Модель по умолчанию клеит плоскую одноплановую мизансцену — воздуха между объектом
и фоном нет. Лечение: прямо прописать, что дымка и частицы висят в воздухе между
камерой, объектом и фоном, из-за чего дальние планы мягче, обесцвеченнее и
менее контрастны. Тогда фигура сидит внутри глубины, а не наклеена на задник.
2Влага без блеска
На любой мокрой сцене модель по умолчанию даёт глянцевые капли и зеркальный отблеск —
мгновенное считывание как CGI. Правильно: влажно, но матово. Мокрый асфальт
с приглушённым, а не зеркальным отражением; краска влажная, но не «шоурум».
Сцена сухая — блок целиком выбрасывается.
3Убийство бликов по зонам
«Матовая кожа» — слишком расплывчато, не держится. Зоны называются поимённо:
лоб, переносица, скулы, виски, подбородок, ключицы. Выбитый блик на переносице или
скуле — тот самый маркер AI-кожи. Плюс потолок «не уродовать»: текстура тонкая и ровная,
без акне, кратеров и клинического макро.
4Контраст, заявленный трижды
Одного упоминания мало — дефолтная тяга модели к контрасту его перебьёт. Поэтому
то же намерение формулируется с трёх сторон: тональная кривая (тени мягко подняты,
света плавно скручены, ничего не выбито и не задавлено), снятие бликов со всех
поверхностей, и сам грейд — низкоконтрастный, слегка обесцвеченный, с сохранённым теплом.
Пять режимов съёмки
M1
Narrative — реальный мир 40/55/75/100mm
Улицы, кухни, машины, бары, интерьеры — всё обжитое. Винтажный 2x анаморфот,
овальное боке, ручная камера с дыханием оператора, цветонегативная плёнка, тил-амбер, зерно 35мм.
M2
Studio / Editorial — сделанное, а не снятое 32/50/75/100mm
Белый бесконечный фон, чистая студия, фэшн-фильм, редакционный портрет. Чистая
сферическая оптика, круглое боке, штатив с опциональным медленным наездом, насыщенный
грейд. Единственный режим, где блик на хроме и стразах — намеренный.
M3
Action / Combat — документальная фантастика 40/55/75/100mm
Бой, погоня, трюки, мехи, обломки, дым, пыль. Ручная и тряская на всём хронометраже,
ни одного стабилизированного кадра, тяжёлое зерно в тенях, пыльная дымка.
Под удары — врезка 96fps.
M4
Performance / Concert — оператор из пита 40/55/75/100mm
Стадион, арена, сцена, джамботрон, лайтстики, фестивальный пит. Горизонтальные
стрик-флеры на сценическом свете, смесь питовой ручной и орбитальной камеры,
жёсткие склейки, тяжёлая объёмная дымка, реальный блеск пота.
M5
Atmospheric / Empty — среда как герой 35→85mm
Заброшенные пространства, кадры без людей, ландшафты, погодные этюды, установочные
планы. Зафиксированная камера или крайне медленный наезд, палитра задаётся hex-кодами.
Переводчик: запрет → замок
Инстинкт (не работает)
Замок (работает)
Не меняй лицо
@image1 сохраняет то же лицо, волосы, одежду и силуэт на всём протяжении
Не дрейфуй
Ботинки стоят на тех же отметках; движутся только дыхание, глаза, волосы и ткань
Не меняйтесь местами
@image1 остаётся в левой трети, @image2 — в правой; центральную линию не пересекает никто
Без лишних людей
В кадре только @image1 и @image2 на своих позициях; других фигур не входит и не проходит
Без хаоса камеры
Медленная контролируемая ручная с дыханием оператора, сохраняющая обоих в своих третях
Не моргай во время действия
Взгляд заперт на @image2 весь хронометраж, глаза ровные, контакт не разрывается
Что унести в свои промпты
- Четыре слоя движения нельзя путать: движение персонажа, микродвижение на теле (дыхание, волосы, ткань, украшения), движение среды (дождь, дым, пыль, трафик) и движение камеры. Каждый называется явно, даже если слой неподвижен — «ничего не движется» это директива, отсутствие блока таковой не является.
- Last Frame модель читает как цель и выстраивает движение всего кадра так, чтобы в него прийти. Это не украшение в конце, а рычаг управления всей динамикой.
- Cross-Frame Rules нужны потому, что без них модель на длинном кадре начинает менять персонажей местами, схлопывать разделение по глубине и плавать дистанцией. Frame Map и Subject Lock сами по себе этого не держат.
- Никаких имён, брендов и названий платформ в теле промпта. Персонаж описывается по цвету волос, одежде и опознавательным маркерам.
- Возраст не описывается — только роль, волосы, гардероб, маркеры.
- Потолок в 9 референсов — жёсткое ограничение Seedance, теги
@image1…@image9 — рабочий синтаксис, а не пометки для себя.