Промпты для Veo 3.1: как писать, чтобы получить кино, а не слайдшоу

Промпты для Veo 3.1: из чего собрать запрос, как задать движение камеры, свет и звук, какие формулировки работают и почему на Veo не стоит экономить на деталях.
Veo прощает меньше, чем другие модели: на коротком небрежном запросе она выдаёт красивую, но пустую картинку без движения и смысла. Зато на подробном запросе отрабатывает как оператор с бюджетом. Промпты для Veo 3.1 это про детализацию, и ниже разберу, из каких кирпичей их собирать. Общая структура промпта у меня есть в гайде про промпт для AI-видео, тут специфика конкретной модели.
Промпты для Veo 3.1: из чего собрать запрос
Рабочий промпт для Veo 3.1 держится на пяти слоях. Сцена и герой: что в кадре, какой товар, какая обстановка. Действие: что происходит, куда движется предмет или человек. Камера: статичная, медленный наезд, облёт, проезд вдоль. Свет и атмосфера: мягкий утренний, контровой, студийный, вечерний тёплый. И звук, потому что Veo умеет нативный: шум улицы, шаги, щелчок крышки.
Чем конкретнее каждый слой, тем меньше модель додумывает от себя. «Красивое видео кроссовка» даст пустоту, «кроссовок на бетонной плите, медленный облёт справа налево, контровой свет, лёгкая пыль в воздухе, приглушённый городской шум» даст кадр.
Что даёт Veo сильнее других
Премиальная картинка и свет это её конёк, поэтому в промпт стоит закладывать киношные вещи: глубину резкости, контровой свет, отражения. Нативный звук отдельная сила: описывайте не только визуал, но и звуковую среду, иначе получите тишину или случайный фон. Подробнее о возможностях есть обзор Veo 3.1.
Чего лучше не просить
Текст в кадре Veo пишет плохо, как и большинство видеомоделей, поэтому надписи на упаковке в промпт не закладываю, их добавляю на монтаже. Сложные действия рук с мелкими предметами тоже даются тяжело. И слишком много событий за десять секунд: одна сцена, одно действие, иначе ролик рассыпается.
По моему опыту, самый частый провал это недосказанность: автор представляет кадр в голове, а в промпте пишет треть. Модель дорисовывает остальное по-своему, и результат не совпадает с ожиданием. Поэтому я пишу длиннее, чем кажется нужным, и правлю по одному параметру за раз. Прогнать несколько вариантов промпта на Veo можно во Flami и сравнить, какой слой реально повлиял на кадр.
Часто задаваемые вопросы
Из чего состоит хороший промпт для Veo 3.1?
Из пяти слоёв: сцена и герой, действие, движение камеры, свет и атмосфера, звук. Veo умеет нативный звук, поэтому звуковую среду тоже стоит описывать, иначе ролик выйдет тихим или со случайным фоном.
Почему Veo выдаёт красивую, но пустую картинку?
Чаще всего из-за короткого запроса: автор представляет кадр в голове, а пишет треть деталей, и модель додумывает остальное по-своему. Помогает подробный промпт с описанием действия, камеры и света вместо общих слов.
Можно ли просить у Veo текст в кадре?
Лучше не стоит: текст видеомодели пишут плохо, надписи выходят искажёнными. Надёжнее сгенерировать кадр без текста, а нужные надписи добавить на монтаже поверх готового ролика.
Сколько действий закладывать в один ролик?
Одно. За десять секунд несколько событий не помещаются, и ролик рассыпается на обрывки. Одна сцена, одно понятное действие, а сложную историю лучше собирать из нескольких отдельных генераций.
Источники
Об авторе
Артём Соколов
Обозреватель Flami