fal · Видео

Kling для короткого рекламного ролика из текста

Генеративное видео устроено покадрово: модель делает короткую сцену на несколько секунд, а ролик собирается из таких сцен на монтаже. Kling стоит 110 токенов за клип и занимает середину линейки — дороже черновых pixverse и hailuo, но радикально дешевле veo-2 с его 1000 токенов. Для рекламного ролика на три-четыре сцены это оптимальная точка.

Почему Kling подходит для этой задачи

Kling заметно устойчивее дешёвых моделей в двух вещах, которые сразу выдают плохое ИИ-видео: он держит форму объекта на протяжении сцены и не разваливает движение камеры. Предмет не течёт и не меняет пропорции на середине клипа — а именно это делает ролик непригодным для рекламы, каким бы красивым ни был первый кадр.

Вторая причина — предсказуемая реакция на операторские команды. Наезд, отъезд, панорама, облёт вокруг предмета, съёмка с уровня стола — всё это отрабатывается как понятная инструкция. В рекламе движение камеры несёт половину смысла: наезд фокусирует внимание на товаре, отъезд открывает контекст. Модель, которая двигает камеру случайно, не даёт снять сценарий.

Третье — экономика перебора. Ролик из трёх сцен, где каждая сцена сделана с двух-трёх попыток, — это 7–9 генераций, около 900 токенов, меньше 8% месячного пакета. На veo-2 тот же перебор стоил бы 9000 токенов, то есть три четверти месяца. Разумная стратегия: черновая раскадровка на pixverse, чистовые сцены на kling, и только ключевой кадр при необходимости на дорогой модели.

Какие входные данные подготовить

Раскадровка: три-четыре сцены по одной мысли в каждой. Больше в короткий ролик не помещается, а меньше не рассказывает историю.

Для каждой сцены: субъект, его действие, движение камеры, свет, время суток и стиль съёмки.

Формат: 9:16 для сторис и вертикальных лент, 16:9 для сайта и презентации. Пропорции задаются при генерации, обрезкой их потом не исправить.

Сквозные признаки, повторяемые во всех сценах: палитра, характер света, тип оптики. Это то, что склеивает разные генерации в один ролик.

Отдельно от видео — текст закадрового голоса и подписи. Они добавляются на монтаже, а не внутри генерации.

Пошаговый процесс

Напишите раскадровку до генерации

Сцена 1 — проблема, сцена 2 — продукт в действии, сцена 3 — результат. Каждой сцене отведите одну фразу описания. Пытаться уместить всю историю в один клип бессмысленно: за несколько секунд успевает произойти ровно одно событие.

Соберите промпт сцены по формуле

Субъект и обстановка, затем действие, затем движение камеры, затем свет, затем стиль. Именно в этом порядке. Модель воспринимает начало промпта как главное, поэтому если сцена о товаре — товар идёт в первом предложении, а не после описания интерьера.

Задайте камеру одним движением на сцену

Один клип — одно движение: медленный наезд, или плавный отъезд, или облёт. Две команды в одной сцене («наезд, потом панорама») дают дёрганое непредсказуемое движение. Смену ракурса делают склейкой, а не внутри кадра.

Генерируйте сцены с общим стилевым хвостом

Последние строки промпта — свет, палитра, оптика, стиль — копируются во все сцены дословно. Без этого три клипа будут выглядеть снятыми разными операторами в разные дни, и никакой монтаж их не спасёт.

Смонтируйте и наложите звук

Соберите сцены встык, добавьте подписи и логотип поверх видео в монтажной программе, а голос сгенерируйте отдельно в ozvuchka-elevenlabs. Внутри видеомодели ни текст, ни звук делать не нужно.

Пример готового промпта

Сцена 2 из 3. Крупный план: керамическая кружка с горячим кофе стоит
на деревянном столе у окна, от поверхности напитка поднимается пар.
Действие: пар медленно вьётся, по столу проходит тёплый солнечный блик.
Камера: очень медленный плавный наезд на кружку, без рывков,
без смены ракурса внутри кадра.
Свет: мягкий утренний свет из окна слева, тёплые тона, глубокие мягкие тени.
Стиль: реалистичная рекламная съёмка, малая глубина резкости, размытый задний план,
приглушённая тёплая палитра, спокойный ритм.
Вертикальный кадр 9:16. Без текста, надписей и логотипов в кадре.

Блоки «Свет» и «Стиль» переносятся в сцены 1 и 3 без единого изменения — меняются только первые три строки с содержанием кадра и движением камеры.

Как проверить результат

Просмотрите клип покадрово в конце: чаще всего объект начинает деформироваться именно на последних кадрах, когда модели не хватает согласованности.

Проверьте руки, лица и мелкие повторяющиеся элементы — пальцы, спицы, буквы на предметах. Это зоны, где генеративное видео ломается первым.

Поставьте сцены встык и посмотрите на стык: если меняется цветовая температура или зернистость, стилевой хвост где-то разошёлся.

Посмотрите ролик без звука на телефоне. Реклама в ленте смотрится именно так, и если без голоса ничего не понятно, проблема в раскадровке.

Типичные ошибки

Пытаются вписать текст и логотип в кадр

Видеомодели не пишут буквы: надпись будет дрожать, менять форму и расползаться от кадра к кадру, а логотип превратится в подобие вашего знака. Всё оформление накладывается на монтаже поверх готового видео — это к тому же позволяет менять текст без перегенерации.

Просят сложное действие в одном клипе

Человек входит в кадр, садится, открывает ноутбук и улыбается — за несколько секунд это превращается в кашу из движений. Одна сцена содержит одно простое действие. Сложные последовательности набираются склейкой коротких клипов.

Начинают сразу с дорогой модели

Раскадровку проверяют дешёвыми генерациями: pixverse за 80 токенов покажет, работает ли идея сцены. Чистовой прогон на kling за 110 делается только после того, как раскадровка утверждена. Иначе бюджет уходит на переснятие сцен, которые всё равно не попадут в ролик.

Частые вопросы

Сколько стоит готовый ролик?

Клип — 110 токенов. Ролик из трёх сцен с двумя-тремя попытками на сцену обходится в 800–1000 токенов, то есть около 8% месячного пакета. За месяц можно собрать примерно 12 таких роликов.

Какой длины получается один клип?

Речь идёт о короткой сцене в несколько секунд — это общая логика генеративного видео. Минутный ролик собирается из десятка сцен на монтаже, а не запрашивается одной генерацией.

Есть ли звук в сгенерированном видео?

Планируйте озвучку отдельно: голос делается в ozvuchka-elevenlabs, музыкальная подложка — в muzyka-lyria-2, и всё сводится в монтажной программе. Так у вас остаётся контроль над таймингом и громкостью.

Как удержать один и тот же товар во всех сценах?

Опишите товар одинаковыми словами в каждой сцене и не меняйте формулировку. Полной идентичности генеративное видео пока не гарантирует, поэтому ключевые крупные планы товара лучше снимать реально, а генерацией добирать окружение и атмосферу.

Что выбрать для вертикального формата?

Указывайте 9:16 прямо в промпте и стройте композицию под вертикаль: объект по центру, действие в средней трети кадра. Горизонтальный клип, обрезанный в вертикаль, теряет края и обычно разваливается композиционно.

Модель Kling доступна в FatherGPT: без VPN, картой РФ, единый баланс токенов на все нейросети. Переключайтесь между моделями в одном чате — под каждую задачу своя.