Правильный порядок: хронометраж, сценарий, голос
Типичная ошибка — сначала смонтировать картинку, а потом пытаться уложить в неё речь. Дальше начинается мучение: текст длиннее видео на двадцать секунд, кадры приходится растягивать, а голос ускорять нечем, потому что скорость речи у синтеза не настраивается.
Рабочий порядок обратный. Сначала вы фиксируете хронометраж — сколько секунд должен длиться ролик. Потом под этот хронометраж пишете сценарий нужного объёма. Потом озвучиваете и получаете точную длину дорожки. И только потом режете картинку под готовый звук. Так монтаж собирается за один проход.
Озвучка стоит 200 токенов за генерацию, и на бесплатном доступе (40 токенов в сутки) её сделать нельзя. Минимальный вход, чтобы попробовать на своём ролике, — пробный день за 1 ₽: 300 токенов, ровно одна дорожка. Пакеты — на странице тарифов.
Как посчитать текст под нужную длину
Ориентир: 1000 знаков текста дают примерно минуту речи в среднем темпе. Это и есть потолок одной генерации у модели Озвучка (ElevenLabs) — за раз она принимает не больше 1000 знаков.
- Ролик 30 секунд для ленты — 400–450 знаков.
- Вертикальный ролик на минуту — 800–900 знаков, а не тысяча: нужен запас на паузы и на титры в начале.
- Обучающее видео на 5 минут — около 4500 знаков, это пять генераций и 1000 токенов.
- Обзор на 10 минут — примерно 9000 знаков, десять генераций, 2000 токенов.
Запас в 10–15 процентов закладывайте всегда. Речь с паузами между смысловыми блоками идёт медленнее расчётной, а в готовом ролике почти наверняка появятся места, где голос должен помолчать: заставка, показ экрана, смена сцены. Текст, посчитанный впритык, вылезает за хронометраж почти гарантированно.
Обратный пересчёт тоже пригодится. Если текст уже написан и его 6200 знаков, значит, ролик получится минут на шесть-семь, и это семь генераций — 1400 токенов. Увидев эту цифру заранее, сценарий обычно сокращают, и правильно делают: шестиминутное видео на площадках досматривают заметно хуже трёхминутного.
Проверьте темп до того, как писать весь текст
Возьмите первые 300 знаков сценария и озвучьте их одной генерацией. Замерьте длину полученного файла секундомером и разделите 300 на число секунд — получите свою личную скорость в знаках на секунду для выбранного голоса. Дальше считайте по ней, а не по усреднённому ориентиру. Двести токенов, потраченные на такой замер, окупаются на первом же ролике, где текст лёг в хронометраж без переделок.
Сценарий пишется до озвучки, а не после
Текст для голоса устроен иначе, чем текст для чтения глазами. Причастные обороты, длинные вводные конструкции и подзаголовки на слух не работают — слушатель не может вернуться на строчку назад. Поэтому сценарий стоит писать сразу под произношение: короткие предложения, один смысл на фразу, прямой порядок слов.
Черновик удобно собрать текстовой моделью. Для роликов есть готовый шаблон запроса — сценарий для видео; если нужна структура посложнее, с репликами и сценами, лучше подойдёт Claude Sonnet 5 для сценариев. Текстовая генерация стоит 12–40 токенов против 200 за озвучку, так что вычитывать и переписывать выгоднее до записи звука, а не после.
Что убрать из сценария перед вставкой в поле
- Пометки вроде «(пауза)», «за кадром», «крупный план» — они будут прочитаны вслух.
- Имена говорящих в начале строки: «Ведущий:» превратится в слово «ведущий».
- Ссылки и адреса в исходном виде. Пишите «наш сайт фазэргэпэтэ точка ру», а не латиницей.
- Числа и знаки: «15%» лучше записать как «пятнадцать процентов».
- Эмодзи и маркеры списков — они либо игнорируются, либо читаются названием символа.
Резать текст по сценам, а не по счётчику
Для видео у нарезки на куски есть неочевидный бонус: если границы дорожек совпадают с границами сцен, монтаж становится сборкой конструктора. Каждая дорожка ложится на свой набор кадров, и подгонять ничего не нужно.
Но не переусердствуйте. Цена генерации плоская — 200 токенов и за 900 знаков, и за 90. Ролик, порезанный на двенадцать микро-сцен, обойдётся в 2400 токенов вместо 600. Разумный компромисс: объединять соседние сцены в одну дорожку, если между ними нет паузы в кадре, и разрывать там, где по монтажу и так будет остановка.
Отдельно проверьте стыки на слух. Если конец одного куска и начало другого читаются разным голосом или заметно разной громкостью — значит, вы случайно переключили голос между генерациями. Голос выбирается чипом над полем ввода и держится до следующего переключения, но при работе в несколько подходов сбить его легко.
Сведение: голос плюс музыкальная подложка
Фоновую музыку делает вторая аудиомодель — Музыка (Lyria 2), тоже 200 токенов за генерацию. Готовый разбор с примерами запросов лежит в гайде для фоновой музыки. Одна музыкальная дорожка обычно закрывает весь ролик: её зацикливают или подрезают под нужную длину.
- Положите голос первым слоем и выровняйте его громкость по всей длине — куски из разных генераций иногда отличаются на пару децибел.
- Музыку кладите вторым слоем и уводите её тише голоса примерно на 12–15 децибел. На слух это «слышно, но не мешает».
- В местах, где голос молчит, музыку можно поднять — так пауза перестаёт звучать как обрыв записи.
- Сделайте плавное затухание музыки в последние 2–3 секунды. Резкий обрыв фона в конце ролика замечают все.
- Прослушайте итог в наушниках и через динамик телефона. Соцсети смотрят с телефона, и там баланс слышен иначе.
Итоговый счёт для трёхминутного ролика: три генерации голоса (600 токенов) плюс одна музыкальная (200) — 800 токенов. Это примерно пятая часть недельного пакета на 4500 токенов. Если картинку вы тоже генерируете, добавьте расход видеомодели: например, Kling стоит 110 токенов за клип, а короткие черновые сцены на PixVerse — 80.
Разбор: ролик на две минуты от начала до конца
Задача — обзор продукта на две минуты для VK Видео и Telegram-канала. Показываю весь путь с цифрами, чтобы порядок действий был не абстрактным.
- Фиксирую хронометраж: 120 секунд. Значит, текста примерно 1800 знаков минус запас на паузы — беру 1600.
- Пишу сценарий и делю его на три смысловых блока: проблема, решение, призыв. Границы блоков совпадают с будущими сценами.
- Чищу текст под произношение: «до 30%» превращается в «до тридцати процентов», название продукта латиницей — в кириллицу, длинные предложения режу пополам.
- Озвучиваю три куска по 500–600 знаков одним голосом. Три генерации, 600 токенов.
- Слушаю дорожки подряд, ловлю одно неверное ударение в названии, переписываю слово, переозвучиваю только этот кусок — плюс 200 токенов.
- Генерирую музыкальную подложку на 200 токенов и подрезаю её под 120 секунд.
- Собираю в редакторе: голос сверху, музыка на 12–15 децибел тише, затухание в конце.
- Режу картинку под уже готовый звук — сцены подгоняются под дорожки, а не наоборот.
Итог: 1000 токенов на звук вместе с одной перегенерацией. Это чуть меньше четверти недельного пакета на 4500 токенов и примерно двенадцатая часть месячного на 12 000. Если картинка тоже генерируется нейросетью, добавьте её расход отдельно — он обычно выходит больше звукового.
Отдельно про перегенерации. Закладывайте одну лишнюю на каждые три куска: ударение в имени, съеденное слово, слишком быстрый финал. Это не брак модели, а обычная работа со звуком — живого диктора тоже переписывают.
Рутуб, VK Видео, Telegram и вертикальные форматы
Технически озвучка одинаковая, различается подача. Вертикальные ролики до минуты требуют плотного текста без разгона: первая фраза должна нести смысл, иначе досмотра не будет. Для длинных горизонтальных видео наоборот полезно оставить дыхание — паузы между блоками помогают удержать внимание.
- Telegram-канал: голосовое сопровождение к посту часто длиннее ролика, тут удобен один длинный кусок на 900 знаков.
- Вертикальные форматы: 800–900 знаков максимум, лучше 600 плюс пауза на финальный кадр.
- Обучающие видео: режьте по шагам инструкции — так потом легко заменить один шаг, не переозвучивая всё.
- Реклама: короткий текст, голос поглубже, музыка чуть громче обычного.
Практический разбор именно этой задачи, с готовым порядком действий и примерами текста, собран в гайде озвучка для видео. Тем, кто ведёт каналы регулярно, пригодится и подборка для SMM — там про поток контента, а не про отдельный ролик.
И последнее про звук в сгенерированном видео: его там нет. Видеомодели отдают немую картинку, поэтому дорожку всегда собирают отдельно — это не ограничение конкретной модели, а общее правило, о котором написано в справке про видео из текста.
Частые вопросы
Ориентир: 1000 знаков дают примерно минуту речи, и это же потолок одной генерации. На тридцать секунд берут 400–450 знаков, на вертикальный ролик в минуту — 800–900. Запас в 10–15 процентов закладывайте всегда: речь с паузами идёт медленнее расчётной.
Сначала хронометраж, потом сценарий под него, потом озвучка, и только затем монтаж картинки под готовый звук. Скорость речи у синтеза не настраивается, поэтому подгонять текст под уже смонтированное видео мучительно.
Нет, видеомодели отдают немую картинку. Голосовую дорожку и музыку всегда собирают отдельно — это общее правило, а не ограничение конкретной модели.
Голос первым слоем, с выровненной по всей длине громкостью; музыка вторым и тише голоса примерно на 12–15 децибел, с плавным затуханием в последние секунды. Итог слушайте и в наушниках, и через динамик телефона — в соцсетях баланс слышен иначе.
Попробуйте сами
Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.