Блог · Редакция FatherGPT · 7 мин · обновлено 8 августа 2026

Озвучка видео: голос вместо диктора

Разбираем порядок работы над роликом, где голос делает нейросеть: сначала хронометраж, потом сценарий, потом озвучка и только в конце монтаж. И считаем, во сколько токенов обходится трёхминутное видео.

Правильный порядок: хронометраж, сценарий, голос

Типичная ошибка — сначала смонтировать картинку, а потом пытаться уложить в неё речь. Дальше начинается мучение: текст длиннее видео на двадцать секунд, кадры приходится растягивать, а голос ускорять нечем, потому что скорость речи у синтеза не настраивается.

Рабочий порядок обратный. Сначала вы фиксируете хронометраж — сколько секунд должен длиться ролик. Потом под этот хронометраж пишете сценарий нужного объёма. Потом озвучиваете и получаете точную длину дорожки. И только потом режете картинку под готовый звук. Так монтаж собирается за один проход.

Озвучка стоит 200 токенов за генерацию, и на бесплатном доступе (40 токенов в сутки) её сделать нельзя. Минимальный вход, чтобы попробовать на своём ролике, — пробный день за 1 ₽: 300 токенов, ровно одна дорожка. Пакеты — на странице тарифов.

Как посчитать текст под нужную длину

Ориентир: 1000 знаков текста дают примерно минуту речи в среднем темпе. Это и есть потолок одной генерации у модели Озвучка (ElevenLabs) — за раз она принимает не больше 1000 знаков.

  • Ролик 30 секунд для ленты — 400–450 знаков.
  • Вертикальный ролик на минуту — 800–900 знаков, а не тысяча: нужен запас на паузы и на титры в начале.
  • Обучающее видео на 5 минут — около 4500 знаков, это пять генераций и 1000 токенов.
  • Обзор на 10 минут — примерно 9000 знаков, десять генераций, 2000 токенов.

Запас в 10–15 процентов закладывайте всегда. Речь с паузами между смысловыми блоками идёт медленнее расчётной, а в готовом ролике почти наверняка появятся места, где голос должен помолчать: заставка, показ экрана, смена сцены. Текст, посчитанный впритык, вылезает за хронометраж почти гарантированно.

Обратный пересчёт тоже пригодится. Если текст уже написан и его 6200 знаков, значит, ролик получится минут на шесть-семь, и это семь генераций — 1400 токенов. Увидев эту цифру заранее, сценарий обычно сокращают, и правильно делают: шестиминутное видео на площадках досматривают заметно хуже трёхминутного.

Проверьте темп до того, как писать весь текст

Возьмите первые 300 знаков сценария и озвучьте их одной генерацией. Замерьте длину полученного файла секундомером и разделите 300 на число секунд — получите свою личную скорость в знаках на секунду для выбранного голоса. Дальше считайте по ней, а не по усреднённому ориентиру. Двести токенов, потраченные на такой замер, окупаются на первом же ролике, где текст лёг в хронометраж без переделок.

Сценарий пишется до озвучки, а не после

Текст для голоса устроен иначе, чем текст для чтения глазами. Причастные обороты, длинные вводные конструкции и подзаголовки на слух не работают — слушатель не может вернуться на строчку назад. Поэтому сценарий стоит писать сразу под произношение: короткие предложения, один смысл на фразу, прямой порядок слов.

Черновик удобно собрать текстовой моделью. Для роликов есть готовый шаблон запроса — сценарий для видео; если нужна структура посложнее, с репликами и сценами, лучше подойдёт Claude Sonnet 5 для сценариев. Текстовая генерация стоит 12–40 токенов против 200 за озвучку, так что вычитывать и переписывать выгоднее до записи звука, а не после.

Что убрать из сценария перед вставкой в поле

  • Пометки вроде «(пауза)», «за кадром», «крупный план» — они будут прочитаны вслух.
  • Имена говорящих в начале строки: «Ведущий:» превратится в слово «ведущий».
  • Ссылки и адреса в исходном виде. Пишите «наш сайт фазэргэпэтэ точка ру», а не латиницей.
  • Числа и знаки: «15%» лучше записать как «пятнадцать процентов».
  • Эмодзи и маркеры списков — они либо игнорируются, либо читаются названием символа.

Резать текст по сценам, а не по счётчику

Для видео у нарезки на куски есть неочевидный бонус: если границы дорожек совпадают с границами сцен, монтаж становится сборкой конструктора. Каждая дорожка ложится на свой набор кадров, и подгонять ничего не нужно.

Но не переусердствуйте. Цена генерации плоская — 200 токенов и за 900 знаков, и за 90. Ролик, порезанный на двенадцать микро-сцен, обойдётся в 2400 токенов вместо 600. Разумный компромисс: объединять соседние сцены в одну дорожку, если между ними нет паузы в кадре, и разрывать там, где по монтажу и так будет остановка.

Отдельно проверьте стыки на слух. Если конец одного куска и начало другого читаются разным голосом или заметно разной громкостью — значит, вы случайно переключили голос между генерациями. Голос выбирается чипом над полем ввода и держится до следующего переключения, но при работе в несколько подходов сбить его легко.

Сведение: голос плюс музыкальная подложка

Фоновую музыку делает вторая аудиомодель — Музыка (Lyria 2), тоже 200 токенов за генерацию. Готовый разбор с примерами запросов лежит в гайде для фоновой музыки. Одна музыкальная дорожка обычно закрывает весь ролик: её зацикливают или подрезают под нужную длину.

  1. Положите голос первым слоем и выровняйте его громкость по всей длине — куски из разных генераций иногда отличаются на пару децибел.
  2. Музыку кладите вторым слоем и уводите её тише голоса примерно на 12–15 децибел. На слух это «слышно, но не мешает».
  3. В местах, где голос молчит, музыку можно поднять — так пауза перестаёт звучать как обрыв записи.
  4. Сделайте плавное затухание музыки в последние 2–3 секунды. Резкий обрыв фона в конце ролика замечают все.
  5. Прослушайте итог в наушниках и через динамик телефона. Соцсети смотрят с телефона, и там баланс слышен иначе.

Итоговый счёт для трёхминутного ролика: три генерации голоса (600 токенов) плюс одна музыкальная (200) — 800 токенов. Это примерно пятая часть недельного пакета на 4500 токенов. Если картинку вы тоже генерируете, добавьте расход видеомодели: например, Kling стоит 110 токенов за клип, а короткие черновые сцены на PixVerse — 80.

Разбор: ролик на две минуты от начала до конца

Задача — обзор продукта на две минуты для VK Видео и Telegram-канала. Показываю весь путь с цифрами, чтобы порядок действий был не абстрактным.

  1. Фиксирую хронометраж: 120 секунд. Значит, текста примерно 1800 знаков минус запас на паузы — беру 1600.
  2. Пишу сценарий и делю его на три смысловых блока: проблема, решение, призыв. Границы блоков совпадают с будущими сценами.
  3. Чищу текст под произношение: «до 30%» превращается в «до тридцати процентов», название продукта латиницей — в кириллицу, длинные предложения режу пополам.
  4. Озвучиваю три куска по 500–600 знаков одним голосом. Три генерации, 600 токенов.
  5. Слушаю дорожки подряд, ловлю одно неверное ударение в названии, переписываю слово, переозвучиваю только этот кусок — плюс 200 токенов.
  6. Генерирую музыкальную подложку на 200 токенов и подрезаю её под 120 секунд.
  7. Собираю в редакторе: голос сверху, музыка на 12–15 децибел тише, затухание в конце.
  8. Режу картинку под уже готовый звук — сцены подгоняются под дорожки, а не наоборот.

Итог: 1000 токенов на звук вместе с одной перегенерацией. Это чуть меньше четверти недельного пакета на 4500 токенов и примерно двенадцатая часть месячного на 12 000. Если картинка тоже генерируется нейросетью, добавьте её расход отдельно — он обычно выходит больше звукового.

Отдельно про перегенерации. Закладывайте одну лишнюю на каждые три куска: ударение в имени, съеденное слово, слишком быстрый финал. Это не брак модели, а обычная работа со звуком — живого диктора тоже переписывают.

Рутуб, VK Видео, Telegram и вертикальные форматы

Технически озвучка одинаковая, различается подача. Вертикальные ролики до минуты требуют плотного текста без разгона: первая фраза должна нести смысл, иначе досмотра не будет. Для длинных горизонтальных видео наоборот полезно оставить дыхание — паузы между блоками помогают удержать внимание.

  • Telegram-канал: голосовое сопровождение к посту часто длиннее ролика, тут удобен один длинный кусок на 900 знаков.
  • Вертикальные форматы: 800–900 знаков максимум, лучше 600 плюс пауза на финальный кадр.
  • Обучающие видео: режьте по шагам инструкции — так потом легко заменить один шаг, не переозвучивая всё.
  • Реклама: короткий текст, голос поглубже, музыка чуть громче обычного.

Практический разбор именно этой задачи, с готовым порядком действий и примерами текста, собран в гайде озвучка для видео. Тем, кто ведёт каналы регулярно, пригодится и подборка для SMM — там про поток контента, а не про отдельный ролик.

И последнее про звук в сгенерированном видео: его там нет. Видеомодели отдают немую картинку, поэтому дорожку всегда собирают отдельно — это не ограничение конкретной модели, а общее правило, о котором написано в справке про видео из текста.

Частые вопросы

Ориентир: 1000 знаков дают примерно минуту речи, и это же потолок одной генерации. На тридцать секунд берут 400–450 знаков, на вертикальный ролик в минуту — 800–900. Запас в 10–15 процентов закладывайте всегда: речь с паузами идёт медленнее расчётной.

Сначала хронометраж, потом сценарий под него, потом озвучка, и только затем монтаж картинки под готовый звук. Скорость речи у синтеза не настраивается, поэтому подгонять текст под уже смонтированное видео мучительно.

Нет, видеомодели отдают немую картинку. Голосовую дорожку и музыку всегда собирают отдельно — это общее правило, а не ограничение конкретной модели.

Голос первым слоем, с выровненной по всей длине громкостью; музыка вторым и тише голоса примерно на 12–15 децибел, с плавным затуханием в последние секунды. Итог слушайте и в наушниках, и через динамик телефона — в соцсетях баланс слышен иначе.

Попробуйте сами

Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.