Почему это два шага, а не один
Перевод и синтез речи — разные модели с разными задачами. Переводит текстовая модель, озвучивает — модель синтеза. Соединять их в одну кнопку заманчиво, но вредно: вы теряете возможность вычитать перевод до того, как он превратится в звук.
А вычитывать надо всегда. Ошибка в тексте на экране правится за секунду; та же ошибка, уже озвученная и вставленная в монтаж, стоит переделки всего фрагмента и ещё 200 токенов.
Порядок работы
- Переведите текст в чате, задав тип текста, адресата и тон — как описано в статье про нейросеть-переводчик.
- Прочитайте перевод глазами. Ищите не смысл, а произносимость: длинные придаточные, стечения согласных, аббревиатуры.
- Попросите ту же модель адаптировать текст под чтение вслух: короче предложения, меньше вводных, числа словами.
- Разбейте результат на куски до 1000 знаков по границам предложений.
- Озвучьте каждый кусок в Озвучке (ElevenLabs), одним и тем же голосом.
Шаг 3 экономит больше всего переделок. Текст, написанный для глаз, и текст для уха — разные тексты: то, что читается легко, вслух часто звучит громоздко.
Как подготовить текст, чтобы озвучка не подвела
Синтез читает ровно то, что написано, и не догадывается о ваших намерениях. Отсюда простые правила, одинаковые для любого языка.
- Числа и даты — словами: «две тысячи двадцать шестой» вместо «2026».
- Аббревиатуры — разворачивать или писать так, как они произносятся.
- Имена и топонимы, где возможна ошибка ударения, — писать фонетически.
- Паузы задаются знаками препинания: точка длиннее запятой, многоточие ещё длиннее.
- Никаких режиссёрских пометок в поле текста — они будут прочитаны вслух.
Последний пункт стоит подчеркнуть: в поле озвучки уходит буквально то, что вы туда вписали. Строка «Подача: тёплая» превратится в фразу, которую диктор зачитает. Подробности — в статье про качество русской озвучки.
Языки и голоса: что важно знать заранее
Модель синтеза называется Multilingual v2 и знает много языков — русский и английский среди них уверенно. Но список конечен, и редкие языки в него могут не входить.
Проверяется это за одну генерацию: возьмите короткую фразу на нужном языке и послушайте. 200 токенов — недорогая цена за определённость до того, как вы спланируете под это проект.
Голосов 22 — 11 женских, 10 мужских и один нейтральный. Они одни и те же для всех языков; отдельного «носителя языка» под каждую локаль нет. Для дикторского закадра это нормально, для дубляжа с характерами персонажей — нет.
Клонирования голоса и голосов конкретных людей у нас нет. Если задача — переозвучить ролик своим голосом на другом языке, наш инструмент не подойдёт.
Сколько стоит связка
Перевод в чате стоит немного — это обычный текстовый запрос. Основная цена в озвучке: 200 токенов за генерацию, плоско, до 1000 знаков.
Материал на 4 000 знаков — это четыре генерации, 800 токенов, плюс перевод и одна-две переделки. В месячный пакет на 12 000 токенов таких материалов помещается около десяти, и это с запасом на текстовые запросы. Цены — на странице тарифов.
На бесплатном доступе связка не соберётся: 40 токенов в сутки против 200 за одну озвучку. Перевести бесплатно можно, озвучить — нет.
Разбор на примере: ролик на английском
Допустим, есть русский сценарий обучающего ролика на 3 500 знаков, нужна английская озвучка.
- Перевод в чате с указанием: обучающее видео, аудитория — начинающие, тон дружелюбный, термины оставить принятыми в отрасли.
- Просьба адаптировать под чтение вслух. Модель разбивает длинные предложения и убирает конструкции, которые трудно произнести.
- Вычитка глазами: проверяются числа, названия продуктов, имена.
- Разбивка на четыре куска по границам смысловых блоков, каждый до 1000 знаков.
- Четыре генерации одним голосом — например Brian.
- Сборка в монтаже: между кусками нужна пауза 0,3–0,5 секунды, иначе стык слышен.
Итого 800 токенов на озвучку плюс текстовые запросы. Времени — около получаса, из которых на сам синтез уходит меньше минуты, а всё остальное занимает подготовка.
Типичные ошибки этой связки
- Озвучивают перевод, не прочитав его. Ошибка, найденная на слух, стоит переделки всего куска.
- Оставляют в тексте английские сокращения вроде «e.g.» и «etc.» — они читаются буквально и звучат странно.
- Меняют голос между кусками одного материала. На стыке это слышно мгновенно.
- Режут текст ровно по 1000 знаков, обрывая предложение. Пауза встаёт в середине фразы.
- Забывают, что режиссёрские пометки в поле озвучки читаются вслух.
Отдельно про числа: «2026» модель может прочитать как «двадцать двадцать шесть» или «две тысячи двадцать шесть» в зависимости от языка и окружения. Если год важен — пишите словами, это дешевле, чем переслушивать.
Частые вопросы
Перевод и синтез речи — разные модели с разными задачами. Промежуточный шаг нужен именно для того, чтобы вычитать перевод до того, как он превратится в звук: ошибка на экране правится за секунду, а уже озвученная стоит переделки всего фрагмента.
Поле озвучки читается буквально: всё, что вы туда вписали, будет произнесено. Режиссёрские пометки, имена говорящих перед репликами и служебные скобки нужно убрать до генерации.
Попросить ту же модель адаптировать текст под чтение вслух: короче предложения, меньше вводных, числа словами, аббревиатуры развёрнуты. Текст для глаз и текст для уха — разные тексты, и этот шаг экономит больше всего переделок.
Нет, клонирования голоса у нас нет — доступны только готовые голоса сервиса. Если задача в том, чтобы переозвучить ролик собственным голосом на другом языке, этот путь её не закрывает.
Попробуйте сами
Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.