Блог · Редакция FatherGPT · 7 мин · обновлено 11 августа 2026

Перевести текст и озвучить его голосом

Запросы «перевод текста в речь», «ии перевод текста в аудио», «программа для перевода текста в голос» — про одну и ту же работу: взять текст на одном языке и получить звучащую речь на другом. Отдельной кнопки для этого нет ни у кого, зато есть понятная связка из двух шагов.

Почему это два шага, а не один

Перевод и синтез речи — разные модели с разными задачами. Переводит текстовая модель, озвучивает — модель синтеза. Соединять их в одну кнопку заманчиво, но вредно: вы теряете возможность вычитать перевод до того, как он превратится в звук.

А вычитывать надо всегда. Ошибка в тексте на экране правится за секунду; та же ошибка, уже озвученная и вставленная в монтаж, стоит переделки всего фрагмента и ещё 200 токенов.

Порядок работы

  1. Переведите текст в чате, задав тип текста, адресата и тон — как описано в статье про нейросеть-переводчик.
  2. Прочитайте перевод глазами. Ищите не смысл, а произносимость: длинные придаточные, стечения согласных, аббревиатуры.
  3. Попросите ту же модель адаптировать текст под чтение вслух: короче предложения, меньше вводных, числа словами.
  4. Разбейте результат на куски до 1000 знаков по границам предложений.
  5. Озвучьте каждый кусок в Озвучке (ElevenLabs), одним и тем же голосом.

Шаг 3 экономит больше всего переделок. Текст, написанный для глаз, и текст для уха — разные тексты: то, что читается легко, вслух часто звучит громоздко.

Как подготовить текст, чтобы озвучка не подвела

Синтез читает ровно то, что написано, и не догадывается о ваших намерениях. Отсюда простые правила, одинаковые для любого языка.

  • Числа и даты — словами: «две тысячи двадцать шестой» вместо «2026».
  • Аббревиатуры — разворачивать или писать так, как они произносятся.
  • Имена и топонимы, где возможна ошибка ударения, — писать фонетически.
  • Паузы задаются знаками препинания: точка длиннее запятой, многоточие ещё длиннее.
  • Никаких режиссёрских пометок в поле текста — они будут прочитаны вслух.

Последний пункт стоит подчеркнуть: в поле озвучки уходит буквально то, что вы туда вписали. Строка «Подача: тёплая» превратится в фразу, которую диктор зачитает. Подробности — в статье про качество русской озвучки.

Языки и голоса: что важно знать заранее

Модель синтеза называется Multilingual v2 и знает много языков — русский и английский среди них уверенно. Но список конечен, и редкие языки в него могут не входить.

Проверяется это за одну генерацию: возьмите короткую фразу на нужном языке и послушайте. 200 токенов — недорогая цена за определённость до того, как вы спланируете под это проект.

Голосов 22 — 11 женских, 10 мужских и один нейтральный. Они одни и те же для всех языков; отдельного «носителя языка» под каждую локаль нет. Для дикторского закадра это нормально, для дубляжа с характерами персонажей — нет.

Клонирования голоса и голосов конкретных людей у нас нет. Если задача — переозвучить ролик своим голосом на другом языке, наш инструмент не подойдёт.

Сколько стоит связка

Перевод в чате стоит немного — это обычный текстовый запрос. Основная цена в озвучке: 200 токенов за генерацию, плоско, до 1000 знаков.

Материал на 4 000 знаков — это четыре генерации, 800 токенов, плюс перевод и одна-две переделки. В месячный пакет на 12 000 токенов таких материалов помещается около десяти, и это с запасом на текстовые запросы. Цены — на странице тарифов.

На бесплатном доступе связка не соберётся: 40 токенов в сутки против 200 за одну озвучку. Перевести бесплатно можно, озвучить — нет.

Разбор на примере: ролик на английском

Допустим, есть русский сценарий обучающего ролика на 3 500 знаков, нужна английская озвучка.

  1. Перевод в чате с указанием: обучающее видео, аудитория — начинающие, тон дружелюбный, термины оставить принятыми в отрасли.
  2. Просьба адаптировать под чтение вслух. Модель разбивает длинные предложения и убирает конструкции, которые трудно произнести.
  3. Вычитка глазами: проверяются числа, названия продуктов, имена.
  4. Разбивка на четыре куска по границам смысловых блоков, каждый до 1000 знаков.
  5. Четыре генерации одним голосом — например Brian.
  6. Сборка в монтаже: между кусками нужна пауза 0,3–0,5 секунды, иначе стык слышен.

Итого 800 токенов на озвучку плюс текстовые запросы. Времени — около получаса, из которых на сам синтез уходит меньше минуты, а всё остальное занимает подготовка.

Типичные ошибки этой связки

  • Озвучивают перевод, не прочитав его. Ошибка, найденная на слух, стоит переделки всего куска.
  • Оставляют в тексте английские сокращения вроде «e.g.» и «etc.» — они читаются буквально и звучат странно.
  • Меняют голос между кусками одного материала. На стыке это слышно мгновенно.
  • Режут текст ровно по 1000 знаков, обрывая предложение. Пауза встаёт в середине фразы.
  • Забывают, что режиссёрские пометки в поле озвучки читаются вслух.

Отдельно про числа: «2026» модель может прочитать как «двадцать двадцать шесть» или «две тысячи двадцать шесть» в зависимости от языка и окружения. Если год важен — пишите словами, это дешевле, чем переслушивать.

Частые вопросы

Перевод и синтез речи — разные модели с разными задачами. Промежуточный шаг нужен именно для того, чтобы вычитать перевод до того, как он превратится в звук: ошибка на экране правится за секунду, а уже озвученная стоит переделки всего фрагмента.

Поле озвучки читается буквально: всё, что вы туда вписали, будет произнесено. Режиссёрские пометки, имена говорящих перед репликами и служебные скобки нужно убрать до генерации.

Попросить ту же модель адаптировать текст под чтение вслух: короче предложения, меньше вводных, числа словами, аббревиатуры развёрнуты. Текст для глаз и текст для уха — разные тексты, и этот шаг экономит больше всего переделок.

Нет, клонирования голоса у нас нет — доступны только готовые голоса сервиса. Если задача в том, чтобы переозвучить ролик собственным голосом на другом языке, этот путь её не закрывает.

Попробуйте сами

Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.