Что получается хорошо
Ровный повествовательный текст — сильная сторона ElevenLabs Multilingual v2 на русском. Описание, объяснение, инструкция, новостная подводка, закадровый комментарий: там, где нужен спокойный человек, читающий по делу, результат отличить от живой записи на слух почти невозможно.
- Обычные предложения средней длины с прямым порядком слов.
- Перечисления через запятую — интонация перечня отрабатывается корректно.
- Вопросы: подъём тона в конце звучит естественно.
- Диалоговые реплики без криков и без сарказма.
- Профессиональная лексика, если слова написаны кириллицей.
Дыхание и микропаузы модель расставляет сама, и это ощутимо отличает её от старых синтезаторов. Робота в речи нет — есть человек, который читает с листа, не сильно вникая в смысл. Ровно так это и стоит воспринимать при планировании.
Технические рамки те же, что и у любой другой задачи с голосом: до 1000 знаков за генерацию, 200 токенов за каждую независимо от длины. Базовый порядок работы разобран отдельно — как озвучить текст, а устройство самого счётчика списаний — в справке про токены.
Числа: главный источник брака
Цифры записаны знаками, а произносятся словами, и правил преобразования в русском много: падежи, род, согласование с единицами измерения. Модель угадывает, и угадывает не всегда.
- «1500 ₽» — символ валюты может выпасть или прочитаться как «рубль» в неправильном падеже.
- «2026 г.» — сокращение «г.» читается то «год», то «город», то «грамм».
- «10–15 минут» — диапазон через тире часто звучит как два отдельных числа подряд.
- «№ 7», «§ 3», «×2» — служебные символы либо игнорируются, либо получают неожиданные названия.
- «1,5» и «1.5» дают разный результат: запятая обычно читается как «целых», точка может стать паузой.
Лечение одно: писать числа словами прямо в исходнике. «Одна тысяча пятьсот рублей», «в две тысячи двадцать шестом году», «от десяти до пятнадцати минут». Выглядит непривычно на экране, но вы этот текст не публикуете — он существует только ради звука.
Проверить, как прочитается спорный фрагмент, стоит на коротком пробнике: соберите все числа из текста в одну фразу и озвучьте её отдельно. Одна такая проверка стоит 200 токенов — столько же, сколько полная перегенерация страницы, но экономит две-три попытки.
Аббревиатуры и сокращения
С сокращениями та же беда, что и с числами: по написанию не видно, читается ли слово по буквам или целиком. «ГОСТ» произносится как слово, «НДС» — по буквам, «ИП» — по буквам, «МФЦ» — по буквам, а «ЕГЭ» — как слово. Никакого правила, только традиция, и модель эту традицию знает выборочно.
- Расшифруйте, если расшифровка не утяжеляет фразу: «налог на добавленную стоимость» вместо «НДС» в первый раз, дальше можно и сокращением.
- Запишите произношение кириллицей: «эн-дэ-эс», «эм-эф-цэ». Дефисы задают буквенное чтение достаточно надёжно.
- Сокращения с точкой раскрывайте всегда: «т. д.», «т. е.», «см.», «руб.» — все они дают лотерею.
- Единицы измерения пишите словами: «килограмм», «квадратных метров», «мегабит в секунду».
Иностранные имена и латиница
Multilingual-модель узнаёт латиницу и переключается на английское произношение прямо посреди русской фразы. Формально это правильно, на слух — заметный шов: голос будто меняет акцент на одно слово и возвращается обратно.
Второй слой проблемы — ударения в незнакомых именах. Фамилии, названия компаний, топонимы модель произносит по общему правилу, а исключений в русском больше, чем правил. Отдельная категория — омографы, где ударение меняет смысл: за́мок и замо́к, о́рган и орга́н, а́тлас и атла́с. Из текста без контекста выбрать верный вариант невозможно.
- Переводите бренды в кириллицу так, как их произносят: «Ютуб», «Телеграм», «Гугл».
- Домены и почту записывайте по звучанию: «фазэргэпэтэ точка ру».
- Незнакомую фамилию проверьте на пробнике до чистовой озвучки — угадать заранее не выйдет.
- Если омограф читается неверно, замените слово синонимом или добавьте рядом уточняющее слово, которое задаёт контекст.
Слова, на которых спотыкаются чаще всего
Список стоит держать под рукой и проверять по нему текст перед озвучкой. Здесь ударение зависит от смысла, и подсказать его может только соседнее слово: за́мок и замо́к, о́рган и орга́н, а́тлас и атла́с, мука́ и му́ка, ви́дение и виде́ние, сто́ящий и стоя́щий, хара́ктерный и характе́рный. Отдельно живут формы вроде «дома» и «стороны», где падеж меняет ударение, а написание — нет.
Приём, который решает почти все такие случаи: поставьте рядом слово, которое однозначно задаёт смысл. «Старинный замок на скале» читается верно чаще, чем «замок» в перечислении. «Мешок муки» — верно, «килограмм муки» — тоже. Контекст здесь работает лучше любых хитростей с написанием.
Разбор: абзац до и после переписывания
Теория выглядит очевидной, пока не увидишь разницу на живом тексте. Возьмём типовой фрагмент из описания услуги — ровно такой, какой обычно копируют с сайта прямо в поле озвучки.
Как было
«Тариф от 1500 ₽/мес. включает НДС и действует с 01.09.2026 г. Оплата картами РФ, поддержка 24/7, срок обработки заявки 10–15 мин. Подробности на сайте example.ru или по т. 8-800-000-00-00.»
Что здесь сломается: цена прочитается как «одна пятьсот», дробь «₽/мес» превратится в набор слов, «НДС» и «т.» — лотерея, дата в цифрах развалится на три числа, диапазон «10–15» прозвучит как два отдельных числа, латиница переключит акцент, а телефон через дефисы модель прочитает по цифре с рваным ритмом.
Как стало
«Тариф начинается от полутора тысяч рублей в месяц, налог на добавленную стоимость уже включён. Он действует с первого сентября две тысячи двадцать шестого года. Оплата картами российских банков, поддержка круглосуточная. Заявку обрабатываем за десять — пятнадцать минут. Подробности на сайте экзампл точка ру или по телефону восемь восемьсот, ноль ноль ноль, ноль ноль, ноль ноль.»
Текст стал длиннее на треть, и это нормально: он существует только ради звука, глазами его никто читать не будет. Зато он читается с первого раза, и вы не тратите 200 токенов на вторую попытку. Кстати, про длину: следите за счётчиком под полем — после переписывания абзац легко перерастает лимит в 1000 знаков.
Эмоции: где проходит потолок
Восклицательный знак добавляет нажим, но крика не будет. Шёпот, сарказм, злость, слёзы, резкая смена настроения внутри реплики — этого синтез не отыгрывает. Реплика «Да ты издеваешься!» прозвучит ровно и вежливо, и никакой набор знаков препинания это не изменит.
Причина техническая: поле принимает только текст, других параметров у модели в интерфейсе нет. Всё, что вы напишете в скобках или через двоеточие в надежде задать подачу, будет произнесено вслух дословно. Пометка «(с иронией)» станет словами «с иронией» и испортит дубль.
Что реально влияет на эмоциональную окраску: выбор голоса из четырёх доступных, длина предложений, знаки препинания и сама лексика. Резкие короткие фразы звучат жёстче длинных. Как это использовать под разные задачи, разобрано в статье про голоса персонажей.
Как переписать текст, чтобы он зазвучал
Практический чек-лист перед вставкой в поле озвучки. Проход по нему занимает пять минут и экономит те самые 200 токенов на каждой не случившейся перегенерации.
- Все числа — словами, включая даты, суммы, проценты и диапазоны.
- Все сокращения — расшифрованы или записаны произношением через дефис.
- Вся латиница — переведена в кириллицу по звучанию.
- Предложения длиннее 25 слов — разрезаны на два.
- Скобки, сноски, маркеры списков и эмодзи — удалены.
- Абзацы разделены пустой строкой: это даёт смысловые паузы.
- Спорные слова с ударением — вынесены в отдельный пробник.
Механическую часть удобно поручить текстовой модели. Запрос вида «перепиши текст под озвучку: числа словами, сокращения расшифруй, латиницу передай кириллицей, предложения длиннее двадцати пяти слов раздели, смысл не меняй» хорошо отрабатывает GPT-5.6 Terra за 16 токенов. Для аккуратной вычитки готового текста подойдёт Claude Sonnet для вычитки, а базовый шаблон переписывания лежит в промптах.
И про вход в сам инструмент. Одна генерация озвучки стоит 200 токенов, поэтому на бесплатных 40 токенах в сутки её не запустить. Чтобы прогнать свой текст и услышать, как он звучит, нужен минимум пробный день за 1 ₽ — там 300 токенов, то есть одна озвучка. Дальше считайте по тарифам: недельный пакет на 4500 токенов даёт 22 генерации, месячный на 12 000 — шестьдесят.
Частые вопросы
Числа записаны знаками, а произносятся словами, и правил преобразования в русском много: падежи, род, согласование с единицами. Модель угадывает и угадывает не всегда — пишите числа, даты и диапазоны словами прямо в исходнике.
По написанию не видно, читается сокращение по буквам или целиком: «ГОСТ» произносится как слово, «НДС» — по буквам. Расшифровывайте или записывайте произношение кириллицей через дефис, а единицы измерения пишите словами.
Модель узнаёт латиницу и переключается на английское произношение прямо посреди русской фразы. Бренды, домены и адреса почты записывайте кириллицей по звучанию — шов исчезнет.
Нет. Восклицательный знак добавит нажим, но не громкость, а пометка в скобках будет прочитана вслух дословно. Окраску задают выбор голоса, длина предложений и сама лексика.
Попробуйте сами
Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.