Что такое синтез речи и чем он отличается от старых читалок
Синтез речи — это преобразование написанного текста в звук. Программы, которые это умели, существуют лет тридцать: встроенный голос в Windows, экранные дикторы, настольные «читалки». Технически они делали то же самое, но разница в результате принципиальная — их слышно за секунду. Ровный металлический тон, паузы строго по знакам препинания, ударения по словарю, интонация не меняется от начала к концу.
Современные модели устроены иначе: они не собирают речь из кусочков, а порождают звук целиком, вместе с дыханием, микропаузами и естественным подъёмом и спадом голоса. На слух это уже не «робот читает», а человек говорит. Именно поэтому такую озвучку стали класть в ролики и подкасты, где раньше нужен был диктор.
В FatherGPT за эту работу отвечает одна модель — Озвучка (ElevenLabs), версия Multilingual v2. Русский для неё родной язык наравне с остальными: это не английская модель, которой скормили кириллицу, поэтому характерного акцента нет.
Как преобразовать текст в аудио: весь путь
Ничего скачивать и настраивать не нужно, всё происходит в браузере или в боте. Порядок такой:
- Откройте раздел озвучки в кабинете. Он же доступен из Telegram — аккаунт и баланс общие, файл придёт туда же, откуда вы его запросили.
- Вставьте текст в поле. Ровно тот, который должен прозвучать: поле читается буквально.
- Выберите голос из 22 доступных. Это выбор диктора, а не настройка тембра — ползунков «сделать ниже» или «добавить эмоций» здесь нет.
- Запустите генерацию и дождитесь файла. Готовое аудио скачивается и сразу годится в монтаж — дополнительная обработка не нужна.
Поле читается буквально. Если вы напишете «(с воодушевлением) Друзья, начинаем!», модель произнесёт и «с воодушевлением» тоже. Режиссёрские пометки, имена персонажей перед репликами, служебные скобки — всё это уйдёт в звук как обычный текст.
Управление интонацией здесь идёт через сам текст, а не через настройки. Точка даёт паузу короче, чем абзац. Многоточие растягивает. Восклицательный знак поднимает интонацию. Если слово читается с неверным ударением, самый надёжный приём — переписать его так, как оно звучит, а не как пишется. Подробный разбор приёмов — в статье как озвучить текст нейросетью.
Сколько стоит и почему цена плоская
Одна генерация озвучки стоит 200 токенов, и эта цена не зависит от длины текста. Озвучка на 60 знаков и озвучка на 990 знаков стоят одинаково. Из этого следует практический вывод, который экономит больше всего: не гоните текст по одному предложению.
Типичная ошибка новичка — озвучить восемь коротких фраз восемью запросами и потратить 1 600 токенов там, где хватило бы 200. Собирайте текст в один блок до тысячи знаков и отправляйте целиком.
- Пробный день за 1 ₽ — 300 токенов, то есть одна озвучка. Хватает, чтобы услышать качество на своём тексте и выбрать голос.
- Неделя за 399 ₽ — 4 500 токенов, это 22 озвучки.
- Месяц за 999 ₽ — 12 000 токенов, 60 озвучек.
- Год за 8 990 ₽ — 90 000 токенов, 450 озвучек.
Баланс общий на все 26 нейросетей: те же токены уходят на чат, картинки и видео. То есть месячная подписка — это не «60 озвучек и всё», а 12 000 токенов, которые вы распределяете сами. Как устроен счётчик, разобрано в справке про токены.
Если генерация сорвалась, токены возвращаются на баланс автоматически — платить за неудачную попытку не придётся.
Лимит 1000 знаков и что делать с длинным текстом
На одну генерацию — до тысячи знаков. Это не каприз интерфейса: поставщик берёт деньги за знаки, а у нас цена фиксированная, и лимит держит её честной для обеих сторон. Тысяча знаков — это примерно минута спокойной речи или полторы страницы диалога.
Длинный текст режется на части, и режется он не по счётчику символов, а по смыслу. Разница слышна: если разрезать посреди предложения, на стыке будет провал интонации, и склейка выдаст себя. Режьте по границам абзацев и законченных мыслей.
- Разбейте текст на куски по 800–950 знаков, каждый — законченная мысль. Оставьте запас: кириллица считается посимвольно, и «почти тысяча» легко оказывается тысяча двадцать.
- Озвучьте куски одним и тем же голосом. Смена голоса между частями на монтаже слышна сразу.
- Склейте файлы в любом редакторе подряд, без перекрытий. Между частями достаточно паузы в полсекунды.
Разбивку удобно поручить самой нейросети: попросите GPT-5.6 Terra разложить текст на блоки до 950 знаков, не разрывая предложения. Это стоит 16 токенов — на фоне озвучки незаметно. Для совсем длинных форматов есть отдельный разбор: аудиокнига и подкаст нейросетью.
Чего здесь нет — честно
Чтобы вы не потратили деньги зря, сразу про границы.
- Клонирования голоса нет. Загрузить свою запись и получить синтез собственным голосом нельзя — доступны только 22 готовых голоса. Если задача именно в этом, наш сервис её не закрывает.
- Ползунков тембра, скорости и эмоций нет. Характер речи задаётся выбором голоса и самим текстом.
- Загрузки файла на озвучку нет: текст вставляется в поле. Документ придётся скопировать.
- Автоматической расстановки ударений в омографах нет. «За́мок» и «замо́к» модель различает по контексту и иногда ошибается — проверять на слух.
Всё остальное — язык, длина в пределах лимита, любой стиль текста — работает без оговорок.
Оплата и доступ из России
Главная причина, по которой этот путь вообще существует: зарубежные сервисы синтеза речи в России либо не принимают карты, либо не открываются без обхода. У нас ни того, ни другого не нужно — оплата российской картой, через СБП или Telegram Stars, чек по 54-ФЗ приходит на почту.
Работает без VPN: запросы идут через наш сервер, а не напрямую к поставщику. Сравнение доступных на русском вариантов — в статье лучшие нейросети на русском без VPN, а про сам ElevenLabs в российских условиях — ElevenLabs в России.
Частые вопросы
Старые синтезаторы собирали речь из кусочков — отсюда металлический тон, паузы строго по знакам препинания и неизменная интонация. Современная модель порождает звук целиком, вместе с дыханием и микропаузами, поэтому на слух это человек, а не робот.
Нет, всё происходит в браузере или в Telegram-боте: вставили текст, выбрали голос из готовых, забрали файл. Аккаунт и баланс общие, файл приходит туда же, откуда вы его запросили.
Цена генерации не зависит от длины текста: озвучка на 60 знаков стоит столько же, сколько на 990. Восемь коротких фраз восемью запросами — самый дорогой способ озвучить материал; собирайте текст в блок близко к лимиту в 1000 знаков.
Нет. Текст вставляется в поле, документ придётся скопировать, а клонирования голоса у нас нет — доступны только готовые голоса.
Попробуйте сами
Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.