Блог · Редакция FatherGPT · 7 мин · обновлено 19 августа 2026

Текст в речь онлайн: как превратить текст в аудио

Одна и та же работа называется по-разному: «текст в речь», «синтез речи», «text to speech», «TTS». Разбираем, как это устроено на практике — от вставленного абзаца до скачанного файла, с настоящими цифрами по цене и ограничениям.

Что такое синтез речи и чем он отличается от старых читалок

Синтез речи — это преобразование написанного текста в звук. Программы, которые это умели, существуют лет тридцать: встроенный голос в Windows, экранные дикторы, настольные «читалки». Технически они делали то же самое, но разница в результате принципиальная — их слышно за секунду. Ровный металлический тон, паузы строго по знакам препинания, ударения по словарю, интонация не меняется от начала к концу.

Современные модели устроены иначе: они не собирают речь из кусочков, а порождают звук целиком, вместе с дыханием, микропаузами и естественным подъёмом и спадом голоса. На слух это уже не «робот читает», а человек говорит. Именно поэтому такую озвучку стали класть в ролики и подкасты, где раньше нужен был диктор.

В FatherGPT за эту работу отвечает одна модель — Озвучка (ElevenLabs), версия Multilingual v2. Русский для неё родной язык наравне с остальными: это не английская модель, которой скормили кириллицу, поэтому характерного акцента нет.

Как преобразовать текст в аудио: весь путь

Ничего скачивать и настраивать не нужно, всё происходит в браузере или в боте. Порядок такой:

  1. Откройте раздел озвучки в кабинете. Он же доступен из Telegram — аккаунт и баланс общие, файл придёт туда же, откуда вы его запросили.
  2. Вставьте текст в поле. Ровно тот, который должен прозвучать: поле читается буквально.
  3. Выберите голос из 22 доступных. Это выбор диктора, а не настройка тембра — ползунков «сделать ниже» или «добавить эмоций» здесь нет.
  4. Запустите генерацию и дождитесь файла. Готовое аудио скачивается и сразу годится в монтаж — дополнительная обработка не нужна.

Поле читается буквально. Если вы напишете «(с воодушевлением) Друзья, начинаем!», модель произнесёт и «с воодушевлением» тоже. Режиссёрские пометки, имена персонажей перед репликами, служебные скобки — всё это уйдёт в звук как обычный текст.

Управление интонацией здесь идёт через сам текст, а не через настройки. Точка даёт паузу короче, чем абзац. Многоточие растягивает. Восклицательный знак поднимает интонацию. Если слово читается с неверным ударением, самый надёжный приём — переписать его так, как оно звучит, а не как пишется. Подробный разбор приёмов — в статье как озвучить текст нейросетью.

Сколько стоит и почему цена плоская

Одна генерация озвучки стоит 200 токенов, и эта цена не зависит от длины текста. Озвучка на 60 знаков и озвучка на 990 знаков стоят одинаково. Из этого следует практический вывод, который экономит больше всего: не гоните текст по одному предложению.

Типичная ошибка новичка — озвучить восемь коротких фраз восемью запросами и потратить 1 600 токенов там, где хватило бы 200. Собирайте текст в один блок до тысячи знаков и отправляйте целиком.

  • Пробный день за 1 ₽ — 300 токенов, то есть одна озвучка. Хватает, чтобы услышать качество на своём тексте и выбрать голос.
  • Неделя за 399 ₽ — 4 500 токенов, это 22 озвучки.
  • Месяц за 999 ₽ — 12 000 токенов, 60 озвучек.
  • Год за 8 990 ₽ — 90 000 токенов, 450 озвучек.

Баланс общий на все 26 нейросетей: те же токены уходят на чат, картинки и видео. То есть месячная подписка — это не «60 озвучек и всё», а 12 000 токенов, которые вы распределяете сами. Как устроен счётчик, разобрано в справке про токены.

Если генерация сорвалась, токены возвращаются на баланс автоматически — платить за неудачную попытку не придётся.

Лимит 1000 знаков и что делать с длинным текстом

На одну генерацию — до тысячи знаков. Это не каприз интерфейса: поставщик берёт деньги за знаки, а у нас цена фиксированная, и лимит держит её честной для обеих сторон. Тысяча знаков — это примерно минута спокойной речи или полторы страницы диалога.

Длинный текст режется на части, и режется он не по счётчику символов, а по смыслу. Разница слышна: если разрезать посреди предложения, на стыке будет провал интонации, и склейка выдаст себя. Режьте по границам абзацев и законченных мыслей.

  1. Разбейте текст на куски по 800–950 знаков, каждый — законченная мысль. Оставьте запас: кириллица считается посимвольно, и «почти тысяча» легко оказывается тысяча двадцать.
  2. Озвучьте куски одним и тем же голосом. Смена голоса между частями на монтаже слышна сразу.
  3. Склейте файлы в любом редакторе подряд, без перекрытий. Между частями достаточно паузы в полсекунды.

Разбивку удобно поручить самой нейросети: попросите GPT-5.6 Terra разложить текст на блоки до 950 знаков, не разрывая предложения. Это стоит 16 токенов — на фоне озвучки незаметно. Для совсем длинных форматов есть отдельный разбор: аудиокнига и подкаст нейросетью.

Чего здесь нет — честно

Чтобы вы не потратили деньги зря, сразу про границы.

  • Клонирования голоса нет. Загрузить свою запись и получить синтез собственным голосом нельзя — доступны только 22 готовых голоса. Если задача именно в этом, наш сервис её не закрывает.
  • Ползунков тембра, скорости и эмоций нет. Характер речи задаётся выбором голоса и самим текстом.
  • Загрузки файла на озвучку нет: текст вставляется в поле. Документ придётся скопировать.
  • Автоматической расстановки ударений в омографах нет. «За́мок» и «замо́к» модель различает по контексту и иногда ошибается — проверять на слух.

Всё остальное — язык, длина в пределах лимита, любой стиль текста — работает без оговорок.

Оплата и доступ из России

Главная причина, по которой этот путь вообще существует: зарубежные сервисы синтеза речи в России либо не принимают карты, либо не открываются без обхода. У нас ни того, ни другого не нужно — оплата российской картой, через СБП или Telegram Stars, чек по 54-ФЗ приходит на почту.

Работает без VPN: запросы идут через наш сервер, а не напрямую к поставщику. Сравнение доступных на русском вариантов — в статье лучшие нейросети на русском без VPN, а про сам ElevenLabs в российских условиях — ElevenLabs в России.

Частые вопросы

Старые синтезаторы собирали речь из кусочков — отсюда металлический тон, паузы строго по знакам препинания и неизменная интонация. Современная модель порождает звук целиком, вместе с дыханием и микропаузами, поэтому на слух это человек, а не робот.

Нет, всё происходит в браузере или в Telegram-боте: вставили текст, выбрали голос из готовых, забрали файл. Аккаунт и баланс общие, файл приходит туда же, откуда вы его запросили.

Цена генерации не зависит от длины текста: озвучка на 60 знаков стоит столько же, сколько на 990. Восемь коротких фраз восемью запросами — самый дорогой способ озвучить материал; собирайте текст в блок близко к лимиту в 1000 знаков.

Нет. Текст вставляется в поле, документ придётся скопировать, а клонирования голоса у нас нет — доступны только готовые голоса.

Попробуйте сами

Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.