Что делает озвучка и сколько она стоит
Синтез речи в FatherGPT закрыт одной моделью — Озвучка (ElevenLabs), версия Multilingual v2. Вы отдаёте ей текст, она возвращает аудиофайл с человеческой речью: с дыханием, паузами, живой интонацией. Никакого микрофона, никакой обработки после — файл сразу можно тащить в монтаж или отправлять в чат.
Цена одной генерации — 200 токенов, и она плоская. Это важнее, чем кажется: озвучка на 60 знаков стоит ровно столько же, сколько на 990. Тот, кто гонит текст мелкими кусочками по одному предложению, платит за воздух. Как устроен сам счётчик, разобрано в справке про токены.
На бесплатном доступе озвучки не будет. Бесплатно даётся 40 токенов в сутки, одна генерация стоит 200 — арифметика не сходится ни при каком раскладе. Минимальный вход — пробный день за 1 ₽: 300 токенов, то есть одна полноценная озвучка и ещё сотня токенов на текстовые модели. Все пакеты — на странице тарифов.
Работает и в веб-кабинете, и в Telegram-боте, баланс токенов общий. Разница только в удобстве: в вебе видно счётчик знаков и можно править текст прямо в поле, в боте быстрее отправить готовый кусок с телефона. Что кому подходит — в заметке Telegram или веб.
Путь от текста к файлу: пять шагов
- Откройте раздел «Аудио» в кабинете. Там же живёт генерация музыки, но это отдельная модель — не перепутайте вкладку.
- Выберите голос. Их 22; первыми в списке идут четыре опорных — Rachel (спокойная рассказчица), Sarah (мягкий женский), Brian (тёплый мужской) и George (глубокий мужской). Голос переключается одним нажатием и запоминается до следующей генерации.
- Вставьте текст в поле. Под полем идёт счётчик вида 640/1000 — он показывает, сколько знаков уже набрано и сколько осталось до потолка.
- Нажмите «Озвучить · 200т». Обычная генерация занимает от нескольких секунд до полуминуты, поле в это время можно не трогать.
- Послушайте результат в плеере и скачайте файл кнопкой загрузки. Он же попадёт в вашу медиатеку, так что переслушать вчерашнюю дорожку получится и завтра.
Первую генерацию имеет смысл потратить не на весь текст, а на пробный абзац знаков на 300. Услышите темп голоса, поймёте, влезаете ли вы в нужный хронометраж, и только потом запускайте остальное. Пробник стоит те же 200 токенов, зато сэкономит вам три перегенерации.
Чего в интерфейсе нет
Нет ползунков скорости, высоты тона и «уровня эмоции». Поле с текстом читается буквально: всё, что вы туда напишете, будет произнесено. Строка «Подача: тёплая, с паузой перед второй фразой» не настроит модель — она прозвучит вслух, слово в слово, и вы потеряете 200 токенов на бессмыслицу. Управление интонацией идёт через сам текст и через выбор голоса, других рычагов нет.
Лимит 1000 знаков и как резать длинный текст
За одну генерацию модель принимает до 1000 знаков. Это не рекомендация, а жёсткая проверка на сервере: 1001 знак вернёт ошибку «Текст озвучки — до 1000 знаков» и генерация даже не начнётся. Токены при этом не спишутся, но время вы потеряете.
Тысяча знаков — это примерно минута речи в среднем дикторском темпе. Отсюда простой пересчёт: страница А4 обычного текста уйдёт в две-три генерации, статья на 5000 знаков — в пять, глава книги на 8000 — в восемь.
Резать по смыслу, а не по счётчику
Соблазн очевидный: копируем ровно 1000 знаков, отправляем, берём следующую тысячу. Так делать нельзя. Разрез на середине предложения даёт слышимый обрыв — интонация уходит вверх, будто человек собирался продолжить, и следующий файл начинается с новой мысли на ровном месте. Склейка таких кусков звучит как плохо смонтированное радио.
- Границу куска ставьте на конце абзаца или хотя бы на точке — там голос сам опускает интонацию вниз, и стык становится незаметным.
- Держите куски в диапазоне 700–950 знаков. Не 300: цена всё равно 200 токенов, и дробить мелко просто дорого.
- Если абзац не влезает целиком, ищите ближайшую точку до лимита, а не «докидывайте» половину следующего предложения.
- Нумеруйте файлы сразу при скачивании — 01, 02, 03. Четыре безымянных дорожки в папке «Загрузки» через час перестают отличаться друг от друга.
Разбить текст на куски по смыслу можно и не вручную: попросите об этом текстовую модель. GPT-5.6 Terra стоит 16 токенов и спокойно нарежет статью на блоки до 950 знаков с границами по абзацам — это в шестнадцать раз дешевле одной озвучки. Формулировка запроса простая: «раздели текст на части не длиннее 950 знаков, разрывы только на конце предложений, ничего не переписывай».
Паузы и темп: чем управлять, когда ползунков нет
Вся ритмика задаётся пунктуацией и структурой текста. Модель читает знаки препинания как режиссёрскую разметку, и это работает предсказуемее, чем любые словесные указания.
- Запятая — короткий вдох. Точка — пауза заметно длиннее и понижение интонации.
- Многоточие даёт самую долгую паузу внутри фразы. Два-три на весь текст, иначе речь начинает тянуться.
- Тире вместо запятой удлиняет разрыв и добавляет фразе весомости: «Это не ошибка — это выбор».
- Пустая строка между абзацами читается как смысловая пауза. В сплошной простыне без переносов голос идёт монотонно.
- Вопросительный знак поднимает интонацию в конце, восклицательный добавляет нажим — но не крик, на это рассчитывать не стоит.
Темп напрямую не выставляется, зато отлично регулируется длиной предложений. Короткие фразы через точку ускоряют речь и делают её собраннее. Длинное предложение с двумя придаточными, где мысль тянется через запятые и уточнения, звучит медленнее и спокойнее. Если вам нужен бодрый ролик — рубите текст на короткие предложения ещё до озвучки, а не ищите настройку скорости.
Ударения: почему модель их путает и как это чинить
Самая частая претензия к синтезу на русском — ударение не там. Причина простая: модель угадывает произношение по написанию и по частотности, а русский полон слов, где написание одинаковое, а ударение разное. Замо́к и за́мок, о́рган и орга́н, до́рог и доро́г — из голого текста понять, что имелось в виду, невозможно.
Отдельная боль — имена собственные. Фамилии, названия компаний, географические названия и всё, что редко встречается, модель произносит по общему правилу, а общего правила у имён нет. «Иванов» она прочитает, а вот незнакомую фамилию с двойной гласной — как повезёт.
Рабочие способы починки
- Перепишите слово так, как оно звучит. Латиницу переводите в кириллицу: не «Nike», а «Найк». Это самый надёжный приём, потому что модель перестаёт переключаться на другой язык посреди фразы.
- Замените слово синонимом. Если «замок» упорно читается как дверной, напишите «крепость» — на смысл фразы это чаще всего не влияет, а на звучание влияет полностью.
- Перестройте фразу так, чтобы контекст встал рядом. «Старинный за́мок на горе» модель читает правильнее, чем одинокое «замок» посреди перечисления.
- Разбейте сложное имя дефисом на слоги — иногда помогает, иногда нет, проверяйте на пробной генерации.
- Знак ударения над гласной иногда срабатывает, но не гарантированно. Способ стоит держать четвёртым в очереди, а не первым.
Проверять правки на полном тексте невыгодно: каждая перегенерация — 200 токенов. Соберите все спорные слова в одну короткую фразу знаков на двести, озвучьте её один раз, послушайте — и уже потом запускайте чистовой текст с исправлениями.
Что пойдёт не так в первый раз
- Цифры прочитаются не так, как вы ожидали. «1500 ₽» может превратиться в «одна пятьсот рублей». Пишите числа словами — подробный разбор в статье про русскую озвучку.
- Аббревиатуры звучат непредсказуемо: где-то по буквам, где-то как слово. Расшифровывайте или записывайте произношение.
- Эмодзи и символы вроде «→» либо игнорируются, либо читаются названием. Чистите текст перед вставкой.
- Слишком длинное предложение теряет интонационный рисунок к концу — режьте на два.
- Если генерация упала на стороне провайдера, токены возвращаются на баланс автоматически. Перед тем как жать «Озвучить» второй раз, обновите счётчик и убедитесь, что списания не было.
Полностью «с первого раза» получается редко — обычно уходит две-три попытки на настройку текста и одна финальная. Заложите на первый ролик 600–800 токенов, дальше расход падает, потому что вы уже знаете, как готовить исходник.
Сколько озвучки помещается в каждый пакет
Считается в лоб: пакет делим на 200. Пробный день за 1 ₽ — 300 токенов, одна генерация. Неделя за 399 ₽ — 4500 токенов, 22 генерации, около 22 минут готового аудио. Месяц за 999 ₽ — 12 000 токенов, 60 генераций, примерно час звучания. Год за 8990 ₽ — 90 000 токенов, 450 генераций, порядка семи с половиной часов речи.
Ориентир по задачам: короткий ролик для соцсетей — одна-две генерации, обучающее видео на пять минут — пять-шесть, глава аудиокниги — восемь-девять. Отсюда видно, что недельный пакет закрывает разовую задачу, а регулярную работу с голосом надо считать по месяцам. Подробнее эта арифметика разобрана в материале про аудиокниги и подкасты.
Баланс общий на все 26 нейросетей: те же токены уходят на текст, картинки и видео. Если вы в один день пишете сценарий на текстовой модели и тут же его озвучиваете, планируйте расход целиком, а не по отдельным моделям. Как это устроено — на странице как это работает, остальные вопросы собраны в FAQ.
Частые вопросы
Никак: ползунков скорости, высоты тона и уровня эмоции нет. Ритм задаётся пунктуацией и длиной предложений, характер — выбором голоса. Строка вроде «Подача: тёплая» не настроит модель, а будет произнесена вслух.
Резать на куски по смыслу, а не по счётчику: границу ставить на конце абзаца или хотя бы на точке. Разрез посреди предложения даёт слышимый обрыв — интонация уходит вверх, и склейка выдаёт себя.
Из голого текста нельзя понять, «за́мок» это или «замо́к», а у имён собственных общего правила нет. Надёжнее всего переписать слово так, как оно звучит, заменить синонимом или поставить рядом слово, задающее контекст.
Нет, при неудачной генерации они возвращаются на баланс автоматически.
Попробуйте сами
Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.