Арифметика: во что обходится глава
Считается в три действия. Берём объём текста в знаках, делим на 1000 — это лимит одной генерации у модели Озвучка (ElevenLabs). Округляем вверх, получаем число генераций. Умножаем на 200 — получаем токены.
- Глава на 8000 знаков — 8 генераций, 1600 токенов, примерно 8 минут звучания.
- Рассказ на 20 000 знаков — 20 генераций, 4000 токенов, около 20 минут.
- Выпуск подкаста на 30 минут — примерно 27 000 знаков, 27 генераций, 5400 токенов.
- Книга из десяти глав по 8000 знаков — 80 генераций, 16 000 токенов.
- Книга на 160 000 знаков — 160 генераций, 32 000 токенов.
Ориентир по длительности: 1000 знаков дают примерно минуту речи, то есть 200 токенов — это минута готового аудио. Число удобное для прикидки в обе стороны: часовой подкаст стоит около 12 000 токенов, десятиминутный — около 2000.
Ещё одна привычная единица — страница. Стандартная книжная страница это примерно 1800 знаков, то есть две генерации и 400 токенов. Двести страниц — 80 000 токенов. Эта цифра сразу отвечает на главный вопрос: полноценный роман в один пакет не помещается, и понять это лучше до начала работы.
Считать надо по финальному тексту, а не по черновику. После подготовки под озвучку — числа словами, сокращения расшифрованы — объём вырастает процентов на десять-пятнадцать. На главе это лишняя генерация, на книге — десяток.
Какой тариф под это брать
Теперь честное сравнение с пакетами. Недельный пакет — 4500 токенов, это 22 генерации. Одна глава на 8000 знаков забирает 1600, то есть в неделю помещаются две главы и остаётся 1300 токенов — на третью уже не хватает. Для книги недельный пакет не годится, он рассчитан на разовую задачу.
Месячный пакет — 12 000 токенов, 60 генераций, около часа готового аудио. Этого хватает на семь глав по 8000 знаков (11 200 токенов) или на две получасовые серии подкаста. Для одной небольшой книги до 60 000 знаков месяц за 999 ₽ — рабочий вариант.
Годовой пакет — 90 000 токенов, 450 генераций, порядка семи с половиной часов речи. Это 56 глав по 8000 знаков. Полноценная книга на 160 000 знаков (32 000 токенов) укладывается в него с большим запасом, и на еженедельный подкаст по полчаса (5400 токенов на выпуск, около 21 600 в месяц) годовой пакет — единственный вариант, который не заканчивается в середине месяца.
Бесплатный доступ под эту задачу не подходит вообще: 40 токенов в сутки против 200 за одну генерацию. Даже пробный день за 1 ₽ с его 300 токенами даёт ровно одну озвучку — этого достаточно, чтобы услышать голос на своём тексте и решиться, но не чтобы записать главу. Все цены — на странице тарифов, способы оплаты — в справке.
И честная граница сверху: 90 000 токенов годового пакета — это 450 000 знаков текста. Роман на шестьсот страниц в один пакет не влезет, придётся растягивать на два периода или сокращать текст. Лучше узнать это до начала работы, чем на тридцатой главе. Как устроен общий баланс на все 26 нейросетей, объяснено в статье про токены.
Подготовка текста: один раз на всю книгу
Когда генераций сорок, любая системная ошибка в исходнике умножается на сорок. Поэтому текст готовят целиком до первой озвучки, а не по ходу.
- Прогоните весь текст через правила чтения: числа словами, сокращения расшифрованы, латиница кириллицей. Подробный чек-лист — в разборе русской озвучки.
- Выпишите все имена собственные книги в один список и озвучьте его одной пробной генерацией. Двести токенов — и вы точно знаете, какие имена придётся переписывать фонетически.
- Уберите из текста всё, что не произносится: номера страниц, сноски, звёздочки разделителей, номера глав в формате «Глава III» (римские цифры читаются плохо, пишите «Глава третья»).
- Разбейте текст на куски по 700–950 знаков с границами на концах абзацев. Механическую нарезку удобно поручить GPT-5.6 Terra за 16 токенов.
- Пронумеруйте куски: 01, 02, 03. Это же будут имена файлов при скачивании.
На вычитку финального текста имеет смысл потратить отдельный проход — Claude Sonnet для вычитки ловит опечатки, которые в тексте глазом не видны, а вслух звучат как оговорка диктора.
Как держать один голос на всю книгу
Голос выбирается чипом над полем и держится до следующего переключения. Проблема появляется, когда работа идёт несколько дней: вы возвращаетесь в кабинет, начинаете с середины главы и не проверяете, какой голос выбран. Половина книги другим тембром — типовая история.
- Запишите выбранный голос в файл со сценарием первой же строкой. Через неделю вы его не вспомните.
- Каждую сессию начинайте с проверки чипа — он подписан прямо под полем ввода.
- Для длинного текста лучше подходит ровная рассказчица: характерная окраска утомляет на третьем часу прослушивания. Подбор голоса под формат разобран в статье про голоса персонажей.
- Прямую речь персонажей внутри книги можно озвучить другим голосом, но тогда её надо выносить в отдельные генерации, а это плюс 200 токенов за каждую реплику. На книге в сорок диалогов набегает 8000 токенов — решайте это на этапе бюджета, а не на середине.
Склейка без слышимых швов
Сорок дорожек надо собрать в один файл так, чтобы слушатель не догадался о нарезке. Швы выдают себя тремя вещами: обрывом интонации, разной громкостью и неестественной паузой на стыке.
- Границы кусков ставьте на концах абзацев. На точке голос уходит вниз — стык становится незаметен. На середине предложения интонация висит в воздухе, и склейка слышна сразу.
- Между кусками оставляйте паузу 400–700 миллисекунд, как между абзацами при чтении вслух. Встык дорожки звучат тороплива и неестественно.
- Нормализуйте громкость всех дорожек до одного уровня. Разброс в пару децибел на слух воспринимается как смена микрофона.
- Обрежьте тишину в начале и в конце каждого файла — модель иногда оставляет по четверти секунды с обеих сторон, и на сорока стыках это превращается в рваный ритм.
- Между главами ставьте паузу секунды на две или короткую музыкальную отбивку.
Отбивки и фоновую подложку делает Музыка (Lyria 2) — те же 200 токенов за генерацию. Для подкаста хватает одной интро-отбивки на все выпуски, её не нужно генерировать заново каждый раз. Разбор с примерами запросов — в гайде для фоновой музыки.
Проверка готового файла перед публикацией
Собранную главу надо прослушать целиком хотя бы один раз. Кажется избыточным — сорок дорожек вы уже слушали по одной, — но ошибки склейки видны только на сквозном прослушивании: пропущенный кусок, дубль одного и того же абзаца, пауза не в том месте.
- Прослушайте главу на скорости в полтора раза. Смысл вы уже знаете, а рваный ритм и пропуски на ускорении слышны даже отчётливее.
- Сверяйтесь с текстом по номерам кусков: 01, 02, 03. Так вы поймаете выпавшую дорожку — самая частая ошибка при сборке сорока файлов.
- Отдельно проверьте первые и последние десять секунд. Начало главы слушают все, конец — тот момент, где решается, включат ли следующую.
- Послушайте финал через телефонный динамик. Аудиокниги и подкасты слушают в дороге, а не в студийных наушниках.
- Сохраните исходные дорожки, а не только склейку. Через месяц выяснится, что в третьем куске неверное ударение, и переозвучивать придётся один фрагмент, а не главу.
Правки после публикации обходятся дороже всего: файл уже разошёлся, а замена одного слова означает перезаливку всего выпуска. Час на проверку экономит этот сценарий целиком.
Режим работы: как не бросить на третьей главе
Сорок генераций подряд в один присест — плохая идея. Внимание падает, вы перестаёте слушать результат и в итоге получаете десять дорожек с непроверенными ударениями. Разумный ритм — глава за подход, с прослушиванием сразу после генерации.
- Слушайте каждую дорожку сразу. Найденная ошибка стоит 200 токенов на перегенерацию одного куска, а найденная через неделю — ещё и поиска нужного файла среди сорока.
- Ведите таблицу: номер куска, статус, замечания. На двадцатом файле память перестаёт справляться.
- Работать удобнее в веб-кабинете: там виден счётчик знаков и история генераций. Telegram-бот берёт своё на коротких задачах — сравнение в справке.
- Держите запас токенов в 15–20 процентов от расчёта. Перегенерации будут: имена, числа, случайно съеденное слово.
Если после расчёта выясняется, что бюджет не сходится, честный выход один — сокращать текст, а не искать обход. Двадцатиминутный выпуск вместо получасового экономит 1800 токенов, и на регулярном подкасте это решает больше, чем смена тарифа. Остальные вопросы про баланс и списания собраны в FAQ и на странице как это работает.
Частые вопросы
Объём финального текста в знаках делится на 1000 — это лимит одной генерации, — округляется вверх, и получается число генераций. Считать надо по подготовленному тексту: после правки под озвучку он вырастает процентов на десять-пятнадцать.
Не всякая. Ориентир: 1000 знаков — примерно минута речи, стандартная книжная страница около 1800 знаков, то есть две генерации. Роман на шестьсот страниц придётся растягивать на два периода или сокращать, и понять это лучше до начала работы.
Записать выбранный голос первой же строкой в файл со сценарием и каждую сессию начинать с проверки чипа над полем: голос держится до следующего переключения, и половина книги другим тембром — типовая история.
Границы кусков ставить на концах абзацев, между кусками оставлять паузу 400–700 миллисекунд, нормализовать громкость всех дорожек и обрезать тишину по краям файлов. Между главами — пауза секунды на две или короткая отбивка.
Попробуйте сами
Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.