Блог · Редакция FatherGPT · 7 мин · обновлено 10 августа 2026

Голоса персонажей и разные интонации

Один и тот же текст четырьмя голосами звучит как четыре разных сообщения. Разбираем, какой голос под какую задачу брать и как собрать диалог персонажей, если модель за раз читает только одним голосом.

Какие голоса доступны

В Озвучке (ElevenLabs) голос выбирается чипом над полем ввода. Голосов 22 — 9 женских, 12 мужских и один нейтральный. Клонирования собственного голоса и загрузки чужих сэмплов в сервисе нет. Своё описание характера есть у четырёх опорных голосов, они же стоят в списке первыми:

  • Rachel — спокойная рассказчица. Ровный нейтральный темп, минимум окраски.
  • Sarah — мягкий женский. Теплее и чуть ближе к слушателю.
  • Brian — тёплый мужской. Дружелюбная подача без нажима.
  • George — глубокий мужской. Ниже по тону, звучит весомее остальных.
  • Остальные 18 голосов подписаны только полом — характер у них придётся оценивать на слух, своим текстом.

Два женских и два мужских — значит, диалог без повторов собирается максимум на четыре роли. Пятому персонажу придётся отдать уже занятый голос, и слушатель это заметит. Планируйте состав действующих лиц с учётом этого ограничения ещё на этапе сценария.

Каждая генерация — 200 токенов независимо от того, сколько знаков вы отправили. На бесплатном доступе (40 токенов в сутки) озвучка не запустится. Голосов 22, и перебирать их подряд дорого: каждая проба — полные 200 токенов, в пробный день за 1 ₽ с его 300 токенами влезает только одна. Поэтому пробуйте сразу на финальном тексте — короткая проба стоит ровно столько же. Пакеты — в тарифах.

Почему один текст разными голосами читается по-разному

Голос несёт информацию помимо слов: возраст, дистанцию, уровень доверия. Фраза «Мы разобрались, в чём была причина» глубоким мужским звучит как отчёт эксперта, мягким женским — как поддержка, спокойной рассказчицей — как строчка из документального фильма. Слова те же, сообщение разное.

Отсюда практическое следствие: подбор голоса — не украшательство, а часть смысла. Если ролик не работает, а текст вроде правильный, попробуйте переозвучить его другим голосом раньше, чем переписывать сценарий. Иногда этого достаточно.

Второе следствие — про темп. Скорость речи напрямую не настраивается, но воспринимаемый темп у голосов разный: низкий мужской на слух идёт неторопливее, чем ровный женский, при одинаковой длине текста. Разница небольшая, однако в ролике на минуту она заметна.

Как выбрать голос, не потратив 800 токенов

Прогнать текст всеми четырьмя голосами — это четыре генерации по 200 токенов. Восемьсот токенов только на выбор тембра, при том что недельный пакет — 4500. Есть способ дешевле.

  1. Сначала решите, мужской голос вам нужен или женский. Это решение зависит от задачи и аудитории, а не от звучания, и слушать для него ничего не надо.
  2. Возьмите не весь текст, а самую характерную фразу — ту, где решается смысл ролика. Хватит 150–200 знаков.
  3. Озвучьте её двумя голосами нужного пола. Две генерации, 400 токенов.
  4. Выбранный голос запишите рядом со сценарием. Через неделю вы не вспомните, Sarah там была или Rachel.

Ещё дешевле — не выбирать заново каждый раз. Если вы ведёте канал или серию роликов, голос должен быть один на весь проект: смена тембра между выпусками читается аудиторией как смена ведущего. Один раз потратили 400 токенов на выбор и дальше не возвращаетесь к вопросу.

Осторожно с проверкой на слишком коротком куске. Фраза в три слова звучит одинаково почти любым голосом — разница между тембрами проявляется на связном тексте, где слышны интонационные переходы. Полторы-две сотни знаков это минимум, на котором сравнение имеет смысл.

Подбор под задачу

Реклама и промо

Короткий текст, ясная выгода, никаких придаточных. Обычно выигрывает голос с весом — George — или, наоборот, максимально дружелюбный Brian, если продукт бытовой. Тексты объявлений удобно готовить по шаблону рекламных объявлений, а потом резать до 400–500 знаков под тридцатисекундный ролик.

Аудиокнига и художественный текст

Здесь важнее выносливость, а не яркость: слушать предстоит часами, и любая характерная окраска начинает раздражать к третьей главе. Rachel как ровная рассказчица под длинный текст подходит лучше остальных. Прямая речь персонажей внутри книги — отдельная работа, о ней ниже.

Обучающий ролик и инструкция

Задача — понятность. Берите нейтральный голос, режьте предложения короче обычного, между шагами оставляйте пустую строку: она даёт паузу, за которую слушатель успевает выполнить действие. Плохая идея — эмоциональная подача: она отвлекает от содержания.

Подкаст и рассказ

Тёплые голоса работают лучше нейтральных, потому что формат подразумевает собеседника, а не диктора. Если ведущих двое, разведите их по полу — так слушателю не нужно вспоминать, кто сейчас говорит.

Закадровый голос в ролике

Здесь голос конкурирует с картинкой и музыкой, поэтому берите тот, что лучше пробивается сквозь фон: глубокий мужской теряется под музыкой сильнее, чем ровный женский. Полный порядок работы с хронометражем и сведением разобран в статье про озвучку видео, практические примеры — в гайде для озвучки видео.

Голос для бота, автоответчика и объявлений

Отдельный класс задач, где персонажа как такового нет, а голос всё равно нужно выбирать: приветствия в телефонии, голосовые подсказки в приложении, объявления для точки продаж. Логика здесь другая — важна не выразительность, а разборчивость с первого раза и на плохом канале связи.

  • Берите нейтральный голос без выраженной теплоты: эмоция в служебном сообщении звучит фальшиво.
  • Фразы делайте максимально короткими. «Нажмите один, чтобы связаться с оператором» — предел длины для голосового меню.
  • Числа и цифры пунктов пишите словами: в телефонии искажения съедают именно короткие слова.
  • Одну и ту же реплику лучше озвучить один раз и переиспользовать. Каждая переозвучка — 200 токенов, а меняется в таких текстах обычно одно слово из десяти.
  • Проверяйте результат через тот канал, где он будет звучать: динамик телефона и колонка в помещении съедают низкие частоты, и глубокий мужской голос там разбирается хуже, чем в наушниках.

Набор служебных реплик удобно готовить пачкой: соберите все фразы меню в один документ, приведите к единому стилю и озвучьте подряд одним голосом за один заход. Десять реплик — 2000 токенов, но это разовая работа, которая потом живёт годами без изменений.

Как собрать диалог двух персонажей

За одну генерацию модель читает одним голосом. Диалог собирается из отдельных дорожек: каждая реплика озвучивается своим голосом и склеивается в аудиоредакторе. Порядок такой.

  1. Разложите сценарий на реплики и подпишите, кто говорит. Подписи нужны вам, в поле озвучки они не попадают — иначе прозвучат вслух.
  2. Склейте подряд идущие реплики одного персонажа в один блок. Три коротких фразы одного героя — это одна генерация, а не три, и разница здесь в 400 токенов.
  3. Озвучьте все реплики первого персонажа подряд, не переключая голос. Так вы не собьётесь и не получите половину диалога чужим тембром.
  4. Переключите голос и озвучьте реплики второго. Скачивайте файлы сразу с номерами по порядку сцены.
  5. Соберите дорожки в редакторе, оставляя паузу 300–600 миллисекунд между репликами. Без пауз диалог звучит как чтение одного текста двумя людьми.
  6. Выровняйте громкость: у разных голосов уровень отличается, и на стыке это слышно сильнее, чем смена тембра.

Считайте бюджет заранее. Диалог на десять реплик без склейки — 2000 токенов, это почти половина недельного пакета на 4500. После объединения соседних реплик обычно остаётся шесть-семь генераций, то есть 1200–1400 токенов. Разница на ровном месте, и возникает она только из-за порядка работы.

Чего от голосов ждать не стоит

  • Акцентов и говоров нет. Персонаж не заговорит по-южному или с иностранным акцентом.
  • Возраст не настраивается: детского и старческого голоса в наборе нет.
  • Крик, шёпот и плач не отыгрываются. Восклицательный знак добавит нажим, но не громкость.
  • Пометки в скобках вроде «(шёпотом)» будут прочитаны вслух — поле принимает только произносимый текст.
  • Один и тот же голос в двух генерациях звучит одинаково, но абсолютной идентичности интонации между дорожками нет. На стыках внутри одной фразы это слышно, поэтому фразы не разрывают.

Если персонажу нужна яркая характерность, синтез её не даст ни при каком тексте. Реалистичный потолок — четыре узнаваемых человека с разной подачей, и для рекламы, обучающих роликов и аудиоформатов этого обычно достаточно. Материал для персонажей и реплик можно подготовить в сторителлинге на GPT-5.6 Sol, а музыкальную подложку под сцену — в Музыке (Lyria 2).

Полный список моделей с ценами в токенах — на странице нейросетей; там же видно, сколько стоят текстовые генерации, которыми вы будете готовить сценарий перед озвучкой.

Частые вопросы

Доступно 22 готовых голоса. Клонирования собственного голоса и загрузки чужих сэмплов нет. Описанный характер есть у четырёх опорных голосов, остальные подписаны только полом — их приходится оценивать на слух.

За одну генерацию модель читает одним голосом, поэтому реплики озвучиваются отдельно и склеиваются в редакторе с паузой 300–600 миллисекунд. Подряд идущие реплики одного героя объединяйте в один блок — так вдвое-втрое дешевле.

Сначала решите, мужской нужен или женский: это зависит от задачи и аудитории, слушать для этого ничего не надо. Потом озвучьте одной-двумя пробами самую характерную фразу на 150–200 знаков — на фразе в три слова тембры почти не различаются.

Нет. Акцентов и говоров в наборе нет, возраст не настраивается, крик и плач не отыгрываются. Реалистичный потолок — несколько узнаваемых людей с разной подачей.

Попробуйте сами

Все нейросети из статьи доступны в одной подписке FatherGPT — без VPN, на русском, с оплатой картой РФ. Первый день стоит 1 ₽, чтобы спокойно всё проверить.