Google · Аудио

Lyria 2 для фоновой музыки и джинглов к роликам

У фоновой музыки в ролике одна задача — держать темп и настроение, не мешая голосу. Хороший фон зритель не замечает; замеченный фон почти всегда означает, что он перебивает речь или живёт своей жизнью. Lyria 2 генерирует музыку по текстовому описанию, и качество результата решается тем, насколько точно вы опишете состав инструментов, темп и плотность — а не жанровыми ярлыками.

Почему Музыка (Lyria 2) подходит для этой задачи

Сгенерированный фон снимает вопрос происхождения фонограммы. Трек, взятый из интернета «на пробу», превращается в проблему при первой же публикации: площадки распознают чужую музыку автоматически, и ролик может лишиться звука или монетизации, а бизнес — получить претензию. Собственная генерация под конкретный ролик избавляет от этой линии риска целиком.

Второе — управляемость под голос. Музыка для озвученного ролика отличается от музыки для прослушивания: ей нужна разреженная середина, где живёт речь, отсутствие вокала и ровная динамика без внезапных подъёмов. Всё это описывается словами — «редкая аранжировка», «без вокала», «без нарастаний», — и генерация выполняет такие ограничения точнее, чем поиск по стоковой библиотеке, где вы выбираете из готового.

Третье — скорость подгонки. Фон подбирают на слух под конкретную озвучку, и обычно нужно три-четыре варианта: этот слишком бодрый, этот тянет внимание на себя, этот подходит. Переписать промпт и сгенерировать заново занимает минуты, тогда как перебор стоковой библиотеки под нужный хронометраж и настроение — часы. Второй музыкальной модели в наборе нет, так что весь подбор ведётся внутри одной.

Какие входные данные подготовить

Роль музыки: фон под закадровый голос, джингл-заставка на несколько секунд, музыка без речи для витринного ролика. От роли зависит вся плотность аранжировки.

Состав инструментов словами: мягкое электропиано, приглушённый бас, лёгкая перкуссия щётками, подложка струнных. Названия инструментов работают лучше, чем названия жанров.

Темп в ударах в минуту и характер ритма: 90 ударов, ровная пульсация без ускорений; или 120, собранный деловой ритм.

Плотность и динамика: разреженная аранжировка, ровная громкость, без нарастаний и без кульминации — для фона это обязательные требования.

Прямые запреты: без вокала, без выраженной мелодии в среднем регистре, без резких ударных акцентов. Именно они мешают речи сильнее всего.

Пошаговый процесс

Определите, кто главный в звуке

Если в ролике есть голос, главный — голос, а музыка обслуживает его. Это решение принимается до генерации и определяет всё остальное: разреженность, отсутствие вокала, ровную динамику. Если голоса нет, музыка становится основным носителем настроения и может быть плотнее и выразительнее.

Опишите состав и темп, а не жанр

Слово «корпоративная музыка» ничего не означает, а «мягкое электропиано, приглушённый бас, лёгкая перкуссия щётками, 90 ударов в минуту» описывает результат однозначно. Жанровые ярлыки дают случайное попадание, перечень инструментов — предсказуемое.

Освободите частотный коридор под речь

Голос живёт в середине диапазона, и всё, что там играет мелодию, будет с ним конкурировать. Просите разреженную середину, мелодические фигуры в верхнем регистре, гармоническую опору снизу. Такая аранжировка звучит скучновато отдельно и отлично под голос — это правильный признак.

Сделайте три-четыре варианта и слушайте только с озвучкой

Оценивать фон в тишине бесполезно: победитель в тишине почти всегда проигрывает под речью, потому что интереснее звучит именно то, что мешает. Сведите каждый вариант с готовой озвучкой хотя бы вчерне и выбирайте так.

Соберите тайминг на монтаже

Точную длительность, петлю и затухание в конце делают в монтажной программе, а не промптом. Генерируйте фрагмент с запасом, подрезайте по хронометражу и уводите громкость в конце. Джингл-заставку, наоборот, делайте короткой и с ясным окончанием, чтобы её не пришлось обрубать.

Пример готового промпта

Инструментальная фоновая музыка под закадровый голос в деловом ролике.
Настроение: спокойная собранность, без пафоса и без грусти.
Состав: мягкое электропиано с короткими фигурами в верхнем регистре,
приглушённый бас, лёгкая перкуссия щётками, тихая подложка струнных.
Темп: 90 ударов в минуту, ровная пульсация, без ускорений и замедлений.
Плотность: разреженная аранжировка, середина диапазона свободна,
мелодия не поёт в том же регистре, где звучит речь.
Динамика: ровная на всём протяжении, без нарастаний, без кульминации,
без резких ударных акцентов.
Строго без вокала, без голосовых сэмплов и без подпевок.
Характер: нейтральный, легко зацикливается, не притягивает внимание.

Запреты в конце — рабочая часть промпта, а не формальность: вокал и мелодия в среднем регистре мешают речи сильнее, чем любая ошибка в выборе инструментов.

Как проверить результат

Послушайте музыку одновременно со своей озвучкой, а не отдельно. Если приходится прибавлять голос, чтобы разобрать слова, фон слишком плотный в середине диапазона.

Проверьте на телефонном динамике и в наушниках. Маленький динамик срезает низ, и трек, который в наушниках был мягким фоном, на телефоне может оказаться навязчивым звоном.

Прослушайте стык петли, если музыка зацикливается: рывок или обрыв фразы на переходе слышен даже неподготовленному уху и сразу выдаёт монтаж.

Убедитесь, что в записи нет вокальных призвуков — слогов, вздохов, подпевок. Они появляются даже при явном запрете и особенно мешают под речью.

Типичные ошибки

Просят «как у известного исполнителя»

Подражание конкретному артисту или узнаваемому треку — плохая идея с двух сторон. Во-первых, результат выходит расплывчатым: модель ловит общее ощущение, а не то, что вам понравилось. Во-вторых, музыка, сознательно построенная как копия чужой, возвращает ровно тот правовой риск, ради ухода от которого её и генерировали. Описывайте инструменты, темп и настроение.

Выбирают трек в тишине

В тишине выигрывает самый выразительный вариант — с ясной мелодией и заметными акцентами. Под голосом он же оказывается худшим, потому что тянет внимание на себя. Фон оценивают только в связке с озвучкой; отдельно он и должен звучать немного пресно.

Заказывают слишком много событий

Просьбы про нарастание, кульминацию и «эмоциональный подъём к финалу» ломают закадровый текст: музыка начинает диктовать темп, а голос под неё не подстроится. Для ролика с речью нужна ровная динамика; всё драматургическое развитие делается монтажом и паузами в тексте, а не аранжировкой.

Частые вопросы

Как считается расход токенов на музыку?

Стоимость генерации указана рядом с моделью в кабинете app.fathergpt.ru и в боте — сверяйтесь там перед серией, поскольку каталог обновляется. Практический ориентир другой: фон подбирают тремя-четырьмя вариантами, и планировать бюджет надо сразу на перебор, а не на одну попытку.

Можно ли использовать музыку в коммерческом ролике?

Сгенерированный фон под ваш ролик снимает основной риск — претензии по чужой фонограмме. Условия использования смотрите в оферте FatherGPT: там описано, что вы получаете вместе с результатом генерации. Отдельно не стоит намеренно воспроизводить узнаваемые чужие произведения — это возвращает риск обратно.

Получится ли трек нужной длительности?

Точный хронометраж надёжнее собирать на монтаже: генерируйте фрагмент с запасом, подрезайте под ролик и уводите громкость в конце. Пытаться попасть в секунды промптом — долгий и дорогой путь.

Будет ли музыка зацикливаться без слышимого стыка?

Бесшовная петля не гарантируется. Просите ровный характер без нарастаний — такой материал сшивается заметно легче, — а сам стык делайте в монтажной программе с коротким перекрёстным затуханием.

Есть ли в наборе другая модель для музыки?

Нет, Lyria 2 — единственная музыкальная позиция среди 26 нейросетей FatherGPT. Голос генерируется отдельно в ozvuchka-elevenlabs, и полная звуковая дорожка ролика собирается из этих двух источников плюс монтаж.

Модель Музыка (Lyria 2) доступна в FatherGPT: без VPN, картой РФ, единый баланс токенов на все нейросети. Переключайтесь между моделями в одном чате — под каждую задачу своя.