Меню
Войти
Голос и звук10 мин чтенияобновлено 26 сентября 2026

Как сделать звук и голос в ИИ-видео, чтобы не звучало фальшиво

Как описывать звук в промпте, почему ИИ-видео звучит плоско, как держать один голос героя, что показали наши тесты русского липсинка и как монтировать звук.

Как сделать звук и голос в ИИ-видео, чтобы не звучало фальшиво

Звук в ИИ-видео выдаёт подделку чаще картинки. Плоское помещение без эха, скомканная реплика, чужой хвост фразы на молчащем герое, голос, который меняется от кадра к кадру, — всё это зритель слышит сразу. Чинится это тремя вещами: описывать звук прямо в сцене (материал, эхо, конкретный фон), писать реплики по правилам (точные слова, длина под шот, один говорящий на шот) и делать важные голоса отдельно в синтезаторе речи, а не надеяться на видео-модель. Ниже — как это устроено, что показали наши тесты, готовые промпты и порядок монтажа звука.

Главное коротко:

  • современные видео-модели умеют генерировать звук вместе с картинкой, но держат его хуже, чем картинку;
  • фон и шумы можно брать из генерации, реплики главного героя надёжнее делать отдельно;
  • монтаж звука — это отдельный этап, а не «музыка поверх».

Картинку зритель прощает, звук — нет. Плоское помещение выдаёт нейроролик раньше, чем шесть пальцев.

Что понадобится

  • Видео-генератор со звуком. Часть моделей генерирует звук вместе с картинкой — например, в Flow от Google звук поддерживается в режимах из картинок и из образцов (по состоянию на сентябрь 2026). У других генераторов звук добавляется отдельно или его нет вовсе.
  • Синтезатор речи — для реплик героя и закадрового голоса. Как с ним работать — в гайде Нейросеть для озвучки.
  • Монтажная программа с несколькими звуковыми дорожками.
  • Библиотека звуков и музыки с понятной лицензией. Не берите музыку из чужих роликов: площадки снимают звук или ролик целиком.
  • Доступ. Часть сервисов работает только с доступом из-за рубежа, у других есть оплата из России или российские аналоги. Условия проверяйте на их сайтах.
  • Время. Звук короткого ролика с репликами — от 30 минут до пары часов, в зависимости от числа героев.

Термины:

  • Липсинк — совпадение движения губ с речью.
  • Шот — один непрерывный кусок внутри генерации, между двумя склейками.
  • Эмбиент — фоновый звук места: шум улицы, гул зала, дождь.
  • Закадровый голос — голос, который звучит, пока губы героя не двигаются.

Войдите, чтобы читать дальше — это бесплатно

Аккаунт считает пройденные гайды, помнит, где вы остановились в маршруте, и открывает все бесплатные материалы.

Где делать звук: в генерации или отдельно

ЧтоВ генерацииОтдельно в монтаже
Фон места (эмбиент)хорошо, если описан конкретнобиблиотечный фон, если генерация дала шум
Шумы действий: шаги, дверь, чашкахорошо в простых сценахкогда нужен точный момент удара
Короткая реплика одного герояработает, если модель держит русскийсинтезатор + наложение, если модель коверкает
Разговор нескольких героеврискованно: голоса путаютсянадёжнее
Закадровый голос, внутренний монологв наших тестах не работаеттолько так
Шёпотв наших тестах из текста не получилсясинтезатор речи
Музыкане рекомендуем: не управляетсятолько так

Пошаговая инструкция

Шаг 1. Составьте звуковую карту ролика

Перед генерацией пропишите для каждого шота три строки: кто говорит (или никто), какая реплика, какой фон. Пример:

ШотКто говоритРепликаФон
1героиня«Ты опять опоздал.»дождь по стеклу, тиканье часов
2никто—дождь, скрип двери
3герой«[тихий вдох] Я не опоздал.»дождь, шаги по паркету

Что должно получиться: таблица, где у каждого шота заполнен фон. Пустой фон — признак того, что модель заполнит тишину чем попало, в том числе чужой репликой.

Шаг 2. Опишите звук внутри сцены

Описывайте звук прямо в описании сцены, а не отдельной строкой в конце: «дождь по стеклу и шипение кофемашины». Подделку чаще всего выдаёт помещение, которое звучит плоско. Опишите материал и эхо:

  • «пустой бетонный гараж, звук отражается от стен»;
  • «маленькая кухня, мягкий приглушённый звук»;
  • «большой каменный зал, шаги гулко отдаются».

Звук характеризует место, а не иллюстрирует его: пустыне подходит низкий гул, стройке — дрожь земли, библиотеке — шелест страниц и далёкий кашель.

Шаг 3. Напишите реплики по правилам

  • Точные слова в кавычках. Не «она говорит, что устала», а реплика дословно.
  • Длина реплики под длину шота. Реплика на 10 секунд в шоте на 5 выходит скомканной. Для ориентира: в короткой речи около 15 знаков в секунду.
  • Короткая реплика в 2–3 слова звучит плоско — модель не успевает поймать интонацию. Помогает вводный звук: «[тихий вдох] Ты кто?».
  • Без тире внутри реплики. Модели о них спотыкаются — заменяйте запятыми.
  • Эмоцию — телом, а не словом. «Голос дрожит, она сглатывает перед словом» работает лучше, чем «говорит грустно».

Шаг 4. Один шот — один говорящий

Модели переносят хвост фразы на соседнего героя: реплика не закончилась, а склейка уже показывает другого человека, и он шевелит губами. Правила:

  • в одном шоте говорит один герой;
  • режьте только после точки: фраза закончена — потом склейка;
  • длинную реплику из двух предложений делите на два ракурса одного и того же героя;
  • в немом шоте пишите конкретный фоновый звук — он заполняет тишину вместо чужой реплики. Не «тишина», а «эхо зала, шаги».

Шаг 5. Держите один голос героя

Если героя озвучивает видео-модель, его голос может меняться от генерации к генерации. Что делать: первая удачная генерация становится эталоном. Склейте реплики героя в короткий файл и подавайте его вместе с листом персонажа, если сервис принимает звуковой образец. Если не принимает — главного героя озвучивайте синтезатором речи одним и тем же голосом, а генерацию используйте только для движения губ.

В разговоре нескольких героев голоса в наших тестах менялись местами. Поэтому главного героя мы в генерацию не «впекаем»: его голос делаем отдельно, а в генерации оставляем только второстепенных.

Шаг 6. Проверьте липсинк на русском

Прежде чем делать серию, проверьте конкретную модель на одной русской реплике. Критерий простой: губы попадают в слоги, слова не искажены. Если нет — не пытайтесь чинить промптом, меняйте модель или делайте голос отдельно.

Шаг 7. Соберите звук в монтаже

Порядок дорожек снизу вверх: фон → шумы → музыка → голос. Затем:

  • звук следующей сцены заходит чуть раньше картинки — так склейка не рвётся (в монтаже этот приём называют J-cut);
  • музыкальную арку стройте по смысловым частям ролика, а не по отдельным клипам: завязка, развитие, развязка;
  • полная тишина на повороте сюжета — сильнейший приём, но только если до неё звучала музыка. Вырежьте музыку целиком на 1–2 секунды;
  • эффект нарастания — только перед важным. Если после него ничего не случилось, он «теряет репутацию», и следующему зритель не поверит;
  • резкая остановка музыки встряхивает, плавный уход говорит «эта часть закончилась».

Шаг 8. Выровняйте громкость и проверьте на телефоне

Голос должен разбираться поверх музыки на динамике телефона. Общую громкость выравнивайте к ориентиру около −14 LUFS — к этому уровню YouTube приводит звук роликов. Послушайте ролик на телефоне без наушников — так его услышит большинство.

Готовые промпты

Промпты на английском: видео-модели в большинстве случаев лучше понимают английский. Реплики пишите на том языке, на котором герой должен говорить.

Сцена со звуком места

Звук вписан в описание сцены. Меняйте место, материал и конкретные звуки.

Vertical 9:16 video, 6 seconds. A small kitchen at night, rain hits the
window, an old wall clock ticks, the kettle starts to hiss at 4 seconds.
Soft, slightly muffled room sound with no echo. A woman in her 30s stands
by the window holding a cup. The camera slowly pushes in. No music.

Реплика с вводным звуком

Для коротких реплик в 2–3 слова. Меняйте вздох на смешок, кашель, выдох.

Vertical 9:16 video, 4 seconds. Medium close-up of a man in his 40s in an
empty concrete garage, sound echoes off the walls. He looks up from the
car engine, eyebrows rise slightly. Dialogue: "[a soft caught breath] Ты кто?"
He finishes the sentence completely before the end of the shot.

Немой шот с конкретным фоном

Чтобы в тишину не попала чужая реплика. Меняйте фон на звуки своего места.

Vertical 9:16 video, 3 seconds. Close-up of a woman listening, lips sealed
shut, completely silent, she blinks slowly and swallows.
Dialogue: NONE. Ambient: "rain on the window, a distant car passes,
the clock ticks".

Два шота, два героя, без перетекания голоса

Для диалога внутри одной генерации. Главного героя лучше озвучивать отдельно — этот промпт для второстепенных.

Vertical 9:16 video, 8 seconds, 2 hard-cut shots, same location and lighting
in both shots: a quiet office in the evening, air conditioner hum.
Each shot contains only one person. A speaker fully finishes the sentence
before any cut, the voice never continues onto the next shot.
Shot 1 (4s, medium close-up): a woman, lips moving. Dialogue: "Отчёт готов?"
Shot 2 (4s, medium close-up): a man, lips moving. Dialogue: "[exhales] Почти."

Музыкальная арка через ИИ-ассистента

Для текстового ассистента: план звука по раскадровке.

Вот раскадровка ролика на [30] секунд: [вставьте таблицу].
Составь звуковой план: для каждого отрезка — фон, шумы, музыка
(характер и громкость), где нарастание и где резкая тишина.
Правила: нарастание только перед главным поворотом; тишина только
после музыки; звук следующей сцены заходит на полсекунды раньше картинки.

Что показали наши тесты

  • Русский липсинк одна из трёх видео-моделей держит, две другие коверкают.
  • Голос за кадром при сомкнутых губах модель не озвучивает: внутренний монолог из промпта не звучит.
  • Шёпот из текста модель не делает, и тембр у героя в пределах сцены один.
  • В разговоре нескольких героев голоса могут меняться местами, а хвост фразы перетекает на молчащего героя.
  • Отрицания работают плохо: «no talking» модель цепляет за слово «talking» и шевелит губами. Пишите утвердительно: «lips sealed shut, completely silent».

Поэтому голоса главных героев мы делаем отдельно в синтезаторе речи и накладываем в монтаже.

Типичные ошибки и как чинить

  • Помещение звучит плоско. Допишите материал и эхо: «бетон, звук отражается», «ковёр и шторы, звук мягкий».
  • Реплика скомкана. Сократите реплику или удлините шот.
  • Короткая фраза без интонации. Добавьте вводный звук: вздох, смешок, выдох.
  • Молчащий герой шевелит губами. Режьте после точки, в немом шоте пишите «lips sealed shut» и конкретный фон.
  • Голос героя меняется от ролика к ролику. Делайте его синтезатором одним голосом, генерацию используйте для движения.
  • Модель коверкает русский. Не боритесь промптом: другая модель или голос отдельно.
  • Музыка из чужого ролика. Берите из библиотеки с понятной лицензией.
  • Нарастания в каждом переходе. Оставьте одно — перед главным.
  • Тишина «повисла». Тишина работает только как обрыв после музыки.
  • Проверили в наушниках. Послушайте на телефоне без наушников.

Чек-лист перед публикацией

  • У каждого шота есть конкретный фон.
  • Помещение звучит как помещение: есть материал и эхо.
  • Реплики дословные и по длине влезают в шоты.
  • В каждом шоте говорит один герой, склейки после точки.
  • Голос главного героя одинаковый во всём ролике.
  • Губы попадают в русскую речь, либо голос наложен отдельно.
  • Музыка построена по смысловым частям, есть одна кульминация.
  • Тишина, если она есть, — резкий обрыв после музыки.
  • Голос разбирается поверх музыки на телефоне.
  • Громкость выровнена, ориентир — около −14 LUFS.
  • Музыка и звуки с понятной лицензией.

Оговорки

Приёмы описания звука взяты из чужих разборов, часть наших звуковых тестов ещё не завершена. Тесты липсинка и голосов — на ограниченном числе генераций, не среднее по многим прогонам. Условия сервисов меняются: доступ, лимиты и возможности звука проверяйте на их сайтах.

Что дальше

Как зашло?

Ответ засчитывает гайд и помогает нам его улучшить

Читать дальше

Видео · 11 минПочему видео-нейросеть отказывает и как написать промпт, который пройдёт фильтрФото и картинки · 12 минGPT Image или Nano Banana? Какую модель брать под вашу задачуПросмотры · 11 минХук за 5 секунд и четыре провала начала ролика, которые его убивают

Вход в ИИ-цех

Аккаунт бесплатный: открывает гайды целиком, считает пройденные и помнит ваш маршрут.