Звук в ИИ-видео выдаёт подделку чаще картинки. Плоское помещение без эха, скомканная реплика, чужой хвост фразы на молчащем герое, голос, который меняется от кадра к кадру, — всё это зритель слышит сразу. Чинится это тремя вещами: описывать звук прямо в сцене (материал, эхо, конкретный фон), писать реплики по правилам (точные слова, длина под шот, один говорящий на шот) и делать важные голоса отдельно в синтезаторе речи, а не надеяться на видео-модель. Ниже — как это устроено, что показали наши тесты, готовые промпты и порядок монтажа звука.
Главное коротко:
- современные видео-модели умеют генерировать звук вместе с картинкой, но держат его хуже, чем картинку;
- фон и шумы можно брать из генерации, реплики главного героя надёжнее делать отдельно;
- монтаж звука — это отдельный этап, а не «музыка поверх».
Картинку зритель прощает, звук — нет. Плоское помещение выдаёт нейроролик раньше, чем шесть пальцев.
Что понадобится
- Видео-генератор со звуком. Часть моделей генерирует звук вместе с картинкой — например, в Flow от Google звук поддерживается в режимах из картинок и из образцов (по состоянию на сентябрь 2026). У других генераторов звук добавляется отдельно или его нет вовсе.
- Синтезатор речи — для реплик героя и закадрового голоса. Как с ним работать — в гайде Нейросеть для озвучки.
- Монтажная программа с несколькими звуковыми дорожками.
- Библиотека звуков и музыки с понятной лицензией. Не берите музыку из чужих роликов: площадки снимают звук или ролик целиком.
- Доступ. Часть сервисов работает только с доступом из-за рубежа, у других есть оплата из России или российские аналоги. Условия проверяйте на их сайтах.
- Время. Звук короткого ролика с репликами — от 30 минут до пары часов, в зависимости от числа героев.
Термины:
- Липсинк — совпадение движения губ с речью.
- Шот — один непрерывный кусок внутри генерации, между двумя склейками.
- Эмбиент — фоновый звук места: шум улицы, гул зала, дождь.
- Закадровый голос — голос, который звучит, пока губы героя не двигаются.
Войдите, чтобы читать дальше — это бесплатно
Аккаунт считает пройденные гайды, помнит, где вы остановились в маршруте, и открывает все бесплатные материалы.
Где делать звук: в генерации или отдельно
| Что | В генерации | Отдельно в монтаже |
|---|---|---|
| Фон места (эмбиент) | хорошо, если описан конкретно | библиотечный фон, если генерация дала шум |
| Шумы действий: шаги, дверь, чашка | хорошо в простых сценах | когда нужен точный момент удара |
| Короткая реплика одного героя | работает, если модель держит русский | синтезатор + наложение, если модель коверкает |
| Разговор нескольких героев | рискованно: голоса путаются | надёжнее |
| Закадровый голос, внутренний монолог | в наших тестах не работает | только так |
| Шёпот | в наших тестах из текста не получился | синтезатор речи |
| Музыка | не рекомендуем: не управляется | только так |
Пошаговая инструкция
Шаг 1. Составьте звуковую карту ролика
Перед генерацией пропишите для каждого шота три строки: кто говорит (или никто), какая реплика, какой фон. Пример:
| Шот | Кто говорит | Реплика | Фон |
|---|---|---|---|
| 1 | героиня | «Ты опять опоздал.» | дождь по стеклу, тиканье часов |
| 2 | никто | — | дождь, скрип двери |
| 3 | герой | «[тихий вдох] Я не опоздал.» | дождь, шаги по паркету |
Что должно получиться: таблица, где у каждого шота заполнен фон. Пустой фон — признак того, что модель заполнит тишину чем попало, в том числе чужой репликой.
Шаг 2. Опишите звук внутри сцены
Описывайте звук прямо в описании сцены, а не отдельной строкой в конце: «дождь по стеклу и шипение кофемашины». Подделку чаще всего выдаёт помещение, которое звучит плоско. Опишите материал и эхо:
- «пустой бетонный гараж, звук отражается от стен»;
- «маленькая кухня, мягкий приглушённый звук»;
- «большой каменный зал, шаги гулко отдаются».
Звук характеризует место, а не иллюстрирует его: пустыне подходит низкий гул, стройке — дрожь земли, библиотеке — шелест страниц и далёкий кашель.
Шаг 3. Напишите реплики по правилам
- Точные слова в кавычках. Не «она говорит, что устала», а реплика дословно.
- Длина реплики под длину шота. Реплика на 10 секунд в шоте на 5 выходит скомканной. Для ориентира: в короткой речи около 15 знаков в секунду.
- Короткая реплика в 2–3 слова звучит плоско — модель не успевает поймать интонацию. Помогает вводный звук: «[тихий вдох] Ты кто?».
- Без тире внутри реплики. Модели о них спотыкаются — заменяйте запятыми.
- Эмоцию — телом, а не словом. «Голос дрожит, она сглатывает перед словом» работает лучше, чем «говорит грустно».
Шаг 4. Один шот — один говорящий
Модели переносят хвост фразы на соседнего героя: реплика не закончилась, а склейка уже показывает другого человека, и он шевелит губами. Правила:
- в одном шоте говорит один герой;
- режьте только после точки: фраза закончена — потом склейка;
- длинную реплику из двух предложений делите на два ракурса одного и того же героя;
- в немом шоте пишите конкретный фоновый звук — он заполняет тишину вместо чужой реплики. Не «тишина», а «эхо зала, шаги».
Шаг 5. Держите один голос героя
Если героя озвучивает видео-модель, его голос может меняться от генерации к генерации. Что делать: первая удачная генерация становится эталоном. Склейте реплики героя в короткий файл и подавайте его вместе с листом персонажа, если сервис принимает звуковой образец. Если не принимает — главного героя озвучивайте синтезатором речи одним и тем же голосом, а генерацию используйте только для движения губ.
В разговоре нескольких героев голоса в наших тестах менялись местами. Поэтому главного героя мы в генерацию не «впекаем»: его голос делаем отдельно, а в генерации оставляем только второстепенных.
Шаг 6. Проверьте липсинк на русском
Прежде чем делать серию, проверьте конкретную модель на одной русской реплике. Критерий простой: губы попадают в слоги, слова не искажены. Если нет — не пытайтесь чинить промптом, меняйте модель или делайте голос отдельно.
Шаг 7. Соберите звук в монтаже
Порядок дорожек снизу вверх: фон → шумы → музыка → голос. Затем:
- звук следующей сцены заходит чуть раньше картинки — так склейка не рвётся (в монтаже этот приём называют J-cut);
- музыкальную арку стройте по смысловым частям ролика, а не по отдельным клипам: завязка, развитие, развязка;
- полная тишина на повороте сюжета — сильнейший приём, но только если до неё звучала музыка. Вырежьте музыку целиком на 1–2 секунды;
- эффект нарастания — только перед важным. Если после него ничего не случилось, он «теряет репутацию», и следующему зритель не поверит;
- резкая остановка музыки встряхивает, плавный уход говорит «эта часть закончилась».
Шаг 8. Выровняйте громкость и проверьте на телефоне
Голос должен разбираться поверх музыки на динамике телефона. Общую громкость выравнивайте к ориентиру около −14 LUFS — к этому уровню YouTube приводит звук роликов. Послушайте ролик на телефоне без наушников — так его услышит большинство.
Готовые промпты
Промпты на английском: видео-модели в большинстве случаев лучше понимают английский. Реплики пишите на том языке, на котором герой должен говорить.
Сцена со звуком места
Звук вписан в описание сцены. Меняйте место, материал и конкретные звуки.
Vertical 9:16 video, 6 seconds. A small kitchen at night, rain hits the
window, an old wall clock ticks, the kettle starts to hiss at 4 seconds.
Soft, slightly muffled room sound with no echo. A woman in her 30s stands
by the window holding a cup. The camera slowly pushes in. No music.
Реплика с вводным звуком
Для коротких реплик в 2–3 слова. Меняйте вздох на смешок, кашель, выдох.
Vertical 9:16 video, 4 seconds. Medium close-up of a man in his 40s in an
empty concrete garage, sound echoes off the walls. He looks up from the
car engine, eyebrows rise slightly. Dialogue: "[a soft caught breath] Ты кто?"
He finishes the sentence completely before the end of the shot.
Немой шот с конкретным фоном
Чтобы в тишину не попала чужая реплика. Меняйте фон на звуки своего места.
Vertical 9:16 video, 3 seconds. Close-up of a woman listening, lips sealed
shut, completely silent, she blinks slowly and swallows.
Dialogue: NONE. Ambient: "rain on the window, a distant car passes,
the clock ticks".
Два шота, два героя, без перетекания голоса
Для диалога внутри одной генерации. Главного героя лучше озвучивать отдельно — этот промпт для второстепенных.
Vertical 9:16 video, 8 seconds, 2 hard-cut shots, same location and lighting
in both shots: a quiet office in the evening, air conditioner hum.
Each shot contains only one person. A speaker fully finishes the sentence
before any cut, the voice never continues onto the next shot.
Shot 1 (4s, medium close-up): a woman, lips moving. Dialogue: "Отчёт готов?"
Shot 2 (4s, medium close-up): a man, lips moving. Dialogue: "[exhales] Почти."
Музыкальная арка через ИИ-ассистента
Для текстового ассистента: план звука по раскадровке.
Вот раскадровка ролика на [30] секунд: [вставьте таблицу].
Составь звуковой план: для каждого отрезка — фон, шумы, музыка
(характер и громкость), где нарастание и где резкая тишина.
Правила: нарастание только перед главным поворотом; тишина только
после музыки; звук следующей сцены заходит на полсекунды раньше картинки.
Что показали наши тесты
- Русский липсинк одна из трёх видео-моделей держит, две другие коверкают.
- Голос за кадром при сомкнутых губах модель не озвучивает: внутренний монолог из промпта не звучит.
- Шёпот из текста модель не делает, и тембр у героя в пределах сцены один.
- В разговоре нескольких героев голоса могут меняться местами, а хвост фразы перетекает на молчащего героя.
- Отрицания работают плохо: «no talking» модель цепляет за слово «talking» и шевелит губами. Пишите утвердительно: «lips sealed shut, completely silent».
Поэтому голоса главных героев мы делаем отдельно в синтезаторе речи и накладываем в монтаже.
Типичные ошибки и как чинить
- Помещение звучит плоско. Допишите материал и эхо: «бетон, звук отражается», «ковёр и шторы, звук мягкий».
- Реплика скомкана. Сократите реплику или удлините шот.
- Короткая фраза без интонации. Добавьте вводный звук: вздох, смешок, выдох.
- Молчащий герой шевелит губами. Режьте после точки, в немом шоте пишите «lips sealed shut» и конкретный фон.
- Голос героя меняется от ролика к ролику. Делайте его синтезатором одним голосом, генерацию используйте для движения.
- Модель коверкает русский. Не боритесь промптом: другая модель или голос отдельно.
- Музыка из чужого ролика. Берите из библиотеки с понятной лицензией.
- Нарастания в каждом переходе. Оставьте одно — перед главным.
- Тишина «повисла». Тишина работает только как обрыв после музыки.
- Проверили в наушниках. Послушайте на телефоне без наушников.
Чек-лист перед публикацией
- У каждого шота есть конкретный фон.
- Помещение звучит как помещение: есть материал и эхо.
- Реплики дословные и по длине влезают в шоты.
- В каждом шоте говорит один герой, склейки после точки.
- Голос главного героя одинаковый во всём ролике.
- Губы попадают в русскую речь, либо голос наложен отдельно.
- Музыка построена по смысловым частям, есть одна кульминация.
- Тишина, если она есть, — резкий обрыв после музыки.
- Голос разбирается поверх музыки на телефоне.
- Громкость выровнена, ориентир — около −14 LUFS.
- Музыка и звуки с понятной лицензией.
Оговорки
Приёмы описания звука взяты из чужих разборов, часть наших звуковых тестов ещё не завершена. Тесты липсинка и голосов — на ограниченном числе генераций, не среднее по многим прогонам. Условия сервисов меняются: доступ, лимиты и возможности звука проверяйте на их сайтах.
Что дальше
- Нейросеть для озвучки — как сделать живой голос, темп и тайминги слов.
- Режиссура вертикального ролика — хук, ритм и развязка.
- Лист персонажа — как держать одного героя во всех роликах.
Как зашло?
Ответ засчитывает гайд и помогает нам его улучшить


