Меню
Войти
Голос и звук10 мин чтенияобновлено 26 сентября 2026

Как сделать нейросетью живой голос для ролика на русском

Как озвучить текст и видео нейросетью: готовый голос или клон, темп речи для коротких роликов, ударения, резка пауз, тайминги слов для титров и громкость.

Как сделать нейросетью живой голос для ролика на русском

Озвучка нейросетью — это синтез речи из текста: вы вставляете текст, выбираете голос и получаете аудиофайл. Голос бывает двух видов: готовый из библиотеки сервиса или клон вашего голоса по записи. Чтобы озвучка звучала живо, мало нажать «сгенерировать»: текст надо переписать под голос, проверить ударения, вырезать лишние паузы и выровнять громкость. Мы озвучиваем так все свои ролики. Ниже — наш процесс по шагам, расчёт длины текста под ролик, готовые промпты и частые ошибки.

Быстрый ответ на главный вопрос «сколько текста на ролик»: для короткого ролика темп — около 15–16 знаков в секунду. Наш замер на своём голосе дал 16,0; до своего замера считайте по 15. Это около 680 знаков на 45 секунд и около 450 знаков на 30 секунд.

Голос выдаёт не синтезатор, а текст. Текст «для глаз» звучит как робот даже у лучшего голоса.

Что понадобится

  • Сервис синтеза речи. Есть зарубежные синтезаторы (мы работаем в ElevenLabs) и российские сервисы синтеза речи крупных компаний — например, SpeechKit у Яндекса и SaluteSpeech у Сбера. Выбирайте по двум признакам: естественность ударений в русском и возможность клонировать голос.
  • Доступ. ElevenLabs по своей справке ограничивает доступ из России, то есть для работы нужен доступ из-за рубежа. Российские сервисы работают из России; для подключения обычно нужен аккаунт компании (Яндекс ID, Сбер ID).
  • Запись своего голоса — если нужен клон. Подойдёт телефон в тихой комнате.
  • Монтажная или звуковая программа — чтобы резать паузы и выравнивать громкость. Для резки пауз хватит любой монтажной программы.
  • Время. Первая озвучка с настройкой — час-полтора. Дальше ролик на 45 секунд — 10–15 минут вместе с проверкой ударений.
  • Цена. У большинства сервисов есть бесплатный или пробный лимит, дальше оплата по знакам или подписка. Размеры лимитов и цены меняются — смотрите на странице тарифов сервиса.

Готовый голос или клон

ВариантЧто нужноПлюсыМинусы
Готовый голос из библиотекиничего, выбрать голосбыстро, чисто, без записитакой же голос у тысяч роликов
Быстрый клон1–2 минуты чистой записиваш тембр за минутычуть менее стабилен, шум в записи переносится в клон
Профессиональный клонот 30 минут до нескольких часов записиближе к живому голосудолго записывать, доступен не на всех тарифах
Живая записьмикрофон, тишина, времяестественнокаждый дубль — ваше время

Числа для клонов — из документации ElevenLabs по состоянию на сентябрь 2026: для быстрого клона рекомендуют около 1–2 минут чистой записи и не больше 3 минут — дальше качество почти не растёт и может даже ухудшиться; для профессионального — минимум 30 минут, лучше 2–3 часа. У других сервисов требования свои, смотрите их документацию. У российских сервисов клонирование своего голоса обычно оформляется как отдельная услуга для компаний.

Пошаговая инструкция: наш процесс

Шаг 1. Посчитайте длину текста под ролик

Умножьте длину ролика в секундах на 15 — это число знаков с пробелами. Пример: 45 секунд × 15 = 675, округляем до 680 знаков. Потом замерьте свой голос: озвучьте абзац, разделите число знаков на секунды звучания без пауз. Наш результат — 16,0 знака в секунду. Своё число используйте дальше вместо 15.

Ориентиры по длине при темпе 15 знаков в секунду:

Длина роликаЗнаков с пробеламиПримерно слов
15 секундоколо 22530–35
30 секундоколо 45060–70
45 секундоколо 68090–100
60 секундоколо 900120–135

Число слов — грубая прикидка: в русском слово в среднем занимает 6–7 знаков с пробелом, но в тексте с длинными терминами слов будет меньше. Считайте по знакам — их показывает любой текстовый редактор.

Что должно получиться: предел знаков для текста. Если текст длиннее — сокращайте текст, а не ускоряйте голос: ускоренная речь звучит суетливо.

Шаг 2. Перепишите текст под голос

Текст «для глаз» и текст «для уха» — разные тексты. Для голоса:

  • короткие фразы, одна мысль в предложении;
  • никаких скобок, сносок, списков через точку с запятой;
  • числа и сокращения — словами, как они должны прозвучать;
  • даты и символы — словами: не «26.09», а «двадцать шестого сентября»; не «%», а «процентов»;
  • английские названия — так, как вы их произносите, или замените русским словом.

Пример. Было — текст «для глаз»:

Сегодня (26.09) расскажу про 3 ошибки в ИИ-роликах — см. список ниже.

Стало — текст для озвучки:

Сегодня расскажу про три ошибки в роликах на нейросетях. Первая — самая частая.

Шаг 3. Разбейте текст на смысловые куски

Одна интонация на весь ролик утомляет. Разбейте текст на 3–5 кусков: хук, проблема, решение, вывод, призыв. Каждый кусок озвучивайте отдельной генерацией — так проще поймать нужную интонацию и перегенерировать только неудачный кусок.

Шаг 4. Синтез

Вставьте первый кусок, выберите голос, сгенерируйте. Послушайте целиком. Если сервис даёт настройки стабильности и выразительности, начните со средних значений: слишком стабильный голос звучит монотонно, слишком выразительный — нестабильно, с перепадами.

Сделайте 2–3 варианта каждого куска и выберите лучший — синтез каждый раз звучит немного по-разному.

Шаг 5. Проверьте ударения и трудные слова

Сложные слова, фамилии, термины и омографы («замок», «мука», «атлас») проверяйте на слух. Если ударение неверное:

  • поставьте знак ударения, если сервис его поддерживает. В Yandex SpeechKit, например, ударение ставится знаком «+» перед ударной гласной: «з+амок». В других сервисах разметка своя — смотрите документацию;
  • перепишите слово так, как оно звучит, или замените синонимом;
  • поставьте слово в другое место фразы — иногда синтезатор меняет ударение от соседних слов.

Шаг 6. Вырежьте лишние паузы

Синтез оставляет длинные паузы между фразами и кусками. Вырезаем их — ролик становится плотнее. Оставляйте короткую паузу там, где нужен вдох или акцент: перед выводом, после вопроса. Паузу-акцент в 1–2 секунды без голоса после важной мысли можно оставить намеренно — она даёт зрителю усвоить сказанное.

Шаг 7. Разметьте тайминги слов

Распознаём озвучку обратно в текст с временем каждого слова. Для этого подходят модели распознавания речи с метками слов — например, открытая модель Whisper умеет отдавать время начала и конца каждого слова. По этим меткам в монтаже встают сцены и титры: смена кадра на ключевом слове, слово в титрах подсвечивается ровно тогда, когда звучит.

Что должно получиться: файл, где у каждого слова есть время. Даже если вы монтируете руками, по такому файлу быстро находится нужный момент.

Шаг 8. Выровняйте громкость

Выравниваем под соцсети, около −14 LUFS. LUFS — единица воспринимаемой громкости. YouTube приводит звук роликов к этому уровню: слишком громкий ролик он приглушит, тихий оставит тихим. У других площадок свои правила, но −14 LUFS — разумный общий ориентир. Большинство монтажных программ умеют нормализовать громкость до заданного уровня.

Если под голосом музыка, делайте её тише голоса так, чтобы слова разбирались на телефонном динамике. Проверяйте именно на телефоне.

Готовые промпты

Эти промпты — для текстового ИИ-ассистента: он готовит текст к озвучке. Сам синтезатор промпт не понимает, ему нужен готовый текст.

Переписать текст под голос

Меняйте длину ролика и знаки в секунду на свои.

Перепиши текст для озвучки короткого ролика на [45] секунд.
Бесплатно, за минуту. Уже есть аккаунт?

Найти трудные слова и ударения

Помогает поймать ошибки до синтеза, а не после.

Вот текст для синтеза речи на русском. Найди слова, где синтезатор может
Бесплатно, за минуту. Уже есть аккаунт?

Разбить текст на куски с интонацией

Для озвучки по кускам.

Разбей текст на 3–5 смысловых кусков для отдельной озвучки.
Бесплатно, за минуту. Уже есть аккаунт?

Подогнать длину без потери смысла

Когда текст длиннее предела.

Сократи текст до [680] знаков с пробелами. Не убирай цифры и
Бесплатно, за минуту. Уже есть аккаунт?

Сравнение: чем озвучивать

Зарубежный синтезатор (например, ElevenLabs)Российские сервисы (SpeechKit, SaluteSpeech)
Доступ из Россиинужен доступ из-за рубежаработают из России
Оплатазарубежной картойроссийской картой, обычно через аккаунт компании
Клон своего голосабыстрый и профессиональный клон в интерфейсеобычно отдельная услуга для компаний
Управление произношениемзависит от моделиразметка ударений и пауз (SSML — язык разметки речи)
Для кого удобнеекреаторам, которым нужен клон и живая интонациябизнесу, которому важна оплата и работа из России

Сравнение — по устройству сервисов, а не по нашему замеру качества: сравнительного теста русских ударений между сервисами мы не проводили. Послушайте свой текст в двух-трёх сервисах на пробном лимите — это займёт полчаса и скажет больше любой таблицы.

Клон голоса: как записать

  • Записывайте 1–2 минуты в тихой комнате, без музыки, с разной интонацией: спокойно, с вопросом, с удивлением.
  • Говорите так, как будете звучать в роликах. Клон повторяет манеру записи: читали монотонно — получите монотонный клон.
  • Держите телефон или микрофон на одном расстоянии, без эха. Мягкая мебель и шторы помогают.
  • Запись с шумом и музыкой даёт «грязный» клон: призвуки и неровную громкость.
  • Клонировать чужой голос без согласия нельзя. Сервисы требуют подтвердить, что голос ваш или у вас есть разрешение.

Частые ошибки

  • Текст написан «для глаз»: длинные предложения, скобки, списки. Для голоса пишите короткими фразами.
  • Числа и сокращения цифрами. Пишите словами, как они должны прозвучать.
  • Одна интонация на весь ролик. Разбивайте на смысловые куски и озвучивайте отдельно.
  • Текст не влезает — голос ускоряют. Сокращайте текст, а не темп.
  • Паузы не вырезаны. Ролик тянется, зритель уходит. Режьте всё, что длиннее короткого вдоха, кроме намеренных пауз.
  • Громкость разная в кусках. Нормализуйте весь трек целиком в конце.
  • Музыка громче голоса. Проверяйте на телефоне, не в наушниках.
  • Ударения проверили в одном куске. Перегенерация может сдвинуть ударение в другом месте — слушайте финал целиком.
  • Клон с плохой записи. Перезапишите 1–2 минуты в тишине: это быстрее, чем бороться с призвуками.

Чек-лист перед публикацией

  • Длина текста рассчитана по вашему темпу (или по 15 знаков в секунду).
  • Числа, даты и сокращения написаны словами.
  • Трудные слова прослушаны, ударения верные.
  • Текст разбит на куски, интонация меняется по смыслу.
  • Лишние паузы вырезаны, паузы-акценты оставлены намеренно.
  • Громкость выровнена, ориентир — около −14 LUFS.
  • Музыка тише голоса, слова разбираются на телефоне.
  • Тайминги слов совпадают с титрами.
  • Голос ваш или у вас есть согласие владельца голоса.

Оговорки

Темп 16,0 знаков в секунду — наш замер на одном голосе, не норма: перемерьте на своём. Условия сервисов меняются: доступ из России, лимиты и цены проверяйте на их сайтах.

Что дальше

Как зашло?

Ответ засчитывает гайд и помогает нам его улучшить

Читать дальше

Нейросети · 5 минBotHub: цены, пакеты Caps, бесплатный старт и сколько стоит один роликНейросети · 5 минChad AI (ChadGPT): цены, тарифы в искрах и сколько стоит один роликНейросети · 4 минCursor: тарифы, лимиты на модели, бесплатный план и как оплатить из России

Вход в ИИ-цех

Аккаунт бесплатный: открывает гайды целиком, считает пройденные и помнит ваш маршрут.