Нейросеть для видео генерирует короткие фрагменты — обычно по несколько секунд — по текстовому описанию, по фото или по паре кадров «начало и конец». Готовый ролик из одной генерации получается редко: его собирают как из кирпичей — сценарий, голос, несколько генераций и монтаж. Для первого фрагмента хватит пробного доступа в любом крупном сервисе: Veo, Kling, Runway, Sora, Hailuo, Seedance, Higgsfield или российских Шедевруме и GigaChat. Ниже — три режима генерации и когда какой брать, пошаговая сборка ролика от идеи до файла, готовые промпты и технические ловушки, на которых теряется больше всего попыток.
| Режим | Что даёте | Когда брать |
|---|---|---|
| Текст в видео | описание сцены | фон, атмосфера, сцены без постоянного героя |
| Фото в видео | картинку первого кадра | нужен конкретный герой, товар или оживить снимок |
| Кадры в видео | первый и последний кадр | жесты, повороты, превращения — модель строит путь между кадрами |
Короткий ответ: для сцены без героя — текст в видео; для своего героя или товара — фото в видео; для точного жеста — кадры в видео. Ролик целиком собирается в монтаже, а не в генераторе.
Что понадобится
- Видео-нейросеть. Известные модели: Google Veo, Kling, Runway, Sora, Hailuo, Seedance, Higgsfield. Они отличаются качеством движения, длиной фрагмента, строгостью фильтров и тем, умеют ли делать звук и реплики вместе с картинкой. Часть зарубежных сервисов из России недоступна — нужен доступ из-за рубежа. Российские варианты: в Шедевруме от Яндекса есть видео по описанию с выбором первого кадра и эффекта движения; в GigaChat от Сбера есть модель Kandinsky Video с режимами по тексту и по картинке.
- Генератор картинок — для первых кадров и героя. Картинки дешевле и быстрее видео: доводить кадр выгоднее на картинке, чем перегенерировать видео.
- Чат-бот — для сценария и черновиков промптов.
- Озвучка — синтез голоса или свой голос, если в ролике есть речь.
- Монтажная программа — любая, где можно склеить фрагменты, положить титры, музыку и выставить частоту кадров.
- Время: первый фрагмент — 15–30 минут вместе с регистрацией. Ролик на 20–40 секунд из нескольких сцен — вечер на первый раз.
- Деньги: у большинства видео-сервисов есть пробные генерации; полноценная работа платная — подписка или оплата за генерацию.
Какой сервис выбрать
Универсально лучшей видео-нейросети нет: модели обновляются каждые несколько месяцев, и лидер по одной задаче отстаёт по другой. Выбирайте по четырём вопросам.
| Вопрос | На что смотреть |
|---|---|
| Работает ли из России | зарубежным сервисам часто нужен доступ из-за рубежа; у Шедеврума и GigaChat этой проблемы нет |
| Какие режимы есть | фото в видео есть почти везде; первый и последний кадр — не у всех; подача нескольких референсов (герой, место, предмет) — у немногих и часто на дорогих тарифах |
| Есть ли звук | часть моделей генерирует звук и реплики вместе с видео — для сценок это экономит озвучку и синхронизацию губ |
| Сколько стоит попытка | считайте не цену подписки, а цену одной генерации: ролик требует 2–3 попыток на сцену |
В Google Flow, например, режим с первым и последним кадром называется Frames to Video, а режим с референсами героев и предметов — Ingredients to Video. У других сервисов названия свои, но смысл тот же.
Пошагово: ролик от идеи до файла
- Сформулируйте идею одной фразой. Что зритель должен понять или почувствовать. Пример: «утро маленькой пекарни: тишина, свет, первый хлеб на прилавке».
- Напишите сценарий. Первая фраза сразу говорит суть — у зрителя пара секунд на решение смотреть или листать. Посчитайте длину: в коротких роликах темп речи, по нашему разбору 60 роликов, — 15–17 знаков в секунду. На 30 секунд это около 470 знаков.
- Разбейте сценарий на сцены. Одна сцена — одна мысль, 3–5 секунд. Для каждой запишите: кто в кадре, что делает, где, какой свет, как движется камера.
- Выберите режим для каждой сцены по таблице выше. Атмосфера — текст в видео, герой — фото в видео, жест — кадры в видео.
- Если есть герой — сделайте его один раз. Сгенерируйте картинку, выберите лучший вариант, соберите лист персонажа (поза и несколько выражений лица) и прикладывайте его ко всем генерациям.
- Сгенерируйте первые кадры сцен в генераторе картинок. Вертикаль 9:16, герой в нижних двух третях, если сверху будет текст.
- Оживите кадры. В промпте опишите одно-два изменения на сцену, не больше. Главное действие ставьте в последнюю треть фрагмента.
- Сделайте 2–3 варианта каждой сцены и выбирайте лучший — результат каждый раз разный.
- Озвучьте текст и вырежьте паузы.
- Смонтируйте. Сцены ставьте по словам голоса, добавьте титры, музыку ниже голоса, выставьте одну частоту кадров.
- Проверьте на телефоне. Смотрите со звуком и без: понятно ли без звука, не закрывают ли титры лицо, не дёргается ли движение.
Готовые промпты
Текст в видео: сцена без героя
Меняйте место, свет и направление камеры. Длину фрагмента указывайте ту, которую поддерживает ваш сервис.
Vertical 9:16. A cozy small bakery at dawn, warm light through the window, flour dust in the air. The camera…Фото в видео: герой или товар
К промпту прикладывается картинка первого кадра. Опишите одно движение героя и одно движение камеры.
Vertical 9:16. The woman in the image turns her head toward the camera and smiles softly. Light breeze moves…Кадры в видео: жест
Первый кадр: героиня стоит, руки опущены. Последний кадр: героиня показывает рукой вниз. Промпт к паре кадров:
The woman raises her right hand and points down to the bottom of the frame. Smooth natural motion, static camera, same outfit and background.
Сцена по секундам
Разметка по времени — самый сильный приём управления: модель перестаёт выбирать за вас, что и когда происходит. Меняйте действия внутри отрезков.
Vertical 9:16, realistic style, one continuous shot, no cuts.Правка готового видео: сменить стиль
Сначала перечислите, что остаётся, потом одну вещь, которую меняете. Работает в сервисах, где можно загрузить видео на вход.
Restyle this video into a 3D animated film look.Как мы собираем ролик
Наш ролик-пример собран нейросетями целиком, и порядок у него такой.
- Сценарий: первая фраза сразу говорит суть.
- Голос: синтез или клон, паузы вырезаются, время каждого слова размечается.
- Кадры: героиня сгенерирована один раз и держится по листу; перерисована в несколько стилей — реализм, 3D, аниме, комикс — и остаётся узнаваемой; жесты сделаны через режим «кадры в видео».
- Монтаж: собирается по словам голоса — титры, переходы, музыка, громкость под соцсети.
Технические ловушки
- 24 и 30 кадров. Многие генераторы отдают 24 кадра в секунду. Если монтаж в 30 — ускоряйте фрагмент ровно в 1,25 раза, иначе движение дёргается.
- Фильтры. Видео-режим у одних и тех же сервисов строже, чем картинка: одна и та же героиня может пройти как фото и не пройти как видео. Имена героев, «подростковые» слова и слова о травмах чаще всего включают отказ.
- Жест текстом не работает. «Показывает пальцем вниз» модель часто игнорирует. В наших тестах такая просьба при неподвижной камере дала наезд камеры втрое, а сам персонаж почти не двинулся. Надёжнее задать первый и последний кадр.
- Проценты камера не держит. Модель держит порядок величины, но не точное число. В наших тестах «на 4% ближе» дало примерно в 1,1 раза, а «на 15% ближе» — почти вдвое, и голова ушла за край кадра. Для спокойного кадра пишите словами: «barely perceptible push-in».
- Толпа. Несколько людей с действиями сливаются в кашу. Пусть толпа стоит неподвижно, а движется только герой.
- Кавычки рисуются в кадре. Если просите текст в кадре, модель может нарисовать и кавычки из промпта. Пишите текст отдельной строкой и добавляйте «no quotation marks».
- Первый кадр задаёт всё. Если по сюжету что-то должно загореться или появиться, на первом кадре этого ещё не должно быть.
Бесплатно и на русском
У большинства видео-сервисов есть пробные генерации, но для регистрации обычно нужна почта или телефон, а для регулярной работы — платный тариф. Сайты, которые обещают видео «без регистрации», часто работают через чужие ключи и собирают загруженные фото — не отдавайте туда снимки, которыми не готовы делиться.
Описание можно писать по-русски, но английский промпт многие модели понимают точнее. Рабочий приём: сначала напишите промпт по-русски, чтобы продумать сцену, потом попросите чат-бот перевести его на английский дословно, без украшений.
Монтаж нейросетью
Отдельно ищут «нейросеть для монтажа». Нейросети уже умеют нарезать длинное видео на короткие фрагменты, подобрать музыку, сделать субтитры и убрать паузы. Но собрать ролик со смыслом — порядок сцен, ритм под голос, где стоит расплата — пока лучше получается кодом по шаблону или руками. Если роликов много, соберите монтажный шаблон один раз: титры, шрифт, громкость, переходы — и дальше подставляйте только голос и кадры.
Типичные ошибки
- Ждать готовый ролик от одной генерации. Генерация — это сцена, ролик — это монтаж.
- Писать длинный промпт с десятком событий. Модель смешивает их. Одно-два изменения на сцену.
- Генерировать героя заново в каждой сцене. Лицо и одежда поедут. Лист персонажа прикладывается ко всем генерациям.
- Статичная камера везде. В вертикали статика читается мёртвой: в кадре что-то должно меняться каждые 2–3 секунды.
- Самое интересное в середине фрагмента. Вторую половину тогда смотреть незачем. Расплата — в последней трети.
- Экономить на картинке и чинить видео. Доводите первый кадр на картинке: это дешевле, чем перегенерировать видео.
- Разная частота кадров в одном ролике. Движение дёргается. Приводите всё к одной.
Чек-лист перед публикацией
- Первая фраза и первый кадр говорят суть сразу.
- Герой одинаковый во всех сценах.
- В каждой сцене одно-два изменения, камера не стоит мёртво.
- Главное действие каждой сцены — в её последней трети.
- Частота кадров одна на весь ролик.
- Паузы в голосе вырезаны, титры идут за словами.
- Титры не закрывают лицо и не уходят под интерфейс площадки.
- Проверено на телефоне со звуком и без.
- Если ролик реалистичный, проверьте, требует ли площадка пометку о контенте, созданном ИИ.
Что дальше
- Как выбрать режим и подготовить картинку — в гайде видео из фото.
- Как собрать промпт для видео по частям — в разборе промпты для видео-нейросетей.
- Как оживить снимок, чтобы лицо не поплыло, — в гайде как оживить фото.
- Как сделать, чтобы видео звучало живо, — в разборе звук в ИИ-видео.
Условия сервисов меняются: бесплатные лимиты, доступ из России и цены проверяйте на их сайтах. Названия режимов Google Flow и наличие видео в Шедевруме сверены по справке сервисов по состоянию на сентябрь 2026. Наши тесты камеры и жестов — клипы по 4 секунды, каждый прогнан один раз.
Как зашло?
Ответ засчитывает гайд и помогает нам его улучшить


