Нейросеть для видео с озвучкой: какая модель реально говорит по-русски
Если поискать «нейросеть для видео с озвучкой», выдача покажет два десятка сервисов, которые озвучивают уже готовый ролик. Это другая задача. Есть модели, которые рисуют картинку и сразу же произносят реплику - губы двигаются в такт, голос идёт из кадра. И вот про них по-русски почти ничего нет.
Публичные рейтинги тут не помогают. Главная арена Artificial Analysis сравнивает ролики без звука - там просто нет графы «как модель говорит». Поэтому мы сделали свой тест: взяли одну русскую фразу, один и тот же промпт и прогнали через пять видеомоделей подряд. Ниже - что вышло, с роликами и с расшифровками того, что модели на самом деле произнесли.
Видео со звуком и озвучка видео - это разные вещи
Судя по Яндекс Вордстату, люди почти всегда ищут второе. «Озвучка нейросетью» - 14 256 запросов в месяц, «видео для озвучки» - 15 906, «нейросеть озвучивает текст» - 3 888. А вот «нейросеть видео со звуком» - всего 522, «нейросеть для видео с озвучкой» - 106.
Разница в тридцать раз. И она объясняет, почему в топе одни статьи про синтез речи: спрос действительно там. Только человеку, который хочет говорящего героя в кадре, эти статьи не помогают вообще.
Дальше по тексту я развожу два случая:
• видео сразу со звуком - модель сама генерирует речь и сама попадает губами в слова;
• озвучка готового видео - сначала картинка, потом отдельно голос, потом синхронизация губ. Это связка из двух-трёх инструментов.
Первое быстрее и дешевле. Второе - надёжнее, если нужен конкретный голос или язык, которого модель не знает.
Как устроен тест
Фраза одна на всех:
Слушай, я уже всё решил: щенка мы забираем в четверг.
Она короткая, но собрана специально: тут есть «ш» (слушай), «ж» (уже), «щ» (щенка), «ч» (четверг) и мягкие согласные. Именно на шипящих и мягких звуках у моделей чаще всего разъезжаются губы - а иногда рассыпается и само слово.
Промпт собран по официальной схеме Google для Veo: кадр, герой, действие, обстановка, стиль - и реплика в двойных кавычках. Google прямо пишет: чтобы персонаж заговорил, реплику нужно взять в кавычки. Kling в своём руководстве советует то же самое: имя говорящего, реплика, интонация - рядом, одной строкой. Ничего своего я не изобретал, взял то, что вендоры описали сами.
Текст промпта - одинаковый для всех пяти моделей, слово в слово:
Настройки тоже одинаковые: 16:9, 720p, 5 секунд. Исключение одно - у Gemini Omni нет варианта «5 секунд», там сетка 4/6/8/10, взял 6.
Как я оценивал результат. Слушать ушами и спорить «мне показалось, что похоже» - так себе критерий. Поэтому я вытащил из каждого ролика звуковую дорожку и прогнал через распознавание речи (Whisper), причём двумя разными по размеру моделями. Если обе слышат одно и то же - значит, модель действительно это произнесла. Заодно померил громкость дорожки: она сразу показывает, есть ли там речь или только фон.
Что получилось
Коротко - в таблице, дальше по каждой модели с роликом.
Veo 3.1 - произнесла фразу целиком
Распознавание вернуло текст без единой правки: «Слушай, я уже всё решил, щенка мы забираем в четверг». Обе модели распознавания согласились между собой, уверенность в том, что язык русский - 0,99.
Мелочь, которая удивила: при выставленных пяти секундах модель отдала ролик на восемь. Фраза целиком поместилась, ещё и пауза осталась.
Gemini Omni - тоже чисто
Тот же результат: фраза распознана дословно, никаких искажений. Плюс картинка ближе всего к тому, что было написано в промпте - кухня, окно, дневной свет.
Seedance 2 Pro - говорит, но ломает шипящие
Вот тут началось интересное. Модель уверенно говорит по-русски, голос живой, интонация нормальная. Но распознавание слышит:
Слушай, я уже все решил, шинка мы заберем в четверть.
Вторая модель распознавания, побольше, услышала почти то же самое, только вместо «четверть» - «в 4». То есть «щенка» превратилось в «шинку» - звук «щ» упростился до «ш». А «четверг» рассыпался: сочетание согласных в конце слова модель не вытянула.
Картинка при этом отличная. Проблема ровно в двух звуках.
Kling 3.0 - говорит, но фраза разваливается
Kling русскую речь выдаёт - и по-русски, распознавание уверенно определяет язык. Только от фразы остаётся одно первое слово:
Слушай, а я уже всё и дел. Шченко мой забирай муфкетка.
Вторая модель распознавания услышала свой вариант той же каши: «Слушай, я уже всё я делал. Шченко мой, забираем его в киафтку». Совпадает главное - «слушай» на месте, «щенка» превратилось в «шченко», а «четверг» не опознали обе модели.
Объяснение нашлось в документации самого Kling. Там прямым текстом сказано, что серия Video 3.0 поддерживает пять языков: китайский, английский, японский, корейский и испанский. Русского в списке нет - модель произносит его как чужой набор звуков, примерно как человек читает вслух незнакомый язык по буквам.
Wan 2.7 - до озвучки дело не дошло
Пять запусков подряд, две версии модели (2.7 и 2.6), два варианта промпта - с кириллицей и полностью на латинице. Каждый раз одно и то же: «Не удалось сгенерировать видео при помощи Wan».
Это не про русский язык, это про доступность модели в конкретный день. Честно фиксирую как есть: проверить Wan на озвучке в этот заход не удалось.
Почему ломается именно «щ» и «ч»
Тут нет никакой мистики. Модели учат на больших наборах речи, и русский в них есть далеко не всегда, а если есть - то в куда меньшем объёме, чем английский или китайский.
Звуки, которые страдают первыми:
• шипящие и «щ». В английском нет отдельного «щ», модель подставляет ближайшее знакомое - «ш». Отсюда «шинка» вместо «щенка»;
• мягкие согласные. Мягкость в русском меняет смысл слова, но акустически разница тонкая - модель её проглатывает;
• стечения согласных. «Четверг» - четыре согласных подряд на пять букв. Модель обрывает слово или заменяет похожим.
Практический вывод простой: если пишете реплику для модели, у которой русский под вопросом, выбирайте слова попроще. Короткие, с открытыми слогами, без «щ» и без хвостов из согласных. Одно это заметно поднимает шанс, что фраза прозвучит целиком.
Если модель не говорит по-русски: связка из двух шагов
Когда нативной озвучки нет, работает обходной путь. Он же выручает, если нужен конкретный голос или ролик длиннее нескольких секунд.
Шаг 1. Голос. ElevenLabs, режим «Озвучка диалога», язык - русский. Здесь русский заявлен официально, в списке 76 языков. Кидаем ту же фразу - на выходе 3,4 секунды чистой речи. Распознавание слышит её дословно, уверенность в языке - 1,00. Никаких «шинок».
Шаг 2. Губы. HeyGen 1.0, режим Lip Sync. Загружаем видео и новую звуковую дорожку - модель переставляет губы под звук. Я взял тот самый ролик Seedance, где фраза прозвучала криво, и подложил чистый голос из ElevenLabs.
Результат - картинка от Seedance, речь без ошибок:
Одна грабля, на которой я споткнулся: HeyGen не принимает пару, если длительность звука и видео отличается больше чем на 15%. У меня было 3,4 секунды звука против 5 секунд видео - отказ. Лечится за минуту: добиваем аудио тишиной до нужной длины. После этого всё прошло с первого раза.
Что из этого следует
Если нужен говорящий герой по-русски и сразу со звуком - берите Veo 3.1 или Gemini Omni. Обе произнесли фразу дословно, без правок промпта и без бубна.
Seedance 2 Pro годится, если реплика простая. Картинка у неё отличная, а речь можно потом переложить через связку с ElevenLabs и HeyGen - исходник-то хороший.
Kling 3.0 для русских диалогов сейчас не подходит: язык он выдаёт похожий на русский, но слова не собираются в фразу. И это не придирка - вендор сам не заявляет русский среди поддерживаемых языков. Как видеомодель без реплик - вопросов нет, картинку по промпту она отрабатывает.
И главное: списки языков у вендоров меняются, а тест занимает двадцать минут. Прежде чем строить проект вокруг одной модели, потратьте эти двадцать минут на свою фразу - именно ту, которая вам нужна.
Как повторить у себя
Все пять моделей плюс ElevenLabs и HeyGen лежат в одном боте Cyber AI - переключаться между ними можно в пару кликов, отдельные аккаунты заводить не нужно.
Порядок такой:
1. Открываете бота, раздел «Создать видео».
2. Выбираете модель - Veo 3.1, Seedance 2.0, Kling 3.0, Wan 2.7 или Gemini Omni.
3. Ставите пропорцию, качество и длительность. Для честного сравнения - одинаковые у всех.
4. Вставляете промпт с репликой в кавычках. У Seedance не забудьте включить тумблер «Генерация аудио», у Kling - Native Audio.
5. Если речь не получилась: раздел «Музыка и Озвучка» - ElevenLabs с русским языком, потом HeyGen 1.0 для синхронизации губ.
Частые вопросы
Какая нейросеть для видео с озвучкой лучше работает на русском?
По моему тесту - Veo 3.1 и Gemini Omni. Обе произнесли контрольную фразу дословно, включая «щ» и «четверг».
Почему нейросеть говорит по-русски с акцентом?
Базовые голоса у части моделей англоязычные. У Gemini Omni об этом честно написано в подсказке самого бота. Лечится либо выбором модели с нормальным русским, либо связкой «своя озвучка плюс липсинк».
Можно ли синхронизировать губы под свой голос?
Да, для этого и нужен липсинк. Загружаете готовое видео и свою звуковую дорожку в HeyGen - модель переставляет губы под звук. Следите за длительностью: расхождение больше 15% не пропустит.
Почему в рейтингах нейросетей для видео нет графы про звук?
Потому что арена Artificial Analysis оценивает ролики без звука - такая методика. Есть площадки, где голосуют со звуком, но там свои шкалы, и цифры двух рейтингов между собой не сравниваются.
Сколько нужно генераций, чтобы проверить модель самому?
Одна на модель. Берёте свою типовую фразу, одинаковые настройки для всех и слушаете результат. Двадцать минут - и вы знаете точно, а не по чужому обзору.