Нейросеть для видео FLUX 3: 20 секунд со звуком и живой русской речью, полный разбор и несколько примеров
Black Forest Labs двенадцать дней держала видео-часть FLUX 3 в закрытом доступе и открыла её 4 августа. Мы подключили модель в бот и за вечер прогнали больше десятка генераций во всех трёх режимах: по тексту, по кадрам и продолжение готового ролика.
Главное, что выяснилось за этот вечер, к маркетингу отношения не имеет: FLUX 3 говорит по-русски так, что распознавалка ставит языку 0,996 уверенности и снимает фразу слово в слово. До этого на той же фразе спотыкались все, кого мы тестировали в июле.
Дальше по порядку: чем FLUX 3 отличается от соседей по категории, что реально показали наши ролики, зачем в настройках отдельный режим черновика и как из него одной кнопкой получить финальный ролик, не переплачивая за перебор вариантов.
Что такое FLUX 3 и почему это не просто ещё одна видео-модель
Black Forest Labs известна семейством FLUX для картинок. FLUX 3 - первая их модель, где изображение, видео, звук и предсказание действий обучены совместно, одним набором весов. Компания называет это моделью реальности: раз реальность не делится на отдельные каналы, то и модель не должна собираться из четырёх разных.
Практический вывод из этой архитектуры один, зато важный. Звук у FLUX 3 не приклеивается второй моделью после картинки, он рождается в том же проходе. Поэтому удар молота по наковальне звучит ровно на том кадре, где металл коснулся металла, а не с задержкой в пару кадров, как бывает у пайплайнов из двух разных сеток.
Ролики выходят длиной до двадцати секунд. HD модель отдаёт нативно, Full HD получается апскейлом. Заявлены диалоги с попаданием в губы на десятке с лишним языков.
По качеству у Black Forest Labs есть собственная оценка живыми асессорами: в тексте в видео их модель выигрывает у прочих, в анимации картинки у неё ничья с Seedance 2.0 и победа над остальными. Это внутренние цифры вендора, независимых арен на момент запуска у модели не было ни одной, и относиться к ним стоит соответственно. Наши тесты ниже тоже не арена, но там хотя бы видно, что происходит с конкретными кадрами.
Русская речь: то, ради чего стоило тестировать
В июле мы гоняли одну и ту же контрольную фразу через пять видео-моделей. Фраза собрана специально из шипящих и мягких согласных: «Слушай, я уже всё решил: щенка мы забираем в четверг». Тогда Seedance превратил «щенка» в «шинку» и развалил «четверг», Kling выдал узнаваемым только первое слово, Wan шесть раз подряд отказался работать.
Ту же фразу мы дали FLUX 3: десять секунд, вертикальный кадр, промпт целиком на русском. Модель отрисовала кухню, которую ни с чем не спутаешь: холодильник с магнитами, пластиковое окно, светлые фасады, серое утро за стеклом. Мужчина в сером свитере с петличкой на вороте смотрит в объектив и произносит фразу целиком.
Сразу оговорка, которая стоила нам трёх дублей. Первые две попытки модель озвучила безупречно, но рот у героя почти не открывался: голос идёт, лицо неподвижно. Лечится это одной строчкой в описании, и об этом ниже отдельный раздел.
Распознавание даёт русский язык с уверенностью 0,996 и текст без потерь: «Слушай, я уже все решил, щенка мы забираем в четверг». Ни «шинки», ни каши на «четверге».
Отдельно про то, как это звучит, потому что дословность и живость разные вещи. Голос не похож на синтез: есть дыхание перед фразой, неровный темп, лёгкая небрежность в окончаниях, интонация человека, который договаривается, а не диктора, который читает. Именно этого обычно не хватает моделям, которые честно выговаривают все буквы и всё равно звучат как автоответчик.
Как заставить героя открыть рот: три слова, которые всё решают
Самая частая поломка речи у FLUX 3 выглядит так: звук идеальный, губы не двигаются. У нас так вышло дважды подряд, и это не случайность - в документации это названо главным сценарием отказа.
Причина в том, что модель по умолчанию не знает, чьё лицо синхронизировать. Если в кадре нет явно описанного говорящего, она либо придумывает его, либо вообще уходит в субтитры и оставляет лицо неподвижным.
Лечится это тремя добавками в описание. Первая: назвать говорящего внешностью и одеждой, а не просто «человек». Вторая: прямо описать сам акт речи как видимое действие - «даёт интервью прямо в камеру», «отчётливо артикулируя, губы двигаются точно в такт словам». Третья: закончить промпт словами «без надписей на экране, без субтитров» - именно они выбивают модель из привычки запечь текст вместо звука.
Третий дубль с этими добавками дал ровно то, что нужно: рот двигается с первого кадра, фазы артикуляции меняются на каждом слове, распознавание держит 0,996 уверенности по русскому языку.
Три режима и что каждый реально умеет
Режимов в карточке модели три, и набор полей меняется вместе с выбором. Это удобно: лишние настройки просто исчезают с экрана.
Только по тексту. Одно описание на входе, ролик на выходе. Мы взяли демонстрационный промпт разработчиков про обратное движение: осколки зелёной бутылки собираются с бетонного пола обратно в целую бутылку. Камера статична, рук в кадре нет, звук стекла идёт задом наперёд. Модель отработала сцену буквально: осколки съезжаются, пыль втягивается в трещины, к пятой секунде бутылка стоит целой.
По кадрам. Сюда можно положить от одного до десяти изображений. Один кадр становится началом, два задают начало и конец, больше двух модель расставляет по времени равномерно. Мы взяли официальный пример разработчиков: одно фото кота на подоконнике и три предложения о том, что он делает дальше. Модель отыграла всю цепочку по порядку - кот проходит по подоконнику, останавливается посмотреть в окно, идёт дальше и спрыгивает вниз, а под этим слышны мягкие шаги лап.
Продолжение видео. Загружаете свой mp4, и модель дописывает то, что было дальше. Мы скормили ей собственный ролик с бутылкой и попросили: справа вкатывается красный стеклянный шарик, бьёт бутылку, та падает. Первый кадр продолжения совпал с исходником по всему: тот же бетон, та же трещина в полу, тот же свет, та же бутылка. Шарик приехал справа, ударил в основание, бутылка легла на бок, шарик остановился рядом. Причина и следствие отработали как надо.
Режим «Черновик»: как проверять идеи и не платить за это дважды
Отдельный переключатель типа рендера самая интересная часть настроек, и работает он не так, как можно подумать.
Логика простая. Полный рендер стоит денег и времени, а идею часто нужно просто проверить: та ли композиция, то ли движение, туда ли смотрит герой. Черновик рисует быстрый предпросмотр примерно за треть стоимости полного HD. Качество у него всегда HD, поэтому селектор разрешения при выборе черновика просто прячется.
Дальше начинается то, ради чего всё это затевалось. Черновик возвращает не только видео, но и служебный слепок генерации. Если предпросмотр устроил, модель пересобирает по этому слепку ту же самую сцену в полном качестве: тот же кадр, та же композиция, то же движение. Это не повторный запуск промпта, а именно доводка одобренного варианта.
В боте это выглядит так. Вы делаете черновик, и сразу за роликом бот присылает сообщение: «Это черновик. Понравилось? Пересоберём эту же сцену в полном качестве». Под ним кнопка «Полное качество», она открывает короткую форму, где остаётся выбрать только HD или Full HD. Промпт, режим и длительность подтягиваются из черновика, заново их вводить не нужно.
Мы проверили это на промпте из подборки тестировщиков fal - одна строчка про золотистого ретривера, который высунул голову из окна машины на трассе. Сначала черновик, потом кнопка.
Кадры совпали: тот же пёс, та же машина, та же трасса, тот же ракурс и та же фаза движения. Отличается детализация шерсти и неба, звук стал плотнее - минус 13,8 децибела против минус 18,5 у черновика.
Отсюда рабочее правило, и оно важное. Кнопкой из чата вы получаете доводку одобренного кадра. А вот если просто перезапустить тот же промпт в режиме полного рендера, руками, через карточку модели - это будет НОВАЯ генерация, и сцена выйдет другой. Мы это тоже проверяли: один и тот же текст дал в черновике туманный лес, а в полном рендере закатный сосняк. Разница между двумя маршрутами - в том, идёте вы от слепка черновика или от текста.
Практический вывод для кошелька: гоняйте варианты черновиками, они дешевле примерно втрое, и доводите до полного качества только тот, который понравился.
Что показали сами файлы
Подпись бота подтверждает настройки, но не подтверждает результат, поэтому каждый ролик мы прогнали через анализ файла.
HD у FLUX 3 это 1280 на 704 пикселя в горизонтали и 704 на 1280 в вертикали. Full HD это 1920 на 1088. Частота кадров у всех роликов ровно 24, независимо от режима и длительности.
Звук живой во всех генерациях: средний уровень от минус 25 до минус 38 децибел. Для сравнения, пустая дорожка в наших прошлых тестах давала минус 60, там речи не было вовсе.
Длительность точная в двух режимах из трёх. По тексту и по кадрам заказ совпадает с фактом до сотых: попросили десять секунд, получили 10,042. А вот продолжение видео стабильно отдаёт на секунду меньше запрошенного: заказ пять секунд дал ролик 4,0 секунды, заказ двадцать секунд дал 19,0. Это не ошибка загрузки, а поведение режима, и на длинных роликах его стоит учитывать в монтаже.
Ещё одна деталь про продолжение. Разработчики ограничивают этот режим пятнадцатью секундами, а слайдер в боте позволяет поставить двадцать. Мы поставили двадцать: генерация прошла и вернула девятнадцать секунд.
Сколько это занимает времени
Пятисекундный ролик в HD собирается примерно за минуту, и черновик тут выигрывает у полного рендера считанные секунды. Десять секунд в вертикали заняли около полутора минут, столько же ушло на десять секунд по двум кадрам.
Разница появляется на Full HD. Восемь секунд в 1920 на 1088 модель считала около пяти минут, то есть примерно втрое дольше, чем аналогичный кусок в HD. Если делаете серию однотипных роликов, разумнее собрать всё в HD и поднять до Full HD только финальные.
Как повторить у себя
Бот живёт в одном мини-приложении, отдельных кнопок с моделями в чате больше нет.
• Откройте бота и нажмите «Открыть приложение»
• В разделе «Видео» выберите карточку FLUX 3
• «Режим»: по тексту, по кадрам или продолжение видео
• «Тип рендера»: черновик для проверки идеи или полный для результата
• «Качество»: HD или Full HD (у черновика это поле спрятано)
• «Соотношение сторон»: от 21:9 до 9:16, есть «Авто»
• «Звук»: включён по умолчанию
• «Длительность»: от 5 до 20 секунд
В поле описания помещается до 5000 символов. Нажатие «Сохранить» и есть запуск генерации, отдельной кнопки для этого больше нет.
Что писать в описании, чтобы получилось
Три вещи, которые заметно влияют на результат.
Называйте звук словами. Модель пишет дорожку по описанию, и «слышны шипение масла и гомон рынка» даёт совсем другую сцену, чем молчаливое описание той же сцены. Тихие статичные кадры без звуковой подсказки часто возвращаются почти беззвучными.
Реплики пишите прямой речью в кавычках. Русский текст в кавычках модель произносит целиком, с попаданием в губы. Транслит и латиница тут не нужны.
Одно ясное событие лучше пяти одновременных. Сцены, где движение переходит от объекта к объекту по цепочке, модель держит уверенно. Групповые действия, где несколько людей должны сделать что-то согласованно, разваливаются чаще, и такие кадры проще разбить на отдельные генерации.
Частые вопросы
Какая нейросеть для генерации видео сейчас лучше всех?
Однозначного ответа нет, и любой, кто его даёт на второй неделе после релиза, опирается на цифры вендора. У Black Forest Labs есть внутренняя оценка с победой в тексте в видео и ничьей с Seedance 2.0 в анимации картинки. Независимых замеров на момент запуска не публиковалось. По нашим тестам сильные стороны FLUX 3 это звук в одном проходе и русская речь.
Нейросеть делает видео со звуком сразу или звук надо накладывать?
Сразу. Звук генерируется вместе с кадрами, отдельно он не тарифицируется. Если дорожка не нужна, звук выключается переключателем, и тогда вы получаете чистое видео под свою озвучку.
Можно ли сделать видео из фото?
Да, это режим «По кадрам». Одно изображение станет первым кадром ролика, два зададут начало и конец, до десяти модель распределит по времени.
Насколько хорошо FLUX 3 говорит по-русски?
В нашем тесте фраза распозналась дословно, язык определился с уверенностью 0,979, губы попадают в речь. Звучит как живой человек, а не как синтез: есть дыхание, неровный темп и нормальная интонация.
Зачем черновик, если можно сразу сделать полный рендер?
Чтобы перебирать варианты примерно втрое дешевле. Понравившийся черновик доводится до полного качества кнопкой «Полное качество» под роликом в чате - сцена сохраняется. А вот ручной перезапуск того же промпта в полном рендере даёт новую интерпретацию, это другой маршрут.
Какую длительность выбирать?
Для соцсетей хватает 5-8 секунд, они и считаются быстрее всего. Двадцать секунд имеет смысл брать под сцены с развитием: смена света, таймлапс, длинный проход камеры. В режиме продолжения помните про минус секунду от заказанного.
Что в итоге
FLUX 3 закрывает то место, где у русскоязычных пользователей до сих пор был провал: связка нормальной русской речи и звука сцены в одном ролике. Плюс продолжение готового видео без видимого шва, кадры-якоря, к которым модель обязана прийти, и черновики с доводкой - редкая для видеогенераторов вещь, когда дешёвый предпросмотр действительно превращается в тот же самый ролик в полном качестве.
Минусы тоже честные: режим продолжения отдаёт на секунду короче заказа, Full HD стоит времени, а речь без правильных слов в промпте озвучивается поверх неподвижного лица. Про качество относительно соседей объективных данных пока нет ни у кого.
Если разбор пригодился, поставьте лайк, так его увидит больше людей. И расскажите в комментариях, какой режим вам интереснее: продолжение своих роликов или кадры-якоря для длинной сцены.