Нейросеть для видео FLUX 3: 20 секунд со звуком и живой русской речью, полный разбор и несколько примеров

Full HD 1920x1088, 8 секунд: промпт из демонстраций разработчиков

Black Forest Labs двенадцать дней держала видео-часть FLUX 3 в закрытом доступе и открыла её 4 августа. Мы подключили модель в бот и за вечер прогнали больше десятка генераций во всех трёх режимах: по тексту, по кадрам и продолжение готового ролика.

Главное, что выяснилось за этот вечер, к маркетингу отношения не имеет: FLUX 3 говорит по-русски так, что распознавалка ставит языку 0,996 уверенности и снимает фразу слово в слово. До этого на той же фразе спотыкались все, кого мы тестировали в июле.

Дальше по порядку: чем FLUX 3 отличается от соседей по категории, что реально показали наши ролики, зачем в настройках отдельный режим черновика и как из него одной кнопкой получить финальный ролик, не переплачивая за перебор вариантов.

Модель уже в боте, можно потестить: TG | MAX

Что такое FLUX 3 и почему это не просто ещё одна видео-модель

Black Forest Labs известна семейством FLUX для картинок. FLUX 3 - первая их модель, где изображение, видео, звук и предсказание действий обучены совместно, одним набором весов. Компания называет это моделью реальности: раз реальность не делится на отдельные каналы, то и модель не должна собираться из четырёх разных.

Практический вывод из этой архитектуры один, зато важный. Звук у FLUX 3 не приклеивается второй моделью после картинки, он рождается в том же проходе. Поэтому удар молота по наковальне звучит ровно на том кадре, где металл коснулся металла, а не с задержкой в пару кадров, как бывает у пайплайнов из двух разных сеток.

Ролики выходят длиной до двадцати секунд. HD модель отдаёт нативно, Full HD получается апскейлом. Заявлены диалоги с попаданием в губы на десятке с лишним языков.

По качеству у Black Forest Labs есть собственная оценка живыми асессорами: в тексте в видео их модель выигрывает у прочих, в анимации картинки у неё ничья с Seedance 2.0 и победа над остальными. Это внутренние цифры вендора, независимых арен на момент запуска у модели не было ни одной, и относиться к ним стоит соответственно. Наши тесты ниже тоже не арена, но там хотя бы видно, что происходит с конкретными кадрами.

Русская речь: то, ради чего стоило тестировать

В июле мы гоняли одну и ту же контрольную фразу через пять видео-моделей. Фраза собрана специально из шипящих и мягких согласных: «Слушай, я уже всё решил: щенка мы забираем в четверг». Тогда Seedance превратил «щенка» в «шинку» и развалил «четверг», Kling выдал узнаваемым только первое слово, Wan шесть раз подряд отказался работать.

Ту же фразу мы дали FLUX 3: десять секунд, вертикальный кадр, промпт целиком на русском. Модель отрисовала кухню, которую ни с чем не спутаешь: холодильник с магнитами, пластиковое окно, светлые фасады, серое утро за стеклом. Мужчина в сером свитере с петличкой на вороте смотрит в объектив и произносит фразу целиком.

Сразу оговорка, которая стоила нам трёх дублей. Первые две попытки модель озвучила безупречно, но рот у героя почти не открывался: голос идёт, лицо неподвижно. Лечится это одной строчкой в описании, и об этом ниже отдельный раздел.

Наша генерация FLUX 3: 10 секунд, 9:16, русская реплика с попаданием в губы

Распознавание даёт русский язык с уверенностью 0,996 и текст без потерь: «Слушай, я уже все решил, щенка мы забираем в четверг». Ни «шинки», ни каши на «четверге».

Отдельно про то, как это звучит, потому что дословность и живость разные вещи. Голос не похож на синтез: есть дыхание перед фразой, неровный темп, лёгкая небрежность в окончаниях, интонация человека, который договаривается, а не диктора, который читает. Именно этого обычно не хватает моделям, которые честно выговаривают все буквы и всё равно звучат как автоответчик.

10-секундный вертикальный кадр: мужчина лет тридцати в сером свитере сидит на кухне обычной городской квартиры и даёт интервью прямо в камеру, петличный микрофон на воротнике. Он смотрит в объектив и произносит вслух, отчётливо артикулируя, губы двигаются точно в такт словам, спокойный разговорный тон: «Слушай, я уже всё решил: щенка мы забираем в четверг». Затем он коротко улыбается и кивает. Камера зафиксирована на уровне глаз, лицо крупно, малая глубина резкости. Audio: его голос на переднем плане, чистый и без обработки, под ним тихий гул холодильника и приглушённый двор за окном. Без музыки, без надписей на экране, без субтитров.

Как заставить героя открыть рот: три слова, которые всё решают

Самая частая поломка речи у FLUX 3 выглядит так: звук идеальный, губы не двигаются. У нас так вышло дважды подряд, и это не случайность - в документации это названо главным сценарием отказа.

Причина в том, что модель по умолчанию не знает, чьё лицо синхронизировать. Если в кадре нет явно описанного говорящего, она либо придумывает его, либо вообще уходит в субтитры и оставляет лицо неподвижным.

Лечится это тремя добавками в описание. Первая: назвать говорящего внешностью и одеждой, а не просто «человек». Вторая: прямо описать сам акт речи как видимое действие - «даёт интервью прямо в камеру», «отчётливо артикулируя, губы двигаются точно в такт словам». Третья: закончить промпт словами «без надписей на экране, без субтитров» - именно они выбивают модель из привычки запечь текст вместо звука.

Третий дубль с этими добавками дал ровно то, что нужно: рот двигается с первого кадра, фазы артикуляции меняются на каждом слове, распознавание держит 0,996 уверенности по русскому языку.

Три режима и что каждый реально умеет

Режимов в карточке модели три, и набор полей меняется вместе с выбором. Это удобно: лишние настройки просто исчезают с экрана.

Три режима FLUX 3 и наши замеры времени
Три режима FLUX 3 и наши замеры времени

Только по тексту. Одно описание на входе, ролик на выходе. Мы взяли демонстрационный промпт разработчиков про обратное движение: осколки зелёной бутылки собираются с бетонного пола обратно в целую бутылку. Камера статична, рук в кадре нет, звук стекла идёт задом наперёд. Модель отработала сцену буквально: осколки съезжаются, пыль втягивается в трещины, к пятой секунде бутылка стоит целой.

Сюрреалистичный, но физически достоверный кадр с обратным движением: осколки зелёной стеклянной бутылки скользят и взлетают с бетонного пола и собираются в одну целую бутылку, которая стоит вертикально. Каждый осколок попадает на своё место, пыль втягивается обратно в трещины. Камера статична, обратный звук стекла, без рук в кадре.
Режим «Только по тексту», полный рендер HD, 5 секунд. Этот же ролик мы дальше отдадим модели на продолжение

По кадрам. Сюда можно положить от одного до десяти изображений. Один кадр становится началом, два задают начало и конец, больше двух модель расставляет по времени равномерно. Мы взяли официальный пример разработчиков: одно фото кота на подоконнике и три предложения о том, что он делает дальше. Модель отыграла всю цепочку по порядку - кот проходит по подоконнику, останавливается посмотреть в окно, идёт дальше и спрыгивает вниз, а под этим слышны мягкие шаги лап.

Кот идёт по подоконнику, хвост покачивается. Останавливается посмотреть в окно, потом идёт дальше и спрыгивает вниз. Мягкие шаги лап и тихое мяуканье.
Режим «По кадрам»: одно фото на входе, вся цепочка действий из промпта - на выходе

Продолжение видео. Загружаете свой mp4, и модель дописывает то, что было дальше. Мы скормили ей собственный ролик с бутылкой и попросили: справа вкатывается красный стеклянный шарик, бьёт бутылку, та падает. Первый кадр продолжения совпал с исходником по всему: тот же бетон, та же трещина в полу, тот же свет, та же бутылка. Шарик приехал справа, ударил в основание, бутылка легла на бок, шарик остановился рядом. Причина и следствие отработали как надо.

Продолжение сцены: целая зелёная бутылка стоит на бетонном полу. Справа в кадр медленно вкатывается красный стеклянный шарик, ударяет бутылку в основание, она покачивается, опрокидывается и катится по бетону. Камера остаётся статичной, свет не меняется. Слышны стук стекла о бетон и перекат бутылки.
Режим «Продолжение видео»: сцена подхвачена один в один, физика удара на месте

Режим «Черновик»: как проверять идеи и не платить за это дважды

Отдельный переключатель типа рендера самая интересная часть настроек, и работает он не так, как можно подумать.

Логика простая. Полный рендер стоит денег и времени, а идею часто нужно просто проверить: та ли композиция, то ли движение, туда ли смотрит герой. Черновик рисует быстрый предпросмотр примерно за треть стоимости полного HD. Качество у него всегда HD, поэтому селектор разрешения при выборе черновика просто прячется.

Дальше начинается то, ради чего всё это затевалось. Черновик возвращает не только видео, но и служебный слепок генерации. Если предпросмотр устроил, модель пересобирает по этому слепку ту же самую сцену в полном качестве: тот же кадр, та же композиция, то же движение. Это не повторный запуск промпта, а именно доводка одобренного варианта.

Черновик и полный рендер: сводка по нашим замерам
Черновик и полный рендер: сводка по нашим замерам

В боте это выглядит так. Вы делаете черновик, и сразу за роликом бот присылает сообщение: «Это черновик. Понравилось? Пересоберём эту же сцену в полном качестве». Под ним кнопка «Полное качество», она открывает короткую форму, где остаётся выбрать только HD или Full HD. Промпт, режим и длительность подтягиваются из черновика, заново их вводить не нужно.

Мы проверили это на промпте из подборки тестировщиков fal - одна строчка про золотистого ретривера, который высунул голову из окна машины на трассе. Сначала черновик, потом кнопка.

Черновик: 5 секунд, HD, примерно треть цены полного рендера
Та же сцена после кнопки «Полное качество»: кадр, ракурс и движение сохранены
Золотистый ретривер высунул голову из окна машины на трассе, уши развеваются на ветру.

Кадры совпали: тот же пёс, та же машина, та же трасса, тот же ракурс и та же фаза движения. Отличается детализация шерсти и неба, звук стал плотнее - минус 13,8 децибела против минус 18,5 у черновика.

Отсюда рабочее правило, и оно важное. Кнопкой из чата вы получаете доводку одобренного кадра. А вот если просто перезапустить тот же промпт в режиме полного рендера, руками, через карточку модели - это будет НОВАЯ генерация, и сцена выйдет другой. Мы это тоже проверяли: один и тот же текст дал в черновике туманный лес, а в полном рендере закатный сосняк. Разница между двумя маршрутами - в том, идёте вы от слепка черновика или от текста.

Практический вывод для кошелька: гоняйте варианты черновиками, они дешевле примерно втрое, и доводите до полного качества только тот, который понравился.

Что показали сами файлы

Подпись бота подтверждает настройки, но не подтверждает результат, поэтому каждый ролик мы прогнали через анализ файла.

HD у FLUX 3 это 1280 на 704 пикселя в горизонтали и 704 на 1280 в вертикали. Full HD это 1920 на 1088. Частота кадров у всех роликов ровно 24, независимо от режима и длительности.

Звук живой во всех генерациях: средний уровень от минус 25 до минус 38 децибел. Для сравнения, пустая дорожка в наших прошлых тестах давала минус 60, там речи не было вовсе.

Длительность точная в двух режимах из трёх. По тексту и по кадрам заказ совпадает с фактом до сотых: попросили десять секунд, получили 10,042. А вот продолжение видео стабильно отдаёт на секунду меньше запрошенного: заказ пять секунд дал ролик 4,0 секунды, заказ двадцать секунд дал 19,0. Это не ошибка загрузки, а поведение режима, и на длинных роликах его стоит учитывать в монтаже.

Ещё одна деталь про продолжение. Разработчики ограничивают этот режим пятнадцатью секундами, а слайдер в боте позволяет поставить двадцать. Мы поставили двадцать: генерация прошла и вернула девятнадцать секунд.

Сколько это занимает времени

Пятисекундный ролик в HD собирается примерно за минуту, и черновик тут выигрывает у полного рендера считанные секунды. Десять секунд в вертикали заняли около полутора минут, столько же ушло на десять секунд по двум кадрам.

Разница появляется на Full HD. Восемь секунд в 1920 на 1088 модель считала около пяти минут, то есть примерно втрое дольше, чем аналогичный кусок в HD. Если делаете серию однотипных роликов, разумнее собрать всё в HD и поднять до Full HD только финальные.

Как повторить у себя

Бот живёт в одном мини-приложении, отдельных кнопок с моделями в чате больше нет.

• Откройте бота и нажмите «Открыть приложение»

• В разделе «Видео» выберите карточку FLUX 3

• «Режим»: по тексту, по кадрам или продолжение видео

• «Тип рендера»: черновик для проверки идеи или полный для результата

• «Качество»: HD или Full HD (у черновика это поле спрятано)

• «Соотношение сторон»: от 21:9 до 9:16, есть «Авто»

• «Звук»: включён по умолчанию

• «Длительность»: от 5 до 20 секунд

В поле описания помещается до 5000 символов. Нажатие «Сохранить» и есть запуск генерации, отдельной кнопки для этого больше нет.

Что писать в описании, чтобы получилось

Три вещи, которые заметно влияют на результат.

Называйте звук словами. Модель пишет дорожку по описанию, и «слышны шипение масла и гомон рынка» даёт совсем другую сцену, чем молчаливое описание той же сцены. Тихие статичные кадры без звуковой подсказки часто возвращаются почти беззвучными.

Реплики пишите прямой речью в кавычках. Русский текст в кавычках модель произносит целиком, с попаданием в губы. Транслит и латиница тут не нужны.

Одно ясное событие лучше пяти одновременных. Сцены, где движение переходит от объекта к объекту по цепочке, модель держит уверенно. Групповые действия, где несколько людей должны сделать что-то согласованно, разваливаются чаще, и такие кадры проще разбить на отдельные генерации.

Частые вопросы

Какая нейросеть для генерации видео сейчас лучше всех?
Однозначного ответа нет, и любой, кто его даёт на второй неделе после релиза, опирается на цифры вендора. У Black Forest Labs есть внутренняя оценка с победой в тексте в видео и ничьей с Seedance 2.0 в анимации картинки. Независимых замеров на момент запуска не публиковалось. По нашим тестам сильные стороны FLUX 3 это звук в одном проходе и русская речь.

Нейросеть делает видео со звуком сразу или звук надо накладывать?
Сразу. Звук генерируется вместе с кадрами, отдельно он не тарифицируется. Если дорожка не нужна, звук выключается переключателем, и тогда вы получаете чистое видео под свою озвучку.

Можно ли сделать видео из фото?
Да, это режим «По кадрам». Одно изображение станет первым кадром ролика, два зададут начало и конец, до десяти модель распределит по времени.

Насколько хорошо FLUX 3 говорит по-русски?
В нашем тесте фраза распозналась дословно, язык определился с уверенностью 0,979, губы попадают в речь. Звучит как живой человек, а не как синтез: есть дыхание, неровный темп и нормальная интонация.

Зачем черновик, если можно сразу сделать полный рендер?
Чтобы перебирать варианты примерно втрое дешевле. Понравившийся черновик доводится до полного качества кнопкой «Полное качество» под роликом в чате - сцена сохраняется. А вот ручной перезапуск того же промпта в полном рендере даёт новую интерпретацию, это другой маршрут.

Какую длительность выбирать?
Для соцсетей хватает 5-8 секунд, они и считаются быстрее всего. Двадцать секунд имеет смысл брать под сцены с развитием: смена света, таймлапс, длинный проход камеры. В режиме продолжения помните про минус секунду от заказанного.

Что в итоге

FLUX 3 закрывает то место, где у русскоязычных пользователей до сих пор был провал: связка нормальной русской речи и звука сцены в одном ролике. Плюс продолжение готового видео без видимого шва, кадры-якоря, к которым модель обязана прийти, и черновики с доводкой - редкая для видеогенераторов вещь, когда дешёвый предпросмотр действительно превращается в тот же самый ролик в полном качестве.

Минусы тоже честные: режим продолжения отдаёт на секунду короче заказа, Full HD стоит времени, а речь без правильных слов в промпте озвучивается поверх неподвижного лица. Про качество относительно соседей объективных данных пока нет ни у кого.

Если разбор пригодился, поставьте лайк, так его увидит больше людей. И расскажите в комментариях, какой режим вам интереснее: продолжение своих роликов или кадры-якоря для длинной сцены.

Больше разборов моделей и промптов 👉 TG | MAX

2
1