Нейросеть заговорила по-русски и сама себя смонтировала: тест FLUX 3 на трёх задачах

Что показал тест FLUX 3
Что показал тест FLUX 3

Ролик, где человек говорит по-русски, а губы попадают в слова, обычно собирают в три захода: сгенерировать картинку, озвучить в другом сервисе, свести в третьем. FLUX 3 делает это за один проход и в одном файле.

Мы взяли три задачи, которые в работе встречаются чаще всего, и прогнали каждую до результата. Ниже что получилось, где модель споткнулась и как это чинится.

Коротко

Модель, о которой речь, живёт в боте Cyber AI: TG | MAX

Русская реплика произносится дословно - распознавание слышит фразу целиком и уверенно определяет язык. Несколько кадров модель монтирует внутри одной генерации и не подменяет героя на стыках. Звук пишет сама, вместе с картинкой, отдельной озвучки не нужно.

Спотыкается на трёх вещах. Дословно переведённый чужой запрос приносит чужой быт. Камеру она понимает вольно и может встать так, что говорящего не видно. Надписи внутри кадра говорят на языке жанра, а не на языке запроса.

Условия теста

Одинаковые для всех дублей: горизонталь 16:9, HD, звук включён. Десять секунд там, где проверяли речь, пятнадцать - там, где считали кадры.

Запросы не сочиняли. Брали чужие, уже отработавшие у людей, и переводили целиком, вместе с репликой. Это, кстати, и подложило первую свинью.

Задача первая: заставить говорить по-русски

Реплику пишем кириллицей прямо в тексте запроса, никакого транслита. Говорящего описываем подробно - возраст, форма, головной убор, микрофон у лица. И обязательно добавляем в конце запрет экранных надписей, иначе модель норовит вместо звука запечь субтитры.

Результат в кабине машиниста: фраза из тринадцати слов прозвучала целиком, вместе с названием вокзала, язык определился как русский с вероятностью 0,962. Губы двигаются синхронно словам с первой секунды.

Первый дубль вышел другим, и он показателен как раз этим. Запрос я перевёл дословно с иностранного примера, где объявление в поезде делает проводник прямо в вагоне. По-русски вышла сцена, в которую местный зритель не поверит: у нас станции объявляет машинист из кабины. Фраза прозвучала, но одно слово поплыло - «Курский» стало «Коским».

Второй дубль достоверность починил, зато принёс новый дефект. Запрос просил камеру позади и сбоку, а модель встала строго за спину, и лица не видно вообще. Для ролика, который держится на речи, это провал: артикуляцию проверить нечем.

Отсюда правило, которое экономит дубли. Если в кадре кто-то говорит, план и направление взгляда задаются в лоб: назвать крупность, указать, что говорящий смотрит в объектив или в три четверти, и отдельно запретить съёмку со спины. Формулировку «камера сбоку» модель трактует широко.

Кабина машиниста: фраза прозвучала целиком, язык русский с вероятностью 0,962

Задача вторая: несколько кадров без монтажной программы

Обычный способ собрать пятнадцатисекундный сюжет - три отдельные генерации и сведение руками. На каждом стыке рискуешь потерять героя: другое лицо, другая одежда, другой свет.

Здесь всё уместилось в один файл. Запрос описывал три кадра по порядку: общий план у печи, крупный план рук, средний план у окна. Модель поставила два монтажных стыка ровно там, где просили, и выдала три кадра в заказанной последовательности. Героиня во всех трёх одна, фартук и колпак не менялись.

Вот это, пожалуй, и есть главная практическая ценность модели. Для рекламной вставки, короткого рецепта или мини-истории на пятнадцать секунд отдельная монтажка больше не нужна.

Одно предупреждение. В запросе было три звуковых слоя - хлопок дверцы, стук по корке, уличный фон. Приехали они едва слышными, хотя формально дорожка есть. Если звук в ролике несёт смысл, его стоит послушать сразу после генерации: модель иногда экономит именно на нём.

Три кадра внутри одной генерации, в заказанном порядке

Задача третья: назвать жанр вместо описания камеры

Приём известный, но проверить его всё же стоило. Вместо абзаца про свет, оптику и движение камеры в запрос ушла одна строка: репортаж местных новостей 1987 года о подростках в торговом центре.

Модель развернула это в полноценный сюжет. Корреспондент с микрофоном, нижние плашки, перебивки, зернистая картинка, причёски и куртки по эпохе. Кадр сам сжался в 4:3 с чёрными полями по бокам, как настоящее вещание тех лет. Ни одного из этих решений в запросе ведь не было - всё вытянуто из названия жанра.

И тут же дефект, который бросается в глаза: надписи в кадре приехали английскими. Запрос русский, а «местные новости 1987» у модели намертво связаны с американским телевидением, и графика пришла оттуда же.

Лечится одной строкой про кириллицу. После неё в кадре появились «МЕСТНЫЕ НОВОСТИ» и «НАТАША, УЧЕНИЦА 10 КЛАССА» - буквы чистые, без выдуманных знаков, что до сих пор умеет далеко не каждая модель. Заодно сменилась вся среда: американский молл превратился в позднесоветский универмаг с эскалатором и витринами обуви.

Вывод шире одного теста. Жанр - самый дешёвый способ задать картинку: одна строка вместо абзаца. Но вместе с жанром приезжает его родная культура, включая язык надписей, и это приходится перебивать вручную.

После строки про кириллицу: титры русские, среда советская, кадр сам стал 4:3
Где модель спотыкается и что писать в запросе
Где модель спотыкается и что писать в запросе

Что делать с этим на практике

Задача | Что писать в запросе | Что проверить после

• Реплика на русском - реплику кириллицей в кавычках, говорящего - внешностью - слышно ли фразу целиком

• Видимая артикуляция - крупность плана и направление взгляда, запрет съёмки со спины - видно ли лицо

• Мини-сюжет из кадров - кадры по порядку, словами «кадр первый», «кадр второй» - все ли кадры на месте и тот ли герой

• Титры и вывески - отдельную строку про кириллицу - каждую надпись глазами

• Звук как часть сцены - слои от переднего плана к фону - послушать сразу после генерации

Как повторить у себя

Модель живёт в боте Cyber AI. Открываете, жмёте кнопку запуска приложения, дальше раздел «Видео» и карточка FLUX 3. Поля простые: режим, качество, пропорции, звук, длительность и описание. Сохранение настроек и есть запуск, отдельной кнопки генерации нет.

Пять мелочей, которые экономят дубли:

• длительность называйте прямо в описании, «10-секундный кадр» модель читает как указание;

• говорящего описывайте внешностью, иначе получите либо выдуманное лицо, либо субтитры вместо звука;

• реплику берите в кавычки и пишите кириллицей;

• музыку просите явно, сама она её не добавит;

• кадры перечисляйте по порядку и словами.

Частые вопросы

Нужен ли транслит для русской реплики?

Нет, пишется кириллицей прямо в описании. В нашем тесте фраза из тринадцати слов прозвучала целиком.

Сколько кадров помещается в одну генерацию?

Мы получили три за пятнадцать секунд. Стыки встали там, где просили, герой между ними сохранился.

Звук оплачивается отдельно?

Нет, дорожка пишется в том же проходе, что и картинка.

Почему титры в кадре получились английскими?

Язык надписей тянется за жанром. Добавьте требование кириллицы отдельной строкой.

Можно ли получить ролик длиннее пятнадцати секунд?

Да, модель работает до двадцати секунд за раз.

Вывод

FLUX 3 закрывает две задачи, ради которых раньше держали связку из нескольких сервисов: русскую речь с попаданием в артикуляцию и несколько кадров в одном файле. Экономится не столько бюджет, сколько этап сведения, а на коротких форматах он обычно и съедает время.

Взамен появляется своя дисциплина. Чужой запрос нельзя переводить дословно - вместе со словами приезжает чужой быт. Камеру надо называть жёстко, иначе говорящего не увидите. Язык надписей задаётся руками. Вот три правила, которых в анонсе модели нет, а вылезают они на первых же дублях.

Разборы моделей и готовые запросы выкладываем в канале: TG | MAX

1