Нейросеть заговорила по-русски и сама себя смонтировала: тест FLUX 3 на трёх задачах
Ролик, где человек говорит по-русски, а губы попадают в слова, обычно собирают в три захода: сгенерировать картинку, озвучить в другом сервисе, свести в третьем. FLUX 3 делает это за один проход и в одном файле.
Мы взяли три задачи, которые в работе встречаются чаще всего, и прогнали каждую до результата. Ниже что получилось, где модель споткнулась и как это чинится.
Коротко
Русская реплика произносится дословно - распознавание слышит фразу целиком и уверенно определяет язык. Несколько кадров модель монтирует внутри одной генерации и не подменяет героя на стыках. Звук пишет сама, вместе с картинкой, отдельной озвучки не нужно.
Спотыкается на трёх вещах. Дословно переведённый чужой запрос приносит чужой быт. Камеру она понимает вольно и может встать так, что говорящего не видно. Надписи внутри кадра говорят на языке жанра, а не на языке запроса.
Условия теста
Одинаковые для всех дублей: горизонталь 16:9, HD, звук включён. Десять секунд там, где проверяли речь, пятнадцать - там, где считали кадры.
Запросы не сочиняли. Брали чужие, уже отработавшие у людей, и переводили целиком, вместе с репликой. Это, кстати, и подложило первую свинью.
Задача первая: заставить говорить по-русски
Реплику пишем кириллицей прямо в тексте запроса, никакого транслита. Говорящего описываем подробно - возраст, форма, головной убор, микрофон у лица. И обязательно добавляем в конце запрет экранных надписей, иначе модель норовит вместо звука запечь субтитры.
Результат в кабине машиниста: фраза из тринадцати слов прозвучала целиком, вместе с названием вокзала, язык определился как русский с вероятностью 0,962. Губы двигаются синхронно словам с первой секунды.
Первый дубль вышел другим, и он показателен как раз этим. Запрос я перевёл дословно с иностранного примера, где объявление в поезде делает проводник прямо в вагоне. По-русски вышла сцена, в которую местный зритель не поверит: у нас станции объявляет машинист из кабины. Фраза прозвучала, но одно слово поплыло - «Курский» стало «Коским».
Второй дубль достоверность починил, зато принёс новый дефект. Запрос просил камеру позади и сбоку, а модель встала строго за спину, и лица не видно вообще. Для ролика, который держится на речи, это провал: артикуляцию проверить нечем.
Отсюда правило, которое экономит дубли. Если в кадре кто-то говорит, план и направление взгляда задаются в лоб: назвать крупность, указать, что говорящий смотрит в объектив или в три четверти, и отдельно запретить съёмку со спины. Формулировку «камера сбоку» модель трактует широко.
Задача вторая: несколько кадров без монтажной программы
Обычный способ собрать пятнадцатисекундный сюжет - три отдельные генерации и сведение руками. На каждом стыке рискуешь потерять героя: другое лицо, другая одежда, другой свет.
Здесь всё уместилось в один файл. Запрос описывал три кадра по порядку: общий план у печи, крупный план рук, средний план у окна. Модель поставила два монтажных стыка ровно там, где просили, и выдала три кадра в заказанной последовательности. Героиня во всех трёх одна, фартук и колпак не менялись.
Вот это, пожалуй, и есть главная практическая ценность модели. Для рекламной вставки, короткого рецепта или мини-истории на пятнадцать секунд отдельная монтажка больше не нужна.
Одно предупреждение. В запросе было три звуковых слоя - хлопок дверцы, стук по корке, уличный фон. Приехали они едва слышными, хотя формально дорожка есть. Если звук в ролике несёт смысл, его стоит послушать сразу после генерации: модель иногда экономит именно на нём.
Задача третья: назвать жанр вместо описания камеры
Приём известный, но проверить его всё же стоило. Вместо абзаца про свет, оптику и движение камеры в запрос ушла одна строка: репортаж местных новостей 1987 года о подростках в торговом центре.
Модель развернула это в полноценный сюжет. Корреспондент с микрофоном, нижние плашки, перебивки, зернистая картинка, причёски и куртки по эпохе. Кадр сам сжался в 4:3 с чёрными полями по бокам, как настоящее вещание тех лет. Ни одного из этих решений в запросе ведь не было - всё вытянуто из названия жанра.
И тут же дефект, который бросается в глаза: надписи в кадре приехали английскими. Запрос русский, а «местные новости 1987» у модели намертво связаны с американским телевидением, и графика пришла оттуда же.
Лечится одной строкой про кириллицу. После неё в кадре появились «МЕСТНЫЕ НОВОСТИ» и «НАТАША, УЧЕНИЦА 10 КЛАССА» - буквы чистые, без выдуманных знаков, что до сих пор умеет далеко не каждая модель. Заодно сменилась вся среда: американский молл превратился в позднесоветский универмаг с эскалатором и витринами обуви.
Вывод шире одного теста. Жанр - самый дешёвый способ задать картинку: одна строка вместо абзаца. Но вместе с жанром приезжает его родная культура, включая язык надписей, и это приходится перебивать вручную.
Что делать с этим на практике
Задача | Что писать в запросе | Что проверить после
• Реплика на русском - реплику кириллицей в кавычках, говорящего - внешностью - слышно ли фразу целиком
• Видимая артикуляция - крупность плана и направление взгляда, запрет съёмки со спины - видно ли лицо
• Мини-сюжет из кадров - кадры по порядку, словами «кадр первый», «кадр второй» - все ли кадры на месте и тот ли герой
• Титры и вывески - отдельную строку про кириллицу - каждую надпись глазами
• Звук как часть сцены - слои от переднего плана к фону - послушать сразу после генерации
Как повторить у себя
Модель живёт в боте Cyber AI. Открываете, жмёте кнопку запуска приложения, дальше раздел «Видео» и карточка FLUX 3. Поля простые: режим, качество, пропорции, звук, длительность и описание. Сохранение настроек и есть запуск, отдельной кнопки генерации нет.
Пять мелочей, которые экономят дубли:
• длительность называйте прямо в описании, «10-секундный кадр» модель читает как указание;
• говорящего описывайте внешностью, иначе получите либо выдуманное лицо, либо субтитры вместо звука;
• реплику берите в кавычки и пишите кириллицей;
• музыку просите явно, сама она её не добавит;
• кадры перечисляйте по порядку и словами.
Частые вопросы
Нужен ли транслит для русской реплики?
Нет, пишется кириллицей прямо в описании. В нашем тесте фраза из тринадцати слов прозвучала целиком.
Сколько кадров помещается в одну генерацию?
Мы получили три за пятнадцать секунд. Стыки встали там, где просили, герой между ними сохранился.
Звук оплачивается отдельно?
Нет, дорожка пишется в том же проходе, что и картинка.
Почему титры в кадре получились английскими?
Язык надписей тянется за жанром. Добавьте требование кириллицы отдельной строкой.
Можно ли получить ролик длиннее пятнадцати секунд?
Да, модель работает до двадцати секунд за раз.
Вывод
FLUX 3 закрывает две задачи, ради которых раньше держали связку из нескольких сервисов: русскую речь с попаданием в артикуляцию и несколько кадров в одном файле. Экономится не столько бюджет, сколько этап сведения, а на коротких форматах он обычно и съедает время.
Взамен появляется своя дисциплина. Чужой запрос нельзя переводить дословно - вместе со словами приезжает чужой быт. Камеру надо называть жёстко, иначе говорящего не увидите. Язык надписей задаётся руками. Вот три правила, которых в анонсе модели нет, а вылезают они на первых же дублях.