Black Forest Labs показала новую модель FLUX 3
FLUX 3 учится воспринимать мир как единое пространство, где картинка, движение и звук связаны между собой. Благодаря этому модель лучше понимает физику объектов, причинно-следственные связи и происходящие события.
На одной архитектуре работают сразу несколько задач.
- Генерация видео со звуком до 20 секунд за один проход.
- Текст в видео, изображениях и на разных языках.
- Image-to-Video, Video-to-Video и продолжение уже существующих роликов.
- Генерация диалогов на нескольких языках.
- Создание длинных сцен из нескольких клипов с сохранением персонажей.
- Поддержка разных стилей, форматов и соотношений сторон.
По предварительным тестам FLUX 3 уже выглядит очень конкурентоспособно.
Модель выигрывала в пользовательских сравнениях у Runway Gen-4.5 в 77% случаев, у Luma Ray 3.2 в 93%, у Grok Imagine Video в 69%, у Kling v3 Pro в 60%, а также опережала Happy Horse, Seedance 2.0 и Gemini Omni Flash.
Отдельно разработчики отмечают сильную передачу эмоций на лицах, более естественную синхронизацию звука с происходящим в кадре и высокое качество многоязычных диалогов.
Также на базе FLUX 3 уже создают модели для робототехники. Вместе с mimic robotics компания разработала FLUX-mimic, которая использует ту же мультимодальную основу для предсказания действий роботов при работе с реальными объектами. Сейчас технология тестируется в производственных задачах Audi.
В ближайшие месяцы Black Forest Labs откроет доступ к генерации изображений, видео, аудио, моделям для робототехники и позже выпустит открытую мультимодальную базовую модель FLUX 3 Dev.