Black Forest Labs показала новую модель FLUX 3

FLUX 3 учится воспринимать мир как единое пространство, где картинка, движение и звук связаны между собой. Благодаря этому модель лучше понимает физику объектов, причинно-следственные связи и происходящие события.

На одной архитектуре работают сразу несколько задач.

  • Генерация видео со звуком до 20 секунд за один проход.
  • Текст в видео, изображениях и на разных языках.
  • Image-to-Video, Video-to-Video и продолжение уже существующих роликов.
  • Генерация диалогов на нескольких языках.
  • Создание длинных сцен из нескольких клипов с сохранением персонажей.
  • Поддержка разных стилей, форматов и соотношений сторон.

По предварительным тестам FLUX 3 уже выглядит очень конкурентоспособно.

Модель выигрывала в пользовательских сравнениях у Runway Gen-4.5 в 77% случаев, у Luma Ray 3.2 в 93%, у Grok Imagine Video в 69%, у Kling v3 Pro в 60%, а также опережала Happy Horse, Seedance 2.0 и Gemini Omni Flash.

Отдельно разработчики отмечают сильную передачу эмоций на лицах, более естественную синхронизацию звука с происходящим в кадре и высокое качество многоязычных диалогов.

Также на базе FLUX 3 уже создают модели для робототехники. Вместе с mimic robotics компания разработала FLUX-mimic, которая использует ту же мультимодальную основу для предсказания действий роботов при работе с реальными объектами. Сейчас технология тестируется в производственных задачах Audi.

В ближайшие месяцы Black Forest Labs откроет доступ к генерации изображений, видео, аудио, моделям для робототехники и позже выпустит открытую мультимодальную базовую модель FLUX 3 Dev.

1