Новый Qwen 3.8 Omni Flash от Alibaba. Обрушение цены на 98%. Модель которая слышит, видит и говорит одновременно
Alibaba выкатила Qwen3.8 Omni Flash — нативную омнимодальную модель, которая работает с текстом, изображениями, аудио и видео в одном контексте. Omni Flash - здесь
Вы когда-нибудь пытались загрузить часовое видео в нейросеть и попросить её найти момент, где кто-то сказал конкретную фразу? Или расшифровать созвон с пятью участниками, разделив их по голосам? Обычно это заканчивалось либо отказом модели, либо счётом, который заставлял задуматься о смене профессии.
Что значит «омнимодальная» на практике
Omni Flash - здесь
Модель принимает до одного часа аудио-видео за запрос. Контекстное окно — 1 миллион токенов. Она не просто «понимает» контент — она планирует задачи, вызывает инструменты и завершает работу. В Qwen описывают это как переход от «понимания омнимодального контента» к «планированию, вызову инструментов и завершению творческой работы».
Конкретные сценарии: видеомонтаж, создание музыкальных клипов, производство фильмов с комментариями, аудио-визуальные саммари, расшифровка созвонов с разделением спикеров, перевод фильмов, добавление субтитров. Не «демо ради демо» — рабочий стек для производства.
Цифры, которые меняют экономику
На 29 публичных и внутренних бенчмарках модель обошла предыдущее поколение Qwen3.5-Omni-Plus в среднем на 26%. Но интереснее, где именно:
WildClawBench-MM — плюс 36.5 балла. AgenticVBench — плюс 22.3. UniClawBench — 69.6. Это тесты на агентские задачи с аудио и видео, а не на распознавание картинок.
В понимании длинных записей — LongAudioSpan плюс 8.3, OmniVideoBench плюс 9.6. В разделении спикеров на встречах AliMeeting — ошибка диаризации упала с 88.11 до 3.35. Для тех, кто когда-либо пытался расшифровать созвон с четырьмя участниками, это не абстрактная цифра.
Есть и агентский режим для длинного видео: модель сама решает, что смотреть и слушать, концентрируя токены на релевантных фрагментах. На OmniVideoBench это подняло точность с 63.4 до 67.8 и сократило расход токенов примерно на 45.7% — с 145 736 до 79 117.
Где подвох в ценах
Alibaba заявляет о снижении цены на часовой аудио-вход более чем на 98% и на аудио-видео-вход более чем на 93% по сравнению с предыдущим поколением. Это не «мы сделали скидку на 10%». Это переписывание экономики для тех, кто строит продукты на аудио и видео.
API-цена на OpenRouter: $0.15 за миллион входных токенов, $0.47 за выходные. Для модели с часовым видео и миллионным контекстом — это уровень, на котором можно строить продакшн, а не только экспериментировать.
Что дают вместе с моделью
Alibaba выпустила Qwen-MM-Plugins — набор плагинов для транскрибации, распознавания говорящих и анализа событий в видео. И открыла Qwen-Live Harness — инфраструктуру для создания мультимодальных агентов с реальным временем.
Alibaba не просто догоняет закрытые модели. Она делает то, что закрытые боятся: открывает доступ и срезает цены. И если тренд продолжится, вопрос будет не «какую модель выбрать», а «почему вы всё ещё платите за старую».
Qwen3.8 Omni Flash - здесь