Qwen выпустили Qwen3.8-Flash - мультимодальную MoE-модель и ранний превью архитектуры Qwen4
- 125B параметров + 51B N-gram embeddings
- активируется всего 6B параметров на токен
- нативный контекст 262K, расширение до 1M через YaRN
- новая архитектура: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding и Muon optimizer
- обучение обошлось примерно в 9 раз дешевле Qwen3.7-Plus
Бенчмарки:
- DeepSWE 1.1 - 58.7
- SWE-bench Pro - 62.5
- CoWorkBench - 73.9
- AndroidWorld - 84.5
- MathVision - 95.7
Продакшен-версия появится в QwenCloud:
$0.16 / 1M входных токенов
$0.47 / 1M выходных токенов
Также Qwen открывает веса Qwen3.8-Flash-Next - ранней версии архитектуры, которую команда исследует для Qwen4.
https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next