Qwen выпустили Qwen3.8-Flash - мультимодальную MoE-модель и ранний превью архитектуры Qwen4

- 125B параметров + 51B N-gram embeddings

- активируется всего 6B параметров на токен

- нативный контекст 262K, расширение до 1M через YaRN

- новая архитектура: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding и Muon optimizer

- обучение обошлось примерно в 9 раз дешевле Qwen3.7-Plus

Бенчмарки:

- DeepSWE 1.1 - 58.7

- SWE-bench Pro - 62.5

- CoWorkBench - 73.9

- AndroidWorld - 84.5

- MathVision - 95.7

Продакшен-версия появится в QwenCloud:

$0.16 / 1M входных токенов

$0.47 / 1M выходных токенов

Также Qwen открывает веса Qwen3.8-Flash-Next - ранней версии архитектуры, которую команда исследует для Qwen4.

https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next

2