Alibaba выпустила Qwen 3.8-2.4T-A95B — монстра на 2,4 трлн параметров, который может работать до 10 дней
Это первая в истории Max-класса модель Qwen с открытыми весами. 2,4 трлн параметров, 95 млрд активных на токен, контекст до 1 млн токенов и способность работать над проектами более 10 дней без контроля человека. Qwen 3.8 - здесь
2,4 трлн параметров — и только 95 млрд активных
Qwen3.8-2.4T-A95B построена на разреженной MoE-архитектуре (Mixture of Experts) с 512 экспертами, из которых на каждый токен активируется 11 экспертов (10 routed + 1 shared). Это значит, что из 2,4 трлн параметров одновременно работает всего ~95 млрд — модель остаётся быстрой и экономичной, несмотря на гигантский размер.
Архитектура — гибрид полного и линейного внимания. Полные слои внимания позволяют модели видеть все токены, а линейные — заменяют растущий KV-кэш ограниченным рекуррентным состоянием. Это делает контекст в 1 млн токенов не просто маркетинговой цифрой, а реально работающей фичей.
Киллер-фича: модель специально дообучали для долгосрочных автономных задач. В отличие от моделей, которые дают один ответ и забывают, Qwen3.8-Max способна самостоятельно планировать, выполнять и проверять многошаговые задачи без участия человека. В одном из тестов модель работала над проектом более 10 дней, сохраняя контекст и не теряя нить рассуждений.
Бенчмарки: топ-уровень в агентных задачах
Alibaba опубликовала результаты тестов, и цифры впечатляют:
Бенчмарки:
- Terminal Bench 2.1 - 86.6
- SWE-bench Pro - 67.7%
- PaperBench 93.0 - 64.8
- GPQA Diamond - 92.6
- CoWorkBench - 74.8
- IFBench 82.8 - 79.1
В рейтинге BenchLM модель занимает #6 из 216 моделей с общим баллом 79.6. При этом по рассуждениям (Reasoning) — #1, по агентным задачам (Agentic) — #2, по мультимодальности — #2.
Модель на равных конкурирует с Claude Fable 5 и GPT-5.6 Sol в автономных задачах, а по PaperBench (93.0) и Terminal Bench 2.1 (86.6) превосходит многих коммерческих конкурентов.
Что умеет: от кодинга до многодневных агентов
Автономное выполнение задач. Модель может работать над проектами более 10 дней без контроля человека. Сама планирует шаги, вызывает инструменты, проверяет результаты и корректирует действия.
Параллельный вызов инструментов. Может одновременно использовать несколько инструментов — от терминала и браузера до API и баз данных.
Контекст до 1 млн токенов. Можно загрузить всю кодовую базу или многотомный архив — модель не потеряет нить рассуждений.
Настройка глубины мышления. Поддерживает режимы low / high / xhigh — можно управлять сложностью рассуждений в зависимости от задачи.
Работа с текстом, изображениями и видео (в облачной версии). Открытая версия пока текстов-only, но мультимодальность уже в API.
Где скачать
Веса уже доступны - здесь
· Репозиторий: Qwen/Qwen3.8-2.4T-A95B
· Форматы: BF16, FP8
· GGUF-квантизации: уже появились от unsloth
Вывод Vectra
Alibaba сделала то, чего от неё долго ждали — открыла веса флагманской Max-модели. Qwen3.8-2.4T-A95B — это не просто «ещё одна большая модель», а первый открытый ИИ, способный автономно работать над проектами более 10 дней.
Ключевые выводы:
· 2,4 трлн параметров (95 млрд активных)
· Контекст до 1 млн токенов
· Автономная работа >10 дней
· Бенчмарки на уровне Fable 5 и GPT-5.6 Sol
· Открытые веса на Hugging Face
· API от 6 за 1M токенов
Как пишут в обзорах: «Qwen3.8-Max — это первая Max-класс модель, которую можно скачать и запустить у себя». Для инди-разработчиков, исследователей и компаний, которым нужен контроль над данными и инфраструктурой, это прорыв. Конкуренты уже трещат по швам.
Qwen3.8-Max - здесь