Alibaba выпустила Qwen 3.8-2.4T-A95B — монстра на 2,4 трлн параметров, который может работать до 10 дней

Это первая в истории Max-класса модель Qwen с открытыми весами. 2,4 трлн параметров, 95 млрд активных на токен, контекст до 1 млн токенов и способность работать над проектами более 10 дней без контроля человека. Qwen 3.8 - здесь

Alibaba выпустила Qwen 3.8-2.4T-A95B — монстра на 2,4 трлн параметров, который может работать до 10 дней

2,4 трлн параметров — и только 95 млрд активных

Qwen3.8-2.4T-A95B построена на разреженной MoE-архитектуре (Mixture of Experts) с 512 экспертами, из которых на каждый токен активируется 11 экспертов (10 routed + 1 shared). Это значит, что из 2,4 трлн параметров одновременно работает всего ~95 млрд — модель остаётся быстрой и экономичной, несмотря на гигантский размер.

Архитектура — гибрид полного и линейного внимания. Полные слои внимания позволяют модели видеть все токены, а линейные — заменяют растущий KV-кэш ограниченным рекуррентным состоянием. Это делает контекст в 1 млн токенов не просто маркетинговой цифрой, а реально работающей фичей.

Киллер-фича: модель специально дообучали для долгосрочных автономных задач. В отличие от моделей, которые дают один ответ и забывают, Qwen3.8-Max способна самостоятельно планировать, выполнять и проверять многошаговые задачи без участия человека. В одном из тестов модель работала над проектом более 10 дней, сохраняя контекст и не теряя нить рассуждений.

Бенчмарки: топ-уровень в агентных задачах

Alibaba опубликовала результаты тестов, и цифры впечатляют:

Бенчмарки:

  • Terminal Bench 2.1 - 86.6
  • SWE-bench Pro - 67.7%
  • PaperBench 93.0 - 64.8
  • GPQA Diamond - 92.6
  • CoWorkBench - 74.8
  • IFBench 82.8 - 79.1

В рейтинге BenchLM модель занимает #6 из 216 моделей с общим баллом 79.6. При этом по рассуждениям (Reasoning) — #1, по агентным задачам (Agentic) — #2, по мультимодальности — #2.

Модель на равных конкурирует с Claude Fable 5 и GPT-5.6 Sol в автономных задачах, а по PaperBench (93.0) и Terminal Bench 2.1 (86.6) превосходит многих коммерческих конкурентов.

Что умеет: от кодинга до многодневных агентов

Автономное выполнение задач. Модель может работать над проектами более 10 дней без контроля человека. Сама планирует шаги, вызывает инструменты, проверяет результаты и корректирует действия.

Параллельный вызов инструментов. Может одновременно использовать несколько инструментов — от терминала и браузера до API и баз данных.

Контекст до 1 млн токенов. Можно загрузить всю кодовую базу или многотомный архив — модель не потеряет нить рассуждений.

Настройка глубины мышления. Поддерживает режимы low / high / xhigh — можно управлять сложностью рассуждений в зависимости от задачи.

Работа с текстом, изображениями и видео (в облачной версии). Открытая версия пока текстов-only, но мультимодальность уже в API.

Где скачать

Веса уже доступны - здесь

· Репозиторий: Qwen/Qwen3.8-2.4T-A95B

· Форматы: BF16, FP8

· GGUF-квантизации: уже появились от unsloth

Вывод Vectra

Alibaba сделала то, чего от неё долго ждали — открыла веса флагманской Max-модели. Qwen3.8-2.4T-A95B — это не просто «ещё одна большая модель», а первый открытый ИИ, способный автономно работать над проектами более 10 дней.

Ключевые выводы:

· 2,4 трлн параметров (95 млрд активных)

· Контекст до 1 млн токенов

· Автономная работа >10 дней

· Бенчмарки на уровне Fable 5 и GPT-5.6 Sol

· Открытые веса на Hugging Face

· API от 6 за 1M токенов

Как пишут в обзорах: «Qwen3.8-Max — это первая Max-класс модель, которую можно скачать и запустить у себя». Для инди-разработчиков, исследователей и компаний, которым нужен контроль над данными и инфраструктурой, это прорыв. Конкуренты уже трещат по швам.

Qwen3.8-Max - здесь

3