Qwen3.8-Max заявляет о 16-дневном автономном режиме программирования
Alibaba Qwen3.8-Max претендует на звание модели для автономного программирования с 16-дневным циклом обучения
Команда Qwen компании Alibaba выпустила Qwen3.8-Max — модель с 2,4 триллионами параметров и 95 миллиардами активных параметров, предназначенную для программирования, офисной работы, исследований и долгосрочных задач, выполняемых с минимальным контролем.
Модель уже доступна на платформе QwenCloud. На следующей неделе будут опубликованы открытые весовые коэффициенты, что станет первым случаем, когда Alibaba выпустит модель Qwen класса Max за пределами закрытого API.
Qwen3.8-Max основана на архитектуре, представленной в Qwen 3.5, и, по заявлениям компании, способна выполнять многодневные автономные задачи, а не давать ответы за один ход. По крайней мере, так заявлено. Компания приводит ряд внутренних тестовых примеров: 16-дневный проект по программированию, воспроизведение научной статьи, участие в онлайн-соревновании, разработка чипа и годичная симуляция работы интернет-магазина.
10 дней на создание самообновляющегося программного обеспечения
Самый подробный пример — проект под названием oh-my-cli, созданный на основе пустого репозитория в ходе, как пишет Qwen, автономного программирования продолжительностью более 10 дней.
Модель объединила в один цикл конечный автомат, диспетчер, монитор и сторожевой таймер: новое требование появляется в разделе GitHub Issues, агент принимает его, переводит в состояния «готово», «зарезервировано» и «активно», затем запускает сквозные тесты и проверки непрерывной интеграции, после чего сливает пул-реквест.
Самотестирование запускалось при каждом обновлении — при сборке, модульном тестировании, сквозном тестировании и проверке жизненного цикла десктопной версии, — а в случае сбоя возвращалось к исходной проблеме для повторной проверки. К 30 июля 2026 года, после примерно 16 дней непрерывной работы, по данным Qwen, в репозитории накопилось 265 коммитов, 127 пул-реквестов и 151 проблема.
Трассировка доступна на GitHub в репозитории qwen-code-dev-bot/oh-my-cli, что, по крайней мере, даёт сторонним наблюдателям возможность проверить данные, а не принимать их на веру.
Воспроизвести статью, а затем превзойти её
Во втором случае Qwen3.8-Max получил опубликованную статью «Унифицированный выбор данных для рассуждений с помощью больших языковых моделей» с инструкциями по воспроизведению и улучшению результатов. Никакого стартового кода. Никакого пайплайна. Только статья и доступ к GPU.
Проработав в одиночку около 125 часов, модель написала около 7600 строк кода, выполнив 1100 действий и пройдя 33 этапа обучения. Первые 37 часов ушли на то, чтобы перестроить работу над документом и подтвердить шесть основных выводов, включая выигрыш в 7,7% по сравнению со случайной выборкой данных в математическом тесте AIME24.
Затем работа продолжилась. В течение следующих 88 часов он провел четыре цикла проверки гипотез и анализа, опробовав 18 собственных идей по улучшению. Победившая идея – точнее, подсчет “баллов за принятие трудных решений” – повысила оценку AIME24 с 49,58% до 52,29%, что на 2,71 балла больше, чем у метода, использованного в оригинальной статье.
Настоящее соревнование
Самым наглядным тестом на соответствие требованиям внешней конкуренции стало соревнование по распознаванию намерений в рамках мультимодального диалога WWW2025 на платформе Tianchi от Alibaba Cloud, в котором приняли участие 526 команд.
Компания Qwen3.8-Max создала решение, объединяющее дообученные модели китайского языка (BERT, MacBERT и RoBERTa) для работы с текстом, а также дообученную модель Qwen2.5-VL-7B и резервную модель Chinese-CLIP для работы с изображениями.
За 24 часа из 45 заявок точность повысилась с 0,60 до 0,853. По данным Qwen, это позволило ей опередить 458 из 526 команд, то есть 87 % участников. Конечно, место в рейтинге среди фиксированного числа конкурентов в конкретный момент времени — это не то же самое, что общее превосходство над аналитиками-людьми при выполнении открытых задач.
Протестированные профессии, заявленная производительность
Компания Qwen также протестировала модель на нескольких сотнях так называемых высокооплачиваемых профессий. В описании приводятся сравнительные данные: проверка на соответствие нормативным требованиям, выполненная менее чем за час, по сравнению с неделей, необходимой для работы команды помощников юристов; прототип банковского приложения, созданный за один прогон, по сравнению с тремя-пятью раундами доработки; меню ресторана на 26 блюд, составленное на основе сотни спецификаций.
Каждое из этих сравнений — это собственная оценка Qwen «традиционного рабочего процесса», а не документально подтверждённые данные о взаимодействии с клиентами или результаты контролируемого исследования. Рассматривайте кратные значения как контекст, предоставляемый поставщиком, а не как измеряемый прирост производительности.
Пример количественного исследования построен по тому же принципу, но с более точными цифрами. По имеющимся данным, Qwen3.8-Max разработал стратегию ротации ETF от начала и до конца, а затем распараллелил поиск факторов, задействовав около 330 субагентов, которые провели около 6000 бэктестов на основе шести исходных описаний.
Полученные факторы обеспечили коэффициент Шарпа от 0,64 до 1,48, а коэффициент информации составил от 0,010 до 0,014. Показатели по результатам бэктестов. Не относится к реальной торговле.
Разработка чипа и 365-дневное моделирование
Два других примера еще больше приближены к синтетическим. В первом случае перед моделью была поставлена задача разработать криптографический ускоритель на основе алгоритма Евклида/RSA на основе шаблона RTL, полностью в изолированной программной среде, подключенной к Iverilog, Yosys и OpenROAD.
За 500 итераций и 71 оценку модель сократила количество логических элементов в своем первом рабочем проекте с 8298 до 678, а затем перешла к физической компоновке, уменьшив площадь кристалла со 106×106 мкм² до 46×46 мкм² и обеспечив частоту до 500 МГц. Самый значительный скачок произошел на 22-м этапе, когда модель заменила аппаратный делитель по модулю на итеративную схему со сдвигом и вычитанием, что позволило сократить количество логических элементов на 6288 за один шаг.
Второй кейс, E-Commerce Bench, представляет собой симуляцию розничной торговли за целый год на основе обезличенных данных о транзакциях с Taobao и Tmall, дополненных информацией о 152 внедренных мошеннических поставщиках и случайных перебоях в поставках. Qwen3.8-Max завершил этот год с виртуальным балансом в 416 252 юаня при стартовом капитале в 100 000 юаней, опередив занявшую второе место модель GLM 5.2 на 38 %.
Доступность и то, что еще не проверено
Qwen3.8-Max поставляется с параметром reasoning_effort (высокий, средний или низкий), позволяющим найти баланс между стоимостью и глубиной обучения, а параметр preserve_thinking включен по умолчанию. QwenCloud поддерживает API для завершения и ответов в чате, совместимые с OpenAI, а также интерфейс, совместимый с Anthropic. Модель интегрируется с Claude Code, Codex, Qoder CLI, Qwen Code и OpenClaw.
Ни один из основных показателей в этом релизе не был получен в ходе сторонних тестов или аудита корпоративного внедрения. Каждое число отсылает к собственным тестовым наборам данных Квен.