Qwen3.8-Max: сколько стоит API, что даёт Token Plan и во что обходится запрос в рублях
3 августа 2026 года Alibaba выпустила Qwen3.8-Max с ценой $2 за миллион входных токенов и $6 за миллион выходных — для флагмана это середина линейки у западных вендоров. Цифра разошлась по новостям без деталей, а деталей три.
Половина обзоров приписывает эту цену всем регионам сразу, хотя прайс региональный: в Пекине та же модель стоит дешевле. Подписок у Qwen две, и продаются они на разных платформах по разным ценам. А до любых цифр нужно пополнить баланс Alibaba Cloud, где российская карта не проходит.
TL;DR:
- ставки в Сингапуре — $2 вход / $6 выход, неявный кэш $0,25; в Пекине та же модель стоит $1,65 и $4,951;
- контекст — 1 000 000 токенов, вывод — до 131 072, вход мультимодальный;
- Token Plan и Coding Plan — разные продукты, ни один не обязателен, а цены в документации и на витрине расходятся;
- короткий запрос стоит около 79 копеек по курсу 96 ₽ (сверка 14 августа 2026 года);
- открытые веса уже опубликованы, но это текстовая база, а не мультимодальный Max; баланс пополняется только зарубежной картой.
Сколько стоит Qwen3.8-Max в API
В Сингапуре вход — $2, выход — $6 за миллион токенов. Кэш тарифицируется отдельно, и ставок у него три.
Тарифицируются две основные вещи. Обычный вход — всё отправленное модели: промпт, история, документ, изображение. Выход — сгенерированный ответ; рассуждение отдельной строкой не считается и оплачивается по ставке выхода.
Дальше начинается кэш, и здесь чаще всего путаются. Режима два. Неявный включён всегда и работает сам: повторённая часть промпта считается по $0,25 за миллион — это 20% от обычного входа при полной цене создания. Явный вы включаете руками: создание записи стоит $2,50 за миллион — дороже обычного входа, зато чтение идёт по $0,17, то есть 10% ставки. Наценка за запись отбивается вторым-третьим обращением к тому же префиксу.
Запись в кэш идёт отдельной позицией и дороже обычного входа.
Бюджет по одной цифре «$2 за миллион» не считается: в прайсе модели пять позиций.
Qwen.ai, Qwen Cloud и Model Studio — это разные платформы
Чат живёт на qwen.ai, подписки продаются на qwencloud.com, API с регионами — в Model Studio. Прайсы у них не совпадают.
Отсюда растёт почти вся путаница в цифрах:
- qwen.ai — бесплатный чат, покупать здесь нечего;
- qwencloud.com — новая глобальная платформа, запущена 26 мая 2026 года в Сингапуре, на витрине только Token Plan;
- alibabacloud.com, Model Studio — прежняя платформа: регионы, оплата по факту, свой прайс-лист;
- help.aliyun.com — китайский контур с ценами в юанях.
Одна и та же подписка у Model Studio и Qwen Cloud стоит по-разному — сравнивая цифры из двух обзоров, смотрите, с какой платформы каждая.
Разные цены по регионам: что есть на самом деле
Цена зависит от региона проекта: в Сингапуре Qwen3.8-Max стоит $2 и $6, в Пекине — $1,65 и $4,951 за миллион токенов.
Первые две недели после релиза цифры были только по международному контуру, и цену $1,65 приписывали модели ошибочно — она относилась к предыдущей qwen3.7-max. К 18 августа 2026 года Alibaba выложила региональные вкладки на страницу модели, и вторая пара цифр стала правдой — но для Пекина, а не для Сингапура.
Что опубликовано на 19 августа 2026 года:
- Сингапур, он же International: вход $2, выход $6, неявный кэш $0,25, создание явного кэша $2,50, чтение $0,17;
- Пекин, китайский контур: вход $1,65, выход $4,951, неявный кэш $0,206, создание явного кэша $2,063, чтение $0,137;
- отдельные вкладки есть у Франкфурта, Вирджинии, Токио и Гонконга.
В сводной странице прайса, обновлённой 18 августа, строка qwen3.8-max тоже появилась: International, $2 / $6. Соседняя qwen3.7-max идёт там с пометкой «List price $2.5 / $7.5, Limited-time 50% off» — акция на прошлый флагман ещё действует.
Разница между Пекином и Сингапуром — около 18%, но переезжать в китайский контур ради неё не стоит: это отдельная площадка обработки данных со своими правилами доступа. И ещё одна региональная разница не про деньги: во Франкфурте, Вирджинии, Токио и Гонконге не работает веб-поиск.
Переключатель региона на сводной странице прайса: у каждой модели свои ставки в каждом регионе.
Планируйте бюджет по ставкам своего региона и перепроверяйте прайс перед крупным списанием.
Token Plan, Coding Plan или оплата по факту
У Qwen три способа платить: Token Plan, Coding Plan и оплата по факту. Обязательных среди них нет.
Token Plan, Personal Edition — предоплаченный объём на одного пользователя. На витрине реально платят $6, $18 и $68 в месяц за Lite, Standard и Pro, рядом зачёркнуты обычные $8, $25 и $80: акция действует. Кредиты: у Lite 700 за 5 часов и 2 500 за 7 дней, у Standard 3 000 и 10 000, у Pro 12 000 и 40 000; отдельно есть Credit Pack — 20 000 кредитов за $15.
Документация отстала от витрины: в хелпе Model Studio у Standard и Pro до сих пор стоят устаревшие $20 и $70. Платят по витрине, и расходятся не только эти две цифры.
Token Plan, Team Edition — за место в месяц: Standard $20, Pro $75, Max $200; зачёркнутые — $30, $100 и $200.
Coding Plan — отдельный продукт, а не ступень Token Plan. Действующий тариф один: Pro $50 в месяц с лимитами 6 000 запросов за 5 часов, 45 000 в неделю и 90 000 в месяц; Lite закрыт для новых подписок с 20 марта 2026 года, для продлений и апгрейдов — с 13 апреля. Искать его придётся вручную: продукта нет ни в меню qwencloud.com, ни на лендингах Alibaba Cloud — он открывается по прямой ссылке или в консоли под логином.
Точка перехода. План выигрывает, когда фактический счёт превышает его цену: при соотношении пять входных токенов на один выходной это 1,87 млн и 375 тыс. в месяц для $6, 5,6 млн и 1,12 млн для $18, 21,2 млн и 4,25 млн для $68.
Когда подписка не нужна: нагрузка нерегулярная; вы ещё тестируете модель; задача разовая; планы Team привязаны к Сингапуру, а вам нужен другой регион.
Token Plan и Coding Plan лежат на разных страницах и покупаются отдельно.
Подписка — инструмент предсказуемости, а не скидка: первый месяц по нашему опыту стоит прожить на оплате по факту.
Сколько стоит реальный запрос
По курсу 96 ₽ за доллар (сверка 14 августа 2026 года) короткий запрос стоит около 79 копеек, разбор документа на 200 тысяч токенов — около 41 рубля.
Комиссия сервиса берётся один раз при пополнении и в расчёт не входит.
Сценарий 1. Короткий чат-запрос, 2 000 токенов входа и 700 выхода: $0,004 плюс $0,0042 — итого $0,0082, или примерно 79 копеек.
Сценарий 2. Разбор документа, 200 000 токенов контекста и 4 000 ответа: вход $0,40, выход $0,024, итого $0,424, или примерно 40,70 ₽.
Сценарий 3. Агентная сессия с кэшем. Постоянная часть промпта — 120 000 токенов, 20 шагов, на каждом 3 000 новых входных и 1 500 выходных:
- запись в явный кэш — $0,30, чтение (2,4 млн токенов по $0,17) — $0,41;
- новый вход (60 000) — $0,12, выход (30 000) — $0,18, итого $1,01, или примерно 97 ₽.
Та же сессия без кэша — $5,10, или 489,60 ₽: 2,46 млн входных токенов уходят по полной ставке. Кэш снижает счёт впятеро, а дорогая запись отбивается на втором-третьем шаге.
Дорогой модель делает не запрос, а длинный контекст, уходящий заново на каждом шаге.
Дешевле ли это GPT-5.6 и Claude Opus 5
За одинаковый объём токенов Qwen3.8-Max дешевле GPT-5.6 Terra вдвое на выходе и дешевле Claude Opus 5 примерно вчетверо.
Ставки на 14 августа 2026 года за миллион входных и выходных токенов:
- Qwen3.8-Max — $2 и $6;
- GPT-5.6 Terra — $2 и $12;
- Claude Opus 5 — $5 и $25.
На входе Qwen идёт вровень с GPT-5.6 и в 2,5 раза дешевле Opus 5, на выходе разрыв заметнее. Дальше оговорка, без которой сравнение обманывает: ставка за токен не равна стоимости задачи. Одна модель решит с первого раза, другая уйдёт на три круга и окажется дороже при формально низкой ставке.
Мы прогоняем двадцать типовых задач на обеих моделях и складываем фактический usage — иначе не сравнить.
Что с характеристиками и открытыми весами
Контекст — 1 000 000 токенов, вывод — до 131 072, вход мультимодальный. Открытые веса опубликованы, но это текстовая база.
Архитектура — MoE: 2,4 трлн параметров, около 95 млрд активных. На каждый токен работает малая часть сети — поэтому модель такого размера и стоит $2 за миллион входных токенов. Интерфейсов у Model Studio три — OpenAI-совместимый, Anthropic-совместимый Messages API и нативный DashScope: клиент на OpenAI SDK переезжает заменой адреса, ключа и имени модели.
Qwen обещала впервые открыть модель класса Max — и обещание выполнила: к 14 августа 2026 года на Hugging Face опубликованы Qwen/Qwen3.8-2.4T-A95B и его FP8-вариант под кастомной лицензией qwen3.8-max.
Тонкость, которую стоит понимать до скачивания: это text-only база. Мультимодальный Qwen3.8-Max со зрением и контекстом в миллион токенов построен на ней, но отдельно как веса не выложен — локально вы получите текстовую модель, а не то, что отвечает в API. Плотная Qwen3.8-27B уже вышла: Qwen/Qwen3.8-27B и FP8-вариант открыты под Apache 2.0, и, в отличие от базы Max, она принимает изображения.
Спецификация на официальной странице: контекст, лимит вывода и модальности.
Ставки и характеристики сверены по документации Model Studio 14 августа 2026 года.
Как оплатить Alibaba Cloud из России
Российская карта на форме пополнения Alibaba Cloud не проходит. Баланс пополняется зарубежной картой.
Сам чат Qwen бесплатен — платить нужно только за Model Studio и подписки.
Вы получаете реквизиты виртуальной зарубежной карты — номер, срок и CVV — и вводите их в форму Alibaba Cloud сами. Доступ к аккаунту передавать не нужно: логин и пароль для платежа не требуются.
Сколько это в рублях. Курс на 14 августа 2026 года — 96 ₽ за доллар, комиссия идёт ступенями от суммы платежа: фиксированные 350 ₽ до 999 ₽, дальше 32% на 1 000–2 999 ₽ и вниз с каждой ступенью — 20% на 10 000–12 499 ₽, 12% на 20 000–49 999 ₽, 7% от 100 000 ₽.
Пополнение на $30 — это 2 880 ₽, ступень 32%, итого 3 801,60 ₽, или 126,72 ₽ за доллар. Пополнение на $120 — 11 520 ₽, ступень 20%, итого 13 824 ₽, или 115,20 ₽ за доллар.
Четыре платежа по $30 обойдутся в 15 206,40 ₽, один платёж на $120 — в 13 824 ₽. Комиссия наказывает за дробление.
Частые вопросы
Сколько стоит Qwen3.8-Max за миллион токенов?
В Сингапуре вход — $2, выход — $6. Кэш считается отдельно: неявный — $0,25, создание явного — $2,50, чтение из явного — $0,17. В Пекине ставки ниже: $1,65 и $4,951.
Правда ли, что в разных регионах цена разная?
Да. С 18 августа 2026 года на странице модели опубликованы региональные вкладки: Сингапур — $2 и $6, Пекин — $1,65 и $4,951 за миллион токенов, отдельные вкладки есть у Франкфурта, Вирджинии, Токио и Гонконга. Первые две недели после релиза цифры $1,65 и $4,951 приписывали модели ошибочно — тогда они относились к предыдущей qwen3.7-max. Веб-поиск при этом недоступен во Франкфурте, Вирджинии, Токио и Гонконге.
Чем Token Plan отличается от Coding Plan?
Это самостоятельные продукты, а не уровни одной подписки. Token Plan — предоплаченный объём: Personal ($6, $18, $68) и Team ($20, $75, $200 за место). Coding Plan — отдельная подписка с тарифом Pro за $50, которой нет в меню платформы.
Нужна ли подписка, чтобы пользоваться моделью?
Нет, модель работает на обычной оплате по факту. Подписка окупается, когда счёт превышает её цену: $18 отбивается примерно на 5,6 млн входных и 1,12 млн выходных токенов в месяц.
Можно ли платить российской картой?
Нет, на форме пополнения Alibaba Cloud она не проходит. Нужна зарубежная: реквизиты вы вводите в форму сами, доступ к аккаунту никому не передаётся.
Вышли ли открытые веса?
Да, к 14 августа 2026 года на Hugging Face опубликованы Qwen/Qwen3.8-2.4T-A95B и его FP8-вариант под лицензией qwen3.8-max. Но это текстовая база: мультимодальный Max со зрением и контекстом 1M на ней построен, а отдельно не выложен.
Что делать дальше
- Посчитайте месячный объём: прогоните десять типовых задач и сложите usage из ответов.
- Включите кэширование постоянной части промпта и выбирайте регион по веб-поиску, а не по цене.
- Решайте про подписку по цифрам, а баланс пополняйте одним платежом покрупнее.