Модель-«невидимка» Ox Alpha от Z.ai раскрылась

26 августа китайская компания Z.ai (бывшая Zhipu) представила модель GLM-5.3-Flash. Забавная деталь: неделю ею пользовались разработчики по всему миру, не зная, чья она.

С 20 августа модель анонимно работала на площадках OpenRouter и OpenCode под именем Ox Alpha — без названия разработчика и без бренда. За шесть дней она обработала 42 триллиона токенов (кусочков текста: два токена — примерно одно русское слово) и заняла первое место в недельном рейтинге OpenRouter, обойдя ближайшую DeepSeek V4 Flash вдвое. Потом Z.ai подняла руку и сказала: это наша.

Модель-«невидимка» Ox Alpha от Z.ai раскрылась

Что же спрятали за этой моделью? Если коротко,то это большая нейросеть, которая умеет работать с текстом, картинками и видео и держит в «памяти» около миллиона токенов, это порядка двух тысяч страниц за разговор.

Внутри 320 миллиардов параметров, но на каждый ответ работает только 18 миллиардов. Такая схема называется «смесь экспертов»: модель как будто состоит из множества узких специалистов, и на каждый запрос подключаются только нужные. Отсюда скорость и низкая цена.

Плюс новая гибридная схема внимания: по данным Z.ai, вычислений стало втрое меньше, чем у прошлой GLM-5.3, а служебная память в длинных диалогах сжалась в 4,4 раза. Для пользователя это значит одно: длинные документы обходятся дешевле.

По тестам на программирование и агентные задачи (когда модель не просто отвечает, а сама выполняет цепочку действий) Z.ai заявляет заметный отрыв от собственной GLM-5.2: 63,4% против 46,2% в тесте DeepSWE.

Во внутреннем тесте компании модель набрала 29 баллов против 29,5 у Claude Opus 4.8 — одного из дорогих западных флагманов.

Оговорюсь, что все эти цифры опубликовала сама Z.ai, часть тестов — её собственная разработка, независимых прогонов пока нет.

Тут у модели два сильных аргумента именно для нас.

Первый — лицензия MIT. Это самая свободная лицензия из возможных: веса модели (её «мозг» в виде файлов) лежат на Hugging Face, их можно скачать, изменять и использовать в коммерческих продуктах без отчислений и юридической волокиты.

Для российских компаний, которым по 152-ФЗ нельзя отправлять персональные данные в зарубежные облака, это прямой путь: скачал — развернул в своём контуре или в российском облаке — данные никуда не уходят.

Второй — доступность. Чат-бот на z.ai открывается из России, базовая работа бесплатна.

API стоит $0,15 за миллион входных токенов и $0,50 за миллион выходных — примерно вдесятеро дешевле прошлого поколения GLM. До 9 сентября действует стартовая скидка 50%. Оплата зарубежных сервисов из РФ — отдельная история, поэтому открытые веса здесь важнее подписки.

И ещё деталь, которая меня как инженера цепляет: по словам Z.ai, весь анонимный тест обслуживали китайские ускорители, без NVIDIA. Конкретные чипы не назвали, но факт показателен: китайский ИИ-стек всё меньше зависит от американского железа.

Рынок открытых моделей за этот год сделал то, чего от него ждали года три: уровень «почти как западные флагманы» теперь скачивается бесплатно и легально.

Для российского пользователя, отрезанного от подписок ChatGPT и Claude, да еще и Qwen неожиданно для все 27 августа отвалился, именно такие кирпичи и есть настоящий прогресс.

Сырость возможна: модели два дня, правки выходят быстро. Пробуйте сейчас, а критичные процессы стройте после независимых проверок.