Cекрет Ox Alpha раскрыт: анонимная модель, съевшая 44 трлн токенов за шесть дней, оказалась GLM-5.3-Flash
Шесть дней на OpenRouter работала модель, у которой не было владельца. 20 августа там появилась запись stealth/ox-alpha: провайдер анонимный, контекст на 1 048 576 токенов, вход текст-картинки-видео, цена — ноль. Сама площадка прямо писала, что она не разработчик, не владелец и не провайдер этой модели, а только маршрутизирует запросы.
26 августа Z.ai подтвердила Bloomberg, что Ox Alpha — новая итерация её серии GLM, и сообщила, что тем же вечером выложит веса. Модель называется GLM-5.3-Flash и, по словам компании, работает на китайских чипах.
Интереснее всего то, что произошло между этими двумя датами.
Зачем вообще выпускать модель без имени
Stealth-релиз — обычная предзапусковая тактика. Лаборатория выкладывает необъявленный чекпоинт на публичный роутер под кодовым именем, ставит нулевую цену и смотрит, как он ведёт себя на реальном трафике разработчиков, прежде чем решаться на запуск. Лаборатория получает бесплатную оценку в масштабе плюс вирусный момент, если модель хороша. Сделка для пользователя неявная: вы получаете модель фронтир-класса бесплатно, оператор получает ваши промпты.
Для этой площадки схема отработана. До Ox Alpha так же выходили Pony Alpha (оказался GLM-5 от Zhipu), Hunter Alpha (MiMo-V2-Pro от Xiaomi), Elephant Alpha (Lingxi Ling-2.6-flash от Ant Group) и Owl Alpha (LongCat-2.0 от Meituan). Все четыре предыдущих раза за анонимом стояла китайская лаборатория. Пятый раз ничего не изменил.
Что было эти шесть дней
Агент OpenCode объявил, что модель будет бесплатной неделю с почти неограниченным использованием, и что у провайдера есть мощности на 100 триллионов токенов в день. Гендиректор Stripe Патрик Коллисон попробовал её и назвал очень впечатляющей.
Масштаб получился внушительный. К 26 августа публичная панель OpenCode показывала 503 тысячи уникальных пользователей, 13,12 млн завершённых сессий и 44 трлн обработанных токенов. Ранний прогон оборвал 56-дневную серию DeepSeek на вершине лидерборда OpenCode.
То есть полмиллиона разработчиков решили, что бесплатная модель фронтир-класса без известного владельца — приемлемая ставка, и залили в неё рабочий код.
Как её вычислили
Пока одни пользовались, другие занялись поиском. И вот эта часть по-настоящему хороша.
Разработчик Бен Дэвис заявил, что уверен на 99%: модель из китайской Zhipu, скорее всего невыпущенный вариант GLM-5.3. Он сослался на совпадающий видеоэнкодер, токенизатор, стиль ответов и поведение при джейлбрейке и отказе от аудио. Отдельная форензика 22 августа усилила теорию: трассировка стека, код ошибки 1214 и совпадение токенизатора 30 из 30 — всё сходилось с семейством GLM.
Дальше проверку расширили. Ox Alpha совпал с опубликованным словарём GLM-5 на всех 95 пробах токенизатора. Счётчики токенов сходились с GLM-5.3 в точности на 25 тестовых промптах, с постоянной разницей ровно в 75 токенов, которую исследователи объяснили скрытой обёрткой или системным промптом. Отдельно нашли сообщения об ошибках, похожие на публичный сервис Z.ai. А расход токенов на видео совпал с GLM-5V-Turbo ровно, на четырёх разных роликах.
Токенизатор — это способ, которым модель режет текст на кусочки. У каждой лаборатории он свой, и совпадение слово в слово на всём наборе проб случайностью не бывает. По сути, модель опознали по отпечаткам пальцев.
Утёкший системный промпт, выложенный сообществом, предписывал модели представляться строго как модель ox-alpha, разработанная нераскрытой организацией. Не помогло.
По-честному: цифра, которая развалилась
Отдельно стоит рассказать про бенчмарк, потому что история поучительная.
В первый день Бен Дэвис прогнал модель по десяти задачам из DeepSWE и получил 80% — впереди Claude Fable 5 с 65% и GPT-5.6 Sol с 52%. Одной этой точки хватило, чтобы модель стала вирусной.
К 23 августа он закончил полный набор из 113 задач и получил примерно 63%. Сам он прокомментировал, что более низкий результат имеет куда больше смысла. Второй независимый прогон полного набора дал примерно ту же цифру. Это уровень GPT-5.6 Sol и ниже, чем 65% у Claude Fable 5.
На выборке из десяти задач одна задача сдвигает результат на 10 процентных пунктов. Разница между «разгромила всех» и «примерно на уровне» — это разница между 10 задачами и 113. При этом первая цифра разошлась по соцсетям, а вторая почти нет.
Что оказалось внутри
GLM-5.3-Flash — это MoE на 320 млрд параметров, из которых активны 18 млрд, нативно мультимодальная, обученная на корпусе в 30 трлн токенов, с контекстом в миллион токенов и потолком вывода в 131 тысячу. По словам Z.ai, это первая открытая фронтир-модель с гибридной архитектурой внимания, сокращающей вычисления на внимание в 3,01 раза, а размер KV-кэша — в 4,44 раза относительно GLM-5.3.
Тут важно не запутаться в названиях. GLM-5.3, вышедшая 14 августа, — это линия на базе 743 млрд параметров с упором на кибербезопасность, у которой открытые веса выкатывают поэтапно. GLM-5.3-Flash — отдельный мультимодальный вариант на 320 млрд с немедленной публикацией под MIT. Общее имя семейства, разные продукты.
Цена вместо нуля: по прайсу 0,15 доллара за миллион входных токенов и 0,50 за выходные, а до 9 сентября действует скидка 50% — 0,075 и 0,25. У флагманской GLM-5.3 те же строчки стоят 1,40 и 4,40. То есть Flash дешевле примерно в десять раз. Кэшированный вход — 0,015 за миллион.
Веса лежат на Hugging Face под MIT, с поддержкой в основных движках раздачи с первого дня. Но 320 млрд параметров — это самостоятельный хостинг на уровне дата-центра, а не ноутбука.
Ещё деталь для тех, кто успел завязаться на бесплатный эндпоинт: адрес stealth/ox-alpha пропал из активного каталога OpenRouter без задокументированного алиаса. Всё, что было построено на нём, нужно переводить на новый идентификатор.
Что осталось без ответа
Один вопрос раскрытие не закрыло: что произошло с промптами, отправленными во время анонимного окна.
Полмиллиона разработчиков шесть дней заливали рабочий код в эндпоинт, у которого не было владельца. Теперь владелец известен. Но соглашение, которого не было в момент отправки, задним числом не появляется.
Что это значит
Гадание про то, какая лаборатория за этим стоит, оказалось самой скучной частью истории. Сообщество вычислило ответ за три дня по токенизатору и коду ошибки, ещё до всякого подтверждения.
Интереснее другое. Запуск без имени перестал быть трюком и стал каналом дистрибуции. Модель собрала полмиллиона пользователей и 44 трлн токенов реальной нагрузки до того, как у неё появились название, цена и лицензия. Обычный релиз с блог-постом и бенчмарками столько внимания не даёт, а анонимность, как выяснилось, даёт: неделю все обсуждали не заявления вендора, а собственные замеры.
И ещё раз подтвердилось наблюдение, которое к пятому случаю уже не выглядит совпадением. Играют в эту игру китайские лаборатории. Западные флагманы выходят с презентациями, охраняемыми весами и поэтапным доступом. Китайские выкатывают бесплатно и анонимно, дают неделю нагрузить себя настоящей работой, а потом публикуют веса под MIT и ставят цену в десять раз ниже собственного флагмана.
Больше про LLM и AI — в нашем Telegram-канале (@devgeek_sh). Разбираем новые модели, делимся опытом и полезными находками.