Z.ai выпустила GLM-5.3 Flash: китайский ответ Fable 5 и GPT 5.6 по цене в 10 раз ниже
Z.ai (бывшая Zhipu AI) официально представила GLM-5.3-Flash — первую нативно мультимодальную модель в серии GLM-5. До релиза модель анонимно тестировалась на OpenRouter и OpenCode под кодовым именем Ox Alpha. GLM-5.3 Flash - здесь
320 млрд параметров, 18 млрд активных
GLM-5.3-Flash построена на гибридной MoE-архитектуре (Mixture of Experts), сочетающей разреженное и линейное внимание. Общее количество параметров — 320 млрд, но на каждый токен активируется всего 18 млрд.
Ключевые характеристики:
- Всего параметров 320 млрд
- Активных параметров 18 млрд
- Контекстное окно 1 млн токенов
- Максимальный вывод 131 072 токена
- Архитектура Гибридная (линейное + разреженное внимание)
- Модальности Текст, изображения, видео
- Лицензия MIT — веса открыты на Hugging Face
По сравнению с GLM-4.5, новая модель почти вдвое сократила активные параметры (18B против 32B) и количество слоёв (45 против 92), при этом снизив вычислительные затраты на внимание в 3 раза и размер KV-кэша в 4,4 раза. Предобучение велось на 30 трлн токенов мультимодальных данных.
Важно: весь трафик Ox Alpha обслуживался кластером китайских AI-ускорителей. Z.ai не раскрыла конкретные модели чипов, но заявила о трёхкратном улучшении end-to-end производительности благодаря кастомным стекам обслуживания и квантизации, адаптированным под отечественное железо.
Бенчмарки: обгоняет GLM-5.2 и приближается к Opus 4.8
GLM-5.3 Flash - здесь
По заявлениям Z.ai, GLM-5.3-Flash превосходит GLM-5.2 на всех шести кодинговых и агентных бенчмарках, при этом приближается к Claude Opus 4.8 по общим показателям.
Ключевые результаты (по данным Z.ai):
На внутреннем бенчмарке Z.ai Code Bench при максимальном уровне рассуждений модель набрала 29,0 баллов, уступая Opus 4.8 всего 0,5 балла.
В рейтинге Artificial Analysis Intelligence Index v4.1.1 модель получила 57 баллов при стоимости $0,045 за задачу (со скидкой) — уровень интеллекта, который ранее был доступен примерно в 10 раз дороже.
Независимые тесты пока не проводились — все результаты на данный момент опубликованы самой Z.ai.
Цена: в 10 раз дешевле GLM-5.2
Главный козырь GLM-5.3-Flash — цена. Стоимость API составляет всего 1/10 от цены GLM-5.2.
Тип токенов Цена (за 1M)
Входные $0,15
Выходные $0,50
Кэшированные входные $0,03
До 9 сентября 2026 года действует 50% скидка: входные — 0,25 за 1M токенов.
В рублях (по курсу ~90 руб./$): ~6,75 руб. за 1M входных и ~22,5 руб. за 1M выходных со скидкой.
Что в итоге?
GLM-5.3-Flash — это не просто «ещё одна модель». Это тектонический сдвиг в экономике ИИ. Модель, которая по ключевым бенчмаркам приближается к Claude Opus 4.8, стоит в 10 раз дешевле своего предшественника и полностью работает на китайских чипах.
Что важно запомнить:
· 320 млрд параметров (18 млрд активных) — MoE-архитектура
· Обгоняет GLM-5.2 по всем кодинговым и агентным бенчмаркам
· Приближается к Claude Opus 4.8 — разрыв всего 0,5 балла на Code Bench
· Цена в 10 раз ниже GLM-5.2 — 0,50 за 1M токенов
· Первая нативно мультимодальная модель GLM-5 — текст, изображения, видео
· Веса открыты под лицензией MIT
· Работает на китайских чипах — кластер отечественных ускорителей
· 1M контекст — для длительных агентных задач
Как написал Stripe CEO Патрик Коллисон, протестировав модель ещё в анонимном режиме: «Очень впечатляюще». Теперь эта «имба» доступна каждому.
GLM-5.3 Flash - здесь