Z.ai выпустила GLM-5.3 Flash: китайский ответ Fable 5 и GPT 5.6 по цене в 10 раз ниже

Z.ai (бывшая Zhipu AI) официально представила GLM-5.3-Flash — первую нативно мультимодальную модель в серии GLM-5. До релиза модель анонимно тестировалась на OpenRouter и OpenCode под кодовым именем Ox Alpha. GLM-5.3 Flash - здесь

Z.ai выпустила GLM-5.3 Flash: китайский ответ Fable 5 и GPT 5.6 по цене в 10 раз ниже

320 млрд параметров, 18 млрд активных

GLM-5.3-Flash построена на гибридной MoE-архитектуре (Mixture of Experts), сочетающей разреженное и линейное внимание. Общее количество параметров — 320 млрд, но на каждый токен активируется всего 18 млрд.

Ключевые характеристики:

  • Всего параметров 320 млрд
  • Активных параметров 18 млрд
  • Контекстное окно 1 млн токенов
  • Максимальный вывод 131 072 токена
  • Архитектура Гибридная (линейное + разреженное внимание)
  • Модальности Текст, изображения, видео
  • Лицензия MIT — веса открыты на Hugging Face

По сравнению с GLM-4.5, новая модель почти вдвое сократила активные параметры (18B против 32B) и количество слоёв (45 против 92), при этом снизив вычислительные затраты на внимание в 3 раза и размер KV-кэша в 4,4 раза. Предобучение велось на 30 трлн токенов мультимодальных данных.

Важно: весь трафик Ox Alpha обслуживался кластером китайских AI-ускорителей. Z.ai не раскрыла конкретные модели чипов, но заявила о трёхкратном улучшении end-to-end производительности благодаря кастомным стекам обслуживания и квантизации, адаптированным под отечественное железо.

Бенчмарки: обгоняет GLM-5.2 и приближается к Opus 4.8

GLM-5.3 Flash - здесь

По заявлениям Z.ai, GLM-5.3-Flash превосходит GLM-5.2 на всех шести кодинговых и агентных бенчмарках, при этом приближается к Claude Opus 4.8 по общим показателям.

Ключевые результаты (по данным Z.ai):

На внутреннем бенчмарке Z.ai Code Bench при максимальном уровне рассуждений модель набрала 29,0 баллов, уступая Opus 4.8 всего 0,5 балла.

В рейтинге Artificial Analysis Intelligence Index v4.1.1 модель получила 57 баллов при стоимости $0,045 за задачу (со скидкой) — уровень интеллекта, который ранее был доступен примерно в 10 раз дороже.

Независимые тесты пока не проводились — все результаты на данный момент опубликованы самой Z.ai.

Цена: в 10 раз дешевле GLM-5.2

Главный козырь GLM-5.3-Flash — цена. Стоимость API составляет всего 1/10 от цены GLM-5.2.

Тип токенов Цена (за 1M)

Входные $0,15

Выходные $0,50

Кэшированные входные $0,03

До 9 сентября 2026 года действует 50% скидка: входные — 0,25 за 1M токенов.

В рублях (по курсу ~90 руб./$): ~6,75 руб. за 1M входных и ~22,5 руб. за 1M выходных со скидкой.

Что в итоге?

GLM-5.3-Flash — это не просто «ещё одна модель». Это тектонический сдвиг в экономике ИИ. Модель, которая по ключевым бенчмаркам приближается к Claude Opus 4.8, стоит в 10 раз дешевле своего предшественника и полностью работает на китайских чипах.

Что важно запомнить:

· 320 млрд параметров (18 млрд активных) — MoE-архитектура

· Обгоняет GLM-5.2 по всем кодинговым и агентным бенчмаркам

· Приближается к Claude Opus 4.8 — разрыв всего 0,5 балла на Code Bench

· Цена в 10 раз ниже GLM-5.2 — 0,50 за 1M токенов

· Первая нативно мультимодальная модель GLM-5 — текст, изображения, видео

· Веса открыты под лицензией MIT

· Работает на китайских чипах — кластер отечественных ускорителей

· 1M контекст — для длительных агентных задач

Как написал Stripe CEO Патрик Коллисон, протестировав модель ещё в анонимном режиме: «Очень впечатляюще». Теперь эта «имба» доступна каждому.

GLM-5.3 Flash - здесь

3