Токены ушли в Китай, деньги остались в США: что показывает статистика OpenRouter

Токены ушли в Китай, деньги остались в США: что показывает статистика OpenRouter

В июле 2026 года на OpenRouter случилось то, чего год назад не ждал никто: все пять первых мест в рейтинге использования заняли китайские модели. Первое место по объёму токенов — MiMo-V2.5 от Xiaomi. Дальше DeepSeek, MiniMax, Qwen, Kimi. Ни OpenAI, ни Google в первой пятёрке нет вообще.

OpenRouter — это не бенчмарк и не маркетинговый лендинг. Через платформу проходит больше 20 триллионов токенов в неделю, и рейтинг там формируется из реальных продакшен-вызовов. Это ведомость того, что разработчики действительно запускают, а не того, что кто-то красиво показал на презентации.

Как менялась доля

Год назад американские модели держали примерно 70% трафика платформы. К середине 2026 года их доля упала примерно до 30%, а модели китайского происхождения перевалили за 60%.

Перелом произошёл в феврале: в неделю с 9 по 15 февраля 2026 китайские модели прогнали через OpenRouter 4,12 трлн токенов против 2,94 трлн у американских — впервые США проиграли по использованию. Дальше разрыв только рос.

Отдельная линия — падение Anthropic. За двенадцать месяцев доля Claude по токенам съехала примерно с 29% до 13%. Выше Claude в рейтинге теперь стоят шесть китайских моделей.

Причина простая — цена

Токены ушли в Китай, деньги остались в США: что показывает статистика OpenRouter

Открытые китайские модели стабильно дешевле лидеров из США на 60–90%, а на краях разрыв доходит до сотни раз. DeepSeek V4 Flash стоит $0.14 за миллион входных токенов. GPT-5.5 — $5.00. GLM 5.2 у Zhipu идёт по $1.40 / $4.40 против $5 / $25 у Opus 4.8.

И это не история про «дёшево, но хуже». На SWE-bench Pro у GLM 5.2 62,1 балла против 58,6 у GPT-5.5. То есть за шестую часть цены вы получаете результат, который на кодинге не проигрывает, а местами выигрывает.

При таких цифрах решение перейти перестаёт быть идеологическим и становится арифметическим. Если у вас агент крутит миллионы токенов в сутки, разница между $0.14 и $5.00 — это не строка в отчёте, это вопрос выживания юнит-экономики.

Но вот что интереснее всего

Anthropic с примерно 12% токенов забирает около половины всех денег платформы.

Тут и прячется главный вывод. Рынок не проигран — он расслоился на две полосы. Есть массовая полоса, где токены дешёвые и их много: суммаризация, классификация, извлечение данных, рутинные правки кода, всё, что можно прогонять пачками. И есть премиальная полоса, где токенов мало, но каждый стоит дорого: сложные рассуждения, длинные агентные цепочки, задачи, где ошибка обходится дороже, чем весь сэкономленный бюджет на инференс.

Китайские модели выиграли первую полосу почти всухую. Вторая пока держится.

Как это выглядит на практике

Я в июле-августе прогнал три реальные задачи на своём сайте через китайские модели из OpenRouter, и цифры получились такие:

  • рефакторинг страниц регистрации и авторизации через MiMo-V2.5 — около 20 центов
  • тёмная тема для сайта через DeepSeek V4 Flash, три промпта, минут двадцать — $0.163
  • виджет «Сейчас читают» с топом статей по просмотрам через GLM 5.2 — $1.30, правок руками вообще не понадобилось

Это не эксперименты ради статьи. Это фичи, которые сейчас работают в продакшене. Суммарно — меньше двух долларов за то, за что раньше я бы платил в десятки раз больше.

Показательно, что MiMo-V2.5, которой я делал рефакторинг, оказалась моделью номер один на платформе по объёму токенов. Выбирал её не по рейтингу — просто она попалась дешёвой и справилась.

Что с этим делать

Токены ушли в Китай, деньги остались в США: что показывает статистика OpenRouter

Вопрос «переходить ли на китайские модели» в 2026 году уже не стоит. Стоит другой: какую модель под какую нагрузку.

Рабочая схема — маршрутизация по типу задачи. Дешёвая открытая модель на объём и рутину, дорогая закрытая на то, где реально нужны рассуждения. Экономия на инференсе при таком подходе выходит 60–80%, и она не стоит вам ничего в качестве, потому что вы не пытаетесь сэкономить там, где экономить нельзя.

Риски, которые стоит держать в голове: данные, уходящие на серверы в Китае, — это отдельный разговор для всего, что попадает под регуляторику. Решение известное: брать открытые веса и хостить у себя или в западном облаке. Тогда модель китайская, а инференс — нет.

Второй риск тише и оттого опаснее. Дешёвые токены провоцируют лить их бесконтрольно. Модель, оптимизированная по цене, на сложной задаче начинает промахиваться, вы уходите в ретраи, и объём токенов растёт — иронично, но именно так дешёвая модель может оказаться дороже.

Итог

Китай выиграл битву за объём. Битва за сложные рассуждения и агентные нагрузки — это вторая половина 2026-го и 2027-й, и там всё ещё открыто.

А для тех, кто просто пишет код и платит за API, вывод уже готов: если вы до сих пор гоняете всё через одну премиальную модель, вы платите за привычку.

Больше про LLM и AI — в нашем Telegram-канале (@devgeek_sh). Разбираем новые модели, делимся опытом и полезными находками.

5