Дешёвый китайский ИИ закончился

Дешёвый китайский ИИ закончился

Случай первый: китайцы подняли цену втрое — и никто не ушёл

Moonshot AI — китайская лаборатория, делает модели Kimi. Раньше их знали ровно по одной причине: почти как у больших, но в разы дешевле.

16 июля вышел Kimi K3, 27-го выложили веса. 2,8 трлн параметров — крупнейшая открытая модель в истории, файл на HuggingFace весит около 594 ГБ.

Но интереснее не параметры, а прайс.

  • Предыдущее поколение, K2.6: $0,95 за миллион входных токенов, $4 за выходные
  • K3: $3 и $15

Рост в три и почти в четыре раза. За одно поколение.

Где сейчас фронтир для сравнения:

  • Claude Opus 5 — $5/$25
  • GPT-5.6 Sol — $5/$30
  • Grok 4.5 — $2/$6

То есть K3 больше не «в двадцать раз дешевле». Он дешевле Opus 5 примерно на 40%. Это уже не другая ценовая лига — это скидка.

Почему Moonshot решила, что может так сделать. По независимому замеру Artificial Analysis K3 набирает 57 в Intelligence Index — четвёртое место в мире и первое среди открытых моделей. На Frontend Code Arena он обошёл Claude Fable 5 в 76% слепых сравнений разработчиками.

Логика простая: если модель играет в лиге фронтира — она и стоит как фронтир.

Дешёвый китайский ИИ закончился

Случай второй: американцы поехали вниз

Пока Moonshot поднимала цены, движение с другой стороны шло навстречу.

24 июля Anthropic выпустила Claude Opus 5: $5/$25, при позиционировании «близко к интеллекту Fable 5 за половину цены». 10 июля OpenAI выкатила GPT-5.6 не одной моделью, а линейкой — младшая, Luna, стоит $1/$6. Claude Sonnet 5 стартовал по $2/$10.

За месяц две крупнейшие американские лаборатории заняли ценовой диапазон, который год назад считался территорией китайского опенсорса.

Что тут общего

Дешёвый китайский ИИ закончился

Разрыв закрывался с двух сторон одновременно. И это ломает стратегию, на которой многие сидели последние полтора года: берём китайскую модель, платим в десять раз меньше, живём.

Три следствия, о которых стоит подумать до того, как это станет проблемой.

Первое. Цена за токен перестала быть правильной метрикой. K3 всегда думает — режим рассуждений у него не отключается. Значит, на одну и ту же задачу он тратит заметно больше выходных токенов, чем модель без обязательного reasoning. Считать надо стоимость выполненной задачи, а не миллион токенов. И разрыв там вполне может оказаться в другую сторону.

Второе. Скорость — это тоже цена. Artificial Analysis намерила у K3 около 32,6 токенов в секунду и медианное время до первого токена в 161 секунду — при отраслевой медиане 2,87 секунды. Для ночной пакетной обработки это неважно. Для чата, автокомплита или любого интерфейса, где человек сидит и ждёт, это делает модель непригодной за любые деньги.

Третье. Веса открыты, и это важнее прайса. K3 лежит под изменённой лицензией MIT. Если есть куда его положить — цена API вас вообще не касается, вы платите за GPU. Так что подорожание бьёт не по всем, а конкретно по тем, кто сидит на чужом хостинге. Заодно решается и вопрос данных: инференс Moonshot держит вне США и ЕС.

Что в этом не так

Цифры по кодингу от самой Moonshot собраны на разных агентных обвязках: где-то KimiCode, где-то Claude Code, где-то mini-SWE-agent. Разные обвязки дают разброс до 10–26 пунктов на одном и том же бенчмарке. Читать эту таблицу как честное сравнение нельзя.

И есть цифра, которой в таблице нет вообще. На бенчмарке AA-Omniscience точность K3 выросла с 33% до 46%, а доля галлюцинаций одновременно поднялась с 39% до 51%. Модель стала чаще отвечать правильно и чаще уверенно врать. Для агентных сценариев без человека в контуре это ровно та проблема, которую не решает никакой прайс-лист.

Отдельно: дешёвый сегмент никуда не делся. DeepSeek V4 по-прежнему отдаёт выходные токены примерно по $0,28 за миллион.

Просто «дешёвый» и «фронтирный» снова стали двумя разными моделями, а не одной.

Вывод

Полтора года стратегия «берите китайское, оно в десять раз дешевле» работала почти без исключений. Сейчас она сломалась — но не потому, что китайские модели стали хуже. Наоборот: они стали хорошими и назначили себе соответствующую цену.

Правильный вопрос больше не «какая модель дешевле». Правильный вопрос — какие задачи в продукте действительно требуют фронтира, а какие закроет модель за доллар. Раньше на этом можно было экономить лениво, одним выбором провайдера. Теперь придётся считать по каждому сценарию.

Больше про LLM и AI — в нашем Telegram-канале (@devgeek_sh). Разбираем новые модели, делимся опытом и полезными находками.

7