Дешёвый китайский ИИ закончился
Случай первый: китайцы подняли цену втрое — и никто не ушёл
Moonshot AI — китайская лаборатория, делает модели Kimi. Раньше их знали ровно по одной причине: почти как у больших, но в разы дешевле.
16 июля вышел Kimi K3, 27-го выложили веса. 2,8 трлн параметров — крупнейшая открытая модель в истории, файл на HuggingFace весит около 594 ГБ.
Но интереснее не параметры, а прайс.
- Предыдущее поколение, K2.6: $0,95 за миллион входных токенов, $4 за выходные
- K3: $3 и $15
Рост в три и почти в четыре раза. За одно поколение.
Где сейчас фронтир для сравнения:
- Claude Opus 5 — $5/$25
- GPT-5.6 Sol — $5/$30
- Grok 4.5 — $2/$6
То есть K3 больше не «в двадцать раз дешевле». Он дешевле Opus 5 примерно на 40%. Это уже не другая ценовая лига — это скидка.
Почему Moonshot решила, что может так сделать. По независимому замеру Artificial Analysis K3 набирает 57 в Intelligence Index — четвёртое место в мире и первое среди открытых моделей. На Frontend Code Arena он обошёл Claude Fable 5 в 76% слепых сравнений разработчиками.
Логика простая: если модель играет в лиге фронтира — она и стоит как фронтир.
Случай второй: американцы поехали вниз
Пока Moonshot поднимала цены, движение с другой стороны шло навстречу.
24 июля Anthropic выпустила Claude Opus 5: $5/$25, при позиционировании «близко к интеллекту Fable 5 за половину цены». 10 июля OpenAI выкатила GPT-5.6 не одной моделью, а линейкой — младшая, Luna, стоит $1/$6. Claude Sonnet 5 стартовал по $2/$10.
За месяц две крупнейшие американские лаборатории заняли ценовой диапазон, который год назад считался территорией китайского опенсорса.
Что тут общего
Разрыв закрывался с двух сторон одновременно. И это ломает стратегию, на которой многие сидели последние полтора года: берём китайскую модель, платим в десять раз меньше, живём.
Три следствия, о которых стоит подумать до того, как это станет проблемой.
Первое. Цена за токен перестала быть правильной метрикой. K3 всегда думает — режим рассуждений у него не отключается. Значит, на одну и ту же задачу он тратит заметно больше выходных токенов, чем модель без обязательного reasoning. Считать надо стоимость выполненной задачи, а не миллион токенов. И разрыв там вполне может оказаться в другую сторону.
Второе. Скорость — это тоже цена. Artificial Analysis намерила у K3 около 32,6 токенов в секунду и медианное время до первого токена в 161 секунду — при отраслевой медиане 2,87 секунды. Для ночной пакетной обработки это неважно. Для чата, автокомплита или любого интерфейса, где человек сидит и ждёт, это делает модель непригодной за любые деньги.
Третье. Веса открыты, и это важнее прайса. K3 лежит под изменённой лицензией MIT. Если есть куда его положить — цена API вас вообще не касается, вы платите за GPU. Так что подорожание бьёт не по всем, а конкретно по тем, кто сидит на чужом хостинге. Заодно решается и вопрос данных: инференс Moonshot держит вне США и ЕС.
Что в этом не так
Цифры по кодингу от самой Moonshot собраны на разных агентных обвязках: где-то KimiCode, где-то Claude Code, где-то mini-SWE-agent. Разные обвязки дают разброс до 10–26 пунктов на одном и том же бенчмарке. Читать эту таблицу как честное сравнение нельзя.
И есть цифра, которой в таблице нет вообще. На бенчмарке AA-Omniscience точность K3 выросла с 33% до 46%, а доля галлюцинаций одновременно поднялась с 39% до 51%. Модель стала чаще отвечать правильно и чаще уверенно врать. Для агентных сценариев без человека в контуре это ровно та проблема, которую не решает никакой прайс-лист.
Отдельно: дешёвый сегмент никуда не делся. DeepSeek V4 по-прежнему отдаёт выходные токены примерно по $0,28 за миллион.
Просто «дешёвый» и «фронтирный» снова стали двумя разными моделями, а не одной.
Вывод
Полтора года стратегия «берите китайское, оно в десять раз дешевле» работала почти без исключений. Сейчас она сломалась — но не потому, что китайские модели стали хуже. Наоборот: они стали хорошими и назначили себе соответствующую цену.
Правильный вопрос больше не «какая модель дешевле». Правильный вопрос — какие задачи в продукте действительно требуют фронтира, а какие закроет модель за доллар. Раньше на этом можно было экономить лениво, одним выбором провайдера. Теперь придётся считать по каждому сценарию.
Больше про LLM и AI — в нашем Telegram-канале (@devgeek_sh). Разбираем новые модели, делимся опытом и полезными находками.