Kimi K3 вышла вчера - обходит Claude, ChatGPT - дешевле на 40% и больше.

16 июля Moonshot AI выпустила Kimi K3 и это знаковая новость, так как закрывать Клода и чатГПТ больше не получится! Далее подробно с тестами и пояснениями

Kimi K3 вышла вчера - обходит Claude, ChatGPT - дешевле на 40% и больше.

Когда 28 мая вышла Claude Opus 4.8, это была самая мощная модель, доступная широкой публике.

16 июля Moonshot AI выпустила Kimi K3 — и на ряде ключевых бенчмарков при максимальном reasoning она обходит Opus 4.8. K3 ставит рекорд на BrowseComp (91.2 — выше и GPT-5.6 Sol, и Fable 5), лидирует на Frontend Code Arena, Automation Bench и SpreadsheetBench, а её результат на GPQA Diamond (93.5%) — лучший среди открытых моделей на сегодня.

Не победила всех, но хороша

По совокупному интеллекту (Artificial Analysis Intelligence Index) K3 идёт четвёртой (~57) — позади Claude Fable 5 (~60) и GPT-5.6 Sol (~59) и чуть впереди Opus 4.8 (~56). На «глубоком» рассуждении — HLE, часть vision-тестов, GPQA против закрытых моделей — Fable 5 и Opus 4.8 сохраняют преимущество. Moonshot и сама пишет, что в целом K3 уступает Fable 5 и Sol. Но в своих полосах — браузинг, агенты, кодинг — она играет на уровне фронтира.

По цене API K3 примерно в 1.7 раза дешевле Opus 4.8 за токен ($3 / $15 за миллион против $5 / $25), а за счёт экономии токенов разрыв в стоимости задачи ещё больше. При этом Moonshot не стала обваливать цену, как обычно делают китайские релизы, — поставила её в средний тариф.

Но главное — не бенчмарки, а лицензия

K3 — открытая. Moonshot обещает выложить все 2.8 трлн параметров 27 июля, и это станет крупнейшей открытой моделью в истории.

Любая закрытая фронтир-модель — это арендованный интеллект: доступ через API, который провайдер может подорожать, депрекейтнуть или выключить.

Прошлый месяц показал, чем это грозит. Экспортное предписание Минторга США заставило Anthropic увести Fable 5 в офлайн по всему миру — с 12 июня по 1 июля. Веса на диске так не выключить: они крутятся на своей инфраструктуре, дообучаются на своих данных, и их нельзя «отрубить» извне.

Оговорка: до 27 июля весов в открытом доступе ещё нет, так что пока K3 — такая же API-модель, как остальные.

Конечно, эту модель не запустить дома, для нее понадобится мини-датацентр.

Kimi K3 вышла вчера - обходит Claude, ChatGPT - дешевле на 40% и больше.

Картинка выше из arena.ai в твиттере

В X (Twitter) релиз Kimi K3 вызвал почти эффект «второго DeepSeek»: разработчики массово делятся результатами тестов, называют модель главным открытым конкурентом Claude и GPT, а многие ожидают, что Anthropic ускорит выпуск следующей версии. Особенно обсуждают лидерство K3 в Frontend Code Arena, открытые веса и возможность запускать модель локально, хотя часть сообщества относится к первым бенчмаркам скептически и призывает дождаться независимых проверок.

Технически Kimi K3 — это открытая MoE-модель с 2,8 трлн параметров, из которых одновременно активны 16 из 896 экспертов (около 50 млрд активных параметров на токен), с контекстом до 1 млн токенов. Полные веса обещаны к 27 июля, но для самостоятельного запуска потребуется очень мощный сервер: ориентировочно не менее 1,4 ТБ видеопамяти, а практически — кластер из 64× NVIDIA H100 80 GB (8 узлов по 8 GPU) или сопоставимая инфраструктура с поддержкой vLLM, TensorRT-LLM или SGLang.

6