Kimi K3. Первый открытый триллионник

Процедурный 3D-мир с лесом, деревней и динамической погодой. K3 собрала это из одного промпта. Источник: блог Moonshot AI
Процедурный 3D-мир с лесом, деревней и динамической погодой. K3 собрала это из одного промпта. Источник: блог Moonshot AI

14 июля Moonshot AI выпустила Kimi K3. Модель на 2,8 трлн параметров с контекстом в миллион токенов. Я потратил пару дней, чтобы разобраться, на что она годится в реальной работе, и собрал всё в одном месте. Короче, K3. Это не просто "раздутый K2", а совсем другая история. Но есть нюансы.

Сразу по делу. Цифры

Чтобы не тянуть кота за хвост. Вот ключевые параметры K3.

2,8 трлн параметров. Первый открытый релиз, перешагнувший 2 трлн. Для сравнения. K2.5 останавливалась на 1 трлн, а K2.6 на 1,1 трлн.

1 млн токенов контекста. В четыре раза больше, чем у K2.5 (256K). Это уже не "влезет ли кодовая база", а "влезет ли вся документация проекта вместе с кодом".

Нативное зрение. Изображения и видео прямо в промпте, без отдельных эндпоинтов. Скриншот, фото, видео. Кидаешь всё в одну кучу.

Гибридная архитектура. MoE + линейное внимание + остаточные связи. Не буду вдаваться в детали, но суть в том, что модель стала умнее не просто за счёт масштаба, а за счёт новых механизмов.

Но вот засада. Цена выросла в 5-6 раз. Если K2.5 стоил $0,60 за миллион входных токенов, то K3 берёт $3,00. И $15,00 за выходные. Для личных экспериментов это терпимо, для продакшена уже больно.

K2.5 на K3. x2,8 параметров, x4 контекста, x5-6 цена. Цены K2 указаны для сравнения. Линейка всё ещё доступна. Инфографика автора
K2.5 на K3. x2,8 параметров, x4 контекста, x5-6 цена. Цены K2 указаны для сравнения. Линейка всё ещё доступна. Инфографика автора

Архитектура. Три новых костыля вместо одного

Шучу, конечно, не костыля, а фичи. Но звучит менее пафосно, чем "три ключевых изменения". Вот что поменялось под капотом.

Kimi Delta Attention (KDA). Гибрид линейного внимания и Gated MLA. Линейное внимание. Это когда модель не пересчитывает всё заново для каждого нового токена, а накапливает состояние. Результат: скорость выросла, память жрётся меньше. KDA. Это как FlashAttention, но заточенный под Moonshot.

Attention Residuals (AttnRes). Остаточные связи для внимания. Вместо того чтобы каждый слой начинал с нуля, он получает "наследство" от предыдущего. В теории это должно улучшить глубокие рассуждения. На практике смотрим бенчмарки.

Stable LatentMoE. 896 экспертов, но активны только 16 на каждый токен. У K2 было 256 экспертов и 8 активных. То есть K3 в 3,5 раза разреженнее, но при этом умнее. Как так. За счёт лучшей специализации экспертов. Каждый отвечает за узкую задачу.

Упрощённая схема. Остов Block Attention Residuals, внутри KDA + Gated MLA и Stable LatentMoE. Инфографика автора по данным блога K3
Упрощённая схема. Остов Block Attention Residuals, внутри KDA + Gated MLA и Stable LatentMoE. Инфографика автора по данным блога K3

Moonshot заявляет, что эффективность масштабирования выросла в 2,5 раза относительно K2. То есть каждый новый параметр даёт в 2,5 раза больше пользы. Проверить это независимо пока сложно. Ждём репликаций от сообщества.

Бенчмарки. Где K3 рвёт, а где сливает

Все цифры ниже из официального блога Moonshot, режим max thinking. Независимых проверок на момент публикации ещё нет, так что относись к ним как к маркетинговым. С долей скепсиса.

Шесть показательных бенчмарков из полной таблицы. Инфографика автора по данным блога K3
Шесть показательных бенчмарков из полной таблицы. Инфографика автора по данным блога K3

Картина неоднородная.

BrowseComp 91,2. Рекорд. Поиск труднодоступной информации в вебе одиночным агентом. Интересная деталь. K3 обошла GPT 5.6 Sol (85,6) и Claude Fable 5 (82,1), хотя те закрытые и дорогие.

SWE Marathon 42,0. Лучший результат среди всех. Длинные сессии программирования (до 12 часов), где K3 обошла даже Fable 5 (35,0) и GPT 5.6 Sol (39,0).

Но в DeepSWE. 67,5 против 73,0 у GPT 5.6 Sol. То есть в сложном программировании с инструментами лидерство не удержала.

HLE с инструментами. 56,0 против 63,0 у Fable 5. И MMLU-Pro. 82,4 против 86,2 у Fable 5. В "зубастых" академических тестах K3 уступает.

Вывод. K3 сильна в длинных агентных задачах и поиске, но в "классических" бенчмарках типа MMLU и HumanEval уступает закрытым лидерам. Это не баг, а фича. Модель заточена под другой профиль.

Агентные Elo-рейтинги. K3 на уверенном третьем месте после двух закрытых лидеров. Инфографика автора по данным Artificial Analysis

По Elo-рейтингам профессиональных задач (GDPval-AA v2) и длинных агентных сценариев (AA-Briefcase) K3 занимает третье место. После Claude Fable 5 и GPT 5.6 Sol. Для открытой модели это отличный результат, но до абсолютного лидерства ещё далеко.

Что K3 делает руками. Кейсы из блога

Игры и 3D с нуля

K3 пишет код, смотрит скриншот, правит. И так по кругу. Получаются вполне играбельные демки.

Воксельный Колизей с толпой и живым FPS-счётчиком. Источник: блог Kimi K3"Gargantua". Интерактивная визуализация сверхмассивной чёрной дыры. Источник: блог Kimi K3
Воксельный Колизей с толпой и живым FPS-счётчиком. Источник: блог Kimi K3"Gargantua". Интерактивная визуализация сверхмассивной чёрной дыры. Источник: блог Kimi K3
"Gargantua". Интерактивная визуализация сверхмассивной чёрной дыры. Источник: блог Kimi K3
"Gargantua". Интерактивная визуализация сверхмассивной чёрной дыры. Источник: блог Kimi K3

Инженерия, которая раньше занимала недели

Оптимизация GPU-ядер. За 15 часов итераций K3 ускорила тренировочное ядро AttnRes с 283 до 1027 TFLOPS. Для сравнения. Команда инженеров NVIDIA на это тратила недели.

Компилятор с нуля. MiniTriton. Triton-подобный компилятор с собственным tile-IR поверх MLIR. Собран за 72 часа, проходит 95% тестов оригинала.

Чип за 48 часов. В одной сессии K3 спроектировала и верифицировала чип под нано-модель. От Verilog до физического дизайна и STA-отчёта.

Наука. Воспроизведение универсальных соотношений I-Love-Q в астрофизике. 20+ статей, формулы, код, графики. Всё за 12 часов.

Отдельно впечатляет видеомонтаж. K3 смонтировала собственный тизер из 56 исходных клипов. Отбор дублей, цветокоррекция, звуковое оформление. Не идеально, но для автоматики очень прилично.

Мой тест. 3D-аквариум с акулой из одного промпта

Чтобы проверить K3 в деле, я попросил собрать интерактивный 3D-аквариум. Одним HTML-файлом, без внешних зависимостей. Получил 1523 строки (676 КБ), Three.js встроен инлайн. Файл просто открывается в браузере. Никакого npm, сборки и сервера.

3D-аквариум. Акула на патрулировании, каустика на песке, водоросли, пузыри. 
3D-аквариум. Акула на патрулировании, каустика на песке, водоросли, пузыри. 

промт можно найти по ссылке

Что внутри.

Стейт-машина акулы. Пять состояний. PATROL, HUNT, ATTACK, SWALLOW, GULP. Хищник сам выбирает жертву, преследует, атакует.

Стая рыб. Пул до 30 особей, падают сверху при кормлении, стаятся, уворачиваются от акулы.

Физика. 600 частиц всплесков, пузырьки, кольца на воде, каустика на дне.

Glassmorphism-UI. Панель со счётчиком, кнопка "Подкормить", управление камерой мышью и колесом.

Задача смешанная. 3D-математика (кватернионы, slerp), поведенческая логика (стейт-машина, flocking), UI (Glassmorphism), физика частиц. K3 справилась с первого раза. Без доработок. Для сравнения. K2.5 на этом же промпте застрял на физике рыб.

Демо-файл аквариума по ссылке

Цены. Больно, но есть лазейка

Kimi K3. Первый открытый триллионник

Рост в 5-6 раз относительно K2. Главный аргумент против. Но есть и аргумент за. Дизагрегированная инференс-архитектура. K3 разбивает запрос на мелкие задачи, распределяет по экспертам. Итоговая цена получается ниже, чем если бы всё считалось полным forward pass. Для длинных задач с повторяющимися контекстами вполне рабочая схема.

Доступ: kimi.com, десктопное Kimi Work (3.1.0+), Kimi Code в терминале и API (kimi-k3). По умолчанию включён max thinking. Не забудь выключить, если не нужен.

Ограничения, о которых молчат в рекламе

Чувствительность к истории размышлений. K3 обучена сохранять thinking history. Если в промпте не вернуть модель к исходной задаче, она может уйти в сторону. Проверял. После трёх уточняющих вопросов K3 начала решать совсем другую задачу.

Избыточная проактивность. Модель заточена под длинные задачи и при неоднозначности принимает решения за пользователя. Иногда это удобно, иногда нет. Особенно когда она "решает" за тебя, что ты имел в виду.

Разрыв в UX. Сама Moonshot признаёт. По пользовательскому опыту K3 уступает Claude Fable 5 и GPT 5.6 Sol. Интерфейс сыроват, иногда лагает, агентный режим требует привыкания.

K2.5 или K3. Что выбрать?

K2.5. Рабочая лошадка. Если задачи укладываются в 256K контекста, важна цена и нужна предсказуемость. Бери K2.5. Он дешевле, стабильнее, лучше документирован.

K3. Когда контекст реально большой. Вся кодовая база, реестр требований, корпус нормативной документации. Всё в одном запросе. Или когда нужен агентный поиск с длинным сценарием. Но готовься платить.

Мой вывод как практика. K2.5 на K3. Это не минорный апдейт, а смена класса. K2 остаётся в сегменте "лучшее из открытого по цене". K3 претендует на "лучшее из открытого по возможностям". Но до закрытых лидеров ещё пилить и пилить.

Дисклеймер. Все бенчмарки из официального блога Moonshot. Замеры вендора, режим max thinking. Независимая верификация ещё не проводилась. Аквариум собственный тест автора, файл выложен для проверки.

#искусственныйинтеллект#Kimi#MoonshotAI#LLM#открытыемодели#бенчмарки

Источники.

  • Kimi K3 Tech Blog: Open Frontier Intelligence. Официальный анонс, полная таблица бенчмарков, кейсы, ограничения (14.07.2026)
  • Kimi API Platform. Цены: $0,30 / $3,00 / $15,00 за 1M токенов
  • Kimi K2 (Wikipedia). Хронология линейки K2
  • Artificial Analysis. Elo-рейтинги GDPval-AA v2 и AA-Briefcase
  • Хабр. Русскоязычный разбор релиза K3

Иллюстрации: скриншоты кейсов из официального блога Kimi K3. Диаграммы авторская инфографика по данным блога. Аквариум собственный тест автора.

1