Открытые веса против закрытых API: где в 2026 году проходит реальная граница

Открытые модели перестали быть компромиссом для энтузиастов. Qwen3.8-Max, DeepSeek V4 и Kimi K3 дают контекст в миллион токенов и цены в разы ниже флагманов OpenAI и Anthropic. Но оценки Epoch AI показывают: разрыв не исчез — он стал менее заметным.
Открытые модели перестали быть компромиссом для энтузиастов. Qwen3.8-Max, DeepSeek V4 и Kimi K3 дают контекст в миллион токенов и цены в разы ниже флагманов OpenAI и Anthropic. Но оценки Epoch AI показывают: разрыв не исчез — он стал менее заметным.

Миллион токенов больше не преимущество

Alibaba выпустила Qwen3.8-Max — флагманскую MoE-модель на 2,4 трлн параметров, из которых 95 млрд активны на каждый токен. Контекст — 1 млн токенов. В API это $2 за млн входных и $6 за млн выходных токенов, что в два с половиной раза дешевле Kimi K3 и более чем в четыре раза дешевле Claude Opus 5, у которого $5 за вход и $25 за выход при закрытых весах.

DeepSeek V4 вышел 24 апреля 2026 как Preview — ровно две модели. deepseek-v4-pro на 1,6 трлн параметров с 49 млрд активных и deepseek-v4-flash на 284 млрд с 13 млрд активных, обе с открытыми весами под лицензией MIT. Для сравнения: у Claude Opus 5 веса закрыты, а кэш входного токена стоит $0,50.

Kimi K3 от Moonshot AI — 2,8 трлн параметров, 104 млрд активных на токен, контекст 1 048 576 токенов, веса выложены на Hugging Face 26–27 июля 2026. Архитектура — Kimi Delta Attention и Attention Residuals, Stable LatentMoE активирует 16 из 896 экспертов, заявлено примерно 2,5-кратное улучшение масштабируемости против K2. Энкодер MoonViT-V2 на 401M параметров, квантование MXFP4 для весов и MXFP8 для активаций, всегда включённое мышление с уровнями low, high и max.

Структура Kimi K3 раскрыта детально: 93 слоя, из них один dense, 69 блоков KDA и 24 Gated MLA, 96 голов, hidden 7168, латентный MoE 3584, помимо 16 активных экспертов ещё 2 shared, активация SiTU-GLU, словарь 160K токенов. Это уже не исследовательский прототип, а инженерная система промышленного класса.

Лицензия важнее размера модели

Ключевая ошибка при разговоре об «открытости» — считать все открытые модели одинаково свободными. На практике лицензии различаются радикально. Qwen3.5-Plus распространяется под Apache 2.0, что допускает дообучение и встраивание в продукт без ограничений. Но Qwen3.6-Plus и Qwen3.5-Omni вышли как проприетарные, а открытым остался только Qwen3.6-35B-A3B под Apache 2.0. У DeepSeek вся линейка — V4-Pro, V4-Flash, V3.2, V3.1, R1 — под MIT.

Особый случай — Kimi K3. Собственная лицензия Kimi K3 License формально открывает веса, но это не Apache 2.0 и не MIT, а значит перед Self-hosted запуском требуется отдельное чтение условий. И отдельно стоит держать в голове: веса Qwen3.8-Max пока только обещаны на Hugging Face и ModelScope. Это первая Max-модель Qwen с заявленными открытыми весами, вместе с ней анонсирована Qwen3.8-27B, но обещание и опубликованный чекпойнт — разные стадии.

Что проверять перед локальным запуском:

— Лицензию на официальной карточке модели: MIT и Apache 2.0 допускают коммерческое встраивание, Kimi K3 License требует отдельного разбора.

— Требования к железу: полнопрецизионный флагман Kimi K3 поднимается на узле из 8xB300, альтернатива — динамические 1-битные и 2-битные GGUF от Unsloth.

— Формат квантования: MXFP4 для весов и MXFP8 для активаций у Kimi K3, GGUF Q4_K_M для Qwen3.5-Plus.

— Запас по памяти и пропускной способности: миллион токенов в карточке модели и миллион токенов в продуктивной эксплуатации — не одно и то же.

— Инструменты запуска: LM Studio на движке llama.cpp для GGUF и MLX на Apple Silicon, Ollama, llama.cpp, vLLM.

— Версию рантайма: в LM Studio с версии 0.4 появился headless-демон llmster, разделяющий графический интерфейс и инференс.

Цена токена — самый мутный параметр

С 16 августа 2026 DeepSeek перешёл на тарификацию пик/непик. Непиковый тариф ровно вдвое ниже пикового, а пик длится 7 часов в сутки — с 01:00 до 04:00 и с 06:00 до 10:00 по UTC. Попадание в кэш стоит около 3% от цены промаха. На serving Moonshot через Mooncake зафиксированы 90% cache hit на задачах кодинга и цена кэшированного входа $0,30 за млн токенов.

Проблема в том, что цифры по DeepSeek расходятся между источниками. Часть публикаций приводит для V4 Pro $0,435 за млн входных токенов и $0,87 за млн выходных как промо-цену, при обычной $1,74 и $3,48. Другие фиксируют с середины августа тарифы непик $0,66 и $1,98 против пиковых $1,32 и $3,96. Расхождение более чем двукратное, и это самостоятельный вывод: любой бюджет на API нужно перепроверять по актуальному прайс-листу, а не по статьям полугодовой давности.

Для контекста: у западных провайдеров кэш-хиты снижают стоимость входа в 50–100 раз, а DeepSeek по стоимости токена оказывается в десятки раз дешевле флагманов. Но кэш работает только при повторяющихся префиксах — в агентных сценариях с длинной системной инструкцией это выполняется часто, в разовых запросах почти никогда.

Бенчмарки льстят открытым моделям

Оценка Epoch AI: с января 2026 лучшие модели с открытыми весами в среднем отстают от закрытого фронтира на 4 месяца, что эквивалентно примерно 8 пунктам по составному индексу ECI. Отдельное предупреждение аналитиков — публичные бенчмарки могут льстить открытым моделям, поскольку тесты проще оптимизировать под конкретный набор задач.

Закрытый лагерь отвечает не цифрами параметров, а результатами. GPT-6 Astra начала раскатываться 3 сентября 2026, в API это gpt-6-astra, стандартная цена $10 за млн входных и $50 за млн выходных токенов, быстрый режим вдвое дороже за двукратную скорость. На Terminal-Bench 4.0 Astra даёт 57,9% против 55,8% у Fable 5.1 и 37,3% у Sol, при этом задача оценивается на 63% дешевле, чем у Fable 5.1.

Показательны и открытые результаты Kimi K3: GPQA Diamond 93,5, BrowseComp 91,2, Terminal-Bench 2.1 88,3, DeepSWE 67,5, FrontierSWE 81,2, SWE-Marathon 42,0. По агентным задачам открытая модель уже стоит в одном ряду с закрытыми — именно поэтому аргумент «открытые догонят через пару лет» потерял смысл. Они догоняют сейчас, просто с лагом в несколько месяцев.

Кому выгоден миф о бесплатном фронтире

Первый провокационный тезис: открытые веса давно стали маркетинговым инструментом, а не подарком сообществу. Опубликовать чекпойнт на Hugging Face и оставить лицензию с ограничениями — распространённая практика. Kimi K3 License, смешанные лицензии Qwen, заявленные, но ещё не опубликованные веса Qwen3.8-Max — всё это формирует образ открытости, не давая полной свободы.

Второй тезис: экономия на токенах перестала быть решающим аргументом. При кэш-хитах разрыв частично съедается, а стоимость интеграции, доработки пайплайнов, оценки качества и поддержки инфраструктуры никуда не исчезает. Разница в цене между $2 и $5 за млн входных токенов ничего не значит, если решение придётся три месяца доводить до продакшена.

Что предлагает закрытый лагерь помимо модели

Аргументы Anthropic и OpenAI строятся не на параметрах, а на сервисе. У Claude в 2026 году Free за $0, Pro за $20 в месяц, Max за $100 на пять пользователей или $200 на двадцать, Team от $25 за место, Enterprise по запросу. API — это отдельный кошелёк: Claude Opus 5 по $5 и $25 за млн токенов, Sonnet 5 по $2 и $10 при постоянной вводной цене, Haiku 4.5 по $1 и $5, Claude Fable 5 по $10 и $50.

У OpenAI линейка шире по бюджету: GPT-5.5 по $5 и $30, GPT-5.4 по $2,50 и $15, GPT-5.4-mini по $0,75 и $4,50, GPT-5.4-nano по $0,20 и $1,25. Для сравнения, Claude Opus 4.8 — $5 за вход и $25 за выход. Grok 4.6 — $2 и $6. Claude Fable 5 — $10 и $50.

Практический опыт показателен: DeepSeek V4 Pro подключается напрямую к Claude Code, и пользователи отмечают прогресс в кодинге и вызове инструментов. Но сам факт такой интеграции говорит о другом — стандарты агентных интерфейсов задают закрытые среды, а открытые модели к ним адаптируются.

Где уже побеждает локальный запуск

Локальный сценарий за год подешевел радикально. Qwen3.5-Plus — флагман на архитектуре MoE 397B с 17B активных, контекст 1 млн токенов, открытые веса Apache 2.0. Для запуска достаточно RTX 3090 или RTX 4090 с 24 ГБ VRAM, скорость в квантовании Q4_K_M — 35–45 токенов в секунду на одной карте, что в 8,6 раза быстрее предыдущего поколения. GPQA Diamond — около 85% против 91% у Claude Opus 4.7. Мультиязычность — 201 язык.

LM Studio при этом закрывает бытовой сценарий: macOS на Apple Silicon, Windows x64 с AVX2, Linux x64 и ARM64, от 16 ГБ RAM и GPU опционально от 4 ГБ VRAM. Четырёхбитные GGUF-кванты дают качество, близкое к FP16, при заметно меньшем расходе памяти.

Сводка по рынку середины 2026 года выглядит так: DeepSeek V4 с контекстом 1 млн токенов стоит около $0,32 за млн, Qwen 3.5 с 397B MoE и 119+ языками — около $1,14, GLM 5 от Zhipu на 355B MoE с окном 200K — около $0,90, MiniMax M2.7 с окном 205K — около $0,75. Разброс в разы, и лицензию каждой модели необходимо проверять на официальной карточке перед Self-hosted запуском.

Красные флаги в любом сравнении цен:

— Тариф зависит от времени суток: у DeepSeek пик занимает 7 часов в сутки и удваивает стоимость запросов.

— Кэш-хиты у западных провайдеров снижают цену входа в 50–100 раз, а у DeepSeek кэш стоит около 3% от цены промаха.

— Лицензия важнее цены: MIT у линейки DeepSeek, Apache 2.0 у части Qwen, собственная Kimi K3 License у Moonshot.

— Публичный бенчмарк может льстить открытой модели, если тест легко оптимизировать под конкретный набор задач.

— Обещанные веса не равны открытым весам: у Qwen3.8-Max публикация только заявлена.

Что делать читателю

Первое: не выбирать модель по одной цифре. Параметры, цена и результат на бенчмарке описывают разные вещи, и ни один из этих показателей не отвечает на вопрос, справится ли модель с конкретным пайплайном.

Второе: проверять лицензию до, а не после технического решения. Apache 2.0 и MIT дают свободу встраивания, Kimi K3 License и проприетарные Qwen-модели требуют юридической сверки.

Третье: считать не цену токена, а стоимость задачи. Кэш-хиты, режимы пик/непик, длина контекста и число повторных вызовов в агентной цепочке меняют итог в разы сильнее, чем разница в прайс-листе.

Четвёртое: держать гибридную архитектуру. Открытая модель на локальном железе закрывает чувствительные данные и массовые операции, закрытый API — сложные агентные задачи, где важны стабильность вызова инструментов и качество рассуждений. Epoch AI оценивает отставание открытого фронтира в 4 месяца — это достаточно, чтобы строить на открытых весах, но недостаточно, чтобы объявлять гонку законченной.

✍ Автор: Neo AI Radar — обзоры ИИ-инструментов и нейросетей.

✅ Подписывайтесь на канал ВК или ТГ

⚠ Информация носит познавательный характер. Инструменты и подходы меняются — проверяйте актуальность перед использованием.

✅ Подписывайтесь на канал и ставьте лайк!