Alibaba, Kimi, OpenCode — кто даёт больше токенов за доллар? Цифры после месяца тестов

Я плачу за подписки на LLM и хотел понять, насколько это выгодно. Какой уровень реальных дотаций со стороны поставщиков. Понять это из описания тарифов практически невозможно. Не «какая модель умнее» и не «какая быстрее» — это отдельные темы. Меня интересовало одно: уровень дотаций. Сколько рыночных токенов подписка отдаёт за каждый заплаченный доллар.

Важно: все цифры ниже — данные одного пользователя с агентным профилем работы (кэш 89–96%, контексты 100K+). Для чат-профиля без кэша результаты будут другими.

Метод простой. Я поднял локальный шлюз — OpenAI-совместимый прокси. Все мои агенты на нескольких машинах ходят к провайдерам через него. Шлюз пишет в базу каждый запрос: модель, токены, попадания в кэш. Кэш важен — без него рыночная цена считается неверно.

Дальше — месяц реальной работы. Потом честная чистка данных: часть трафика ходила мимо шлюза, это утечки. Слепой период в начале я восстановил по консолям провайдеров и калибровке квот. Сверка на «выжженной до 100%» неделе сошлась с консолью Alibaba с точностью 0.3%. Картина не идеальная, но показательная — и совпадает с ощущениями.

Z.AI я из рейтинга выбросил: мной была куплена годовая подписка ещё до первого изменения тарифов, потом было второе изменение. Не оценивается.

Результат: дотация за последний полный месяц

Рыночная стоимость = тот же трафик, купленный по обычному API-прайсу (pay-as-you-go). Дотация = рынок / цена подписки.

Alibaba, Kimi, OpenCode — кто даёт больше токенов за доллар? Цифры после месяца тестов

За весь период (полтора месяца): $370 рынка за $134 подписок — 2.76× в среднем. Это с простоями: у Kimi и OpenCode месяц закончился исчерпанием квот.

Что я понял по ходу

1. Квоты — главный ограничитель, и они не в токенах. Подписка не даёт жечь сколько хочешь. «Лимит недели» — не число токенов:

  • Alibaba — квота не в токенах. Две 100%-недели дали 74.5M и 154M токенов, flash-неделя — 620M на 90%+. Зато сходятся uncached-токены: 25–35M на исчерпании. Гипотеза: квота считается по uncached-токенам, кэш-хиты почти не расходуют лимит. Если так, то дотация радикально зависит от того, что ты жжёшь: неделя на max-моделях ≈ $78 рынка (потолок ~19×), на flash ≈ $20 (потолок ~3.4×). В реале получилось 7.4× — микс. Решающий эксперимент не проводился, но наблюдаемый факт железный: на flash квота живёт дольше, а в деньгах — скромнее.
  • Kimi режется месячным капом. Рекордная неделя давала $74 рынка (потолок был бы 8×), но месяц закрылся на ~$198. 5-часовые окна мешают, только если долбить в упор.
  • OpenCode Go: месячная квота маленькая. 3.5× — это не «я недожал», это потолок. Квота выбрана вся. Когда кончилась — CreditsError. Справедливости ради: были ещё два подарочных сертификата по $5, которые в шлюзе не видны. С ними реальная дотация могла быть ниже — где-то 1.75–3.49×, но проверить уже нечем.

2. Прямые сессии дёшевы в долларах, но дороги в квоте. За два дня я слил напрямую 500M токенов — неделя сгорела на 90%+. По рынку это всего ~$16: flash-модели и 95% кэша. Следить надо не за токенами, а за кредитами квоты.

3. Лучшая дотация — не равно лучший выбор. Kimi даёт больше абсолютных долларов дотации ($159/мес), но Alibaba за $18 даёт 7.4×, стабильную работу и большой выбор моделей. Мой выбор — Alibaba: базовый ворклоуд на нём, Kimi — когда нужна конкретная модель. OpenCode Go не продлеваю. У Alibaba перейду на более дорогой тариф.

Статистика из логов шлюза

Пока считал дотации, логи показали ещё несколько интересных вещей.

Половина output — это мышление. Reasoning-токены составляют 42–64% completion у всех моделей: qwen3.8-max 60%, glm-5.3 64%, kimi-for-coding 52%. Считаешь стоимость агента — считай и его размышления, они тарифицируются как обычный output.

Кэш работает сам. У Kimi не было ни одного запроса с промптом больше 10K без кэш-хита. Неявное кэширование включено у провайдеров по умолчанию. Агентские ворклоуды получают 89–98% попаданий без каких-либо настроек. Важно: кэш-запись провайдеры в usage не отдают — в счёте она уходит в «обычный» вход. Рыночная оценка из-за этого чуть занижена, но не сильно.

Дорогие запросы — это холодный гигантский контекст. Медианный запрос стоит копейки ($0.05–0.2). Топ-3 за всё время: glm-5.2 с промптом 200–234K и кэш-хитом 2–4% — по $3+ каждый. Один холодный старт большой сессии стоит как 50 обычных запросов.

Контексты у агентов большие, но стабильные. Медиана по провайдерам 77–146K, средний запрос ~120K промпта. Роста по неделям нет — агенты не раздувают контекст со временем.

Скорость тоже разная. Медианный ответ: alibaba 9.4 секунды, kimi 13.1 — самый медленный (в среднем 23 с). Быстрее всех был zai, но он не в рейтинге. Максимумы — до 16 минут, это длинные генерации, не ошибки. Оборванных стримов за всё время ноль.

Если хочешь повторить

Нужен шлюз, через который идёт весь трафик. Учёт по моделям и кэшу обязателен. Утечки будут — нормируй по консолям провайдеров и квотам. Один полный месяц на провайдера — достаточная база. Цены бери из прайсов на дату расчёта, они меняются.

Данные: июль–сентябрь 2026, ~11.5k запросов через шлюз. Ставки — официальные прайсы и models.dev на сентябрь 2026.

Хочешь повторить или проверить — передам код шлюза и логи.