Как я запустил агентов на моделях в 60 раз дешевле Claude Opus

$0.08 за миллион токенов. Столько стоит Gemma 4. Claude Opus 4.7 - $5. Та же задача, разница в 62 раза.

Очевидный вопрос: может ли модель за такие деньги реально работать как агент? Месяц тестов в продакшене дал ответ. Но не такой, как я ожидал.

Как я запустил агентов на моделях в 60 раз дешевле Claude Opus

Главный инсайт

Чем умнее модель - тем меньше требований к фреймворку. Чем дешевле модель - тем больше должен делать фреймворк.

Opus прощает плохие промпты, раздутый контекст, кривые схемы инструментов. Он компенсирует. Дешёвые модели не компенсируют. Любая слабость фреймворка вылезает мгновенно.

Как я сначала сдался

Несколько месяцев назад я бросил эксперименты с дешёвыми моделями. Потратил недели, пытаясь выжать из них поведение уровня Claude Code. Ничего не держалось.

Переключился на Opus - результаты пошли почти сразу.

Ушёл с мыслью: дешёвые модели не готовы.

Я ошибался. Не готов был мой фреймворк.

Вернулся к ним с новыми знаниями. Сейчас три модели реально работают через Tuplet - мой open source фреймворк для агентов.

Три модели, которые выжили в продакшене

Kimi K2.5 - $0.40/M

Хорошо планирует. Держит длинный контекст. Задаёт точные уточняющие вопросы. Первая дешёвая модель, которой я поверил.

Проблема: на OpenRouter отвечает мучительно медленно. Рассуждения нормальные, латентность убивает. Если знаете более быстрого провайдера - напишите в комментариях.

Qwen 3.5 26B - $0.20/M

Сначала не работала. Слишком много стартового контекста - модель терялась ещё до старта реальной работы.

Заработала только после двух вещей в Tuplet:

  • Deferred tool loading - инструменты подгружаются по требованию, а не все схемы сразу дампятся в системный промпт
  • Skills - точечные инструкции вместо раздутого prompt

Контекст на старте упал кратно. Qwen начала чисто планировать и выполнять многошаговые задачи.

Урок: дешёвым моделям не нужны более умные промпты. Им нужны меньшие.

Gemma 4 - $0.08/M

Самая дешёвая из трёх. Разумное рассуждение. Одна особенность: иногда заворачивает tool call в формат, от которого падает парсер.

Решено на уровне фреймворка. Tuplet это поглощает. Подключаешь Gemma 4 - получаешь чистый output агента.

Что ещё не решено: task management

Task management на дешёвых моделях пока хрупкий. После 30+ шагов модели дрейфуют. Перестают обновлять статусы. Начинают заново выполненные задачи. Теряют нить.

Это не проблема модели. Это проблема фреймворка. Сейчас я выношу состояние задач из модели в сам Tuplet - реестр, который модель читает, но не владеет им.

Что открывается на sub-$1/M

  • Фоновые агенты, которые работают часами без бюджетных ограничений
  • Персональные ассистенты без счётчика
  • Batch-пайплайны, которые не окупались на Opus

Полную конфигурацию выложу, когда допилю task management.

Вывод

Дешёвые модели готовы к продакшену. Но не сами по себе - фреймворк должен поглощать то, что раньше компенсировала дорогая модель.

Кто ещё гоняет дешёвые модели в продакшене? Что пришлось компенсировать именно в фреймворке - поделитесь в комментариях.