Как я запустил агентов на моделях в 60 раз дешевле Claude Opus
$0.08 за миллион токенов. Столько стоит Gemma 4. Claude Opus 4.7 - $5. Та же задача, разница в 62 раза.
Очевидный вопрос: может ли модель за такие деньги реально работать как агент? Месяц тестов в продакшене дал ответ. Но не такой, как я ожидал.
Главный инсайт
Чем умнее модель - тем меньше требований к фреймворку. Чем дешевле модель - тем больше должен делать фреймворк.
Opus прощает плохие промпты, раздутый контекст, кривые схемы инструментов. Он компенсирует. Дешёвые модели не компенсируют. Любая слабость фреймворка вылезает мгновенно.
Как я сначала сдался
Несколько месяцев назад я бросил эксперименты с дешёвыми моделями. Потратил недели, пытаясь выжать из них поведение уровня Claude Code. Ничего не держалось.
Переключился на Opus - результаты пошли почти сразу.
Ушёл с мыслью: дешёвые модели не готовы.
Я ошибался. Не готов был мой фреймворк.
Вернулся к ним с новыми знаниями. Сейчас три модели реально работают через Tuplet - мой open source фреймворк для агентов.
Три модели, которые выжили в продакшене
Kimi K2.5 - $0.40/M
Хорошо планирует. Держит длинный контекст. Задаёт точные уточняющие вопросы. Первая дешёвая модель, которой я поверил.
Проблема: на OpenRouter отвечает мучительно медленно. Рассуждения нормальные, латентность убивает. Если знаете более быстрого провайдера - напишите в комментариях.
Qwen 3.5 26B - $0.20/M
Сначала не работала. Слишком много стартового контекста - модель терялась ещё до старта реальной работы.
Заработала только после двух вещей в Tuplet:
- Deferred tool loading - инструменты подгружаются по требованию, а не все схемы сразу дампятся в системный промпт
- Skills - точечные инструкции вместо раздутого prompt
Контекст на старте упал кратно. Qwen начала чисто планировать и выполнять многошаговые задачи.
Урок: дешёвым моделям не нужны более умные промпты. Им нужны меньшие.
Gemma 4 - $0.08/M
Самая дешёвая из трёх. Разумное рассуждение. Одна особенность: иногда заворачивает tool call в формат, от которого падает парсер.
Решено на уровне фреймворка. Tuplet это поглощает. Подключаешь Gemma 4 - получаешь чистый output агента.
Что ещё не решено: task management
Task management на дешёвых моделях пока хрупкий. После 30+ шагов модели дрейфуют. Перестают обновлять статусы. Начинают заново выполненные задачи. Теряют нить.
Это не проблема модели. Это проблема фреймворка. Сейчас я выношу состояние задач из модели в сам Tuplet - реестр, который модель читает, но не владеет им.
Что открывается на sub-$1/M
- Фоновые агенты, которые работают часами без бюджетных ограничений
- Персональные ассистенты без счётчика
- Batch-пайплайны, которые не окупались на Opus
Полную конфигурацию выложу, когда допилю task management.
Вывод
Дешёвые модели готовы к продакшену. Но не сами по себе - фреймворк должен поглощать то, что раньше компенсировала дорогая модель.
Кто ещё гоняет дешёвые модели в продакшене? Что пришлось компенсировать именно в фреймворке - поделитесь в комментариях.