Ваш ИИ-агент сжигает лимиты впустую: 10 инструментов, которые режут расход токенов
Лимит подписки кончается к обеду, хотя за утро агент сделал три задачи. Токены уходят не на код. Агент читает простыню логов от тестов, перечитывает один и тот же файл на каждом шаге, пишет вежливые абзацы вместо ответа и каждую новую сессию заново изучает проект. Большую часть этого можно урезать без смены тарифа. Ниже 10 инструментов из каталога SkillFoxx, у каждого в карточке есть команда установки и разбор, что он делает с вашей системой.
Одна оговорка до списка. Почти каждый такой инструмент обещает «минус 90% токенов». Автор RTK честно пишет в README, что 90% относится к выводу терминала, а в счет входят еще ваш промпт, системный промпт, история диалога и ответы модели. Поэтому начинать нужно с замера.
Что внутри
Команды взяты из документации авторов, их можно запустить в терминале или в сессии агента. Звезды репозиториев приводим на 2 октября 2026 года. Большинство инструментов работает с Claude Code, Codex, Cursor и другими агентами. Если инструмент привязан к одному агенту, это сказано в пункте.
Этап 1. Посчитать, куда уходят токены
1. ccusage, 18,8 тыс. ★ репозитория
Читает логи, которые агенты и так пишут на диск, и строит отчеты по дням, месяцам, сессиям и проектам. Для Claude Code показывает расход по пятичасовым окнам лимитов. Кроме него понимает Codex, Gemini CLI, OpenCode, Amp и GitHub Copilot CLI. Стоимость в долларах оценочная, она зависит от таблицы цен. Риск низкий, потому что инструмент только читает локальные файлы.
npx ccusage@latest
2. CodeBurn, 11,3 тыс. ★ репозитория
Считает то же самое, но ищет причины. Команда codeburn optimize находит, например, файл, который агент перечитывает на каждом шаге, или MCP-сервер, которым давно никто не пользуется, и предлагает исправление с возможностью отката. codeburn guard install останавливает сессию Claude Code, когда трата превысила заданную сумму. Риск средний, потому что в файлах сессий бывает содержимое переписки, а режим исправления меняет конфигурацию.
npx codeburn
3. Claude HUD, 28,3 тыс. ★ репозитория
Строка статуса Claude Code с полосой заполнения контекста и лимитов. Цифры берутся у самого Claude Code, а не оцениваются. Когда видно, что контекст заполнен на 80%, проще вовремя начать новую сессию, чем ждать сжатия диалога. Работает только с Claude Code. Риск низкий.
/plugin marketplace add jarrodwatts/claude-hud
/plugin install claude-hud
/claude-hud:setup
Этап 2. Сжать то, что агент читает
4. RTK, 82,2 тыс. ★ репозитория
Встает между агентом и терминалом. Хук переписывает git status в rtk git status, и агент получает короткий вывод без лишних строк. По замерам автора вывод тестов и git сжимается до 90%. Команда rtk gain показывает, сколько сэкономлено на самом деле. Встроенные инструменты Claude Code для чтения и поиска файлов через хук не проходят, сжимается только командная строка. Риск средний, потому что хук меняет команды агента перед выполнением.
brew install rtk && rtk init -g
5. Context Mode, 24,8 тыс. ★ репозитория
Крупный вывод инструментов, например снимок страницы из браузера или двадцать задач с GitHub, уходит в песочницу, а в контекст попадает выжимка. В примере автора 315 КБ превращаются в 5,4 КБ. Второй прием экономит больше. Вместо того чтобы читать 50 файлов и считать функции в уме, агент пишет короткий скрипт и выводит только результат. Лицензия Elastic License v2, перед коммерческим использованием прочитайте ее. Риск средний, потому что сервер выполняет код и ставит хуки.
claude mcp add context-mode -- npx -y context-mode
6. Headroom, 74,3 тыс. ★ репозитория
Локальный прокси между агентом и моделью, у которого для JSON, кода, логов и текста свой компрессор. Оригиналы хранятся на диске, и модель может запросить полный текст. В таблице автора экономия от 21% на поиске по коду до 57% на разборе инцидента. Проза почти не сжимается. Риск высокий, потому что весь трафик агента и ключи API идут через прокси, а команда headroom wrap меняет настройки агентов.
uv tool install --python 3.13 "headroom-ai[all]" && headroom wrap claude
Этап 3. Не перечитывать проект и документацию
7. code-review-graph, 31,9 тыс. ★ репозитория
Строит локальный граф кода: функции, классы, вызовы, зависимости. Перед правкой агент спрашивает у графа, что затронет изменение, и читает только эти файлы. На примере фреймворка Flask автор насчитал 143 тыс. токенов на чтение всего кода против 2,2 тыс. на ответ по графу. Первая сборка на большом репозитории занимает время. Риск средний.
pip install code-review-graph && code-review-graph install && code-review-graph build
8. Context7, 62,6 тыс. ★ репозитория
Сокращает число попыток. Агент получает документацию нужной версии библиотеки и не пишет код по устаревшему API, который потом три раза исправляет. Документацию добавляет сообщество, и компания Upstash, автор Context7, не гарантирует ее точность. Риск средний, потому что запросы уходят во внешний сервис.
npx ctx7 setup
Этап 4. Говорить короче
9. Caveman, 108,7 тыс. ★ репозитория
Скилл заставляет агента отвечать как пещерный человек, коротко и без вежливых абзацев. При этом код, команды и тексты ошибок не трогает. У Caveman есть независимый замер. JetBrains проверила скилл на 86 реальных задачах, и выходных токенов стало меньше всего на 8,5% при том же качестве. Сам автор пишет, что правила скилла добавляют 1–1,5 тыс. входных токенов на каждый ход, и на коротких задачах можно потерять. Риск высокий, если ставить полный комплект с прокси и хуками. Скилл отдельно — это просто текст.
claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman
Этап 5. Не начинать каждую сессию с нуля
10. Claude-Mem, 95,1 тыс. ★ репозитория
Записывает, что агент делал и какие решения принимались, и в новой сессии подставляет нужное. Агенту не приходится заново изучать проект и спрашивать то, о чем договорились вчера. Установщик по умолчанию предлагает облачное хранение памяти. Отказаться можно флагом --provider или переменной CLAUDE_MEM_ONLINE_OPTIN=false. Риск высокий, потому что хуки пишут действия агента и вывод инструментов.
npx claude-mem install
С чего начать
Все 10 сразу ставить не нужно. RTK, Headroom и Caveman перехватывают одно и то же, вывод команд или трафик к модели, и вместе сжимают уже сжатое.
- Запустите ccusage и посмотрите, на что ушла последняя неделя.
- Если много уходит на вывод тестов и git, поставьте RTK. Если агент тащит в контекст большие ответы MCP-серверов, поставьте Context Mode.
- Если агент каждое утро заново изучает проект, подключите code-review-graph или Claude-Mem.
- Caveman ставьте последним и проверьте на своих задачах, окупаются ли его правила.
Остальные инструменты для работы с контекстом собраны в каталоге SkillFoxx. Подборку под ваш проект и агента сделает Foxx AI.
На что у вас уходит больше всего токенов? Напишите в комментариях, какой у вас агент и на какой задаче. Подскажем, что из списка поможет.