Как работает прокси-роутинг токенов (на примере Free Claude Code и похожих инструментов)

Это локальный прокси-сервер, который встаёт между Claude Code (или похожими coding-агентами) и настоящим API Anthropic. Claude Code думает, что общается с Claude, а на самом деле запросы уходят на бесплатные/локальные/дешёвые модели других провайдеров.

Схема работы

Как работает прокси-роутинг токенов (на примере Free Claude Code и похожих инструментов)

Ключевые механизмы

Перехват через переменные окружения

ANTHROPIC_BASE_URL=http://localhost:8082 ANTHROPIC_AUTH_TOKEN=любой-токен

Все запросы вместо api.anthropic.com идут на ваш локальный прокси.

Как работает прокси-роутинг токенов (на примере Free Claude Code и похожих инструментов)

Роутинг по уровням моделей

В конфиге (обычно .env или через Admin UI) задаётся:

MODEL_OPUS="nvidia_nim/moonshotai/kimi-k2.5" MODEL_SONNET="open_router/deepseek/deepseek-r1-0528:free" MODEL_HAIKU="lmstudio/какой-то-локальный-модель" MODEL="fallback-модель"

Когда Claude Code внутри себя решает «это сложная задача → Opus», прокси направляет запрос на одну модель. Для простых задач — на другую (часто бесплатную или локальную).

Перевод форматов (самая важная часть)

  • Anthropic использует свой Messages API + Server-Sent Events (SSE).
  • Многие провайдеры (особенно NVIDIA NIM) используют OpenAI Chat Completions.
  • Прокси на лету конвертирует:запрос (messages, tools, system prompt)
  • потоковый ответ (streaming chunks)
  • thinking/reasoning блоки
  • информацию о токенах
  • Благодаря этому Claude Code не замечает подмены.

Дополнительные оптимизации

  • Некоторые «служебные» запросы (проверка квот, генерация заголовков, простые probe) обрабатываются локально и вообще не уходят к провайдеру → экономят токены.
  • Есть failover: если один провайдер упал или закончилась квота — автоматически переключается на следующий.
  • Поддержка tool use, streaming, multi-turn диалогов сохраняется.

Что важно понимать

  • Вы не получаете настоящего Claude. Вы получаете интерфейс и агентский workflow Claude Code, а интеллект — от той модели, которую выбрали (DeepSeek, Kimi, GLM, локальная и т.д.).
  • Качество обычно ниже настоящего Claude Opus/Sonnet (часто оценивают как 80–90 % для кодинга).
  • Бесплатные квоты провайдеров ограничены (rate limits, дневные лимиты) и могут меняться.
  • Всё работает локально — ваши запросы и код не уходят в Anthropic (но уходят к выбранному вами провайдеру, если это не полностью локальная модель).

По сути, это классический API Gateway / reverse proxy с адаптерами протоколов + умный роутер по моделям. Именно поэтому такие проекты так быстро набирают популярность: сохраняется удобный агентский интерфейс Claude Code, а стоимость и зависимость от одного вендора резко снижаются.

Источники

GitHub - репо

Официальные ресурсы и материалы по ИИ