DeepSeek напрямую или через подписку Ollama: что выгоднее харнессу

Разница между DeepSeek и Ollama — не в цене модели, а в том, за что вы платите и в котором часу запускаете работу. Обе площадки отдают одну и ту же DeepSeek-V4-Pro: у DeepSeek списываются деньги только за токены, у Ollama — двадцать долларов в месяц за подписку, в которую уже зашиты шестьдесят долларов расхода. Третий фактор, который всплывает в счёте последним, — время суток запуска.

Цена токена у обоих поставщиков

Базовые тарифы на DeepSeek-V4-Pro совпадают вплоть до знака. За миллион токенов:

  • вход, кэш попал: DeepSeek берёт $0,003 вне пика, Ollama — $0,022;
  • вход, кэш промахнулся: $0,15 против $0,66;
  • выход: $0,60 против $1,98;
  • подписка: у DeepSeek отсутствует, у Ollama — $20 в месяц и $60 включённого расхода.

Это внепиковые ставки, и здесь DeepSeek ровно вдвое дешевле Ollama по каждой строке. Ключевое слово — «вне пика»: у DeepSeek двойной тариф действует в окна 01:00–04:00 и 06:00–10:00 UTC по будням, всё прочее время, включая выходные, считается по половинной цене. У Ollama двойной тариф приходится на 12:00–18:00 UTC по будням.

Техник у серверной стойки в дата-центре NERSC. Фото: Derrick Coetzee, CC0
Техник у серверной стойки в дата-центре NERSC. Фото: Derrick Coetzee, CC0

Из чего состоит счёт на самом деле

Сравнивать цену миллиона токенов бессмысленно, если не разобраться, каких токенов у вас больше. Агент, который по несколько часов крутится в одном репозитории, почти весь вход набирает из чтения кэша: инструкции, история шагов, файлы, которые модель перечитывает в каждом вызове. Нового текста в запросе немного, и он целиком уходит в промахи кэша.

Я поднял журнал своих сеансов: на 75 миллионов прочитанных токенов приходится около 250 тысяч новых. Кэш — это 99,7% входа, и четырёхкратная разница на кэше бьёт по кошельку сильнее, чем разница на выходе.

Расписание важнее прайса

Переведём окна в московское время. У DeepSeek пик — с четырёх до семи утра и с девяти до часа дня; у Ollama — с трёх до девяти вечера. Вечер — это как раз тот час, когда за харнесс садятся после работы, а у сервера день уже кончился.

Итог по московским рабочим часам: один и тот же запрос у Ollama стоит вчетверо дороже на кэше, вдвое дороже на несбитом кэше и вдвое на выходе. Модель ни при чём — проигрывает расписание.

Харнесс считает траты по каждому сеансу сам: прочитанный кэш, новые входные и выходные токены. Умножаем на тариф нужного окна — и выходит простое правило: длинные автономные задания, где агент подолгу крутит один контекст, надо запускать не тогда, когда вам удобно, а когда дёшево маршруту. Разница в расписании за месяц набегает на цену ещё одной подписки.

Считать надо сеанс, а не токен

Правильная единица — не миллион токенов, а один рабочий сеанс харнесса. Возьму реальные цифры из журнала запусков: за сеанс агент прочитал 75 миллионов токенов из кэша, добавил 250 тысяч новых на входе и сгенерировал 250 тысяч на выходе.

DeepSeek вне пика: 75x0,003 + 0,25x0,15 + 0,25x0,60 = $1,01 Ollama в пик: 75x0,022 + 0,25x0,66 + 0,25x1,98 = $2,43

Два доллара сорок три против одного доллара — модель та же, работа та же. Сорок вечерних сеансов за месяц дают разницу около 57 долларов; подписка Ollama этого не отменяет, она просто пакует шестьдесят долларов расхода в двадцать долларов платы.

Видеокарта GeForce RTX 3090: железо, на котором считают открытые модели. Фото: PantheraLeo1359531, CC BY 4.0
Видеокарта GeForce RTX 3090: железо, на котором считают открытые модели. Фото: PantheraLeo1359531, CC BY 4.0

Что подписка даёт помимо токенов

Подписка Ollama — это не одна модель DeepSeek: в тот же счёт входят Kimi, GLM, Qwen, Mistral, и токены по всем списываются из общего пула. Если харнессу нужны разные модели под разные задачи, один счёт проще пяти. У DeepSeek в прайсе одна семья моделей, зато без подписки и без обязательств.

Ограничения тоже разные. На плане Pro у Ollama три одновременных запроса, остальные встают в очередь и могут отвалиться, если она переполнена. У DeepSeek на V4-Pro заявлено 500 одновременных обращений, на Flash — 2500. Для одиночного агента разница незаметна, для конвейера из субагентов — принципиальна.

Как обе площадки подключаются к харнессу

DeepSeek цепляется родным маршрутом deepseek-official: усилия рассуждения, режим мышления, распознавание картинок у Flash и сжатие контекста работают сразу. Ollama подключается вторым провайдером через pi-ai — интерфейс, совместимый с OpenAI; идентификатор модели прописывается в настройках вручную, а набор возможностей ограничен тем, что выдаёт площадка.

Проверил на собственном конфиге: маршрут ollama-cloud собран, ключ на месте, но модели DeepSeek на текущем плане отвечают отказом 402 — до оплаты подписки доступны только gpt-oss, gemma и nemotron. Это важно для сравнения: подписку надо включить до начала подсчётов, иначе мерить нечего.

Вывод

Если сеансы идут по московскому дню и вечеру, прямая оплата у DeepSeek дешевле, иногда в разы: двойной тариф Ollama приходится ровно на эти рабочие часы. Подписка Ollama выигрывает там, где нужен один счёт на десяток открытых моделей и предсказуемая плата в месяц. Считать надо не прайс, а расписание — в этом споре оно весит больше, чем цена токена.

Разложу по случаям:

  • один агент, работа по московскому дню и вечеру — прямая оплата DeepSeek;
  • конвейер из субагентов — DeepSeek: у Ollama на Pro всего три одновременных обращения;
  • несколько разных открытых моделей в одном счёте — подписка Ollama;
  • жёсткий потолок расходов на месяц — подписка: двадцать долларов платы и шестьдесят включённого расхода;
  • ночные и выходные прогоны — DeepSeek вне пика.

Оба маршрута живут в харнессе рядом: родной deepseek-official и второй провайдер через совместимый интерфейс. Держать оба и переключаться по часам — не хитрость, а обычная экономика: маршрут выбирается не по вкусу, а по расписанию.

Полная версия: https://habr.com/ru/articles/1084484/