Своя GPU под нейросеть почти не окупается - вот честный расчёт

Своя GPU под нейросеть почти не окупается - вот честный расчёт
Применить: 30 минут на прикидку · Уровень: средний · Чтение: ~26 минут · Данные проверены на 10 июля 2026

Что узнаешь

  • Где на самом деле лежит точка окупаемости своей GPU: против дешёвого API это не 5-10 млн токенов в месяц - реальная планка ~5,7 млрд на одном H100.
  • Почему простаивающая видеокарта дороже топового облака: при загрузке 10% цена за 1000 токенов растёт с $0,013 до $0,13.
  • Сколько стоит человек, который держит нейросеть на сервере живой: loaded cost инженера $250-360K/год, это 60-75% всей сметы self-hosting.
  • Как гибрид (дешёвое и приватное локально, пики через API) режет счёт на 40-85% - с реальным кейсом $47K → $8K/мес.
  • Когда своё железо оправдано: 152-ФЗ, КИИ, суверенитет данных - и почему экономия тут ни при чём.
  • Причём тут гига чат, официальный сайт Сбера и открытая под MIT нейросеть GigaChat 3.5 Ultra на 432B.

Главное. Интуиция «куплю видеокарту - уйду от облака» почти всегда врёт. Своя GPU окупается только на очень высокой стабильной нагрузке (сотни миллионов - миллиарды токенов в месяц), потому что львиную долю сметы съедает зарплата инженера, а железо на её фоне дешёвое. Против дешёвого API вроде DeepSeek V4 Flash своё железо не окупается почти никогда. Реальные причины ставить своё - суверенитет данных и регуляторика. Дешевле всего - гибрид: рутина локально, сложное через облако.

Счёт за облачный API вырос вдвое за квартал, и рука сама тянется к калькулятору: «А если купить свою видеокарту?» Открытые веса лежат на Hugging Face, качай бесплатно. DeepSeek, Qwen, GLM, теперь ещё и GigaChat под MIT - всё в открытом доступе. Кажется, что дальше только железо и розетка.

Сразу оговорюсь для тех, кому из России нужен доступ к моделям без своего сервера. provod.ai - это агрегатор нейросетей для пользователей из России: Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API (OpenAI- и Anthropic-совместимый), с оплатой в рублях легально, без VPN и зарубежных карт, с договором и закрывающими документами для юрлиц. Это готовый облачный вариант, если считать своё железо не хочется.

Вот в чём подвох. Эта арифметика почти всегда собирается из двух строк - цена GPU и электричество, - и обе строки красиво «доказывают» выгоду. Честный расчёт состоит из четырёх строк, и четвёртая (инженер плюс простой) переворачивает вывод. Ниже - те самые четыре строки, с ценами железа июля 2026, зарплатами, тарифами на аренду GPU и пересчётом в рубли. Спойлер: своё железо оправдано куда реже, чем подсказывает интуиция, и совсем по другим поводам.

Почему кажется, что своя нейросеть дешевле облака?

Главное. Иллюзию создают три вещи: пугающий счёт за API в конце месяца, «бесплатные» открытые веса на Hugging Face и страх утечки данных. Все три - реальные боли. Но каждая сравнивает облако лишь с половиной себестоимости своего сервера. Полную цену - с инженером и простоем - в расчёт не берут. Как только к железу прибавляется человек и простой, картинка разворачивается.

Разберём по порядку, откуда растёт ошибка №1.

Счёт за API психологически давит сильнее, чем зарплата. Когда в конце месяца прилетает $8000 за токены, это выглядит как утечка из кармана. А зарплата DevOps-инженера в $250K/год лежит в другой строке бюджета и «не считается» - хотя это тот же кошелёк. Мозг сравнивает видимый счёт за облако с невидимой стоимостью своей команды, и облако проигрывает ещё до расчёта. Психология тут работает против кошелька: одна цифра болит, вторая размазана по фонду оплаты труда.

Открытые веса выглядят бесплатными. DeepSeek V4 под модифицированной MIT, GLM-5.2 под MIT, Qwen3, теперь и нейросеть от Сбера GigaChat 3.5 Ultra под MIT - всё качается с Hugging Face без единого рубля лицензии. Логика простая: раз модель бесплатная, останется только «поставить её на свой сервер». Слово «поставить» и прячет всю стоимость - VRAM, инженера, обслуживание. Лицензия бесплатная, эксплуатация - нет.

Приватность ощущается как всё-или-ничего. «Не хочу, чтобы наши данные уходили в OpenAI» - здоровая мысль, особенно под 152-ФЗ. Из неё делают вывод «значит, всё своё», хотя между «шлём всё в чужое облако» и «строим свой ЦОД» лежит десяток промежуточных решений: приватный контур у российского провайдера, договор поручения, гибрид, локальный дев-стек. Приватность - это шкала, а её воспринимают как тумблер.

Есть и четвёртый источник ошибки - hobby-опыт. Человек запустил ollama run на своём макбуке, увидел, что нейросеть на пк отвечает бодро, и мысленно экстраполировал это на прод команды. На Hacker News таких историй десятки: локальная llm летает на ноуте у одного пользователя и умирает под нагрузкой сотни. Демо на одном запросе и прод на тысяче запросов - разные инженерные задачи, и вторая стоит денег.

Двухстрочная модель TCO всегда голосует за своё железо. Четырёхстрочная - говорит правду. - Digital Applied Team, 24 апреля 2026

Эта фраза (в оригинале «Two-line TCO models always favor self-hosting. Four-line models tell the truth») - ось всей статьи. Две строки - это GPU плюс электричество. Четыре - плюс инженер и плюс простой. Дальше считаем именно по четырём.

Совет. Прежде чем считать окупаемость, вытащи из бюджета ВСЕ строки, включая те, что прячутся вне счёта за API. Зарплаты, амортизация, простой, on-call - в одну таблицу. Половина решений «уходим на своё железо» разворачивается прямо на этом шаге, когда цифры перестают прятаться по разным статьям.

Где точка окупаемости: сколько токенов в месяц нужно, чтобы своя GPU окупилась?

Главное. Порог «5-10 млн токенов в месяц» - миф. Он верен только против самых дорогих API (уровня GPT-5 или Claude Sonnet). Против дешёвого DeepSeek V4 Flash за $0,14 на миллион токенов своя GPU окупается лишь с ~5,7 млрд токенов в месяц на одном H100. Реальный порог - сотни миллионов - единицы миллиардов токенов в месяц, и то при загрузке 60-70%.

Своя GPU под нейросеть почти не окупается - вот честный расчёт

Точка окупаемости держится на одной переменной, которую проваливают почти все калькуляторы: с каким именно API ты сравниваешь своё железо. Пока эта переменная не зафиксирована, любая цифра порога бессмысленна.

Если сравнивать с премиум-моделью за $5 на миллион токенов, своё железо начинает выигрывать уже с 256 млн токенов в месяц (Digital Applied, 27 мая 2026). Против Claude Sonnet-класса - примерно с 430 млн при загрузке GPU 60-70%. Вот отсюда и растёт цифра «5-10 млн», которую любят повторять: она про дорогие API и часто ещё и посчитана без инженера в смете.

А теперь то же железо против дешёвого DeepSeek V4 Flash по $0,14 за миллион. Порог улетает до ~5,7 млрд токенов в месяц на одном H100. Разница больше чем в 20 раз - только из-за того, с чем сравниваешь. Одна и та же GPU по отношению к дорогому API выглядит выгодной покупкой, а по отношению к дешёвому - выброшенными деньгами.

Exhibit-1: где своё железо обгоняет облако (данные Digital Applied, апрель-май 2026)

  • С чем сравниваем: Премиум (GPT-5-класс) • Цена API: ~$5 / 1M • Порог окупаемости своей GPU: ~256 млн ток/мес
  • С чем сравниваем: Средний (Claude Sonnet-класс) • Цена API: ~$3 / 1M • Порог окупаемости своей GPU: ~430 млн ток/мес (загрузка 60-70%)
  • С чем сравниваем: Чат общего назначения • Цена API: - • Порог окупаемости своей GPU: ~1,2 млрд ток/мес
  • С чем сравниваем: Код-ассистент • Цена API: - • Порог окупаемости своей GPU: ~600 млн ток/мес
  • С чем сравниваем: Дешёвый (DeepSeek V4 Flash) • Цена API: $0,14 / 1M • Порог окупаемости своей GPU: ~5,7 млрд ток/мес на 1×H100

Прикинь на пальцах, что такое 5,7 млрд токенов в месяц. Это около 190 млн токенов в день, или ~2200 токенов в секунду без остановки - круглосуточно, все 30 дней. Средний ответ чат-бота - 300-800 токенов. То есть твоя нейросеть должна выдавать несколько ответов в секунду 24/7 без единой паузы, чтобы обогнать DeepSeek V4 Flash по цене. У большинства продуктовых команд реальная нагрузка на два-три порядка ниже.

Braincuber заходит с другой стороны и получает тот же вывод. По расчёту Mayur Domadiya (CEO Braincuber, 10 марта 2026), при нагрузке 1 млн токенов в день self-hosting на Azure выходит в 733 раза дороже, чем тот же объём через API. Break-even у него - около 11 млрд токенов в месяц. Baseten даёт ориентир помягче: практическая точка ~500 млн токенов в месяц. Разброс большой, но нижняя граница у всех считается сотнями миллионов; единицы миллионов остаются мифом.

При загрузке облачной GPU на 10% эффективная цена за 1000 токенов прыгает с $0,013 до $0,13 - дороже, чем премиум-API. - Digital Applied Team, 27 мая 2026

Вот почему объём вторичен. Первична утилизация, и к ней мы вернёмся в разделе про простой. Пока запомни правило пересчёта: сырую цену аренды GPU умножай на 1,3-2,0 (консервативно) или на 3-5 (с учётом DevOps, обновлений и простоя), и только потом сравнивай с API. Без этого множителя ты сравниваешь свою половину сметы с полной ценой облака.

Теперь честная таблица цен на сами API - чтобы понимать, с каким числом ты вообще воюешь. Для российского читателя добавляю строку с ценами в рублях по тем же официальным тарифам.

Сравнение цен облачных API (за 1M токенов, вход/выход; курс ЦБ 10.07.2026 = 75,93 ₽/$)

  • Модель: Claude Opus 4.8 • Цена, $ / 1M: $5 / $25 • Класс: фронтир
  • Модель: GPT-5.6 (Sol) • Цена, $ / 1M: $5 / $30 • Класс: фронтир
  • Модель: Claude Sonnet 5 • Цена, $ / 1M: $3 / $15 • Класс: средний
  • Модель: Gemini 3.1 Pro • Цена, $ / 1M: $2 / $12 • Класс: средний
  • Модель: Qwen3.7 Max • Цена, $ / 1M: ~$1,2 / $6 • Класс: доступный
  • Модель: DeepSeek V4 Flash • Цена, $ / 1M: $0,14 / $0,28 • Класс: дешёвый
  • Модель: Те же модели в рублях (provod.ai)Цена, $ / 1M: DeepSeek V4 Flash 11 / 22 ₽ · Opus 4.8 390 / 1950 ₽Класс: оплата картой РФ

Строка provod.ai: те же официальные цены 1:1 без наценки, только в рублях, оплата картой РФ, СБП или по счёту. Реселлеры за то же обычно берут на 30-100% больше. Тарифы provod.ai сверены на 10.07.2026 - проверить в агрегаторе.

Смотри на нижнюю строку и на порог из Exhibit-1 вместе. Чтобы обогнать DeepSeek V4 Flash за 11-22 рубля на миллион токенов своим H100, тебе нужно прокачивать через него миллиарды токенов в месяц без простоя. У подавляющего большинства команд такой нагрузки просто нет, а значит и разговор про «своё дешевле» на этом уровне закрыт.

Сколько на самом деле стоит своя GPU под нейросеть?

Главное. Купить H100 - это $22-40K за карту, а под серьёзную модель нужен не один ускоритель. RTX 5090 на 32 ГБ дешевле ($1999 MSRP, на улице ~$3844), но её VRAM хватает только на мелкие модели. В России H100 у дилера стоит 3 485 187 ₽, а аренда - от ~246 тыс ₽/мес за одну карту. Модель определяет железо: чем больше параметров, тем больше VRAM, тем больше карт.

Начнём с прайса. Цены июля 2026, разброс на рынке огромный.

Цены на железо под нейросеть (покупка, июль 2026)

  • GPU: H100 80GB PCIe • VRAM: 80 ГБ • Цена: $22-33K (new) • Комментарий: рабочая лошадка инференса
  • GPU: H100 SXM5 • VRAM: 80 ГБ • Цена: $35-40K+ • Комментарий: TDP 700 Вт
  • GPU: RTX PRO 6000 Blackwell • VRAM: 96 ГБ • Цена: $13 250 • Комментарий: +55% за 16 мес, дефицит GDDR7
  • GPU: RTX 5090 • VRAM: 32 ГБ • Цена: $1999 MSRP / ~$3844 street • Комментарий: потолок для мелких моделей
  • GPU: RTX 4090 • VRAM: 24 ГБ • Цена: ~$3299 • Комментарий: снята с производства, дефицит
  • GPU: H100 у РФ-дилера • VRAM: 80 ГБ • Цена: 3 485 187 ₽ • Комментарий: серый импорт

Ценник одной карты - это ещё полбеды. Беда в том, что модель диктует, сколько карт тебе нужно. Интуиция снова обманывает: «возьму видеокарту, запущу нейросеть на ПК» работает только для крохотных моделей уровня Qwen3 8B, а они и качеством уступают облачным флагманам. Как только речь заходит про серьёзную qwen нейросеть на 235B или дипсик нейросеть в полном разрешении, ПК под столом заканчивается и начинается стойка.

Сколько VRAM едят реальные модели

  • Модель: DeepSeek V4 Flash • Квантование: Q4 • VRAM: 18,5-26 ГБ • Железо: 1×A100 или RTX PRO 6000
  • Модель: DeepSeek V4 Flash • Квантование: Q8 • VRAM: 37-46 ГБ • Железо: 1×H100
  • Модель: DeepSeek V4 Flash • Квантование: full • VRAM: ~160 ГБ • Железо: несколько карт
  • Модель: Qwen3 235B • Квантование: Q4_K_M • VRAM: ~140 ГБ • Железо: 2×H100 (все эксперты в VRAM)
  • Модель: GLM-5.2 744B • Квантование: FP8 • VRAM: ~744 ГБ • Железо: 8×H200
  • Модель: GLM-5.2 744B • Квантование: 2-bit • VRAM: ~241 ГБ • Железо: 4×RTX 3090 → 3-6 ток/с
  • Модель: GigaChat 3.5 Ultra 432B • Квантование: FP8 • VRAM: ~432 ГБ • Железо: 8×H100/H200

Обрати внимание на две ловушки. Первая - MoE-модели вроде Qwen3 235B держат в VRAM ВСЕХ экспертов, даже если на каждом токене работают лишь несколько. «Активных параметров 22B» не значит «влезет в 22 ГБ», в память нужно уложить все 235B. Вторая - glm нейросеть GLM-5.2 на 2-bit можно ужать до четырёх бытовых RTX 3090, но ты получишь 3-6 токенов в секунду. Это скорость чтения вслух, для прода непригодно.

Аренда GPU снимает капзатраты, но не отменяет математику. Западные площадки:

Аренда H100 on-demand (июль 2026)

  • Площадка: Vast.ai • Цена H100: $1,50-1,87/ч • Примечание: спот-маркет, разброс качества
  • Площадка: RunPod • Цена H100: $1,99-3,29/ч • Примечание: популярен у стартапов
  • Площадка: Lambda • Цена H100: $2,99-3,99/ч • Примечание: reserved $1,89
  • Площадка: Modal • Цена H100: $3,95/ч • Примечание: serverless, A100 $2,50
  • Площадка: Together • Цена H100: $6,49/ч • Примечание: dedicated

Разброс цен на одно и то же железо - от 4 раз между спот-маркетом и dedicated в таблице до 12 раз, если добавить гиперскейлеры вроде AWS. Это само по себе сигнал: рынок аренды незрелый, и «средней цены GPU-часа» не существует. Одна и та же H100 на спот-маркете и на dedicated-тарифе отличается вчетверо, и вместе с ценой скачет надёжность.

Про амортизацию покупки коротко. H100 за $30K при сроке службы 3 года - это ~$830 в месяц только на списание стоимости, без электричества, стойки и инженера. Арендованная H100 на Vast за $1,50/ч в режиме 24/7 - около $1080 в месяц. Покупка выигрывает по «голому» железу процентов на 20-30, но лишь если карта загружена постоянно все три года и не устареет раньше. Модели и требования к VRAM меняются каждый квартал, так что это смелое допущение.

В России Immers.cloud (проверка 11.07.2026) даёт A100 от ~210 ₽/час (~152 тыс ₽/мес за карту в режиме 24/7), H100 - около ~340 ₽/час (~246 тыс ₽/мес). Кластер A100×8 - порядка 1,2 млн ₽/мес. Считай: одна арендованная H100 за ~246 тыс ₽/мес быстро догоняет счёт за API, если ты не грузишь её под завязку. За предоплату площадки дают скидки 10-25%, но порядок величины это не меняет.

Здесь развилка для тех, кому нужен просто доступ к сильной модели в рублях без своего сервера и без капзатрат. В рублях 1:1 с официальными тарифами эти модели считает provod.ai - оплата картой РФ, СБП или по счёту с закрывающими для юрлиц. Реселлеры за то же обычно берут на 30-100% больше, так что аренда H100 за ~246 тыс ₽/мес плюс инженер на этом фоне выглядит спорно.

🚨 Критично. Дефицит GPU в России - это серый импорт со всеми рисками. Дмитрий Завалишин (директор DZ Systems, newsinfo.ru, 09.07.2026): «с видеокартами ситуация критическая». Топ-GPU везут через Шэньчжэнь, Гонконг, Малайзию, Казахстан; для карт с криптомодулями нужно уведомление ФСБ, а с 01.09.2026 вступает новый техрегламент ТР ТС 010. Планируя закупку своего железа, закладывай срыв сроков и отсутствие гарантии сверх самого ценника.

Какие скрытые косты убивают экономику self-hosting?

Главное. 60-75% стоимости self-hosting уходит на людей - больше, чем на само железо. Loaded cost инженера под LLM-serving - $250-360K/год, это как целый кластер 8×H100 в аренде. Полный контроль над одной 70B-моделью требует ~3,5 FTE. Прибавь амортизацию, охлаждение, обновления и простой - и «дешёвое своё железо» становится самой дорогой строкой сметы.

Своя GPU под нейросеть почти не окупается - вот честный расчёт

Вот где двухстрочная модель разбивается о реальность. Считаем строку, которую все забывают, - людей.

Инженер, который поднимет vLLM, настроит квантование, отловит OOM и переживёт ночной инцидент, стоит дорого. MLOps в США - медиана $130-165K, вилка $90-257K (kore1.com, апрель 2026). А именно под LLM-serving (vLLM, TensorRT, Triton поверх Kubernetes) - mid $170-230K, senior $235-325K.

Digital Applied сводит это в loaded cost $250-360K/год на инженера inference. Это $20-30K в месяц - примерно как целый кластер 8×H100 в аренде on-demand. То есть один человек в смете стоит столько же, сколько восемь топовых GPU.

60-75% стоимости self-host - это люди, а не железо. - CPO финтех-компании, Habr, 17 апреля 2026

Тот же автор оценивает полный контроль над одной 70B-моделью в ~3,5 FTE - целая мини-команда на дежурствах, апдейтах и разборе инцидентов, не один человек. Фонд зарплат такой команды - сотни тысяч долларов в год, и амортизация карт рядом с ним превращается в мелкую строку.

Exhibit-2: из чего реально складывается смета self-hosting

  • Строка: GPU (аренда/амортизация) • Двухстрочная модель: есть • Честная четырёхстрочная: есть
  • Строка: Электричество • Двухстрочная модель: есть • Честная четырёхстрочная: есть
  • Строка: Инженер (loaded cost) • Двухстрочная модель: - • Честная четырёхстрочная: $250-360K/год
  • Строка: Простой + обновления + on-call • Двухстрочная модель: - • Честная четырёхстрочная: +30-40% overprovision под P99

И это ещё не всё, что прячется в четвёртой строке:

  1. Обновления моделей. Каждый апдейт - 1-2 недели работы инженера на подгонку сервинга (~$12K за цикл). Модели в 2026 выходят чуть ли не ежемесячно.
  2. On-call. 2-4 инцидента в месяц. Нейросеть падает без предупреждения, обычно среди ночи в пятницу.
  3. Overprovision под P99. Чтобы держать хвост латентности, закладывают +30-40% лишних мощностей, которые простаивают в среднем.
  4. Охлаждение и PUE. Годовой счёт за электричество с учётом охлаждения умножается примерно в 2,5 раза.

Разберём на живом примере, чтобы четыре строки перестали быть абстракцией. Возьмём команду, которая гоняет 300 млн токенов в месяц - вроде бы «серьёзная нагрузка».

  • Строка 1, GPU. Одна арендованная H100 под завязку: ~$1080/мес.
  • Строка 2, электричество. Если карта своя - ~$150/мес с охлаждением; в аренде уже включено.
  • Строка 3, инженер. Даже 0,5 FTE DevOps под LLM - это ~$12-15K/мес loaded cost.
  • Строка 4, простой и обновления. +30-40% сверху на overprovision и циклы апдейтов - ещё ~$4-5K/мес.

Итого около $17-21K в месяц. Те же 300 млн токенов через DeepSeek V4 Flash по $0,14 обошлись бы в ~$42 (да, сорок два доллара). Даже против среднего API за $3/1M это ~$900. Двухстрочная модель показала бы $1230 и «выгоду», четырёхстрочная показывает $17-21K и приговор. Вот вся разница между «работает на бумаге» и «работает в бухгалтерии».

Nahla Davies (KDnuggets, 29 апреля 2026) формулирует боль точно: «разрыв между "работает" и "работает хорошо" шире, чем большинство ожидает». Запустить нейросеть на сервере командой из одной строки - это демо. Держать её в проде с латентностью, аптаймом и обновлениями - это те самые 3,5 FTE.

Электричество и простой: какой счёт тут забывают?

Главное. Один H100 SXM5 при TDP 700 Вт в режиме 24/7 съедает 6132 кВт·ч в год - это ~$736 по $0,12/кВт·ч, а с охлаждением (PUE) ~$1838. Но главный удар по экономике наносит простой: при загрузке 10% цена за 1000 токенов вырастает в 10 раз, и простаивающая GPU становится дороже премиум-API. Счёт за розетку рядом с этим - мелочь.

Сначала прямой счёт за электричество. H100 SXM5 имеет TDP 700 Вт (TRG Datacenters). В режиме 24/7 это:

700 Вт × 24 ч × 365 дней = 6132 кВт·ч в год.

По американскому тарифу $0,12/кВт·ч - около $736 в год за карту. С учётом охлаждения счёт умножается на PUE: при типичном дата-центровом PUE 1,5 это ~$1100, у плохих площадок под 2,5 - до ~$1840. PUE (Power Usage Effectiveness) показывает, сколько ты тратишь на инфраструктуру вокруг карты: на каждый ватт вычислений уходит ещё столько же на кондиционеры, ИБП и вентиляцию. Кластер из 1000×H100 обходится, по данным Spheron, в $50,8-317,5 тыс/мес в зависимости от региона - шестикратный разброс только из-за цены электричества.

В России розница в Москве - около 8,7 ₽/кВт·ч, в области ~9,1. Дешёвое электричество есть (Иркутск ~1,78 ₽/кВт·ч), но там нет ни каналов связи, ни персонала под ЦОД. Промышленный тариф для дата-центров официально не публикуется, так что дальше - прикидка с оговоркой: 8×H100 с охлаждением потребляют порядка 10 кВт, и в режиме 24/7 это грубо 440-610 тыс ₽/год за электричество. Цифра оценочная, но масштаб понятен: розетка - заметная, но не главная строка.

Главная строка прячется в слове «простой». Вернёмся к цитате из раздела про окупаемость: при загрузке 10% цена за 1000 токенов растёт с $0,013 до $0,13. Механика простая - ты платишь за GPU круглосуточно, а работает она десятую часть времени. Все затраты делятся на меньший объём токенов, и удельная цена взлетает в десять раз. Простаивающий H100 в этот момент становится дороже, чем премиум-API, за уход от которого его и покупали.

Эндпоинт под нагрузкой продолжает отдавать 200 OK и просто тратит 30 секунд на ответ. - Du'An Lightfoot, Senior AI Engineer, Akamai, 18 июня 2026

Это про другую сторону простоя - тихую деградацию. Дашборды зелёные, error rate ноль, health-check возвращает 200 OK, а нейросеть под нагрузкой отвечает по 30 секунд. Формально всё живо, метрики радуют. Фактически - авария уровня P0, которую двухстрочная модель не видит в принципе, потому что в ней нет строки «латентность под нагрузкой».

Отсюда правило утилизации: своё железо имеет смысл только при стабильной загрузке 60-70% и выше. Если нагрузка рваная (днём пик, ночью тишина, по выходным ноль), простаивающая GPU сжигает деньги, а API в это время просто не тарифицируется. Облако эластично по устройству - ты платишь за токены, а карта, которой нет у тебя в стойке, не простаивает за твой счёт.

Совет. Прежде чем покупать GPU, неделю снимай метрику утилизации на арендованной карте под своей реальной нагрузкой. Если средняя загрузка ниже 50%, покупка почти наверняка не окупится - и ты узнаешь это за $50 аренды, до траты $30K на железо плюс год обслуживания.

Гибрид дешевле обоих: как совместить своё железо и облако

Главное. Гибрид срезает счёт на 40-85%: рутину и приватные данные гонишь через локальную LLM, сложное и редкое - через облачный API. Роутинг 70/30 даёт экономию ~67%, 80/20 - до 77-79%. Реальный fintech-кейс: $47K → $8K/мес, минус 83%. Главное - держать quality-gate, иначе роутер незаметно просадит качество.

Идея гибрида простая: запросы неравнозначны. Классификация, извлечение полей, модерация, heartbeat агента - дешёвая рутина, которую тянет локальная модель на своём железе или на арендованной GPU. Сложное рассуждение, длинный контекст, редкие тяжёлые запросы - уходят на фронтир-API, где платишь по факту. Так ты забираешь выгоду self-hosting (приватность и дешёвый объём) и отдаёшь облаку то, в чём оно сильнее (эластичность и топ-качество).

Цифры (Digital Applied, 14 июня 2026): routing-слой даёт минус 40-85%. Раскладка 70/30 (70% дешёвых запросов локально, 30% на фронтир) экономит ~67%. Раскладка 80/20 - 77-79%. RouteLLM (ICLR 2025) показал 85% экономии при сохранении 95% качества GPT-4, отправляя на фронтир лишь 14% запросов - правда, цифра benchmark-specific и не гарантия для твоей нагрузки.

Конкретный кейс: финтех-команда перешла с чистого self-host на гибрид и уронила счёт с $47K до $8K в месяц - минус 83%. Отдельно показателен heartbeat агента: крон, который дёргает модель каждые несколько минут, на наивной реализации жрёт 20-40 тыс токенов на запрос, а после оптимизации - 1,5 тыс. Минус 93% на одной ручке, просто потому что перестали гонять весь контекст на каждый тик.

Оптимизируют одно число, которое легко увидеть, игнорируя то единственное, которое имеет значение. - Digital Applied Team, 14 июня 2026

Как собрать гибрид (порядок действий)

  1. Разметь запросы по сложности: что реально требует фронтира, а что решает 8B-модель.
  2. Посади дешёвую и приватную рутину на локальную LLM (своё железо или аренда GPU).
  3. Пики и сложное рассуждение отправляй на облачный API - платишь только за них.
  4. Поставь quality-gate: 50-500 тестовых кейсов в CI, которые ловят просадку качества роутером.
  5. Считай PII-вызовы отдельно - их держи локально, если того требует регуляторика.

🚨 Критично. Роутинг без quality-gate незаметно убивает качество. Роутер начинает гонять на дешёвую модель запросы, которым нужен фронтир, метрики затрат падают, все радуются - а пользователи получают деградировавшие ответы. Без 50-500 кейсов в CI ты этого не увидишь, пока не придут жалобы и отток.

Гибрид - это дефолт 2026 года для большинства команд. Он снимает главную боль self-hosting (простой и утилизацию) и оставляет выгоду там, где она реальна: приватность и дешёвая высокообъёмная рутина. Заметь, что оба конца гибрида - локальный vLLM и облачный API - говорят на одном OpenAI-совместимом протоколе, так что переключение между ними стоит две строки кода вместо переписывания пайплайна.

Гига чат, официальный сайт и нейросеть от Сбера: причём тут своё железо?

Главное. GigaChat - это облачная нейросеть от Сбера: гига чат официальный сайт нейросеть отдаёт через веб-интерфейс и API на developers.sber.ru, платишь в рублях от 600 ₽/мес. В июле 2026 Сбер открыл GigaChat 3.5 Ultra под MIT - её можно скачать с Hugging Face. Но 432B в FP8 требуют ~432 ГБ VRAM (8×H100). MIT не равно «поставил на свой сервер» - это кластер корпоративного уровня.

Разберём, где тут облако, а где своё железо, потому что путаница здесь массовая.

GigaChat как облачный сервис. Доступ - через приложение и веб ГигаЧат плюс API в GigaChat Studio. Официальный сайт для разработчиков - developers.sber.ru, регистрация по телефону или Sber ID. Для работы с API нужен корневой сертификат НУЦ Минцифры (russian_trusted_root_ca) - это российская специфика, без него запросы к giga нейросети не пойдут. Тарифы на июль 2026: Free - 1 млн токенов с обновлением раз в 12 месяцев (примерно 1250-2000 запросов); физлица с 01.02.2026 - 0,2 ₽ за 1000 токенов при минимальном платеже 600 ₽/мес с НДС; юрлица - 20 млн токенов Lite за 1300 ₽, 100 млн за 6500 ₽. Это облако. Своё железо тут ни при чём - ты платишь Сберу за токены в рублях, а модель крутится в его дата-центрах.

Весь этот доступ - облачный: регистрация, сертификат, оплата в рублях, никакого своего сервера.

GigaChat 3.5 Ultra как открытая модель. Примерно 6 июля 2026 Сбер выложил нейросеть от Сбера под лицензией MIT: на Hugging Face это ai-sage/GigaChat3.5-432B-A28B (bf16 и GGUF), плюс зеркало на GitVerse. Архитектура - MoE на 432 млрд параметров при 28 млрд активных, гибрид MLA и GatedDeltaNet. Модель на ~40% компактнее прошлой 3.1 Ultra на 700B, KV-кэш урезан вчетверо, генерация быстрее на 20% (MTP разгоняет до 2,2×).

...проверка гипотезы, что гибридную архитектуру с линейным вниманием можно довести до сотен миллиардов параметров, не разменивая качество на скорость. - команда GigaChat (Сбер), Habr, 6 июля 2026

Вот тут и стыкуется с темой статьи. MIT-лицензия звучит как «бесплатно ставь на свой сервер». Реальность: FP8-версия GigaChat 3.5 Ultra требует ~432 ГБ VRAM, а это 8×H100 или H200. Bf16 - ~865 ГБ, уже мультинода. Даже 4-bit GGUF - 220-250 ГБ, четыре топовых карты. Открытая giga нейросеть от Сбера self-host-абельна только для того, у кого уже стоит кластер корпоративного уровня. Для всех остальных гига чат остаётся облачным сервисом с официального сайта developers.sber.ru за рубли, и это нормальный сценарий.

Та же история с любой большой открытой моделью - DeepSeek V4, GLM-5.2, Qwen3 235B. Веса открыты и бесплатны, но full-precision версии требуют кластеров. «Открытая» и «дешёвая в эксплуатации» - разные характеристики, и вторую оплачивает твой инженер и твоё электричество. Когда в чате хвалятся, что «поставили нейросеть от Сбера себе», в 99 случаях из 100 речь про облачный API или про сильно урезанный квант на паре карт с несерьёзной скоростью.

Суверенитет данных - главная настоящая причина ставить своё

Главное. Единственный повод, который реально оправдывает своё железо в 2026, - это суверенитет данных и регуляторика. 152-ФЗ требует первичной записи персональных данных на серверах в РФ, GigaChat API запрещает слать ПДн в запросах, а self-hosting даёт локализацию автоматически. Для банков и КИИ на кону сама допустимость обработки, и стоимость тут второстепенна.

Здесь своё железо оправдано контролем над данными, и окупаемость в токенах роли не играет вообще. Это единственная развилка, где ответ «ставь своё» не зависит от объёма нагрузки.

152-ФЗ (статья 18, часть 5) требует: первичная запись персональных данных россиян - на серверах в РФ. Есть нюанс: вызов модели трактуется как обработка и под требование о хранении в РФ формально не подпадает, и если первичная запись легла в российскую базу, локализация соблюдена даже при обращении к внешней модели. Но дальше начинаются ограничения по конкретным сервисам.

GigaChat API прямо запрещает отправлять ПДн в запросах. Yandex Cloud разрешает - через договор поручения и аттестацию. Отправка в OpenAI, Anthropic или Google - это трансграничная передача.

С трансграничкой важен нюанс юрисдикции. Китай (а значит и дипсик нейросеть DeepSeek) считается «адекватной» юрисдикцией - передача возможна после уведомления. США (OpenAI, Anthropic, Google) требуют ожидания 10 рабочих дней после уведомления Роскомнадзора. Self-hosting снимает вопрос целиком: всё остаётся в контуре РФ, локализация автоматическая, никаких договоров поручения и уведомлений.

Для банков и КИИ это уже не выбор из соображений экономии. Совкомбанк оценивает масштаб суверенной инфраструктуры прямо: по оценке главного аналитика банка Дмитрия Трошина (tks.ru, 22 июня 2026), суверенный ИИ-ЦОД уровня DeepSeek V4-класса - это не менее 300 МВт мощности и капзатраты порядка 1,2 трлн рублей.

Это верхний предел спектра. Полный цикл обучения LLM с нуля в России, по оценке Совкомбанка, текущих мощностей ЦОД, вероятно, не потянет.

Между «свой ИИ-ЦОД на 1,2 трлн» и «шлём всё в чужое облако» есть рабочие решения. On-premise ПАК Cotype от MTS AI работает «без внешних серверов» и целится в банки и КИИ - туда, где данные не должны покидать периметр ни при каких условиях. МТС вложила в направление 1 млрд ₽. Базой суверенного стека служат открытые MIT-модели: DeepSeek V4, GLM-5.2, GigaChat 3.5 - их можно поднять в своём контуре, если есть железо.

Для корпоративного контура инфраструктура self-hosted LLM оценивается в 40-60 млн ₽, а кластер 8×H200 под DeepSeek-класс становится «стратегическим активом» - строкой в балансе. Логика тут простая: определённые данные юридически или по риск-модели нельзя выпускать за периметр, и тогда своё железо остаётся единственным допустимым вариантом, сколько бы оно ни стоило.

Запомни разделение. Если ты считаешь окупаемость в токенах и она не сходится (а она чаще всего не сходится) - это сигнал уходить в облако или гибрид. Если вопрос стоит как «эти данные не имеют права оказаться в чужой юрисдикции» - тогда предмет расчёта меняется: ты считаешь стоимость соответствия закону, и окупаемость тут вообще ни при чём.

Стек для запуска: vLLM, Ollama, llama.cpp - что и когда

Главное. Прод-дефолт 2026 - vLLM (vllm serve , PagedAttention до 24× throughput). Для агентов и RAG с общими префиксами - SGLang (RadixAttention до 6,4×). Прототип на своём ПК - Ollama (ollama run qwen3:8b). Любое железо и экзотика - llama.cpp с GGUF. TGI с 11.12.2025 в maintenance mode - в новые проекты не брать.

Если своё железо всё-таки оправдано (суверенитет, стабильная высокая нагрузка), вот чем это поднимают. Правильный выбор стека экономит недели инженерного времени.

Стек для запуска нейросети на сервере (июль 2026)

  • Инструмент: vLLM (ветка v0.24, июнь 2026) • Когда брать: прод-дефолт, серьёзная нагрузка • Фишка: PagedAttention, до 24× throughput
  • Инструмент: SGLang • Когда брать: агенты, RAG, общие префиксы • Фишка: RadixAttention до 6,4×, DeepSeek MLA 3,1×
  • Инструмент: Ollama • Когда брать: прототип, дев, «нейросеть на пк» • Фишка: одна команда, OpenAI-совместим
  • Инструмент: llama.cpp • Когда брать: любое железо, экзотика • Фишка: минимум зависимостей, GGUF
  • Инструмент: TensorRT-LLM • Когда брать: NVIDIA-only, максимум скорости • Фишка: FP8
  • Инструмент: KTransformers • Когда брать: длинный контекст, MoE • Фишка: оптимизация под большие модели
  • Инструмент: TGI • Когда брать: не брать • Фишка: maintenance mode с 11.12.2025

Немного цифр, чтобы выбор был предметным. vLLM с PagedAttention выдаёт до 24× throughput против наивной реализации - это де-факто дефолт для прода. SGLang с RadixAttention выигрывает на общих префиксах (типичный кейс агентов и RAG, где системный промпт повторяется): на бенче Llama3.1-8B/H100 он даёт ~16200 токенов в секунду против ~12500 у vLLM, это +29%. На DeepSeek с механизмом MLA SGLang ускоряется до 3,1×. Так что для ИИ-ассистентов программирования и агентных пайплайнов с длинным общим контекстом SGLang часто предпочтительнее.

Как установить нейросеть для прототипа - буквально одна команда Ollama:

ollama run qwen3:8b

Для прода на своём кластере дефолт - vLLM:

vllm serve deepseek-ai/DeepSeek-V4-Flash

vLLM даёт OpenAI-совместимый эндпоинт из коробки, и это важно для гибрида: код, который ходит в облачный API, переключается на локальную нейросеть сменой base_url. Тот же принцип работает и в обратную сторону - с локального стека на облако.

Как это подключить из России

>

Гибрид удобен тем, что и локальный vLLM, и облако говорят на одном протоколе - OpenAI-совместимом. Пайплайн, который сегодня ходит в свою нейросеть, завтра ходит в облачную сменой двух строк - ключа и адреса.

from openai import OpenAI client = OpenAI( api_key="PROVOD_API_KEY", base_url="https://api.provod.ai/v1", # OpenAI-совместимый эндпоинт ) resp = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Проверка связи"}], ) print(resp.choices[0].message.content)

Так из России заводятся Claude Code, Cursor, n8n и любой код на OpenAI- или Anthropic-SDK - один ключ вместо пяти, оплата в рублях. Подробности - на provod.ai.

>

Честная граница. Агрегатор закрывает доступ к облачным моделям и оплату в рублях. Но там, где нужен именно суверенитет, он своё железо не заменяет: air-gap, хранение ПДн в своём контуре, fine-tuning под свои данные - это ровно то, ради чего ставят собственный сервер под нейросеть, и агрегатор эти задачи не решает. Для облачных моделей он дешевле и проще, для суверенного контура понадобится своё.

Ещё раз про TGI: он ушёл в maintenance mode 11 декабря 2025. Гайды в интернете всё ещё советуют его по инерции - игнорируй, в новые проекты бери vLLM или SGLang. llama.cpp держи для экзотики: разношёрстное железо, ноутбук, одноплатник, любой GGUF - когда нужен сам факт запуска нейросети на компьютере, а скорость вторична.

5 ошибок, из-за которых своя нейросеть выходит дороже облака

Главное. Пять антипаттернов топят экономику: двухстрочная TCO-модель без инженера, роутинг без quality-gate, health-check 200 OK как признак здоровья, экстраполяция опыта с ноутбука на прод и слепая вера, что квантование бесплатно. Каждый из них незаметно, но стабильно делает своё железо дороже облака.

Разберём по одной, с парой «должно / не должно».

Ошибка 1. Двухстрочная TCO-модель. Считать только GPU и электричество.

  • Не должно: «карта + розетка = дешевле облака».
  • Должно: четыре строки - GPU, электричество, инженер, простой. Умножай цену аренды на 1,3-2,0 минимум.

Ошибка 2. Роутинг без quality-gate. Гнать запросы на дешёвую модель без проверки качества.

  • Не должно: «экономим 80%, метрики затрат упали, отлично».
  • Должно: 50-500 кейсов в CI, которые ловят просадку качества до того, как её заметят пользователи.

Ошибка 3. Health-check 200 OK как индикатор здоровья. Считать зелёный дашборд признаком живой нейросети.

  • Не должно: «error rate ноль, значит всё работает».
  • Должно: мерить латентность под нагрузкой. Эндпоинт может отдавать 200 OK и думать 30 секунд - это авария, которую нельзя считать нормой.

Ошибка 4. Экстраполяция опыта с ноутбука на прод. «У меня Ollama на макбуке летает, значит и в проде взлетит».

  • Не должно: путать демо на одном пользователе с нагрузкой команды.
  • Должно: Ollama-стеки не рассчитаны на тысячи одновременных запросов; для прода - vLLM или SGLang и нагрузочное тестирование.

Ошибка 5. Вера, что квантование бесплатно. Ужать модель до Q4 и ждать того же качества.

  • Не должно: «Q4 экономит VRAM, качество то же».
  • Должно: помнить, что модель, надёжная на FP16, на Q4 ломает JSON-схемы и теряет качество на длинном контексте. Тестируй именно квантованную версию.

Типовой финал провального пилота описан точно (Habr/OTUS, март 2025): сервер встал, инференс падает раз в неделю, Q4 просел по качеству, и через три месяца команда уезжает обратно на API - с разочарованием и потраченным бюджетом. Все пять ошибок ведут в одну и ту же точку. Добавь сюда «налог на ошибку» разработки: пока пилишь агента, каждый прогон - 5-10 вызовов модели, и на своём нестабильном контуре отладка растягивается вдвое.

Что выбрать: своё железо, аренда GPU или облачный API?

Главное. Облачный API - дефолт для низкой и средней нагрузки (до ~250 млн токенов в месяц) и для команд без GPU-опыта. Аренда GPU - если нужна конкретная модель под контролем, но без капзатрат. Своё железо - только при стабильной высокой нагрузке (сотни миллионов - миллиарды токенов при загрузке 60-70%+) ИЛИ при жёсткой регуляторике. Дефолт для большинства - гибрид.

Своя GPU под нейросеть почти не окупается - вот честный расчёт

Дерево решений (отвечай по порядку)

  1. Данные нельзя выпускать за периметр (152-ФЗ строго, КИИ, банковская тайна)? → Да: своё железо или on-premise ПАК, окупаемость не считаешь. → Нет: дальше.
  2. Нагрузка стабильно выше ~250 млн токенов в месяц при загрузке 60-70%? → Нет: облачный API или гибрид, точка. → Да: дальше.
  3. Есть выделенный инженер с опытом vLLM/квантования (или бюджет на 2-3,5 FTE)? → Нет: аренда GPU или гибрид, покупку не тяни. → Да: дальше.
  4. Нагрузка предсказуемая, не рваная, не экспериментальная? → Да: считай своё железо всерьёз. → Нет: гибрид.

Матрица выбора

  • Вариант: Облачный API • Когда: низкая/средняя нагрузка, нет GPU-опыта • Плюс: ноль капзатрат, эластичность, свежие модели • Минус: данные уходят в чужой контур
  • Вариант: Аренда GPU • Когда: нужна своя модель без покупки • Плюс: контроль модели, нет капзатрат • Минус: 246 тыс ₽/мес за H100 быстро догоняет API
  • Вариант: Своё железо • Когда: регуляторика ИЛИ высокая стабильная нагрузка • Плюс: суверенитет, окупается на миллиардах • Минус: 60-75% сметы - люди, простой убивает
  • Вариант: Гибрид • Когда: почти все остальные • Плюс: -40-85% счёта, приватность рутины • Минус: нужен quality-gate

Для подавляющего большинства команд правильный ответ - облако или гибрид. Своё железо оправдано на двух полюсах: жёсткая регуляторика (считаешь стоимость соответствия закону) и промышленная стабильная нагрузка с выделенной командой. Всё, что посередине, дешевле и надёжнее закрывается облачным API - в том числе для российских пользователей, которым нужен доступ в рублях без VPN. Начни с облака или гибрида, а на своё железо переходи, только когда упрёшься в конкретную стену - регуляторную или нагрузочную.

Частые вопросы

Главное. Короткие ответы на частые вопросы про экономику self-hosting: где официальный сайт GigaChat и сколько он стоит, с какого объёма токенов окупается своя GPU, можно ли поднять GigaChat 3.5 Ultra на своём сервере, где взять Claude и GPT в рублях без VPN и почему гибрид дешевле и облака, и своего железа.

Гига чат официальный сайт нейросеть - где это и сколько стоит? Гига чат официальный сайт нейросеть от Сбера отдаёт по адресу developers.sber.ru плюс через веб и приложение ГигаЧат. Для API нужен корневой сертификат Минцифры. Тарифы на июль 2026: Free - 1 млн токенов на 12 месяцев; физлица с 01.02.2026 - 0,2 ₽ за 1000 токенов при минимуме 600 ₽/мес; юрлица - 20 млн Lite за 1300 ₽, 100 млн за 6500 ₽. Это облачный доступ, своё железо не нужно.

Где взять доступ к Claude, GPT и DeepSeek в рублях без VPN? Агрегатор нейросетей provod.ai даёт Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API из России - оплата в рублях картой РФ, СБП или по счёту с закрывающими для юрлиц, без VPN и зарубежных карт. Цены 1:1 с официальными тарифами. Детали - на provod.ai.

Сколько токенов в месяц нужно, чтобы своя GPU окупилась? Зависит от того, с каким API сравниваешь. Против премиум-моделей - от ~256 млн токенов в месяц. Против дешёвого DeepSeek V4 Flash - только с ~5,7 млрд токенов на одном H100 (Digital Applied, 27.05.2026). И то при загрузке GPU 60-70%.

Можно ли поставить GigaChat 3.5 Ultra на свой сервер? Технически да - модель открыта под MIT на Hugging Face (ai-sage/GigaChat3.5-432B-A28B). Но FP8-версия требует ~432 ГБ VRAM, это 8×H100/H200 - кластер корпоративного уровня, а не «поставил на свой ПК».

Почему гибрид дешевле и своего железа, и облака? Потому что снимает главную боль self-hosting - простой GPU. Рутину и приватные данные гонишь через локальную нейросеть, сложное и редкое - через облачный API по факту. Экономия 40-85%, реальный кейс - $47K → $8K/мес.

Своя GPU под нейросеть почти не окупается - вот честный расчёт

Сделай прямо сейчас

Не поднимай кластер вслепую. Сними метрику утилизации на арендованной GPU под своей реальной нагрузкой неделю, посчитай смету по четырём строкам (GPU, электричество, инженер, простой) и сравни с ценой API за задачу. Если порог окупаемости не сходится - а против дешёвого API он почти никогда не сходится - бери облако или гибрид. Своё железо оставь на случай, когда упрёшься в регуляторную стену.

Проверь любую модель из этой статьи за пять минут: на provod.ai все флагманы - Claude, GPT, Gemini, DeepSeek, Qwen - в одном чате и через единый API, оплата в рублях с карты РФ, для юрлиц - договор и закрывающие. Без VPN, без наценки. Если окупаемость своего железа у тебя не сходится - это самый быстрый способ получить сильную нейросеть в рублях, не поднимая кластер.

Была полезна статья? Поделись в комментариях, с какой нагрузки у тебя окупается своё железо - и окупается ли.

Источники

  • Digital Applied Team. TCO frontier для self-hosting LLM. 24 апреля 2026.
  • Digital Applied Team. Decision Guide: точки окупаемости против API. 27 мая 2026.
  • Digital Applied Team. Routing и гибридная экономия 40-85%. 14 июня 2026.
  • Braincuber (Mayur Domadiya, CEO). Расчёт «733× дороже» на Azure. 10 марта 2026.
  • Baseten / GMI Cloud. Практический break-even ~500 млн токенов/мес.
  • aisuperior.com. Порог «5-10 млн токенов» только для премиум-API.
  • MindStudio. Пороги нагрузки для локального железа. 27 мая 2026.
  • kore1.com. Зарплаты MLOps и LLM-serving инженеров в США. Апрель 2026.
  • TRG Datacenters. TDP H100 SXM5 700 Вт.
  • Spheron.network. Стоимость электричества кластера 1000×H100 по регионам.
  • RunPod, Vast.ai, Lambda, Modal, Together. Тарифы аренды H100 on-demand.
  • wccftech.com, Tom's Hardware. Цены RTX PRO 6000 Blackwell, RTX 5090.
  • Habr (CPO финтех-компании). «60-75% стоимости self-host - это люди». 17 апреля 2026.
  • Habr / OTUS (Анастасия Нечепоренко). Типовой провал self-host-пилота. 10 марта 2025.
  • Akamai (Du'An Lightfoot, Senior AI Engineer). «200 OK и 30 секунд на ответ». 18 июня 2026.
  • KDnuggets (Nahla Davies). «Разрыв между "работает" и "работает хорошо"». 29 апреля 2026.
  • RouteLLM (ICLR 2025). 85% экономии при 95% качества GPT-4.
  • developers.sber.ru. Тарифы и сертификаты GigaChat. Июль 2026.
  • Hugging Face. ai-sage/GigaChat3.5-432B-A28B (MIT).
  • Habr / Сбербанк. Анонс GigaChat 3.5 Ultra и цитата про гибридную архитектуру. 6 июля 2026.
  • digital-razor.ru. Требования VRAM для self-host GigaChat 3.5 Ultra. 6 июля 2026.
  • Совкомбанк (Дмитрий Трошин). Капзатраты суверенного ИИ-ЦОД 1,2 трлн ₽. tks.ru, 22 июня 2026.
  • DZ Systems (Дмитрий Завалишин). «С видеокартами ситуация критическая». newsinfo.ru, 9 июля 2026.
  • Immers.cloud. Тарифы аренды H100/A100 в рублях. Проверка 11 июля 2026.
  • TINVEST. Цена H100 у РФ-дилера 3 485 187 ₽.
  • Хабр. 152-ФЗ и обработка ПДн в LLM. 2026.
  • MTS AI / MWS. Cotype on-premise. 2026.
  • Курс ЦБ РФ на 10 июля 2026: 75,93 ₽/$.

provod.ai — российский LLM API-агрегатор

Один OpenAI-совместимый endpoint ко всем флагманам: OpenAI (GPT-5.5, GPT-5.4), Anthropic (Claude Opus 4.8, Sonnet 4.6), Google (Gemini 3.1 Pro, 3.5 Flash), DeepSeek V4 Pro, Qwen 3.6 Plus.

Цены 1-в-1 с провайдером по курсу ЦБ— без наценки на токены. Оплата в рублях по договору, полный пакет закрывающих документов (договор-оферта, счёт, акт, счёт-фактура, УПД 5.03 через ЭДО). Без VPN — легальный B2B-сервис в России.

Если статья была полезной— попробуйте provod.ai: главная страница · каталог моделей · документация