gpt 4 api и расходы команды до выбора модели

gpt 4 api и расходы команды до выбора модели

Два счёта пришли в один день. Первый — за gpt-4o: команда платит $2,50 за миллион входных токенов и $10 за миллион выходных, окно контекста 128 000 токенов. Второй — за устаревший gpt-4-0613, который кто-то из разработчиков всё ещё дёргает по старой памятке: $30 за вход, $60 за выход, окно всего 8 192 токена. Разница не в разы, а на порядок, и её не видно, пока смотришь на цену одного запроса.

Дальше в этом тексте не обзор моделей, а измеримый эксперимент: собрать единую модель нагрузки команды и получить не одну цифру, а диапазон расходов по явным допущениям. В калькулятор входят роли, частота обращений, длина контекста, длина ответа и повторы; ничего из этого нельзя списать с прайс-листа, всё нужно принести из очереди задач команды.

Итог эксперимента— рабочее правило выбора: если рассчитанный диапазон превышает согласованный порог команды, модель не проходит отбор, сколько бы ни стоил её единичный запрос. Дальше показываю, как считается диапазон и куда в нём утекают деньги.

Почему цена gpt 4 api не решает вопрос в одиночку

Спорное умолчание, с которым спорит этот текст, звучит просто: цены одного запроса достаточно, чтобы команда выбрала модель. Оно удобно, потому что цену видно сразу, а нагрузку нет. Но модель выбирает не один разработчик в момент чтения прайса, а весь будущий поток команды: боты на сайте, внутренние помощники, агенты, генерация картинок, синтез речи. Каждый сценарий умножает базовую цену на свой множитель, и у длинных диалогов есть отдельная ловушка: окно в 8 192 токена у gpt-4-0613 против 128 000 у gpt-4o означает, что старая модель либо не помещает историю целиком, либо обрезает её и провоцирует повторные уточнения. Повтор — это ещё один платный проход, и дальше он войдёт в калькулятор отдельным множителем.

Здесь же стоит закрыть частый источник закупочных ошибок: общий баланс провайдера сам по себе не доказывает цену конкретной модели. Баланс упрощает оплату, но не считает нагрузку, — это по-прежнему задача техлида и финансового владельца, и решается она моделью нагрузки, а не прайс-листом.

Какие цены подтверждены на дату расчёта

Первое правило метода: не строить смету по памяти и не доверять старой закладке. У этого есть конкретная ловушка. Обзорная страница gpt api pricing на сайте OpenAI сейчас показывает только текущую линейку gpt-5.x, а цены на gpt-4, gpt-4o и gpt-4.1 приходится брать отдельно, со страницы каждой модели. Кто бюджетирует с одной вкладки прайса, рискует заложить не ту цифру.

Ниже то, что подтверждено на страницах моделей OpenAI, доступ 18 июля 2026. Колонка «query» — это то, как модель ищут разработчики в тикетах; техническое имя дано в скобках.

  • Модель (query): gpt 4o api (gpt-4o) • Вход $/1M: 2,50 • Кэш-вход $/1M: 1,25 • Выход $/1M: 10,00 • Контекст: 128 000 • Статус: активна в API
  • Модель (query): gpt 4 mini api (gpt-4o mini) • Вход $/1M: 0,15 • Кэш-вход $/1M: - • Выход $/1M: 0,60 • Контекст: 128 000 • Статус: дефолтная дешёвая
  • Модель (query): gpt 4.1 api (gpt-4.1) • Вход $/1M: 2,00 • Кэш-вход $/1M: 0,50 • Выход $/1M: 8,00 • Контекст: ~1 047 576 • Статус: текущий флагман без reasoning
  • Модель (query): gpt 4 api (gpt-4-0613) • Вход $/1M: 30,00 • Кэш-вход $/1M: - • Выход $/1M: 60,00 • Контекст: 8 192 • Статус: deprecated, отключение 23.10.2026

Что из таблицы важно для сметы: gpt 4.1 api по данным OpenAI дешевле gpt 4o api и по входу, и по выходу, при этом окно у неё около 1 047 576 токенов, а знания по июнь 2024 года. gpt 4 mini api остаётся дефолтной дешёвой моделью для узких задач. А сам gpt 4 api и gpt-4-turbo помечены в расписании депрекаций OpenAI как устаревшие, с датой отключения 23 октября 2026 и рекомендованной заменой gpt 5.5 api — то есть смета, всё ещё привязанная к цене gpt-4, требует не статичной цифры, а решения о миграции внутри этого окна.

Отдельно про кэш входных токенов: он напрямую влияет на повторные ходы. Для gpt-4o вход на кэшированном префиксе падает с $2,50 до $1,25 за 1M, для gpt-4.1 — с $2,00 до $0,50. Это единственный честный «скидочный» рычаг для модели повторов, и ниже он войдёт в калькулятор.

gpt 4 api и расходы команды до выбора модели

Из чего собрать модель нагрузки

Единая модель нагрузки делает явными пять вещей: роли, частоту, контекст, длину ответа и повторы. Роль — это не «модель», а сценарий, который генерирует запросы, и у одной команды таких сценариев обычно несколько.

Вот типовой список ролей продуктовой команды и то, что в каждой раздувает счёт:

  • gpt 4o бот поддержки на первой линии: высокая частота, короткие ответы, но растущий контекст диалога.
  • чат бот gpt 4o на лендинге (в заявках эту же роль часто называют «чат бот gpt сайты»): пики по трафику, много коротких сессий, дешёвый вход при кэше приветствия.
  • gpt tg бот для внутренних заявок: средняя частота, длинные цитаты из переписки в контексте.
  • gpt бот помощник в CRM: редкие, но тяжёлые запросы с большим системным промптом, где как раз окупается кэш.
  • gpt агент бот с инструментами: один пользовательский запрос порождает цепочку из нескольких вызовов модели.
  • gpt агент создатель идей иллюстраций: бриф текстом плюс обращение к картиночной модели вроде gpt image 2 api — в заявках дизайнеров это звучит как «api online gpt нарисовать картину по фото» для карточек товара.
  • Озвучка ответов через gpt-4 mini-tts: отдельный поток символов, который в токенную смету текста не входит и считается отдельно.

Заметь асимметрию: агент с инструментами при том же числе пользователей платит за несколько проходов на одно обращение, а помощник в CRM платит за огромный неизменный системный промпт на каждом запросе. Роль важнее ярлыка модели, два сценария на одной и той же gpt-4o дадут разницу в счёте в разы.

Роли берутся не из головы, а из очереди задач, которую уже принесли техлиду. Заявка на gpt 3 чат бот вместо старого скрипта поддержки тоже описывает роль, только очень раннюю: частоты и контекста в ней ещё нет, и это сразу отправляет её в отложенные, а не в смету. Дизайнеры отдельно просят gpt image 2 купить как самостоятельный доступ, но в общей модели нагрузки это та же картиночная строка, просто с другой ролью на входе. У каждого кандидата в роль ровно два обязательных поля: множители нагрузки и подтверждённая цена. Нет множителей — роль не считается вообще. Нет цены — роль уходит в отложенные, а не в оптимистичный расчёт «примерно как gpt-4o».

Калькулятор диапазонов на Python

Официальной таблицы «команда из N человек при X запросах в день стоит столько-то» у OpenAI нет, так что калькулятор придётся строить самим на подтверждённых ценах за токены, и он должен выдавать не точку, а диапазон: от экономного сценария до пессимистичного. Ниже компактный gpt api python набросок: словарь цен, функция стоимости одной роли и суммирование с учётом повторов.

from openai import OpenAI client = OpenAI( api_key="sk-...", # твой gpt api token base_url="https://api.provod.ai/v1", ) PRICES = { "gpt-4o": {"in": 2.50, "cached_in": 1.25, "out": 10.00}, "gpt-4o-mini": {"in": 0.15, "cached_in": 0.15, "out": 0.60}, "gpt-4.1": {"in": 2.00, "cached_in": 0.50, "out": 8.00}, } def role_cost(model, req_per_day, ctx_in, cached_share, resp_out, retries): p = PRICES[model] eff_in = p["in"] * (1 - cached_share) + p["cached_in"] * cached_share per_req = (ctx_in / 1e6) * eff_in + (resp_out / 1e6) * p["out"] return per_req * req_per_day * (1 + retries) * 30 low = role_cost("gpt-4o-mini", 800, 1200, 0.6, 250, 0.1) high = role_cost("gpt-4o", 800, 6000, 0.2, 700, 0.5) print(round(low, 2), "-", round(high, 2), "USD/мес на одну роль")

Все числа в вызовах, req_per_day, ctx_in, cached_share, resp_out, retries, это допущения, а не измеренный факт. Цены в словаре PRICES — внешний подтверждённый факт на дату. Диапазон между low и high — производный вывод из допущений. Смешивать эти три слоя нельзя: как только допущение выдаётся за факт, смета врёт с уверенным лицом.

Множитель (1 + retries)— это проверяемая гипотеза статьи в виде строки кода: повторы и рост контекста меняют общий счёт сильнее, чем ценник любой отдельной модели. Механика кэша из фактов OpenAI её поддерживает, но точной измеренной цифры повторов у команды обычно нет, поэтому её подставляют сами и честно помечают как допущение.

gpt 4 api и расходы команды до выбора модели

Как токены, ключи и лимиты меняют счёт

При закупке часто склеивают токен, ключ и лимит, хотя это разные сущности. gpt api token — единица тарификации текста, по ней считается всё в таблице выше. Отдельный gpt 5 api key нужен просто для доступа и сам по себе цену не меняет: разработчики уже просят завести его для тестов раньше, чем у модели появится подтверждённая строка в смете. Ключ можно выпустить сегодня, а бюджетную строку модель получит только тогда, когда цена станет видна на странице модели, а не в анонсе. Лимит — уже потолок пропускной способности, третья независимая переменная.

Про лимиты есть подтверждённый факт, который команда обязана учитывать до роста трафика. По документации OpenAI на 18 июля 2026 уровни использования, от Free до Tier 5, гейтят лимиты по накопленной оплате: от потолка $100 в месяц на Free и Tier 1 до $200 000 в месяц на Tier 5, который открывается после $1 000 суммарных платежей. Лимиты RPM, TPM, RPD и TPD действуют на уровне организации или проекта, а не на конкретного разработчика. Для растущей команды это значит, что при пиковой нагрузке она упрётся не в цену, а в throughput, и это отдельная строка риска в смете, не про стоимость запроса.

Отсюда практическое следствие для тех, кто ищет gpt api с балансом: пропускная способность и цена за токен — разные оси, одну нельзя вывести из другой. Дешёвая модель, упёршаяся в потолок TPM, обходится команде дороже расчётной, потому что часть трафика просто не проходит. Если старая смета всё ещё анкорится на gpt 3.5 turbo api или её ключ до сих пор называют gpt 3.5 turbo api key, цену стоит снять заново: этой модели нет на страницах моделей, которые я проверял 18 июля 2026, значит, число в смете может быть уже недействительным.

Где команды теряют деньги на версиях

Самая дорогая ошибка— заложить в годовой бюджет цену модели, которую через три месяца отключат. gpt 4 api в снапшоте gpt-4-0613 и gpt-4-turbo несут подтверждённую дату отключения 23 октября 2026, примерно через три месяца после даты этого расчёта. Это повод не для статичной цифры, а для явной пометки «перепроверить до отключения» и для запланированной миграции на gpt 5.5 api.

Вторая ловушка— подмена контуров. 13 февраля 2026 OpenAI убрала GPT-4o, GPT-4.1, GPT-4.1 mini и o4-mini из интерфейса ChatGPT, но в собственном объявлении написала: «в API на данный момент изменений нет». Ретаймент на стороне ChatGPT не трогает API-смету команды, хотя эти два контура постоянно путают: одних это пугает раньше времени, других усыпляет там, где бдительность нужна.

gpt 4 api и расходы команды до выбора модели

Каталог растёт быстрее подтверждённых цен

Когда открываешь текущий каталог gpt api models, линейка уже не та, что была вчера, и не вся она попадает в проверенные источники этой статьи.

Разработчики уже спрашивают про gpt 5 api и параллельно заводят под неё gpt 5 api key для тестов: доступ и цена здесь разные вопросы, и в бюджет попадает только то, что подтверждено на странице модели.

Для совсем узких задач в каталоге всплывают компактные варианты: gpt-4.1 nano и gpt 5.4 mini api. Логика та же, что у gpt-4o mini, минимальная цена под фокусированный сценарий, но без собственной подтверждённой строки в источниках на 18 июля 2026 они остаются кандидатами, а не строками бюджета.

На другом полюсе gpt 5.4 api и gpt 5.5 pro api, которые в тикетах уже называют преемниками флагмана. Прежде чем закладывать gpt 5.5 api price в годовой бюджет, её нужно снять на день расчёта: в проверенных страницах моделей, на которые опирается этот текст, её ещё нет.

Отдельная путаница в написании: chatgpt 5 api и chat gpt 5 api у разработчика означают одно и то же обращение к модели, но в тикет-трекере это две разные строки поиска, и обе всё равно требуют той же проверки цены, что и родовое название gpt 5 api.

Кодовый ассистент стоит считать отдельной статьёй расхода. codex gpt тарифы и полученная из них gpt codex цена на команду из нескольких разработчиков — это про подписку на инструмент, а не про токены модели в API, которые разбирает этот калькулятор. Правило простое: нет подтверждённой цены на день расчёта — роль не входит в смету, независимо от того, насколько привычно звучит её название.

Что даёт единый баланс команде

Когда ролей несколько и разработчиков тоже несколько, боль перестаёт быть про цену токена и становится административной: раздельные ключи на каждого, разные кабинеты, ручная сверка того, кто сколько сжёг за месяц. Часть этой боли снимает единый OpenAI-совместимый доступ через provod.ai: клиент, который умеет говорить с эндпоинтами OpenAI, подключается сменой base_url и ключа, без переписывания интеграции под каждого провайдера, ровно как в примере кода выше.

Вторая часть боли командная, а не техническая: provod.ai как gpt chats агрегатор нейросетей для команды даёт общий ключ и один баланс организации, показывает расход по каждой роли, а не общей суммой в конце месяца, то есть ровно ту фактуру, которой в калькуляторе пока стоят допущения. При этом доступ к моделям идёт по ценам самих провайдеров без наценки сверху, значит, числа из таблицы выше не придётся пересчитывать при смене платёжного контура: меняется способ оплаты и учёта, а не стоимость токена.

Чего этот расчёт не решает

Калькулятор диапазонов— это дисциплина, а не пророчество. Он ограничивает спонтанный выбор модели «по красивой цене», но избавляет от куда более дорогой находки: скрытой общей стоимости, которая всплывает счётом через месяц. У этого размена есть цена, и её стоит назвать прямо.

Смета зависит от допущений и требует обновления цен, она не заменяет замер на реальном трафике: пока не поедет продовый поток, множители повторов и средний контекст остаются оценкой. Она не отменяет депрекации: цифра на gpt-4 живёт только до 23 октября 2026, и держать её статичной нельзя. И она не решает вопрос выбора вендора инфраструктуры, приватного или on-prem развёртывания, а также функций, доступных только в подписке конкретного провайдера — это отдельные решения с другими критериями. Ниже решающая таблица: как диапазон превращается в вердикт.

  • Диапазон против порога: Диапазон ниже порога • Версия и цена: подтверждены на дату • Вердикт: модель проходит выбор
  • Диапазон против порога: Диапазон пересекает порог • Версия и цена: подтверждены • Вердикт: сузить роли, включить кэш, пересчитать
  • Диапазон против порога: Диапазон выше порога • Версия и цена: подтверждены • Вердикт: модель не проходит независимо от цены запроса
  • Диапазон против порога: Любой диапазон • Версия и цена: цена или версия не подтверждена • Вердикт: решение отложить до факт-проверки
  • Диапазон против порога: Нет ролей или частоты • Версия и цена: - • Вердикт: смету не считать, нагрузка не задана
gpt 4 api и расходы команды до выбора модели

Частые вопросы

Можно выбрать модель просто по самой низкой цене за токен? Нет. gpt-4o mini дешевле всех по входу ($0,15 за 1M на 18.07.2026), но если роль тянет длинный контекст и повторы, дешёвый ценник даёт дорогой месяц. Сначала считай диапазон, потом сравнивай с порогом.

Насколько сильно кэш меняет смету? Ощутимо на ролях с большим неизменным префиксом: вход gpt-4.1 на кэше падает с $2,00 до $0,50, вход gpt-4o — с $2,50 до $1,25 за 1M. Для помощника в CRM с гигантским системным промптом это главный рычаг.

Что делать с моделями, которых нет в проверенных ценах? Любую такую строку вносишь в калькулятор только с ценой, снятой в день расчёта. Нет подтверждённой цены — решение откладывается, а не угадывается по аналогии с соседней моделью.

Если команда переходит на агрегатор моделей, смету надо пересчитывать? Цены за токены нет: доступ идёт по ценам провайдера без наценки, таблица выше остаётся в силе. А вот лимиты держи отдельно в любом контуре: потолки RPM и TPM считаются на организацию или проект, а не на человека, значит роли делят общую квоту и конкурируют за неё ровно на пиках.

gpt 4 api и расходы команды до выбора модели

Собери командный калькулятор на подтверждённых ценах, а расчёты по оплате переведи в рубли: оплатить provod.ai картой, СБП или счётом без VPN можно из России, а закупка gpt business закрывается договором, счётом и закрывающими актами от российского юрлица, тем, что бухгалтерия примет без отдельного разговора. Дальше всё держится на дисциплине: цену модели снимай в день расчёта, а диапазон сверяй с порогом до того, как роль уедет в прод.

Источники

  • OpenAI, страницы моделей gpt-4o, gpt-4o mini, gpt-4.1, gpt-4, доступ 18.07.2026 — цены, контекст, статус.
  • OpenAI, расписание депрекаций API, доступ 18.07.2026 — дата отключения 23.10.2026 и замена gpt-5.5.
  • OpenAI, объявление о ретайменте моделей в ChatGPT, 13.02.2026 — формулировка «в API изменений нет».
  • OpenAI, руководство по rate limits, доступ 18.07.2026 — уровни Free-Tier 5 и пороги накопленной оплаты.

provod.ai — не переплачивайте мощной моделью за простую задачу

Разделяйте быстрые массовые запросы и сложные случаи: компактные модели берут рутину, флагманские — задачи, где критичны reasoning, контекст и качество результата.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Оптимизация опирается на реальную стоимость: цены всех вариантов соответствуют официальным тарифам провайдеров 1:1, без наценки provod.ai.