AI на $600 в день: как посчитать окупаемость агента и не поверить красивой метрике

OpenAI раскрыла необычные внутренние цифры: медианный исследователь компании использует AI-вычисления более чем на $600 в день по публичным API-тарифам, а самые активные — более чем на $7000. Одновременно на каждый рабочий день человека приходится 3,1 «рабочего дня» агентов.

Звучит так, будто один сотрудник получил ещё троих. Но это неверный вывод: длительность работы агента не равна объёму принятого результата. Я пересчитал метрику в понятную экономику и собрал способ проверить окупаемость AI-агента на своих задачах.

Параллельность создаёт дополнительное машинное время, но сама по себе не гарантирует принятый результат.
Параллельность создаёт дополнительное машинное время, но сама по себе не гарантирует принятый результат.

Коротко: агент за $600 в день оправдан, если возвращает больше времени и ценности, чем съедают вычисления, инструменты, проверка и переделки. Считать нужно не количество запущенных агентов и не написанные строки кода, а стоимость принятого результата.

Оглавление

Что именно измерила OpenAI

6 сентября OpenAI опубликовала разбор того, как её исследователи используют coding agents. В нём есть три цифры, которые легко превратить в громкий, но неверный заголовок:

  • медианный по интенсивности использования исследователь к середине августа расходовал на inference более $600 в день, если считать по публичным API-тарифам;
  • сотрудник на 90-м процентиле — более $7000 в день;
  • на каждый восьмичасовой день человеческой работы исследовательская организация использовала 3,1 восьмичасового «агентского рабочего дня».

Здесь важна формулировка «по API-тарифам». OpenAI не утверждает, что переводит самой себе $600 за каждого исследователя. Это эквивалент объёма вычислений по внешнему прайсу — полезный ориентир для клиента API, но не раскрытие внутренних денежных затрат компании.

Вторая оговорка ещё важнее. «Агентский рабочий день» — это нормализованное время выполнения, а не готовая ставка сотрудника. Четыре агента могут параллельно работать по два часа и создать один такой день. Они могут написать полезный код, провести неудачные эксперименты или подготовить результат, который человек отклонит.

Сама OpenAI аккуратно пишет, что рост числа экспериментов коррелирует с использованием Codex, но на него одновременно влияет доступный вычислительный ресурс. Компания также признаёт: измерить код и запуски проще, чем понять, насколько они ускорили настоящий исследовательский прогресс.

Именно поэтому эти цифры интересны. Они показывают не готовую замену людей, а масштаб нового производственного ресурса, который ещё нужно научиться считать.

Почему 3,1 рабочего дня не равны трём сотрудникам

У человеческого рабочего дня и агентского времени разные ограничения.

Человек удерживает контекст проекта, выбирает направление, замечает странный результат, договаривается с коллегами и отвечает за решение. Агент быстро перебирает варианты, пишет код, запускает тесты и может работать параллельно. Это разные типы труда, поэтому складывать их один к одному нельзя.

Представим, что за день четыре агента суммарно отработали 24,8 часа — те самые 3,1 восьмичасового дня. Возможны три совершенно разных результата:

  1. Они независимо нашли три рабочих решения, и человек выбрал лучшее.
  2. Они повторили одну и ту же ошибку четыре раза, потому что получили одинаково неполное условие.
  3. Два агента сделали полезную работу, третий подготовил одноразовый прототип, четвёртый только увеличил объём проверки.

В отчёте все три ситуации могут выглядеть как одинаковые 3,1 дня вычислений. Для бизнеса их ценность различается радикально.

Поэтому метрика «сколько часов работал агент» годится для оценки загрузки инфраструктуры. Для оценки продуктивности нужны другие вопросы:

  • сколько задач дошло до принятого результата;
  • сколько человеческого времени действительно освободилось;
  • сколько заняли проверка и исправления;
  • уменьшился ли календарный срок;
  • выросло ли качество, которое без агента было бы слишком дорогим.

Во что $600 в день превращаются за год

$600 выглядят терпимо, пока остаются дневной цифрой. При 220 рабочих днях это $132 000 в год на одного активного пользователя по API-прайсу.

Уровень 90-го процентиля — более $7000 в день — превращается в сумму свыше $1,54 млн в год. Это уже не «подписка на нейросеть», а отдельная статья производственного бюджета.

Но и здесь нельзя останавливаться на расходах. Исследователь, инфраструктурный инженер или специалист по безопасности может принимать решения стоимостью намного выше. Если агент помогает на неделю раньше найти ошибку в обучении, избежать неудачного большого запуска или проверить в несколько раз больше гипотез, даже шестизначный годовой бюджет может оказаться рациональным.

Обратная ситуация тоже возможна. Если тот же объём вычислений расходуется на косметические правки, бесконечные переписывания и код, который никто не использует, низкая цена токена ничего не спасает.

Правильный вопрос звучит не «дорого ли $600», а «какую часть принятой работы эти $600 создали».

Сколько времени агент должен вернуть

Для быстрой проверки можно начать с точки безубыточности:

Необходимая экономия времени = ежедневные затраты на агента / полная стоимость часа специалиста.

Если вычисления стоят $600 в день, получаются такие ориентиры:

  • при полной стоимости специалиста $50 в час агент должен вернуть 12 человеческих часов;
  • при $100 в час — 6 часов;
  • при $200 в час — 3 часа;
  • при $300 в час — 2 часа.

Полная стоимость часа — не зарплата, делённая на 160. В неё входят налоги, оборудование, управление, найм, простой команды и цена задержки проекта.

Формула всё равно упрощённая. Она не учитывает платные инструменты, инфраструктуру, проверку результата и повторные запуски. Зато быстро показывает масштаб ожиданий.

Например, для специалиста с полной стоимостью $50 в час расход $600 трудно окупить только личной экономией времени: в восьмичасовом дне нет 12 свободных часов. Экономика может сойтись, если агент параллельно экономит время всей команды, уменьшает календарную задержку или выполняет работу, которая иначе вообще не была бы сделана.

А для дорогого исследователя, от решения которого зависит большой вычислительный запуск, достаточно вернуть несколько часов или предотвратить одну серьёзную ошибку.

Почему ощущение ускорения может обманывать

Человек замечает, как быстро агент создаёт первый результат. Гораздо хуже мы замечаем время на формулировку задачи, ожидание, чтение длинного ответа, поиск скрытой ошибки и повторную проверку.

Это расхождение уже попадало в измерения. В исследовании METR 2025 года 16 опытных разработчиков выполняли 246 реальных задач в знакомых им открытых проектах. До эксперимента они ожидали ускорения на 24%. После работы с AI им казалось, что ускорение составило около 20%. Фактически в этих условиях задачи заняли на 19% больше времени.

Этот результат нельзя переносить на всё программирование: исследовались конкретные разработчики, инструменты начала 2025 года и задачи длительностью примерно от 20 минут до четырёх часов. METR отдельно подчёркивает эти ограничения.

К 2026 году картина, вероятно, изменилась. В следующем эксперименте METR появились признаки ускорения, но исследователи назвали оценку ненадёжной: разработчики, уже привыкшие к агентам, часто отказывались участвовать, если половину задач требовалось делать без AI. Одновременный запуск нескольких агентов также усложнил измерение человеческого времени.

Получается полезный парадокс: AI мог стать настолько встроенным в работу, что классический эксперимент «с ним или без него» стало сложнее провести. Но это не отменяет главного урока — субъективное ощущение скорости нельзя использовать вместо измерения.

Формула стоимости принятого результата

Для обычного чата можно считать цену запроса. Для агента этого мало: один пользовательский запрос разворачивается в несколько модельных проходов, вызовы инструментов, чтение истории и повторные попытки.

Практическая формула выглядит так:

Стоимость принятого результата = (inference + инструменты + человеческая проверка + исправления + стоимость неудачных запусков) / число принятых результатов.

Вычисления — лишь один из четырёх потоков затрат. Ошибки, инструменты и человеческая проверка тоже входят в итоговую цену.
Вычисления — лишь один из четырёх потоков затрат. Ошибки, инструменты и человеческая проверка тоже входят в итоговую цену.

«Принятый» здесь — ключевое слово. Написанный файл, зелёный тест или уверенный отчёт ещё не означают ценность.

Для программной задачи результат принят, когда он соответствует требованиям, проходит проверки и не создаёт неприемлемый долг. Для аналитики — когда цифры подтверждаются источниками и вывод выдерживает ручную проверку. Для поддержки — когда вопрос решён, а не просто закрыт ботом.

В таблицу запуска я бы записывал девять полей:

  1. тип и сложность задачи;
  2. модель и режим;
  3. входные, кэшированные и выходные токены;
  4. количество агентских шагов;
  5. стоимость внешних инструментов;
  6. машинное время;
  7. время постановки и проверки человеком;
  8. принята ли работа без переделки;
  9. сколько занял бы сопоставимый результат без агента.

После этого можно получить три честные метрики: цену принятой задачи, чистую экономию человеческого времени и долю результатов без переделки.

Как провести честный тест за две недели

Не нужно сразу подключать AI ко всей компании. Достаточно короткого теста на настоящей работе.

1. Возьмите не демонстрации, а 30–50 повторяющихся задач

Хорошо подходят исправления ошибок, подготовка аналитических записок, разбор обращений, обновление тестов, миграции и работа с внутренней документацией. Задачи должны иметь понятный критерий завершения.

2. Зафиксируйте исходный уровень

Для сопоставимых задач нужны обычное время выполнения, доля переделок и качество. Если исходной линии нет, любое ускорение останется впечатлением.

3. Разделите задачи до начала работы

Часть выполняется привычным способом, часть — с агентом. Не отдавайте AI только самые удобные задачи после того, как уже оценили их сложность: так легко получить красивый, но бесполезный результат.

4. Считайте человеческое время отдельно от машинного

Параллельность — одно из главных преимуществ агентов. Двадцать машинных часов могут пройти за два часа на часах. Но если человек все эти два часа наблюдал за процессом и отвечал на вопросы, это не полностью автономная работа.

5. Проверяйте вслепую там, где это возможно

Ревьюер не должен заранее знать, какой результат сделал человек, а какой — AI. Иначе ожидания начинают влиять на оценку.

6. Не удаляйте неудачные попытки из отчёта

Ошибка, зависший инструмент и отклонённый вариант — часть экономики агента. Именно они чаще всего исчезают из демонстраций.

7. Смотрите на медиану и хвост распределения

Среднее скрывает редкие дорогие провалы. Добавьте медиану, 90-й или 95-й процентиль стоимости и времени, а также худшие несколько случаев с объяснением причины.

Через две недели у вас будет не универсальный ответ «AI ускоряет» или «AI мешает», а карта задач, где агент действительно окупается.

Когда дорогой агент действительно выгоден

Высокий расход оправдан там, где одновременно выполняются несколько условий:

  • задачу можно разбить и распараллелить;
  • результат легко проверить тестом, данными или понятным ревью;
  • цена задержки высока;
  • работа требует множества вариантов или экспериментов;
  • контекст и критерии качества можно передать явно;
  • неудачная попытка не создаёт необратимого ущерба.

Хуже всего экономика сходится на коротких разовых задачах с большим объёмом неявного контекста, дешёвым человеческим трудом и дорогой проверкой. Там агент может впечатляюще писать — и одновременно делать процесс медленнее.

Главный вывод из данных OpenAI не в том, что каждому специалисту теперь нужны вычисления на $600 в день. Компания показала другую вещь: передовые команды уже используют агентское время как масштабируемый производственный ресурс. Следующий дефицит — не токены, а способность выбирать правильные задачи и проверять реальный результат.

Если завтра вам покажут график с десятью параллельными агентами, спросите две цифры: сколько результатов приняли и сколько человеческих часов они действительно вернули. Всё остальное — загрузка оборудования.

А у вас AI уже экономит время по измерениям — или пока только по ощущениям?

Источники и методика

Данные проверены 15 сентября 2026 года. Годовые суммы рассчитаны для 220 рабочих дней. Это ориентиры по публичной стоимости API, без налогов, корпоративных скидок, инфраструктуры и курсовой разницы.