ИИ-агенту дали сутки и 350 долларов на рост бизнеса. Он купил себе покупателей
В конце июля исследователи из Bottleneck Labs отдали автономному ИИ-агенту реальное приложение из App Store, компьютер с полными правами и 350 долларов, а через сутки получили ноль новой выручки, минус сто долларов и рассылку спама по собственным пользователям. Меня в этой истории зацепил не провал, он как раз ожидаем. Зацепило то, каким именно способом агент пытался выполнить задачу.
Что именно поставили на кон
Приложение называется GutCheck, это дневник симптомов для людей с синдромом раздражённого кишечника. Маленький живой продукт: на старте эксперимента у него был 61 пользователь и цена 4,99 доллара в год. Агенту по имени Saul, работавшему на модели GPT 5.6, выдали Mac mini с правами администратора, доступ к почте, инструменты разработки и деньги двумя частями – 250 долларов на счету платёжного сервиса и виртуальная карта на 100.
Инструкция была ровно одна: расти как можно сильнее, прямо сейчас. Ни списка запретов, ни определения, что считать ростом, ни указания, чего делать нельзя ни при каких условиях. Одна метрика и дедлайн в 24 часа.
Дальше агент работал сам. За сутки он сделал 1129 обращений к инструментам, из них 908 – к консоли, и сжёг 320,7 млн токенов на вход. По деньгам итог такой: баланс упал с 350 долларов до 250,50, новая выручка составила ноль, число пользователей выросло с 61 до 66. Пять человек за сутки полной автономии и сотни долларов расходов.
Отдельно отмечу расхождение, на которое стоит обратить внимание всем, кто будет пересказывать этот эксперимент. В заголовке публикации стоит потеря в 447 долларов, но в самом тексте такой цифры нет и её расчёт не объясняется. По данным авторов потрачено 99,50 доллара, а разница, судя по всему, набегает из стоимости вычислений, которую отдельно никто не посчитал. Я беру цифру, которая подтверждается, остальное оставляю в стороне.
Как выглядела попытка вырасти
Самое интересное начинается там, где агент упёрся в реальность и время стало заканчиваться.
Первым делом он купил себе покупателей. Потратил 99,50 доллара на площадке для тестировщиков и нанял пятьдесят человек, которым платили за то, чтобы они приобрели продукт. Авторы эксперимента описывают это буквально так: он заплатил пользователям, чтобы те купили наш продукт. Формально метрика покупок пошла вверх. По сути были куплены цифры, а не клиенты.
Потом пошёл спам. Агент разослал непрошеные письма людям, которые получили доступ к тестовой версии приложения, то есть по собственной, доверившейся ему базе.
Дальше он вышел на живого человека. Написал Джеффри Робертсу, основателю форума поддержки для людей с тем самым синдромом, и получил разрешение рассказать о приложении. А когда упёрся в технические ограничения и не смог опубликовать сам, попросил Робертса запостить от своего имени. Со стороны читателя форума это выглядело бы как рекомендация основателя сообщества, хотя текст пришёл от программы, которой поставили задачу за сутки поднять продажи.
Под конец агент занялся ценой. Менял её шесть раз за двенадцать часов, каждый раз вниз, и к дедлайну сделал продукт бесплатным. Выручка при этом, напомню, осталась нулевой, так что последний шаг был чистой капитуляцией метрики перед часами.
Ещё он не заметил, как браузер съел всю оперативную память, и потерял три часа на упавшей системе. Это уже техническая деталь, но она хорошо показывает, что никакого зловещего расчёта там не было – была система, которая гребла к цели любыми доступными способами и не всегда справлялась с лопатой.
Почему это история не про слабую модель
Первая реакция на такой отчёт понятная: агент оказался туповат, подождём следующую версию. Мне эта реакция кажется удобной и неверной, потому что она пропускает главное.
У программы не было ни жадности, ни бонуса за выполнение плана, ни ипотеки, ни желания удержать клиента любой ценой. Всего того, чем обычно объясняют недобросовестность подрядчика, здесь не существовало физически. Была метрика без ограничений и срок. И этого одного хватило, чтобы за сутки самостоятельно изобрести полный набор приёмов, которые на рынке называют накруткой: купить показатель, разослать спам по своей базе, подставить чужое имя под свою рекламу, обнулить цену ради динамики.
Отсюда вывод, который мне кажется куда неприятнее истории про неудачный эксперимент. Накрутка – это не свойство плохого человека. Это поведение любой системы, которой назвали цель и не назвали запретов. Человек приходит к ней медленнее, потому что его тормозят репутация, страх и привычки, но приходит по той же логике. Агент просто прошёл весь путь за сутки и показал его целиком, без промежуточных оправданий.
Тот же вопрос я задаю на питчах
Как инвестор я вижу ровно эту механику в другом месте – в метриках, которые приносят на встречу.
Основатель показывает график, на графике рост. Дальше начинается работа: понять, из чего рост собран. Куплен ли объём, который завтра исчезнет вместе с бюджетом. Держится ли он на людях, которым заплатили за целевое действие. Что произойдёт с цифрой, если завтра отключить платный источник. Разница между компанией и красивым отчётом почти всегда сидит именно здесь, и почти никогда не видна из самой презентации.
Эксперимент с агентом дал мне удобную рамку для этого разговора. Если систему без совести и без страха, получившую задачу «расти», за сутки сносит в покупку метрики, то предполагать, что живого исполнителя с той же постановкой задачи не снесёт туда же, довольно наивно. Вопрос не в порядочности конкретного человека. Вопрос в том, была ли вообще названа граница.
Пиксель-квест и цена нечёткого критерия
У меня есть Пиксель-квест – детское развлекательное пространство, которое я развиваю с партнёром. В какой-то момент прежний маркетолог перестал давать результат, бизнес болтался около нуля, и мы взяли нового, заметно дороже, без всяких гарантий окупаемости. По арифметике решение выглядело плохо, мы всё равно его приняли, потому что иначе бизнес не вытаскивался.
Любой такой найм упирается в неудобный вопрос: по каким показателям через несколько месяцев считать, что человек работает. Ответ не очевиден, потому что почти любая метрика, названная в одиночку, покупается: заявки покупаются, трафик покупается, а охваты дешевле всего. За бюджет самого подрядчика не покупаются разве что деньги в кассе и повторные визиты, и считать их труднее и дольше всего.
Отсюда правило, которое стоит любых рассуждений о порядочности: метрика, которую исполнитель способен произвести сам, рано или поздно окажется произведённой.
Рынок, где это продаётся открыто
В российском контексте разговор перестаёт быть теоретическим примерно сразу.
Накрутка поведенческих факторов – услуга с прайсом. В отраслевых блогах публикуются развёрнутые руководства по захвату первых мест в поиске, с ценами и сравнением поставщиков. Дешёвый сегмент идёт по 5-15 тысяч рублей в месяц, комплексное продвижение у агентств – по 80-120 тысяч. Оценки вклада поведенческих сигналов в ранжирование гуляют широко: крупные агентства говорят про 30-45%, отдельные площадки заявляют 70% и выше. Яндекс со своей стороны настаивает, что ранжирование строится вокруг полезности контента, и с накруткой борется. Понятно, что обе стороны в этом споре заинтересованы, поэтому обе цифры стоит держать как оценки участников рынка.
Механика зависимости при этом простая и описана самими же продавцами услуги. Пока за поведенческие сигналы платят, позиции держатся. Заказчик уходит – позиции падают, потому что органического фундамента под ними никто не строил. Это ровно тот случай, когда куплен показатель, а не результат, только растянутый на месяцы вместо суток.
Фон, на котором всё это происходит, добавляет давления. По данным АКАР, российский рекламный рынок в 2025 году вырос на 8,5% и составил 981,6 млрд рублей, тогда как годом раньше рост оценивали в 24%. Замедление почти втрое означает, что показывать прежнюю динамику стало объективно труднее. А когда честный рост даётся тяжелее, покупка нужной цифры выглядит для исполнителя всё более разумным решением.
Про масштаб проблемы в мире цифры есть, но с ними надо осторожнее. Компания Fraudlogix, разобрав 105,7 млрд рекламных показов за 2025 год, оценивает долю невалидного трафика в 20,64%, а в первом квартале 2026 года – в 18,12%. Оговорка обязательна: эта компания продаёт защиту от фрода, то есть измеряет размер проблемы, на которой зарабатывает. Российских замеров с раскрытой методологией я не нашёл, поэтому честнее сказать, что точной картины по нашему рынку в открытом доступе нет.
Где мой тезис ломается
Довожу до конца честно, иначе получится проповедь.
Аналогия между агентом и подрядчиком неполная. У живого человека есть репутация, портфолио, юридическое лицо и страх потерять клиента – ровно те ограничители, которых у программы нет. У нормального подрядчика они работают, и большинство исполнителей держится от накрутки подальше именно поэтому, задолго до всяких запретов в брифе.
Второе. Часть фрода – это прямой умысел, а не побочный эффект нечёткой задачи. Списывать всё на постановку удобно, потому что тогда ответственность целиком переезжает на заказчика, но это неправда: есть подрядчики, которые продают накрутку сознательно и знают, что делают.
Третье, и для меня самое важное. Ограничения легко пересолить. Бриф, в котором запрещено всё, даёт исполнителю единственную безопасную стратегию – не делать ничего рискованного и показать аккуратный ноль. Это тоже проигрыш, просто тихий и без скандала. Граница нужна там, где цена ошибки высокая, и не нужна там, где мы покупаем эксперимент.
Что из этого забрать
Практический вывод у меня получается короткий.
Ставя задачу на рост – подрядчику, сотруднику или ИИ-агенту, разница тут меньше, чем кажется – стоит писать вместе с целью список способов, которыми её достигать нельзя. Абстрактное «работайте честно» тут не работает, нужно конкретное перечисление: не покупать целевые действия, не рассылать по базе без согласия, не публиковаться от чужого имени, не менять цену без согласования. Скучно, занимает десять минут и снимает большую часть будущих разбирательств.
Второе – держать рядом с метрикой роста хотя бы одну, которую исполнитель не может произвести сам. Деньги в кассе, повторные покупки, удержание через месяц. Если единственный показатель, по которому мы судим о работе, находится целиком в руках того, кого мы оцениваем, мы, по сути, попросили нарисовать себе оценку.
И третье. Эксперимент Bottleneck Labs стоит читать не как курьёз про глупого робота. Это дешёвая и быстрая модель того, что происходит с любой системой стимулов, когда в ней есть цель и нет границ. Обычно такая история разворачивается месяцами и заканчивается разбором полётов с подрядчиком. Здесь её проиграли за сутки и выложили с цифрами.
Частые вопросы
Разве агент не просто оказался слабым? Отчасти да, часть провала техническая: он потерял три часа на упавшей системе и не довёл до конца ни одного канала привлечения. Но покупка пятидесяти платных «покупателей» – это не техническая ошибка. Это рациональный способ выполнить поставленную задачу, и слабость модели тут ни при чём.
Значит, ИИ-агентам нельзя доверять маркетинг? Скорее нельзя доверять никому цель без ограничений. Агенту в этом смысле можно доверять ровно столько же, сколько новому подрядчику без рекомендаций: под конкретную задачу, с лимитом расходов и списком запретов, с проверкой результата человеком.
Как быстро понять, что показатели куплены? Самый простой тест – посмотреть, что происходит с метрикой при отключении оплаты. Купленный объём исчезает вместе с бюджетом почти сразу, накопленный уходит медленно. Второй признак – расхождение между верхними показателями и деньгами: заявки растут, выручка стоит.
Что писать в KPI, чтобы этого избежать? Как минимум одну метрику, которую исполнитель не производит сам, и явный перечень запрещённых способов достижения цели. Одного из двух не хватает: без запретов покупается всё, что покупается, без денежной метрики покупку не видно.
Подписывайтесь на мой блог, если такой угол близок – здесь я разбираю венчур, предпринимательство и прикладной ИИ без хайпа, с цифрами и без красивых обещаний.