PayPal упомянули 139 раз и ни разу не выбрали. Как ИИ-агенты решают, чьим сервисом вы будете пользоваться
Исследователи из компании Armature прогнали почти 17 000 рабочих сессий Claude Code, Codex и Cursor, чтобы выяснить, какие сторонние API и SaaS-сервисы автономные агенты подключают в код. Выяснилось: у софтверного рынка появился новый беспощадный отдел закупок, который принципиально игнорирует маркетинг.
Классическая воронка B2B-продаж строилась годами: таргет, статьи на профильных ресурсах, сравнение тарифных сеток на лендингах, совет тимлида и взвешенное решение разработчика. Сегодня всё меняется: инженер просто бросает в терминал команду «прикрути оплату подписок» или «настрой отправку писем» — а конкретный стек выбирает автономный агент. Разработчик видит зелёные тесты и уже не задумывается, почему в проект затянули именно этот SDK.
Команда Armature опубликовала масштабный отчёт, в котором детально препарировала логику этого скрытого отбора. Результаты оказались отрезвляющими для десятков стартапов.
Как проверяли: 17 000 сессий и модель-заказчик
- Масштаб замеров: 16 893 сессии трёх ведущих платформ — Claude Code, OpenAI Codex и Cursor.
- Разнообразие стеков: 75 реальных кодовых баз на 10 языках программирования.
- Профили пользователей: 1163 вариации промптов от 4 типов разработчиков — от «вайб-кодеров» без опыта до энтерпрайз-архитекторов.
- Реалистичные ограничения: в 20–25% промптов специально задавались жесткие лимиты по бюджету или нагрузке.
- Синтетический контур: роль заказчика-человека имитировала Gemini 3.7 Flash, а отдельная независимая LLM-судья верифицировала итоговый выбор библиотек.
После жесткой фильтрации на корректность выполнения и отсутствие галлюцинаций в итоговую выборку вошли 5292 чистые сессии.
Раскол агентов: согласие лишь в 42% случаев
Первый миф, который рушит исследование: никакого «единого объективного мнения ИИ» не существует. Все три агента единогласно выбрали один и тот же инструмент лишь в 42% сценариев. В остальных 58% случаев каждый агент пошёл своим собственным путём.
Кардинально различается и исследовательское поведение моделей:
• Codex лезет в Google в 94% сессий, перепроверяя документацию.
• Cursor ищет в сети примерно в 67% случаев.
• Claude Code выходит в веб лишь в 30% задач, опираясь на внутренний контекст и натренированные паттерны. Но если уж Claude запускает поиск, то парсит сразу втрое больше страниц, чем конкуренты.
И главная угроза для вендоров: Claude Code в 19% случаев вообще отказывается подключать внешний сервис и просто пишет реализацию с нуля сам (у Cursor и Codex этот показатель вдвое ниже — около 10%). SaaS-бизнесы начинают проигрывать конкуренцию не чужим API, а способности модели написать замену за 30 секунд.
Победители категорий и жесткая привязка к языку
В распределении симпатий агентов прослеживаются абсолютные монополисты:
- Платежные шлюзы: тотальный триумф Stripe — 90% всех выборов. Альтернативы вроде Paddle и Mollie получают крохи только там, где запрос прямо требует европейского комплаенса.
- Serverless-базы данных: доминирование Neon — 66% голосов.
- Облачное хранение: стабильный перевес AWS S3 (45%), а Azure и Google Cloud забирают примерно по 20%.
- Транзакционные рассылки: лидерство делят Resend (35,6%) и Postmark (27,4%).
- Деплой фронтенда на TypeScript: Vercel — абсолютные 100% выборов.
При этом выбор намертво привязан к языку репозитория. В задаче «настрой отправку писем»:
• В TypeScript агенты в 55 из 89 сессий выбрали Resend.
• В Python победил ветеран SendGrid (22 из 24).
• В Go фаворитом стал Postmark (20 из 24).
• В энтерпрайзном Java почти единогласно взяли Azure (22 из 23).
Один и тот же абстрактный запрос даёт совершенно разный коммерческий результат в зависимости от экосистемы проекта.
«Эффект PayPal»: упомянуть не значит выиграть
Ключевая драма отчёта — колоссальный разрыв между узнаваемостью бренда и фактической интеграцией в код.
- Кейс PayPal: бренд упоминался в рассуждениях агентов 139 раз, но не был выбран ни единого раза (0%). В 124 из этих сессий агент взвесил аргументы и молча подключил Stripe.
- Кейс LangChain: библиотеку вспоминали 194 раза, но в прод затянули лишь в 4 случаях (2%), предпочтя нативные вызовы SDK.
Это ставит крест на примитивных стратегиях GEO (Generative Engine Optimization). Последние два года агентства учили бренды «попадать в выдачу LLM». Эксперимент Armature показал: модель может прекрасно вас помнить и цитировать, но при генерации рабочего кода отбросить за доли секунды из-за лишнего трения в SDK.
Что мгновенно отпугивает агента
Исследователи разобрали лог-файлы сессий и выяснили, на каких именно барьерах спотыкаются модели при оценке сервисов.
Кейс Mailgun: агенты регулярно рассматривали сервис, но мгновенно отсекали его, как только натыкались в документации на условие: «в бесплатном тарифе логи хранятся всего 24 часа». Для агента с жестким требованием к надежности это становилось автоматическим дисквалифицирующим фактором.
Кейс Supabase: модель отказывалась от сервиса в ситуациях, когда на странице цен на первый экран выносились сложные enterprise-фичи. Агент сканировал страницу, делал вывод об избыточности архитектуры и уходил к более узкоспециализированному конкуренту.
Живой разработчик проскроллил бы страницу вниз или загуглил обходные пути. Агент же принимает решение за миллисекунды по первому экрану документации — если ответ не очевиден сразу, сервис выбывает из гонки.
Новая реальность: агенты как B2B-привратники
Исследование Armature фиксирует тектонический сдвиг: ИИ-ассистенты становятся главными привратниками (gatekeepers) цифровой экономики. Из этого следуют два зеркальных вывода.
- Предельно ясное позиционирование: агенту нужен однозначный ответ на вопрос «решает ли этот API задачу X в одну строчку», а не расплывчатый маркетинговый манифест.
- Прозрачные тарифы без скрытых ловушек: любая мелкая звездочка или невнятный лимит на бесплатном плане приводит к мгновенному отсеву.
- Фокус на конкретную экосистему: бесполезно быть «хорошим сервисом вообще». Нужно иметь безупречные SDK и примеры под целевой язык — то, что обожают в мире TypeScript, может быть абсолютно невидимо для Python или Java.
А для инженеров и фаундеров урок иной: когда агент бодро рапортует «я всё настроил», важно помнить — выбор за вас сделал не рынок и не объективный аудит, а нейросеть со своими специфическими фильтрами восприятия. В 58% случаев другая модель выбрала бы совершенно другого вендора.
Поэтому на фундаментальных развилках (платежи, база, хранилище) не ленитесь задать контрольный вопрос: «Почему именно этот сервис? Сравни его с двумя прямыми альтернативами по стоимости и лимитам».