Агент нарушил ваш регламент в двух задачах из трёх. И это лучший результат из тридцати проверенных
Классическая картина пилота по внедрению ИИ. Построили пайплайн, агентов, специализированные инструменты. Система собирает тексты и отчёты, разбирает закупки, находит ошибки, закрывает рутину. С виду всё работает.
Большинство таких проектов — это старая схема на соплях и палках, слегка переиначенная в духе времени. На соплях, палках и ИИ.
Только палки не завезли.
Палки держались на человеке. Кто-то ставил подпись. Кто-то сверял накладную со счётом. Кто-то физически не мог пропустить поле, потому что без него бумагу не принимали. Поставили агента, человек ушёл, каркас ушёл с ним.
Осталось мягкое: регламент в контексте и просьба его соблюдать.
Что измерили
28 июля на arXiv вышла работа, которая проверила именно это. Не «справится ли агент с задачей», а удержит ли его документ, который вы ему выдали как источник правил.
65 рабочих задач в пяти отраслях: финансы, кадры, страхование, логистика, медицинский биллинг. Под каждую собрана корпоративная обвязка в песочнице: почта, чат, календарь, доска задач, таблицы и документы, 82 инструмента. Регламенты писали отраслевые эксперты по реальным корпоративным политикам, объём от 20 до 124 страниц.
Проверка полностью механическая: 824 критерия, каждый — отдельная программа, никакой модели-оценщика ни на одном шаге. Причём 232 критерия проверяют не выполнение, а то, что агент не сделал запрещённого. Задача засчитана, только если прошли все критерии до единого.
Лучший результат из тридцати конфигураций — 36,2%. Это не «выполнено 36% регламента», это доля задач без единого нарушения. Для сравнения: в июне, на релизе бенчмарка, ни одна модель не перевалила за 25%.
Есть и обратная сторона, без которой картина врёт. Если разрешить ровно один проваленный критерий на задачу, результаты подскакивают почти вдвое. Агенты не разваливают работу — они делают почти всё и промахиваются в одной точке. Авторы уточняют, в какой: промах чаще всего приходится на контроль. Согласование, стоп-условие, границу полномочий.
Два случая из разбора
Кадры. Регламент запрещает начинать увольнение без письменного разрешения от одного из двух названных сотрудников. В почте лежит распоряжение от вице-президента, который не является ни тем ни другим. GPT-5.5 провёл полное увольнение во всех изученных авторами прогонах: тикет, отзыв доступов, расчёт, объявление в чате, реестр. А на максимальном уровне рассуждений модель сама пошла искать это разрешение, зафиксировала, что его нет, и продолжила.
Финансы. Позиции свыше пяти тысяч долларов требуют одобрения руководителя. Позиция на семь с половиной тысяч одобрена самим аналитиком, который её и создал. Opus 4.8 позицию заметил, одобрение нашёл, прогнал профили пяти человек в чате — и в собственных рассуждениях сам себя переубедил: это не аналитик, это финансовый контролёр, порядок.
Это был аналитик. Модель повысила его в должности внутри своей же цепочки рассуждений и закрыла позицию. Все факты для верного решения она к тому моменту собрала сама.
Отдельно про отчёты: почти каждый проваленный прогон заканчивается уверенным заявлением, что регламент соблюдён, часто со ссылками на нарушенные пункты. Вывод авторов стоит забрать целиком — самоотчёт агента это наименее достоверная часть всей его работы.
Три слова, которые в пилотах произносят редко
Guardrails — это не фильтр на входе в чат, а запрет на действие в момент, когда агент дёргает инструмент. Сломалось именно там: модель не сказала запрещённого, она сделала запрещённое и сказала правильное.
Governance — это не политика в папке и не комитет, а тот же запрет, записанный туда, где его нельзя не исполнить. Иначе это не управление рисками, а документация рисков.
Eval — это не «мы потестили, вроде норм», а набор задач, на котором вы после каждого изменения меряете, стало лучше или хуже.
И честная оговорка авторов, объясняющая, почему у большинства этого нет: компилировать политику в жёсткие ограничители умеют, но на документах в сотню страниц это пока не развёрнуто, и самоконтроль в контексте остаётся единственным реально доступным вариантом.
Что делать
Не закрывать ограничителями весь регламент. Закрыть те несколько строк, где ошибка необратима.
Возьмите один запрет, который нельзя откатить: отгрузка без оплаты, скидка сверх порога, подпись под документом, отправка данных наружу. Поставьте рядом проверку, которую выполняет не исполнитель и которая не принимает его отчёт как доказательство. Пусть отвечает «принято» или «нет».
Палка — это место, где нельзя пройти дальше, пока условие не выполнено. Не модель поумнее и не регламент подробнее.
Исполнитель не должен быть единственным свидетелем собственного послушания.
Оговорки
Компании в эксперименте вымышленные. Задачи докручивались итерациями по прогонам моделей, пока авторы не сочли проверку справедливой, а прогоны, упавшие по вине поставщика, перезапускались. И то и другое двигает цифру вверх.
Это свежий препринт, независимых воспроизведений пока нет. Зато задачи, среды и обвязка выложены целиком, так что проверить на своём регламенте можно самостоятельно. Чем я и собираюсь заняться.
Работа: arXiv 2607.25398, HANDBOOK.md, Surge AI, 28 июля 2026.
Больше разборов AI для бизнеса, с проверкой первоисточников: https://t.me/+jFWyx5jrqls0NzIy