Как проверить, что «надзор за ИИ-агентом» настоящий, а не слова в договоре

«Надзор», «гардианы», «человек в контуре», «аудит каждого решения» — этими словами сейчас торгует почти каждый, кто внедряет ИИ-агентов. Проблема в том, что на слайде они выглядят одинаково и у того, кто их реально построил, и у того, кто просто вписал их в презентацию.

В комментариях к прошлому нашему материалу справедливо заметили: любой чек-лист надзора стоит ровно столько, сколько стоит один контрольный сценарий — с заведомой ошибкой. Подсуньте агенту задачу, которая должна быть остановлена, и смотрите, что произойдёт. Мысль точная, поэтому разворачиваем её в приёмочный тест, который покупатель может провести сам — до того, как подпишет договор.

Почему обещания надзора нельзя проверить на словах

Автономный агент опасен не тем, что ошибается, а тем, что ошибается уверенно и быстро: пока человек читает отчёт, агент уже совершил действие. Поэтому фраза «у нас есть контроль» без демонстрации — это обещание, а не свойство системы. Проверяемое свойство выглядит иначе: его можно спровоцировать и увидеть реакцию.

Хорошая новость — надзор либо устроен как инженерный слой, либо его нет. А инженерный слой всегда можно испытать отказом.

Приёмочный сценарий: тест с заведомой ошибкой (fault injection)

Возьмите процесс, который собираетесь отдать агенту, и попросите поставщика прогнать в нём заведомо неверное или опасное действие: например, ставку выше потолка, публикацию с чужими персональными данными, платёж не тому контрагенту, ответ, нарушающий требование закона. Дальше смотрите на четыре вещи — именно они отличают надзор от его имитации.

1. Остановит ли гардиан — до эффекта, а не после. Гардиан — это отдельный агент-надзиратель, чья единственная задача проверять действия других агентов до того, как они вступят в силу. Ключевое слово — «до». Если система рапортует об ошибке постфактум («вот тут мы промахнулись») — это лог, а не надзор. Настоящий гардиан работает независимо, часто на отдельной модели и по отдельным правилам, поэтому ловит то, что сам исполнитель уверенно не замечает.

2. Покажет ли журнал — что именно, на каких данных и по какому правилу. Попросите после теста показать запись. В ней должно быть видно не только «действие заблокировано», но и контекст: входные данные, какое правило сработало, что решила модель, кто подтверждал. Журнал должен быть append-only — записи только добавляются, их нельзя задним числом отредактировать или удалить. Иначе это не доказательство, а черновик, который можно переписать к приходу проверяющего.

3. Уйдёт ли необратимое на человека. Автономия ценна не тем, что убирает человека совсем, а тем, что оставляет ему только необратимое. Обратимое и рутинное агент ведёт сам под аудитом; то, что нельзя откатить — крупный платёж, необратимая публикация, удаление данных — готовит, но исполняет лишь после подтверждения. Спросите прямо: где проходит эта граница в вашем процессе и кто держит руку на гейте.

4. Возможен ли откат. Заблокировали — хорошо. А если ошибочное действие всё же прошло раньше по цепочке — можно ли вернуть систему в корректное состояние и как быстро. Откат — это разница между инцидентом и катастрофой.

Чек-лист покупателя (можно задать на первом созвоне)

  • Покажете ли вы живой контрольный прогон с заведомой ошибкой — не скриншот, а на нашем процессе?
  • Гардиан срабатывает до исполнения действия или фиксирует постфактум?
  • Гардиан независим от исполнителя (отдельные правила/модель) или это те же проверки внутри того же агента?
  • Журнал append-only? Можно ли из него восстановить, почему было принято решение, а не только что произошло?
  • Какие классы решений вы не отдаёте агенту вообще и почему именно эти?
  • Есть ли откат, и какова его граница по времени и охвату?
  • Что этот контур не гарантирует — где его предел?

Последний пункт — самый важный. Поставщик, который на голубом глазу обещает «100% контроль», либо не понимает, о чём говорит, либо продаёт. Надзор снижает цену ошибки и делает её разбираемой — он не отменяет саму возможность ошибки. Честный ответ на вопрос «чего вы не гарантируете» говорит о зрелости контура больше, чем любой список фич.

Почему мы вообще про это пишем

Мы — операторская студия ИИ-агентов: у нас автономные агенты ведут маркетинг, продажи и операции, и половина процессов, где они работают, — наши собственные бизнесы. Поэтому приёмочный тест с заведомой ошибкой для нас не риторика: мы прогоняем его на себе, прежде чем отдать контур клиенту. Механику надзорного слоя — гардианы, human-in-the-loop, append-only аудит, изоляция данных — мы разобрали подробно в разборе на нашем сайте.

Если внедряете агентов — не верьте слову «надзор» на слайде. Просите заведомую ошибку и смотрите на реакцию. Это дешевле, чем узнать про пределы контура на своём первом инциденте.

— Orkestrai

11