Как проверить, что «надзор за ИИ-агентом» настоящий, а не слова в договоре
«Надзор», «гардианы», «человек в контуре», «аудит каждого решения» — этими словами сейчас торгует почти каждый, кто внедряет ИИ-агентов. Проблема в том, что на слайде они выглядят одинаково и у того, кто их реально построил, и у того, кто просто вписал их в презентацию.
В комментариях к прошлому нашему материалу справедливо заметили: любой чек-лист надзора стоит ровно столько, сколько стоит один контрольный сценарий — с заведомой ошибкой. Подсуньте агенту задачу, которая должна быть остановлена, и смотрите, что произойдёт. Мысль точная, поэтому разворачиваем её в приёмочный тест, который покупатель может провести сам — до того, как подпишет договор.
Почему обещания надзора нельзя проверить на словах
Автономный агент опасен не тем, что ошибается, а тем, что ошибается уверенно и быстро: пока человек читает отчёт, агент уже совершил действие. Поэтому фраза «у нас есть контроль» без демонстрации — это обещание, а не свойство системы. Проверяемое свойство выглядит иначе: его можно спровоцировать и увидеть реакцию.
Хорошая новость — надзор либо устроен как инженерный слой, либо его нет. А инженерный слой всегда можно испытать отказом.
Приёмочный сценарий: тест с заведомой ошибкой (fault injection)
Возьмите процесс, который собираетесь отдать агенту, и попросите поставщика прогнать в нём заведомо неверное или опасное действие: например, ставку выше потолка, публикацию с чужими персональными данными, платёж не тому контрагенту, ответ, нарушающий требование закона. Дальше смотрите на четыре вещи — именно они отличают надзор от его имитации.
1. Остановит ли гардиан — до эффекта, а не после. Гардиан — это отдельный агент-надзиратель, чья единственная задача проверять действия других агентов до того, как они вступят в силу. Ключевое слово — «до». Если система рапортует об ошибке постфактум («вот тут мы промахнулись») — это лог, а не надзор. Настоящий гардиан работает независимо, часто на отдельной модели и по отдельным правилам, поэтому ловит то, что сам исполнитель уверенно не замечает.
2. Покажет ли журнал — что именно, на каких данных и по какому правилу. Попросите после теста показать запись. В ней должно быть видно не только «действие заблокировано», но и контекст: входные данные, какое правило сработало, что решила модель, кто подтверждал. Журнал должен быть append-only — записи только добавляются, их нельзя задним числом отредактировать или удалить. Иначе это не доказательство, а черновик, который можно переписать к приходу проверяющего.
3. Уйдёт ли необратимое на человека. Автономия ценна не тем, что убирает человека совсем, а тем, что оставляет ему только необратимое. Обратимое и рутинное агент ведёт сам под аудитом; то, что нельзя откатить — крупный платёж, необратимая публикация, удаление данных — готовит, но исполняет лишь после подтверждения. Спросите прямо: где проходит эта граница в вашем процессе и кто держит руку на гейте.
4. Возможен ли откат. Заблокировали — хорошо. А если ошибочное действие всё же прошло раньше по цепочке — можно ли вернуть систему в корректное состояние и как быстро. Откат — это разница между инцидентом и катастрофой.
Чек-лист покупателя (можно задать на первом созвоне)
- Покажете ли вы живой контрольный прогон с заведомой ошибкой — не скриншот, а на нашем процессе?
- Гардиан срабатывает до исполнения действия или фиксирует постфактум?
- Гардиан независим от исполнителя (отдельные правила/модель) или это те же проверки внутри того же агента?
- Журнал append-only? Можно ли из него восстановить, почему было принято решение, а не только что произошло?
- Какие классы решений вы не отдаёте агенту вообще и почему именно эти?
- Есть ли откат, и какова его граница по времени и охвату?
- Что этот контур не гарантирует — где его предел?
Последний пункт — самый важный. Поставщик, который на голубом глазу обещает «100% контроль», либо не понимает, о чём говорит, либо продаёт. Надзор снижает цену ошибки и делает её разбираемой — он не отменяет саму возможность ошибки. Честный ответ на вопрос «чего вы не гарантируете» говорит о зрелости контура больше, чем любой список фич.
Почему мы вообще про это пишем
Мы — операторская студия ИИ-агентов: у нас автономные агенты ведут маркетинг, продажи и операции, и половина процессов, где они работают, — наши собственные бизнесы. Поэтому приёмочный тест с заведомой ошибкой для нас не риторика: мы прогоняем его на себе, прежде чем отдать контур клиенту. Механику надзорного слоя — гардианы, human-in-the-loop, append-only аудит, изоляция данных — мы разобрали подробно в разборе на нашем сайте.
Если внедряете агентов — не верьте слову «надзор» на слайде. Просите заведомую ошибку и смотрите на реакцию. Это дешевле, чем узнать про пределы контура на своём первом инциденте.
— Orkestrai