Дайджест Agent Experience. Неделя 20–26 июля 2026
В прошлый раз обещал разобрать, как выглядит «пульт доверия» для агента. Но за меня его на прошедшей недели разобрали 1Password, WorkOS и Okta, каждый со своего конца. Сегодня в дайджесте девять материалов: из чего этот пульт складывается и почему одной галочки «разрешаю» больше не хватает.
Главное: ваши исследования начинают читать машины
Тони Алисеа из NNG отталкивается от неприятного факта: интерфейсные решения давно генерируют не дизайнеры. Продакт собирает макет промптом, инженер добавляет фичу через ИИ и гейткипингом это не остановить. Значит, задача другая: чтобы всё, что генерирует ИИ, опиралось на то, что команда знает о своих пользователях. Отсюда его мысленный эксперимент — файл UX.md по образцу открытого Google Labs DESIGN.md, который живёт рядом с кодом продукта: синтез исследований, стандарты взаимодействия, глоссарий домена, модели пользователя и модели мира. В статье описывается новая мера успеха: артефакт оценивается не по тому, убедил ли он стейкхолдеров, а по тому, стал ли лучше вывод ИИ.
Зачем вам: это переворачивает адресата ресёрча. Отчёт, который никто из людей не дочитает, вдруг получает читателя, который дочитает всегда и буквально. И перестаёт быть документом, который сдают по хендоффу и забывают.
AX: пропуск на десять минут — и кнопка «да» внутри вашего продукта
1Password выложил архитектуру делегированных полномочий для локального агента, это самый внятный технический документ недели. Никакого нового протокола: доверие собирают вокруг «локального якоря» — подписанного кодом приложения на машине пользователя. Ключи привязаны к устройству и лежат в Secure Enclave или TPM. Агент получает на каждый запрос короткоживущий токен, десять минут или меньше. Долгоживущих секретов у него нет по построению, refresh-токенов ему не выдают вовсе. Человек доказывает, что это он, через WebAuthn; агент меняет подписанное удостоверение на токен доступа по RFC 8693. WorkOS на той же неделе закрыл вторую половину задачи, где человек говорит «да». Обычно его в середине разговора с агентом выбрасывает на чужой домен, в чужую вёрстку, в самый чувствительный момент. Вместо этого агент запрашивает полномочия, ваш бэкенд получает короткий код вида BCDF-GHJK, вы показываете его в своём интерфейсе, человек зачитывает код агенту. С жёстким условием: пользователь должен быть аутентифицирован до того, как код появится на экране, иначе агента заберёт себе любой, кто откроет страницу. Признаюсь, сначала мне это показалось шагом назад: зачитывать буквы вслух в 2026-м. А потом дошло, что это честнее редиректа: человек не покидает разговор и видит, кому именно выдаёт права. Okta же показал, что тема давно не про энтузиастов: Agent Gateway (пока research release) ставит шлюз между агентами и корпоративными системами, изолирует креденшелы, ведёт аудит с атрибуцией на конкретного человека и умеет обрубить сбежавшего агента. Оттуда же цифра, которую Okta приводит по данным Cloud Security Alliance: 84% организаций сомневаются, что прошли бы аудит по поведению агентов или контролю их доступов.
Зачем вам: три материала складываются в тот самый пульт. Кто это (идентичность), что ему можно (скоуп), на сколько (минуты, а не «навсегда»), где человек нажимает «да» (у вас, а не на хостед-странице вендора) и где всё это обрывается. Ни один из пяти переключателей не рисуется сам.
AX: у агента появляется своя поверхность
Крупнейшая ревизия протокола с момента запуска. Главное — уход в stateless: протокольные сессии убирают вместе с хендшейком и заголовком сессии, появляется механизм многораундовых запросов, а транспорт наконец переваривают обычные API-шлюзы. Авторизацию переписали вокруг OAuth 2.1 и OpenID Connect. Roots, Sampling, Logging, старый транспорт HTTP+SSE и динамическую регистрацию клиентов отправляют в депрекейт (работать они будут ещё год). И отдельным пунктом в перечне: интерактивные MCP Apps. 2026-07-28 — пока release candidate, зафиксированный 21 мая. Финальная спецификация публикуется 28 июля, а на сегодня действующая версия всё ещё 2025-11-25.
Зачем вам: stateless снимает главный инфраструктурный барьер. MCP-сервер уезжает за обычный балансировщик, и «выставить себя агентам» перестаёт быть отдельным проектом с sticky-сессиями. А MCP Apps — первый официальный способ отдать агенту не только данные, но и интерфейс. Поверхность внутри агентного хоста становится проектируемой, и кому-то придётся её проектировать.
И тут же: доверие нельзя выдать один раз
Пока одни строят пульт, четыре независимые команды за десять дней показали, зачем на нём нужна кнопка «оборвать». Manifold Security: любое установленное расширение браузера может подделывать клики пользователя в Claude for Chrome — шесть строк кода, и это до сих пор воспроизводится. Отравление памяти через обычное письмо: агент сохранял инструкции атакующего больше чем в половине случаев. Кэти Пакстон-Фир с коллегами вживила модели бэкдор меньше чем за £75 и примерно за час — хватило десяти отравленных обучающих примеров, и крупные модели оказались уязвимее. А в PromptArmor пересчитали коннекторы ChatGPT и Claude: те менялись в среднем каждые девять минут, 931 из 2517 изменился за шесть недель, и примерно двое из пяти Claude-коннекторов сами зовут другие ИИ-сервисы.
Зачем вам: последняя цифра ломает саму привычку ревьюить интеграцию один раз. Штука, которую вы проверили в понедельник, к пятнице другая. Доверие агенту — процесс со сроком годности, а не состояние, которое однажды выдали.
Из рунета: агента лечит среда, а не промпт
Автор формулирует прямо: «Промпт не лечит провалы агента, лечит среда». С ноября 2024 он вырастил из одного конвейера примерно десяток параллельных, с корневым роутером сверху и control plane на 239 рабочих элементах как единственном источнике истины. Три практики стоят того, чтобы их украсть. «Трещотка»: повторяющийся сбой превращается в постоянное исправление среды, а не в напоминание агенту в чате. Sensor-first: сначала детектор с контрактом PASS/FAIL, текстовое правило потом. И проверка на декоративность — правило прогоняют на соответствующем артефакте и на нарушающем; если оба зелёные, оно только украшает конфиг. Отдельно ценно, что автор перечисляет свои дыры: часть инвариантов детекторами не покрыта и держится на ревью и дисциплине оператора.
Зачем вам: в продукте работает то же самое. Просить агента вежливо в документации бессмысленно, работают гейты. AX начинается с устройства среды, в которую агента впускают, а не с подбора слов.
Из рунета: рой за $1339 и цена слов «с нуля»
Разбор эксперимента Cursor: сотни агентов параллельно пишут движок SQLite на Rust, имея только 835 страниц документации — без исходников, без готовых тестов, без бинарника оригинала и без интернета. Дешёвая конфигурация обошлась в $1339 за четырёхчасовой прогон, дорогая в $10 565 на той же задаче, и разница целиком в организации работы, а не в силе модели. Планировщики декомпозируют, воркеры исполняют и съедают 69–90% токенов. Против прошлой архитектуры: меньше 1000 merge-конфликтов вместо 70 000+, тесты проходят на 73–85% вместо 11–77%, кода 9908 строк вместо 64 305. Git выбросили и написали свой VCS — тысяча коммитов в секунду вместо тысячи в час. В комментариях, а их семьдесят, «с нуля» разносят по делу: 835 страниц спеки это уже перевод с человеческого на Rust, а не изобретение. И справедливо считают, что $1339 цена 73–85% зелёных тестов, а не готового продукта; остаток добивается логарифмически.
Зачем вам: дефицит переехал с написания кода на точное описание намерения. Спека на 835 страниц из бюрократии превратилась во вход в производство.
Из рунета: метрики выросли, продукт просел
Формально не про агентов, но лучший на этой неделе русскоязычный текст о том, чем кончается оптимизация под клик. Разбор майского обновления Яндекс.Музыки: 27 персональных категорий, из которых на экран влезает три — до конца списка девять скроллов, и под это перекроили всё приложение. В отчёте три цифры: гиперконтекстные рекомендации включают на 30% чаще, треки из них добавляют в коллекцию на 64% чаще, дизлайков на 4% меньше. А времени прослушивания, главной метрики стриминга, в отчёте нет. Как нет шеров, продлений подписки и retention. Текст собрал 298 комментариев, и это отдельное чтение.
Зачем вам: ровно этот вопрос вам зададут про вашего агента — что он максимизирует? Пока рекомендатель растит клики, у пользователя копится ощущение, что его водят за нос. Агент с правами и доступом наберёт это ощущение в разы быстрее.
Реплика недели
Я собирался показывать «пульт доверия» сам и с нуля, а за неделю его показали за меня. Правда, по частям и в трёх разных компаниях. 1Password: агент занимает полномочия на десять минут и не хранит секретов. WorkOS: подтверждение живёт в вашем интерфейсе, коротким кодом, который человек зачитывает вслух. Okta: у агента своя идентичность, свой аудит и кнопка отключения. Собрать их вместе и видно, что «дать доступ» перестало быть экраном. Это процесс с истечением, отзывом и журналом. Дизайнерам придётся проектировать не форму согласия, а его жизненный цикл: кто, на что, до какого момента и как это обрывается посреди действия. Чекбокс «разрешить приложению» сюда не масштабируется. А цифра PromptArmor про коннектор, который меняется каждые девять минут, закрывает вопрос, можно ли выдать доверие один раз. Нельзя. Отдельно скажу про рунет. Он на той же неделе отвечает на тот же вопрос с другого конца: не «как выдать права», а «в какой среде агента вообще можно отпускать». Промпт не лечит, лечит среда. Между этими двумя мыслями и живёт вся дисциплина AX.
Обещанный разбор пульта руками не отменяется: соберу минимальный экран согласия для агента — скоуп, срок, журнал, кнопка «оборвать» и покажу отдельным постом.