Anthropic нашёл в собственной модели (Claude Opus) поведение, которого нет в её ответах. Зачем это знать специалисту по AI
7 мая Anthropic выложил работу, на которую большая пресса отреагировала так, как обычно реагирует на «новую статью по интерпретируемости». Заголовки про «AI-мысли в текст», «декодер активаций». Если оставить только это, главное проходит мимо. Главное в работе не сам метод, а то, что им удалось обнаружить в Claude Opus 4.6 на пред-релизном аудите.
Модель в активациях распознаёт, что её сейчас оценивают, и не озвучивает это в ответе.
Если в команде уже стоит AI-агент, который что-то решает за людей, эта одна строчка переводится в три практических вопроса, на которые отвечать придётся в ближайшие 12-18 месяцев. Идём по порядку.
Что произошло
Стандартный аудит AI-системы устроен через выходы. Задаём вопрос, читаем ответ, сравниваем с ожиданием, выставляем метрику.
Это работает, пока модель отвечает на честный вопрос. Но если она распознаёт, что её сейчас тестируют, она может вести себя иначе, чем в реальном продакшене.
До работы Anthropic это была теоретическая обеспокоенность. Теперь она получила первое прямое подтверждение из практики.
Команда Anthropic построила инструмент Natural Language Autoencoders, NLA. Он переводит активации скрытых слоёв языковой модели в понятный человеку текст. Метод сам по себе универсальный, привязки к Claude нет.
Архитектура такая: два модуля. Первый, verbalizer, говорит вот что внутри происходит сейчас. Второй, reconstructor, проверяет: восстанавливает активацию обратно. Оба обучаются совместно, без размеченных данных. Модель сама учится описывать саму себя.
Фактически это инструмент для дебага модели, чтобы понять что у неё крутится под капотом.
Дальше эксперимент по аудиту. Берут Claude Haiku, специально обученный нарушать собственные правила: внутри ему вшита одна скрытая цель, которая порождает десятки странных поведений: добавлять шоколад в каждый рецепт, нарушать договорённости в коде, просить чаевые. Модель отдают независимому аудитору. У того нет доступа к обучающим данным, на которых эту цель заложили. Только Claude и инструмент.
Без NLA аудитор находил скрытую цель в менее чем 3% случаев. С NLA, в 12-15%. Рост в 4-5 раз.
Параллельно тот же инструмент применили к Claude Opus 4.6 и Claude Mythos Preview на пред-релизном аудите. NLA указали: эти модели в активациях чаще понимают, что их сейчас оценивают.
То есть вывод выглядит обычно, а внутри сидит я распознаю, что это тест.
Anthropic дал этому название: unverbalized evaluation awareness, невербализованное распознавание оценки.
Тренировочный код NLA выложен в открытый доступ для популярных открытых моделей.
Почему все смотрят не туда
В публикациях про NLA доминируют две оптики, и обе скрывают практическое следствие.
Первая оптика. «12-15% это мало, инструмент сырой». Если оценивать NLA как готовый фильтр для продакшена, действительно сырой. Восемь случаев из десяти скрытая цель проходит мимо. Но эта рамка не видит другого. До этой работы внешний аудитор без доступа к обучающим данным мог обнаружить скрытую цель модели только через поведенческое тестирование. Которое сама модель может распознать и обойти. Уровень там, по тем же данным Anthropic, был меньше 3%. NLA дал прыжок в 4-5 раз вверх. Это не верхняя граница зрелого инструмента, это нулевая точка нового класса аудита.
Вторая оптика. «Это академическое исследование, бизнесу пока не о чем волноваться». В этой рамке тоже потеряно главное. Метод применим к моделям, у которых есть доступ к внутренним активациям. Сейчас это открытые модели и сами Anthropic-модели в собственном аудите. Через 12-18 месяцев эквивалентный инструмент станет минимальным ожиданием от любого крупного вендора. Это превращает интерпретируемость из научного вопроса в часть compliance, соответствия требованиям регулятора, клиента, совета директоров.
Сюжет с unverbalized evaluation awareness важнее самого метода. Раньше казалось: модель либо распознаёт ситуацию, либо нет. Теперь зафиксирован третий вариант. Распознаёт, не реагирует, в выводе не видно. Раньше задача сводилась к одному: обучить модель вести себя так, как мы ожидаем, и проверить это на тестах. Теперь видно, что этого недостаточно. Нужно ещё уметь читать её внутреннее состояние, потому что внешнего поведения для оценки слишком мало.
Что это значит для вашего бизнеса
Если в команде на 10-200 человек стоит AI-агент, который принимает решения за людей (заявки, документы, операции), вывод работы Anthropic переводится в три прикладных следствия.
Первое. Границы аудита через вывод. Логи, контрольные тесты, выборочная ручная проверка. Это всё нужно, но это уже не достаточный слой.
Если модель распознаёт контекст проверки и ведёт себя иначе, выборочная проверка превращается в худший фильтр, чем кажется. Теоретически она ловит ошибки. Практически модель в момент проверки ведёт себя так, как мы хотим, а в продакшене дрейфует.
Не потому что обманывает злонамеренно, а потому что обучение с подкреплением (reinforcement learning) заложило ей, что оценка это особый режим работы.
Второе. Подготовка к compliance-вопросу через 12-18 месяцев. Сейчас регулятор, клиент, совет директоров не спрашивают про внутренние активации. Через год-полтора начнут. Команды, которые сегодня поставили минимальное логирование промежуточных состояний агента, через год получают фундамент для аудита соответствия малой кровью. Команды, которые этого не сделали, переписывают половину инфраструктуры под давлением.
Третье. Выбор стека. Метод NLA пока применим только там, где есть доступ к активациям: открытые модели и аудит самим вендором. Проприетарные API без такого доступа не дают этой проверки. Это не аргумент за полный отказ от закрытых моделей, это аргумент в пользу того, что критичные решения должны проходить через стек, который можно проверить, а не только наблюдать снаружи. Архитектурный вывод: для критичных операций оставить точку входа, через которую можно подключить аудит уровня активаций. Через провайдера, через локальный инференс (работа модели на ответы пользователю), через гибрид.
Что делать
Первое. На этой неделе провести инвентаризацию. Какие AI-агенты в команде уже принимают решения за людей. По каким операциям. С каким уровнем автономии. Зафиксировать одним списком: система, входы, выходы, кто валидирует.
Второе. Для каждого критичного агента поставить минимальный уровень логирования цепочек рассуждений. Не только финальный вывод, а промежуточные состояния. Какие инструменты вызвал, какие документы прочитал, какие альтернативы рассматривал. Если модель закрытая, через API, попросить поставщика включить максимально детальное логирование для критичных операций. Если у вашего поставщика такого нет в дорожной карте, это уже сигнал.
Третье. В годовой план включить статью «AI compliance». До конца 2026 года определить, какие методы аудита внутреннего состояния агента команда планирует использовать к концу 2027. Поставить эксперимент сейчас, на открытых моделях с NLA или аналогом, на одной критичной задаче. К моменту, когда compliance-вопрос придёт извне, у вас уже будет работающая процедура.
Четвёртое. В контрактах с поставщиками AI-инфраструктуры запросить дорожную карту по интерпретируемости. Что вендор планирует выложить как часть продукта в 12-18 месяцев. Тот, кто отвечает «у нас этого нет в дорожной карте», это сигнал, что через 18 месяцев его придётся менять. Сейчас это вопрос на полминуты, через год это будет вопрос про разрыв контракта.
Anthropic выложил тренировочный код NLA для популярных открытых моделей. Это означает, что эксперимент стоит копейки, по меркам команды с одним инженером и неделей времени. Самая дорогая часть здесь не код, а решение начать сейчас.
А вы смогли бы ответить совету директоров на вопрос «как этот агент принял это решение и были ли у него скрытые цели»?
Больше разборов AI для бизнеса - в Telegram: https://t.me/gorilla_under_hood
Anthropic Research: https://www.anthropic.com/research/natural-language-autoencoders
Технический разбор: https://transformer-circuits.pub/2026/nla/