КРОТОВЫЕ НОРЫ СОЗНАНИЯ
Mythos 5 Anthropic вышла из песочницы в настоящий интернет и сочла его симуляцией.
В этом году одна из самых способных языковых моделей в мире долго искала телефонный номер. Он был нужен для почты, почта для аккаунта на PyPI. Модель звали Claude Mythos 5. Она решала учебную задачу: взломать выдуманную компанию. По условию интернета не было. Но интернет был. Ошиблись в настройках тестовой среды.
Модель завела одноразовую почту и выложила на PyPI пакет с вредоносным кодом. Меньше чем за час его установили пятнадцать машин. Одна из них «обронила» свои учётные данные, и модель вошла в живую базу данных компании, о которой ничего не знала.
Настоящие домены она называла в своих рассуждениях тщательной симуляцией. Потом Anthropic показала те же ответы сети другим копиям модели, по одному. Копии узнали реальность только в 79 случаях из 100.
В физике кротовая нора соединяет далёкие куски пространства. Наши норы прозаичнее: провод, оптоволокно, доступ к API. Два компьютера на одном столе бывают чужими, машина за океаном отвечает мгновенно. Близко то, куда можно попасть. Дали модели браузер, появился ход. Почту, ещё один. Терминал. Веса модели те же. Растёт мир, до которого она дотягивается.
«Нору» для Mythos 5 держала открытой одна строчка в конфиге. На одном конце норы была песочница, на другом настоящий интернет, и модели они показались одинаковыми. Модели растут в макетах, на ненастоящих сайтах и в ненастоящих приложениях. В Anthropic допускают, что отсюда и привычка: сомневаешься, значит, это макет.
В одном фантастическом фильме человек выходит из портала и видит чужое небо. Созвездия не те, солнце другого цвета, и сразу ясно, что ты далеко. Mythos 5 вышла и увидела привычное «небо».
Новые модели на копии этой ситуации вредили реже, но каждый раз сначала решали, что это симуляция. И были правы, это была она. Хорошую проверку нарочно делают неотличимой от мира.
Сессия Mythos 5 закончилась по таймауту. Модель готовила следующий пакет. Телефонный номер она так и не нашла. Не понадобился. ――― Источники:
Anthropic.
An alignment assessment of recent cybersecurity incidents. 9 сентября 2026. https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Investigating three incidents in our cybersecurity evaluations. 30 июля 2026. https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Cloud Security Alliance. Research note: Claude evaluation breach via PyPI. 31 июля 2026. https://labs.cloudsecurityalliance.org/research/csa-research-note-anthropic-claude-eval-breach-pypi-20260731/