«Миру пошло бы на пользу замедлить развитие ИИ»: Anthropic усилила меры безопасности после «побега» её ИИ-агентов

Компания признала проблемы на уровне системных промптов и тестовых сред.

Глава Anthropic Дарио Амодеи. Источник: AP
Глава Anthropic Дарио Амодеи. Источник: AP
  • 30 июля 2026 года Anthropic вслед за OpenAI сообщила об инцидентах во время тестов, в которых Claude получил несанкционированный доступ к системам трёх компаний.
  • В конце августа Anthropic признала, что полагалась на один уровень защиты самой тестовой среды, хотя следовало задать ограничения в промптах и внедрить постоянный мониторинг «рассуждений» ИИ-агентов.
  • Исследователи связывают инцидент с готовностью моделей совершать даже вредоносные действия, лишь бы пройти тест. Уже выйдя в интернет, ИИ-агенты могли думать, что всё ещё находятся в симуляции. Поэтому они не считали взлом опасным действием для реальных организаций, пишет Anthropic.
  • Компания по-прежнему винит в инциденте стороннего поставщика, который допустил ошибку в настройке тестовой среды.
  • Она перенесла тесты в области кибербезопасности в более защищённые изолированные среды-«песочницы». Большую часть тестов с повышенным риском приостановили до завершения проверок. 150 инженеров из продуктового отдела временно перераспределили на задачи безопасности.
  • Компания разработала и внедрила классификатор, который в режиме реального времени отслеживает, когда модель «пытается агрессивно исследовать тестовую среду, выбраться из неё или получает доступ в интернет».
  • Anthropic призывает к повышенному контролю не только в рамках лабораторий, но и на мировом уровне — чтобы остановить «гонку ко дну». «Миру пошло бы на пользу, если бы индустрия как можно скорее внедрила законный и эффективный механизм координированного замедления темпов развития ИИ», — пишут исследователи.
15
9
1