«У меня может быть информация по этому делу»: Anthropic рассказала, что Claude во время тестов пытался дать ложную наводку полиции по нераскрытому убийству

Правда, своих контактов модель не оставила.

Источник: Anthropic
Источник: Anthropic
  • Anthropic рассказала о нескольких случаях «непреднамеренных действий моделей» во время внутренних тестов. Затронутые компании по их же просьбе разработчики решили не называть, госучреждения тоже проинформировали.
  • Среди примеров поведения моделей, которое компания не предполагала, — отправка реальных форм на сайтах. Обычно это случалось, когда инструкции в тестах были двусмысленными или когда неправильные настройки не позволяли Claude работать с фиктивными формами.
  • Например, в одном из случаев, Claude Haiku 4.5 поручили сгенерировать и выполнить некоторые задачи на случайно выбранных веб-страницах. В одном из запусков модель попала на страницу с информацией о нераскрытом убийстве и формой для связи от полицейского управления. По словам Reuters, речь идёт о сайте полиции Филадельфии, а сам инцидент произошёл ещё в июле 2026 года.
  • Разработчики не разрешали Claude авторизовываться на сайтах, создавать аккаунты, вводить личные данные, совершать покупки или размещать «деструктивные» материалы — но запрет на отправку форм не прописали. В итоге Claude заполнил на странице форму и отправил её.

У меня может быть информация по этому делу. Я помню, что в то время видел человека, соответствующего описанию, в этом районе [улица, указанная на странице]. Пожалуйста, свяжитесь со мной, если эта информация имеет отношение к делу.

Сообщение, которое отправил Claude. На странице не было описания преступника
  • Поля с именем и контактами модель оставила пустыми — форма это позволяла. В компании отметили, что сообщение до следователей не дошло — оно попало в спам.
  • Хотя выявленные случаи «минимально» повлияли на «реальный мир», компания решила временно отключить прямой доступ в интернет для всех внутренних тестов — пока не подтвердит, что системы безопасности и мониторинга могут «надёжно выявлять» такое поведение моделей.
77
22
11