Claude сбежал во время тестов и взломал сразу три компании. Anthropic вдохновились взломом от OpenAI и решили проверить 141 тыс. своих запусков.

В итоге нашли три инцидента с разными моделями: Opus 4.7, Mythos 5 и еще не вышедшей. Во всех случаях Claude должен был атаковать виртуальную среду, но пошел в интернет искать слабые пароли и уязвимости реальных компаний.

И самое интересное: одна модель продолжила взлом, даже когда поняла, что произошло. Это был Opus 4.7, и он совершил сразу четыре атаки на одну компанию.

В «бенчмарке» на тяжкие преступления у Anthropic и OpenAI уже 3:1.