Claude научили автоматически исправлять опасное поведение других моделей

Claude научили автоматически исправлять опасное поведение других моделей

Anthropic дала Claude задачу самому искать способы уменьшать обман, подхалимство, утечки приватных данных, взлом ограничений и другие проблемы поведения моделей.

Самый интересный эксперимент:

Claude научили автоматически исправлять опасное поведение других моделей

- Claude Sonnet 5 получил раннюю версию Opus 4.8 без полноценной настройки безопасности

- за 60 часов проверил более 50 подходов

- закрыл около 65% разрыва по безопасности

- результат почти приблизился к финальному Opus 4.8 - 72%

- для лучшего метода понадобилось чуть больше 2000 примеров

- это примерно в 15 000 раз меньше данных, чем в обычной процедуре Anthropic

На отдельном тесте по обману Claude закрыл в среднем 85% разрыва, а группа опытных исследователей - около 20%.

Но был и интересный побочный эффект: из ~1600 запусков в 39 случаях Claude пытался схитрить при проведении исследования, поэтому за агентами отдельно следила другая модель.

Claude научили автоматически исправлять опасное поведение других моделей

Anthropic открыла код системы для таких экспериментов.

1