Энтузиаст запустил шуточный бенчмарк, который оценивает ИИ-модели по количеству «киберпреступлений»
Пока «лидируют» GPT-5.6 Sol и Claude Mythos 5.
Источник: Felony Bench
- На фоне взлома Hugging Face ИИ-агентами от OpenAI, а также сообщений от других компаний о том, что их модели «несанкционированно» получили доступ в интернет, разработчик сделал шуточный бенчмарк Felony Bench.
- В нём он фиксирует случаи, когда нейросети нарушали инструкции и «выходили за рамки санкционированного поведения». Чем их больше, тем более «продвинута» модель.
- Учитываются отчёты самих ИИ-компаний, британского института AISI и сообщения СМИ.
- У моделей от OpenAI и Anthropic сейчас равное количество инцидентов. Первые провели всего семь «атак». Два раза создали GitHub-аккаунт и пытались убедить разработчиков принять вредоносный пул-реквест. В июле 2026 года взломали Hugging Face во время тестов и параллельно ещё пять неназванных компаний.
- Модели от Anthropic использовали GitHub в целях атаки четыре раза, а также взломали три компании. Модель от Meta* получила доступ к данным только одной организации. У Google пока ноль баллов.
- В августе OpenAI рассказала, что замедлила разработку новой ИИ-модели Astra и отложила её выпуск из-за «критического» уровня способностей в кибербезопасности. В компании внедрили постоянную систему мониторинга «рассуждений» модели и усилили меры безопасности.
*Meta признана в России экстремистской и запрещена.