Энтузиаст запустил шуточный бенчмарк, который оценивает ИИ-модели по количеству «киберпреступлений»

Пока «лидируют» GPT-5.6 Sol и Claude Mythos 5.

Источник: Felony Bench
Источник: Felony Bench
  • На фоне взлома Hugging Face ИИ-агентами от OpenAI, а также сообщений от других компаний о том, что их модели «несанкционированно» получили доступ в интернет, разработчик сделал шуточный бенчмарк Felony Bench.
  • В нём он фиксирует случаи, когда нейросети нарушали инструкции и «выходили за рамки санкционированного поведения». Чем их больше, тем более «продвинута» модель.
  • Учитываются отчёты самих ИИ-компаний, британского института AISI и сообщения СМИ.
  • У моделей от OpenAI и Anthropic сейчас равное количество инцидентов. Первые провели всего семь «атак». Два раза создали GitHub-аккаунт и пытались убедить разработчиков принять вредоносный пул-реквест. В июле 2026 года взломали Hugging Face во время тестов и параллельно ещё пять неназванных компаний.
  • Модели от Anthropic использовали GitHub в целях атаки четыре раза, а также взломали три компании. Модель от Meta* получила доступ к данным только одной организации. У Google пока ноль баллов.
  • В августе OpenAI рассказала, что замедлила разработку новой ИИ-модели Astra и отложила её выпуск из-за «критического» уровня способностей в кибербезопасности. В компании внедрили постоянную систему мониторинга «рассуждений» модели и усилили меры безопасности.

*Meta признана в России экстремистской и запрещена.

1