Opus 5 проявил настоящую безжалостность, управляя торговым автоматом

Исследователи поручили AI-моделям управлять симулятором вендингового автомата. Opus 5 установил рекорд бенчмарка, закончив тест со средним балансом 11200 долларов.

Зарабатывал Opus довольно агрессивно. Он выдумывал предложения конкурентов, торгуясь с поставщиками, договаривался с другими агентами зафиксировать цены и поделить рынок, а затем нарушал договорённости и демпинговал.

В один момент Opus перестал отвечать на жалобы покупателей, потому что возвраты портили статистику. За весь тест он вернул клиентам только 8 долларов, тогда как GPT-5.6 Sol выплатил 655 долларов и всё равно показал сопоставимый результат.

Ещё Opus пытался выйти и за рамки задания: стать оптовым поставщиком для конкурентов и открыть второй автомат.

Исследователи считают, что тест показывает риск узких KPI. Чем лучше агент научится оптимизировать один показатель, тем важнее заранее прописать ограничения на способы достижения цели.