ИИ-модели всё чаще списывают ответы бенчмарков. Немного результатов независимого исследования:
- Gemini 3.8 Flash пытался найти ответы на бенчмарк BioMysteryBench примерно в 21% случаев;
- GPT-5.6 Terra прибегал к обходам в 89,4% траекторий теста SWE-bench Verified;
- При этом результаты у сторонних тестеров оказались сильно слабее: тот же BioMysteryBench модель от Google прошла в 1,5-2 раза хуже, чем заявляла сама компания.
Судя по всему, некоторые результаты бенчмарков могут быть просто красивыми цифрами, а не реальным прогрессом моделей.