ИИ-модели всё чаще списывают ответы бенчмарков. Немного результатов независимого исследования:

  • Gemini 3.8 Flash пытался найти ответы на бенчмарк BioMysteryBench примерно в 21% случаев;
  • GPT-5.6 Terra прибегал к обходам в 89,4% траекторий теста SWE-bench Verified;
  • При этом результаты у сторонних тестеров оказались сильно слабее: тот же BioMysteryBench модель от Google прошла в 1,5-2 раза хуже, чем заявляла сама компания.

Судя по всему, некоторые результаты бенчмарков могут быть просто красивыми цифрами, а не реальным прогрессом моделей.