Бенчмарки врут: как SWE-rebench обнажил реальный разрыв между ИИ-моделями

Последние месяцы в ИИ-индустрии царила красивая картинка: китайские лаборатории якобы догнали лидеров рынка.

Бенчмарки врут: как SWE-rebench обнажил реальный разрыв между ИИ-моделями

MiniMax, GLM, Qwen показывали результаты «на уровне Opus» и «сопоставимо с GPT-5». Маркетинговые отделы ликовали, комьюнити бурлило.

А потом появился SWE-rebench. И стало... неудобно.

Экзамен, ответы к которому утекли

Как вообще работают стандартные бенчмарки в ИИ? Есть набор задач, вы прогоняете через них модель, получаете процент решённых. Чем выше тем лучше. Схема простая и понятная.

Вот только есть нюанс: задачи в большинстве бенчмарков публичные. Лежат на GitHub, на Hugging Face, в открытом доступе. Годами.

Представьте себе экзамен, билеты к которому опубликованы за два года до сдачи. Понятно что в какой-то момент студенты перестают учить предмет и начинают зубрить ответы. Классика.

Именно это происходит с SWE-bench Verified. Бенчмарк создавался для оценки способности моделей решать реальные инженерные задачи с GitHub. 500 задач из настоящих репозиториев, проверенных живыми разработчиками. Звучит серьёзно.

Но проблема не в самом бенчмарке — он был отличным инструментом. Проблема в том что за два года существования задачи стали частью тренировочных данных. Исследователи из IBM прямо называют лидерборд SWE-bench Verified «насыщенным», а исследование «The SWE-Bench Illusion» (arXiv:2506.12286, август 2025) зафиксировало паттерны запоминания репозиториев у топовых моделей.

Результат? Модели которые выдают 75-80% на старом бенчмарке, не решают задачи. Они вспоминают ответы.

SWE-rebench: свежие задачи, которые нельзя зазубрить

SWE-rebench (arXiv:2505.20411) придумали ребята из Nebius. Идея, честно говоря гениальна в своей простоте: берём тот же формат задач, ту же сложность, но каждый месяц используем свежие issue с GitHub. Задачи из репозиториев созданных после даты обучения модели. То есть модель просто физически не могла их видеть.

Чем это отличается от оригинального SWE-bench:

  • Автоматический пайплайн извлечения задач из свежих репозиториев
  • Каждый месяц набор задач обновляется
  • Более 21 000 интерактивных Python-задач
  • Задачи помечаются красным если были созданы до релиза модели (потенциальная контаминация)

По сути тот же экзамен. Только билеты теперь действительно новые каждый раз.

А теперь самое интересное: цифры

Вот что показал SWE-rebench (данные лидерборда за январь 2026):

Топ закрытых моделей:

  • Gemini 3 Flash Preview - 57.6% (!)
  • Gemini 3 Pro Preview - 56.5%
  • Claude Code (Opus 4.6) - 52.9%
  • Claude Opus 4.6 - 51.7%
  • GPT-5.2 варианты - около 51%
  • Claude Sonnet 4.5 - 47.1%

Открытые и китайские модели:

  • Kimi K2 Thinking - 43.8%
  • GLM-5 - 42.1%
  • Qwen3-Coder-Next - 40.0%
  • MiniMax M2.5 - 39.6%
  • Kimi K2.5 - 37.9%

Теперь сравним с тем что эти же модели показывали на старом SWE-bench Verified.

MiniMax M2.5 заявляет 80.2% на SWE-bench Verified. Claude Opus 4.6 показывает около 80.8% там же. На бумаге они были практически одинаковы. Маркетинг MiniMax прямо пишет: «reaching a level comparable to the Claude Opus series on coding tasks».

На SWE-rebench? MiniMax падает до 39.6%. Opus держит 51.7%. Разница в 12 процентных пунктов которая была абсолютно невидима на старом бенчмарке.

Это не значит что MiniMax плохая модель. Это значит что MiniMax и Opus никогда не были сопоставимы по способности решать незнакомые задачи. Просто раньше это было не видно.

Дааа, тут есть нюанс: кто на самом деле виноват

Многие сразу начинают показывать пальцем: «Китайские лабы жульничают!» Давайте разберёмся.

Контаминация бенчмарков — это не «китайская» проблема. Это системная проблема всей индустрии. Исследование из EMNLP 2025 (Chen et al., «Benchmarking Large Language Models Under Data Contamination») описывает как даже Meta столкнулась с обвинениями в оптимизации LLaMA 4 под бенчмарки. Статическая публичная оценка просто сломана как концепция.

Но если быть честным — масштаб падения у разных моделей сильно отличается.

Вот что показывает SWE-bench Pro от Scale AI (ещё один антиконтаминационный бенчмарк, включающий приватные кодовые базы): лучшие модели показывают лишь 23% на публичном сете и 15-18% на приватных репозиториях. На коде который модель гарантированно никогда не видела результаты падают радикально у всех.

Но падение неравномерное. Модели Anthropic, OpenAI и Google теряют 20-25 пунктов. Многие китайские модели — 35-40. Разница статистически значимая и она говорит о разной степени обобщающей способности.

Кстати, не все открытые модели провалились одинаково. GLM-4.7 на SWE-rebench оказался сопоставим с закрытыми моделями уровня GPT-5.1-codex. Kimi K2 Thinking тоже держится достойно. А Gemini 3 Flash между прочим обогнал Gemini 3 Pro — меньшая и дешёвая модель оказалась лучше для кодинга. Такие дела.

Реальный масштаб разрыва: без хайпа

Тут начинается самое сложное. Реальность оказывается не чёрно-белой.

Утверждение «Anthropic и OpenAI на 6-12 месяцев впереди» — это маркетинговый нарратив, а не научный факт. Посмотрим трезво.

Факты в пользу разрыва:

  • На деконтаминированых бенчмарках закрытые модели стабильно выше
  • Падение производительности у лидеров меньше — лучшее обобщение
  • На приватных кодовых базах (SWE-bench Pro) разрыв ещё заметнее

Факты против упрощения:

  • GLM-4.7 реально конкурирует на SWE-rebench, находясь рядом с закрытыми моделями
  • Qwen3-Coder-Next при ~3B активных параметров показвает 40% — как по мне, впечатляющая эффективность
  • Открытые модели прогресируют быстрее: в октябре 2025 лидер открытых моделей был значительно ниже, сейчас разрыв сокращается
  • Стоимость решения задачи у MiniMax — $0.09, у Claude Code — $3.50. Это 40-кратная разница в цене

Разрыв существует но его масштаб зависит от контекста. Для критичных задач с незнакомым кодом лидеры впереди ощутимо. Для типовых задач — разница куда менее драматична.

Почему бенчмарки сломаны (по-настоящему)

Проблема глубже чем кажется. Дело не только в том что кто-то «жульничает».

Современная парадигма RL-обучения буквально требует окружений для тренировки. MiniMax сам пишет что у них «сотни тысяч реальных окружений» для RL. Когда компания тренирует модель решать задачи с GitHub а потом тестирует на других задачах с GitHub из тех же репозиториев — конечно будет переобучение. Не потому что кто-то намеренно читерит а потому что модель выучила паттерны конкретных репозиториев.

Исследование «The SWE-Bench Illusion» показало: модели демонстрируют до 76% точности в угадывании файловых путей в репозиториях SWE-bench, не имея контекста необходимого для этой задачи. Это прямое свидетельство запоминания структуры, а не понимания кода.

Ок это все по теории, а что на практике

Devhack: что делать практикующему разработчику?

  • Не верьте одному бенчмарку. Смотрите на несколько: SWE-rebench, SWE-bench Pro, LiveBench, Aider
  • Обращайте внимание на деконтаминированные бенчмарки — те что используют свежие задачи
  • Лучший бенчмарк это неделя работы с моделью на ваших реальных задачах
  • Сравнивайте стоимость решения задачи а не только качество: 40-кратная разница в цене может быть важнее 12% разницы в accuracy

Что использовать прямо сейчас

По совокупности деконтаминированных бенчмарков, отзывов и реального использования:

Для серьёзного агентного кодинга (деньги не проблема): Claude Code на Opus 4.6. Первое место на SWE-rebench (52.9%), стабильная производительность на свежих задачах. Pass@5 выше всех конкурентов.

Для баланса цены и качества: Claude Sonnet 4.5. Уникально решает задачи которые не может решить ни одна другая модель, при разумной стоимости.

Для терминальных workflow: GPT-5.3 Codex. Доминирует на Terminal-Bench.

Для бюджетных решений: GLM-4.7 или Kimi K2 Thinking. Серьёзная производительность за 10-20x дешевле фронтирных моделей. GLM-4.7 особенно интересен — самая сильная открытая модель на SWE-rebench.

Для ультрабюджетных агентных деплоев: Qwen3-Coder-Next. При 3B активных параметров показывает 40% на SWE-rebench и входит в топ-2 по pass@5 среди открытых моделей.

Итого

SWE-rebench не «доказал что китайские модели — мусор». Он доказал кое-что поважнее: статические публичные бенчмарки перестали работать как инструмент оценки. Все модели теряют производительность на свежих задачах, просто одни теряют больше другие меньше.

Разрыв между Anthropic/OpenAI/Google и открытыми моделями реален но не так катастрофичен как рисуют хайповые посты. Он сокращается. GLM-4.7 уже конкурирует с закрытыми моделями. Qwen3-Coder-Next впечатляет эфективностью.

Настоящий вывод простой: пора перестать выбирать модели по одному числу из маркетингового блога. Смотрите на деконтаминированные бенчмарки, на стоимость, на реальное использование. И главное — тестируйте на своих задачах.

Потому что единственный бенчмарк который по-настоящему имеет значение — это ваш продакшн.