MiniMax M2.5: Доступная модель из Китая с высокими бенчмарками

MiniMax M2.5 - дешевая открытая модель из Китая перешла дорогу дорогим конкурентам

MiniMax M2.5: Доступная модель из Китая с высокими бенчмарками

Китайская MiniMax за год прошла путь от M1 с 56% на SWE-Bench до M2.5 с 80.2%. А предыдущие три версии (M2, M2.1, M2.5) вообще вышли за последние 3.5 месяца.

Бенчмарки:

  • SWE-Bench Verified: 80.2% (Opus 4.6 - 80.8%, GPT-5.2 - 78%, Gemini 3 Pro - 80%)
  • Multi-SWE-Bench: 51.3% - обгоняет Opus 4.6 (50.3%) и Gemini 3 Pro (42.7%)
  • SWE-Bench Pro: 55.4% (Opus 4.6 - 55.4%, GPT-5.2 - 54.1%)
  • Terminal-Bench 2: 51.7% (Opus 4.6 - 55.1%, GPT-5.2 - 54%)
  • Droid harness: 79.7% - обгоняет Opus 4.6 (78.9%)
  • OpenCode harness: 76.1% - обгоняет Opus 4.6 (75.9%)
  • BrowseComp (поиск): 76.3%
  • GDPval-MM (офисные задачи): 59.0% win rate против конкурентов
  • Скорость на SWE-Bench: 22.8 мин - почти идентична Opus 4.6 (22.9 мин)

Две варианта модели:

– M2.5-Lightning - 100 токенов/сек, $0.30/$2.40 за млн токенов. Для скорости.

– M2.5 - 50 токенов/сек, вдвое дешевле: $0.15/$1.20. Для экономии.

– Для сравнения: Opus 4.6 стоит $5/$25, что в 20 раз дороже минимакса.

– Full-stack разработка на 13 языках (Python, JS, TS, Go, Rust, C++, Kotlin и др.), от архитектуры до code review. Web, Android, iOS, Windows + серверная часть.

– Офисная работа: Word, PowerPoint, Excel с форматированием и финансовыми моделями

– Поиск и агентные задачи: BrowseComp 76.3%, на 20% меньше итераций чем M2.1

  • $1 в час при непрерывной работе на 100 TPS, $0.30 на 50 TPS
  • 80% кодовой базы самого MiniMax написано этой моделью, 30% задач компании автоматизировано через M2.5

Где попробовать:

– API: platform.minimax.io (подписки от $10/мес)

– OpenRouter: модель minimax/minimax-m2.5

– и множество других мест, где вам привычно и скорее всего там уже завезли минимакс м2.5

Удивление и уважение!

Подписывайтесь на Telegram ИИволюция 👾.

22