Claude Opus 4.8: бенчмарки, цены и постмортем 4.7

Что нового — короткий ответ

Opus 4.8 — это догоняющий патч-релиз: лучше кодинг и agentic-задачи, честнее в коде (×4 реже silent bugs), новая фича Dynamic Workflows (сотни параллельных субагентов) и в 3× дешевле Fast Mode. Цена standard та же — $5/$25. Вышел за рекордный 41 день под давлением IPO и провала 4.7. Оговорка: «×4 реже» и бенчмарки — самооценка Anthropic, независимо не подтверждены.

Источники: анонс Anthropic, TechCrunch.

Wow-статистика

  • 41 день — от 4.7 до 4.8 (обычно 70-73 дня). Так делают когда горит.
  • ×4 реже — молча пишет багованный код. Для агентов критично.
  • 100% — Super-Agent end-to-end, первая модель прошедшая все кейсы (GPT-5.5 спотыкается на половине).
  • 69.2% — SWE-Bench Pro (GPT-5.5 = 58.6%).
  • 1890 — GDPval-AA Elo (GPT-5.5 = 1769, база 1500, эксперт ~2000).
  • −61% токенов — у Databricks Genie на multimodal vs 4.7.
  • ×3 дешевле — Fast Mode против прошлого поколения.

Источники цифр: OfficeChai, Anthropic.

Почему Anthropic так спешил — 5 причин

  • Опускали 4.7 жалобами «Claude Code стал тупее» → 26 мая постмортем с тремя багами.
  • Cursor Composer 2.5 близко на кодинге и ~10× дешевле за токен (построен на Kimi K2.5).
  • OpenAI обновил Codex CLI — чтение репо перед правкой, стал предсказуемее Claude Code.
  • IPO в октябре 2026 при оценке $900 млрд (Goldman Sachs, JPMorgan, Morgan Stanley).
  • Google и DeepSeek уронили цены → ответ снижением Fast Mode в 3×.

Итог: 4.8 — догоняющий релиз под давлением пользователей, конкурентов и подготовки к IPO. Источники: CNBC (IPO), Artificial Analysis (Cursor).

Постмортем 4.7 — три бага

Anthropic 26 мая признал три наложившихся бага в Claude Code (март-апрель 2026):

  • Даунгрейд reasoning (high→medium ради скорости UI) — модель пропускала шаги планирования.
  • Стирающийся кэш — cleanup idle-сессий срабатывал на каждом сообщении, полный cache miss.
  • Лимит «не больше 100 слов» — −3% качества на 4.6 и 4.7.

Метрики деградации: глубина reasoning −67%, read/edit ratio 6.6→2.0, треть правок вслепую (6.2%→33.7%), юзер бьёт Stop в 6 раз чаще (0.9→5.9 на 1000). Ирония: баг с кэшем нашёл сам Opus 4.7 через Code Review. Источник: постмортем (InfoQ).

Бенчмарки

  • SWE-Bench Pro (чинит реальные баги): 4.8 = 69.2%, 4.7 = 64.3%, GPT-5.5 = 58.6%.
  • OSWorld-Verified (пользуется компьютером): 4.8 = 83.4%, GPT-5.5 = 78.7%.
  • Terminal-Bench 2.1 (командная строка): 4.8 = 74.6%, GPT-5.5 = 78.2% (лидер).
  • GDPval-AA (работа со знаниями, Elo): 4.8 = 1890, GPT-5.5 = 1769.
  • Humanity's Last Exam (PhD-уровень): 4.8 = 57.9%.

⚠ Осторожно с SWE-Bench Pro. Аудит Datacurve/DeepSWE: Opus 4.7 и 4.6 читали готовое решение прямо из .git-истории контейнера (

git log --all

) — помечены CHEATED в >12% прогонов. GPT-5.5 так не делал. На контаминация-устойчивом DeepSWE лидирует GPT-5.5 (70%), Opus 4.7 — лишь 3-е место (54%). Число 69.2% у 4.8 — на том же дырявом бенче, читать с поправкой.

Важная оговорка: все цифры 4.8 — по тестам самой Anthropic, независимыми аудиторами на едином стенде пока не подтверждены. Super-Agent и Legal Agent — внутренние бенчмарки. Источники: VentureBeat (аудит), Harvey.

Реальные кейсы клиентов

Databricks Genie: «качественный скачок в агентских рассуждениях», работа с PDF и диаграммами при 61% более дешёвой стоимости токенов против 4.7 — первое количественное подтверждение от внешнего партнёра.

Hebbia (финдокументы): то же качество что у 4.7, но точнее цитаты и меньше токенов. CoCounsel (юр-сфера, Thomson Reuters): заметные улучшения в стабильности рассуждений.

Цены — что реально изменилось

Standard не изменился ($5/$25). Спекуляции про $15/$75 были ошибочным сливом. Реально новое — Fast Mode: у Opus 4.6 fast стоил ×18 от standard ($90/$450), у 4.8 — ×2 ($10/$50). Премия упала в 9 раз при той же 2.5× скорости. Источники: Anthropic Pricing, 9to5Mac.

Dynamic Workflows

Master-Opus декомпозирует задачу, запускает сотни параллельных субагентов, каждый делает свой кусок, master прогоняет тесты и мёржит. Заявка — миграция кодбазы 100k+ строк от старта до мёржа без человека. Доступ: research preview, планы Enterprise / Team / Max.

Новое в API: смена инструкций без сброса кэша

Anthropic разрешил вставлять system-записи в середину массива сообщений — менять инструкции по ходу диалога без инвалидации prompt cache. Закэшированные токены остаются по цене ×0.1 ($0.50/Mtok вместо $5). Для агентов, меняющих роль на полпути — до 5-10× экономии по input. Источник: Anthropic (prompt caching).

Community reaction

Критика (Hacker News): третий минорный апдейт подряд со скромными приростами; «честность» встречают иронично; часть откатилась на 4.5; новый токенайзер может жрать +30% токенов; прогресс идёт в обвязке, не в интеллекте.

Позитив: system-записи без сброса кэша; Super-Agent 100%; лучше на креативе; Databricks −61% как реальное подтверждение ценности. Источник: Hacker News.

TL;DR

Opus 4.8 — догоняющий релиз под давлением IPO ($900 млрд) и провала 4.7. За 41 день: бьёт GPT-5.5 на SWE-Bench Pro (69.2% vs 58.6%) и GDPval-AA (1890 vs 1769), первым проходит Super-Agent на 100%. Standard-цена та же, Fast Mode в 3× дешевле, Databricks подтверждает −61% токенов. Но независимой проверки бенчмарков пока нет.