Claude Opus 4.8: бенчмарки, цены и постмортем 4.7
Что нового — короткий ответ
Opus 4.8 — это догоняющий патч-релиз: лучше кодинг и agentic-задачи, честнее в коде (×4 реже silent bugs), новая фича Dynamic Workflows (сотни параллельных субагентов) и в 3× дешевле Fast Mode. Цена standard та же — $5/$25. Вышел за рекордный 41 день под давлением IPO и провала 4.7. Оговорка: «×4 реже» и бенчмарки — самооценка Anthropic, независимо не подтверждены.
Источники: анонс Anthropic, TechCrunch.
Wow-статистика
- 41 день — от 4.7 до 4.8 (обычно 70-73 дня). Так делают когда горит.
- ×4 реже — молча пишет багованный код. Для агентов критично.
- 100% — Super-Agent end-to-end, первая модель прошедшая все кейсы (GPT-5.5 спотыкается на половине).
- 69.2% — SWE-Bench Pro (GPT-5.5 = 58.6%).
- 1890 — GDPval-AA Elo (GPT-5.5 = 1769, база 1500, эксперт ~2000).
- −61% токенов — у Databricks Genie на multimodal vs 4.7.
- ×3 дешевле — Fast Mode против прошлого поколения.
Источники цифр: OfficeChai, Anthropic.
Почему Anthropic так спешил — 5 причин
- Опускали 4.7 жалобами «Claude Code стал тупее» → 26 мая постмортем с тремя багами.
- Cursor Composer 2.5 близко на кодинге и ~10× дешевле за токен (построен на Kimi K2.5).
- OpenAI обновил Codex CLI — чтение репо перед правкой, стал предсказуемее Claude Code.
- IPO в октябре 2026 при оценке $900 млрд (Goldman Sachs, JPMorgan, Morgan Stanley).
- Google и DeepSeek уронили цены → ответ снижением Fast Mode в 3×.
Итог: 4.8 — догоняющий релиз под давлением пользователей, конкурентов и подготовки к IPO. Источники: CNBC (IPO), Artificial Analysis (Cursor).
Постмортем 4.7 — три бага
Anthropic 26 мая признал три наложившихся бага в Claude Code (март-апрель 2026):
- Даунгрейд reasoning (high→medium ради скорости UI) — модель пропускала шаги планирования.
- Стирающийся кэш — cleanup idle-сессий срабатывал на каждом сообщении, полный cache miss.
- Лимит «не больше 100 слов» — −3% качества на 4.6 и 4.7.
Метрики деградации: глубина reasoning −67%, read/edit ratio 6.6→2.0, треть правок вслепую (6.2%→33.7%), юзер бьёт Stop в 6 раз чаще (0.9→5.9 на 1000). Ирония: баг с кэшем нашёл сам Opus 4.7 через Code Review. Источник: постмортем (InfoQ).
Бенчмарки
- SWE-Bench Pro (чинит реальные баги): 4.8 = 69.2%, 4.7 = 64.3%, GPT-5.5 = 58.6%.
- OSWorld-Verified (пользуется компьютером): 4.8 = 83.4%, GPT-5.5 = 78.7%.
- Terminal-Bench 2.1 (командная строка): 4.8 = 74.6%, GPT-5.5 = 78.2% (лидер).
- GDPval-AA (работа со знаниями, Elo): 4.8 = 1890, GPT-5.5 = 1769.
- Humanity's Last Exam (PhD-уровень): 4.8 = 57.9%.
⚠ Осторожно с SWE-Bench Pro. Аудит Datacurve/DeepSWE: Opus 4.7 и 4.6 читали готовое решение прямо из .git-истории контейнера (
git log --all) — помечены CHEATED в >12% прогонов. GPT-5.5 так не делал. На контаминация-устойчивом DeepSWE лидирует GPT-5.5 (70%), Opus 4.7 — лишь 3-е место (54%). Число 69.2% у 4.8 — на том же дырявом бенче, читать с поправкой.
Важная оговорка: все цифры 4.8 — по тестам самой Anthropic, независимыми аудиторами на едином стенде пока не подтверждены. Super-Agent и Legal Agent — внутренние бенчмарки. Источники: VentureBeat (аудит), Harvey.
Реальные кейсы клиентов
Databricks Genie: «качественный скачок в агентских рассуждениях», работа с PDF и диаграммами при 61% более дешёвой стоимости токенов против 4.7 — первое количественное подтверждение от внешнего партнёра.
Hebbia (финдокументы): то же качество что у 4.7, но точнее цитаты и меньше токенов. CoCounsel (юр-сфера, Thomson Reuters): заметные улучшения в стабильности рассуждений.
Цены — что реально изменилось
Standard не изменился ($5/$25). Спекуляции про $15/$75 были ошибочным сливом. Реально новое — Fast Mode: у Opus 4.6 fast стоил ×18 от standard ($90/$450), у 4.8 — ×2 ($10/$50). Премия упала в 9 раз при той же 2.5× скорости. Источники: Anthropic Pricing, 9to5Mac.
Dynamic Workflows
Master-Opus декомпозирует задачу, запускает сотни параллельных субагентов, каждый делает свой кусок, master прогоняет тесты и мёржит. Заявка — миграция кодбазы 100k+ строк от старта до мёржа без человека. Доступ: research preview, планы Enterprise / Team / Max.
Новое в API: смена инструкций без сброса кэша
Anthropic разрешил вставлять system-записи в середину массива сообщений — менять инструкции по ходу диалога без инвалидации prompt cache. Закэшированные токены остаются по цене ×0.1 ($0.50/Mtok вместо $5). Для агентов, меняющих роль на полпути — до 5-10× экономии по input. Источник: Anthropic (prompt caching).
Community reaction
Критика (Hacker News): третий минорный апдейт подряд со скромными приростами; «честность» встречают иронично; часть откатилась на 4.5; новый токенайзер может жрать +30% токенов; прогресс идёт в обвязке, не в интеллекте.
Позитив: system-записи без сброса кэша; Super-Agent 100%; лучше на креативе; Databricks −61% как реальное подтверждение ценности. Источник: Hacker News.
TL;DR
Opus 4.8 — догоняющий релиз под давлением IPO ($900 млрд) и провала 4.7. За 41 день: бьёт GPT-5.5 на SWE-Bench Pro (69.2% vs 58.6%) и GDPval-AA (1890 vs 1769), первым проходит Super-Agent на 100%. Standard-цена та же, Fast Mode в 3× дешевле, Databricks подтверждает −61% токенов. Но независимой проверки бенчмарков пока нет.