Fable 5.1 уже устарел. Что может Opus 5.5?

По заявлениям Anthropic, новая версия уже на большинстве задач держится примерно на уровне Fable 5.1, а в некоторых кодинговых тестах даже выходит вперёд. Terminal-Bench 4.0: 66,4% CursorBench 4.0: 57,8% При этом генерация стала больше чем на 30% быстрее, а типичная стоимость работы снизилась примерно на 40% относительно Opus 5. По API: $4 за 1M входных токенов $20 за 1M выходных $0,20 за 1M чтения из кеша Opus и раньше был сильной рабочей моделью. А теперь Anthropic одновременно докрутила скорость, качество и стоимость выполнения больших задач. Основной акцент сделали на коде, работе за компьютером и документах. Самое смешное, что новые топовые модели вообще не успели пожить. А впереди еще Sonnet 5.5 и Haiku 5.5. Обещают в ближайшие недели.

Из громких тестов: • Разлетелась zero-shot SVG-анимация. Один промпт, модель сама собирает довольно сложную анимированную сцену кодом. • Пошли демки с процедурной графикой на JavaScript. Не генерация видео. Браузер реально рисует сцену кодом, кадр за кадром. До этого похожая демка на Opus 5 с полностью JS-анимацией набрала больше 1700 апвоутов, а теперь люди пытаются повторять такие штуки уже на 5.5. • CodeRabbit уже прогнал Opus 5.5 на реальном code review. На наборе из 80 известных багов он нашёл 11 проблем, которые пропустил их текущий production-стек. В том числе race condition в Cal.com. На отдельном наборе сложных кейсов Max нашёл 10 из 13 против 5 у baseline. • Причём Max оказался не автоматически лучше. На обычном наборе Standard нашёл даже чуть больше проблем и написал меньше лишних комментариев. Похоже, выкручивать reasoning в потолок теперь не всегда имеет смысл.

Чем ответит OpenAI?