Час с Claude Opus 5.5. Мои первые впечатления
Буквально 2 часа Anthropic выпустила Opus 5.5. Я успел посидеть с ним примерно час, так что это не большой обзор, а скорее первые впечатления и немного цифр из анонса
Первое, на что наткнулся: в самом чате модель была доступна сразу, однако в Claude Code мне написало что необходимо обновить приложение до последней версии. Так что если у вас тоже не видно модели, дело скорее всего в этом
По ощущениям мне показалось что Opus 5.5 умнее чем Fable 5.1. Отвечает быстрее и понимает что реально от него требует. Anthropic в своем посте пишут примерно то же самое: на большинстве задач уровень Fable 5.1, а в агентном кодинге местами выше. На Terminal-Bench 4.0 у Opus 5.5 66,4%, у Fable 55,8%, а у GPT-6 Astra 57,9%. Но на Terminal-Bench-Science Astra сильно впереди, 64,6% против 58,7% у опуса.
По ценами миллион входных токенов в API стоит $4, выходных $20. У Opus 5 было $5 и $25. Fable 5.1 стоит $10 и $50, то есть больше чем в два раза дороже. Anthropic говорит, что в сумме Opus 5.5 выходит на 40% дешевле Opus 5, потому что он еще и тратит меньше токенов на задачу
Я считаю что это правда, потому что имея подписку Max 20x и запустив 3 чата на Opus 5.5 с Max effort, я потратил только 2% пяти-часового лимита. То есть токены он экономит значительно лучше чем Fable или старые модели Opus
Но с выходом каждой новой модели меня не покидает одно и то же чувство что меня просто греют. При выходе Fable 5.1 я испытал такое же ощущения прорывной модели, которая реально понимаю что ты от нее просишь. Первые дни казалось, что это прям скачок. Спустя каждый день пользования моделью появлялось ощущение, что она намеренно деградирует в своих возможностях и спустя примерно 2 недели перестала хоть как-то быть лучше того же Opus 5.0
У меня два варианта, почему так. Либо на старте модели дают чуть больше мощности, чтобы собрать хайп и хорошие бенчмарки. Либо же наоборот, старые модели со временем специально деградируют, чтобы ново-вышедшая модель на их фоне казалась прорывом
Доказать я ни то, ни другое не могу, это просто мое ощущение после нескольких релизов подряд. Но из-за этого я не до конца верю первым впечатлениям
Аналогично Fable 5.1, если запрос касается кибербезопасности или биологии, его могут молча отправить на Opus 4.8 или Opus 5. В обычном чате это ок, а вот в агентах часть изменений может выполнить более слабая модель и вы это не сразу обратите внимание
Пока модель мне нравится, но выводы делать рано. Через пару недель напишу новую статью о моих впечатлениях