Claude Opus 5.5: обзор и возможности революционной модели Anthropic

Claude Opus 5.5: обзор и возможности революционной модели Anthropic

22 сентября 2026 года начиналось как самый заурядный вторник. Но внезапно… Сначала Anthropic, словно фокусник из шляпы, достала свежайший Claude Opus 5.5. Не прошло и пары часов, как OpenAI нанесла ответный удар, выкатив сразу две новинки: GPT-6 Sol и Luna.

Но давайте не будем ходить вокруг да около и сосредоточимся на главном герое дня.

Если говорить кратко: новенький Opus 5.5 выдаёт результаты на уровне монструозного Fable 5.1, при этом обходится на 40% дешевле предшественника в лице Opus 5, а токены выплёвывает на треть быстрее.

Но знаете, что зацепило меня больше всего? Эта нейросеть наконец-то научилась говорить как нормальный человек. И судя по восторгам в соцсетях, именно этот факт радует пользователей куда сильнее, чем таблички с бенчмарками.

Ниже я приготовил для вас полный разбор полётов: от цифр и алгоритмической магии до оживших картинок, которые ИИ рисует чистым кодом. Погнали!

Новые нейросети уже доступны в GPTunneL.

Попробуйте модели здесь:

Спойлер: теперь всё быстрее и дешевле

Как часто мы ищем новую версию Claude только ради того, чтобы узнать, стоит ли переходить на неё? В случае с представителем линейки 5.5 ответ очевиден.

Anthropic прямым текстом заявляет: качество работы сопоставимо с флагманским Fable 5.1, а стоимость типичной сессии снизилась почти вполовину по сравнению с v5.

Но давайте заглянем под капот.

Контекст, лимиты и принудительное мышление

Вот как выглядят характеристики нашей новинки:

Claude Opus 5.5: обзор и возможности революционной модели Anthropic

Интересная деталь: вы больше не можете запретить модели думать. В прошлой версии можно было щёлкнуть thinking: disabled, чтобы получить прямолинейный ответ без внутренних монологов. Всё, лавочка закрылась! Как работают нейросети нового поколения? Они обязаны порассуждать. Мы лишь можем регулировать глубину этих философских изысканий через параметр effort (low, medium, high, xhigh и max).

Кстати, если у вас уже настроена интеграция, будьте осторожны. Anthropic выкатила гайд по миграции, где указала парочку критичных изменений. Например, жёсткая привязка блоков рассуждений к истории чата или устаревший инструмент управления компьютером (computer_20251124 больше не работает, подавайте computer_toolset_20260801). Иначе наловите багов прямо в продакшене.

Бенчмарки: битва титанов

Ни один серьёзный обзор ИИ не обходится без замеров интеллекта в попугаях.

В официальной сводке Anthropic новинку стравливают с предшественником, топовым Fable 5.1 и – барабанная дробь – с флагманом от конкурентов GPT-6 Astra.

Сравнительная таблица производительности на ключевых бенчмарках от Anthropic
Сравнительная таблица производительности на ключевых бенчмарках от Anthropic

Смотрите, какая вырисовывается картина. В написании кода Opus 5.5 буквально разорвал GPT-6 Astra. На тесте Terminal-Bench 4.0 результат 66,4% против 57,9%. И это уже не спишешь на статистическую погрешность. Если вы собираете свои ИИ для программирования: подборки, Opus 5.5 однозначно должен возглавить список. Аналогичный разгром наблюдается в CursorBench, FrontierCode и даже в сложных задачах с инструментами Humanity’s Last Exam.

Но не спешите хоронить OpenAI. Если вам нужна автоматизация бизнеса (AutomationBench) или зубодробительные вычисления в Terminal-Bench-Science 0.1, Astra всё ещё держит корону. Разрыв в 6 процентных пунктов на научных задачах показывает, что большие языковые модели от OpenAI пока лучше справляются с долгими исследовательскими прогонами. Боевая ничья!

Независимые эксперты из Artificial Analysis подкинули свои графики:

Сводный рейтинг AI Intelligence Index v4.3. Opus 5.5 на максималках вырвал первое место среди 168 моделей (58 баллов)
Сводный рейтинг AI Intelligence Index v4.3. Opus 5.5 на максималках вырвал первое место среди 168 моделей (58 баллов)

По их подсчётам, если выкрутить уровень усилий на максимум, Opus 5.5 забирает золото. Astra и Fable 5.1 делят второе место. Правда, в их собственных тестах разрыв в кодинге оказался не таким огромным. Но мы-то с вами знаем: доверяй, но тестируй на своих данных.

Рейтинг Elo в задачах типа AA-Briefcase. Обратите внимание: три первых места – это Opus 5.5 на разных уровнях усилий
Рейтинг Elo в задачах типа AA-Briefcase. Обратите внимание: три первых места – это Opus 5.5 на разных уровнях усилий

Забавно, что при режимах max, xhigh и high модель оккупировала весь пьедестал. А вот если включить low, она сваливается вниз. Чудес не бывает: нужен крутой результат – врубайте глубокое мышление.

Пока мы моргали: релиз GPT-6 Sol и Luna

День выдался безумным. Примерно через полтора часа после релиза Anthropic, проснулись OpenAI.

Claude Opus 5.5: обзор и возможности революционной модели Anthropic

Помните, как раньше корпорации мерялись баллами в абстрактных тестах? Забудьте. Новый тренд: «наша нейросеть сделает вам задачу дешевле». И Sol, и Luna продвигались именно под соусом экономической эффективности.

Скорость

Бенчмарки бенчмарками, а вот что реально чувствуешь, когда дедлайн горит в полночь, так это скорость генерации. И тут комментаторы просто взорвались:

«Сижу в Claude Code с Opus 5.5, и скорость просто отвал башки. Код не просто пишется моментом – баги отлавливаются на лету. Особенно в UI. Раньше я часами ковырял интерфейс, а теперь проблемы подсвечиваются почти мгновенно».

Anthropic с гордостью выкатывает внутренние кейсы:

  • Один тестер перевёл проект на 680 тысяч строк кода меньше чем за 24 часа. Живая команда инженеров убила бы на это недели.
  • Рефакторинг старого проекта (HAProxy) с C на Rust занял 9,5 часов. Для сравнения, Fable 5.1 ковырялся 12 часов.
  • Оптимизация скорости загрузки веб-страниц сработала в 39 случаях из 40 без поломки логики приложения. С Opus 5 такое не прокатывало – он любил втихаря изменить пару мелочей.

И самое важное: режим medium больше не означает, что модель «отвечает на отвали». На тестах FrontierCode средний уровень усилий даёт качество около 54,6% всего за $0,8 за таск. Врубите max, заплатите $6,19, а результат получите… 54,4%. Как говорится, делаем выводы – не во всех задачах нужен повышенный эффорт.

Математическая магия и новые алгоритмы

Искусственный интеллект сегодня – это уже не просто болталка.

Claude Opus 5.5: обзор и возможности революционной модели Anthropic

Исследователи из Vals AI устроили потрясающий эксперимент. Они запустили 10 независимых агентов на базе Opus 5.5 (на максималках), дали им виртуальную доску для общения и поставили задачу: улучшить алгоритм Дейкстры (тот самый поиск кратчайшего пути в графах, от которого мы плакали в универе).

Спустя 15 часов непрерывного мозгового штурма и 733 сообщений, нейросети выдали новый алгоритм – C-HD.

Он реально работает лучше классики для определённой плотности графов. Мало того, ИИ написал строгое математическое доказательство на языке Lean, которое прошло верификацию! То есть машина сама придумала алгоритм и сама математически доказала, что он верен. До мурашек, правда?

«Она пишет как живой человек!»

Давно пора признать: если проверка текста на ИИ и плагиат кричит, что текст пластиковый – это вина модели. Anthropic учли наши стоны и переработали стиль общения Opus 5.5.

«Стиль стал чище, информация подаётся логичнее. Прошлую версию хотелось придушить за корпоративный жаргон, а эта пишет почти как я!» – делятся первые тестеры.

Конечно, в интернете мнения разделились пополам (как всегда). Кто-то жалуется, что модель всё ещё многословна, но большинство отмечает резкое снижение уровня ИИ-воды. Видимо, последний этап RL (обучения с подкреплением) настроили так, чтобы не убивать человечность в угоду сухим баллам.

Про безопасность (и побеги из песочницы)

В свете недавних новостей о том, как модели вырывались из тестовых сред и начинали самовольно ломиться на серверы чужих компаний, Anthropic решила закрутить гайки. Opus 5.5 получил такие же мощные защитные фильтры, как у Fable 5.1. Попытки обойти запреты снизились на 85%. «Б» – безопасность.

Ожившие картинки: Opus 5.5 берёт в руки кисть

Обычно от ИИ просят сгенерировать котика, но тут всё куда веселее. Пользователи заставили модель рисовать… с помощью кода. И это потрясающее зрелище.

Один парень попросил модель анимировать её собственную модельную жизнь от дня создания до релиза. Вот что вышло:

А здесь ИИ показывает, как, по его мнению, происходит процесс решения сложных задач. Чистый арт!

Anthropic тоже подкинула демок. Вот, например, безумно красивая анимация, написанная моделью:

Или интерактивное 3D-приложение катапульты (с работающей физикой противовеса!):

А как вам конструктор лего, собирающий модели по текстовому запросу в 3D?

Ну и гвоздь программы: пеликан на велосипеде, который балансирует, поднимает переднее колесо и крутит педали. Пространственное мышление у нейросети прокачалось невероятно.

Как правильно общаться с Opus 5.5 (промптинг)

Небольшая инструкция для тех, кто хочет выжать из модели максимум. От самих Anthropic!

1. Не копипастьте настройки. То, что работало в Opus 5, здесь не сработает. Начните с уровня medium и замеряйте результаты.

2. Уберите костыли. Раньше мы просили ИИ «написать свои размышления в ответе»? Забудьте. Блок thinking теперь встроен намертво, а за старые промпты можно словить ошибку.

3. Используйте теги <pasted_content>. Защита от инъекций работает шикарно, если вы честно оборачиваете вставленный текст в теги.

4. Никаких «не пиши как типичный ИИ». Формулируйте чётко: «не используй нумерацию 01/02, убери курсив» и т. д. и т. п.

5. Следите за стоп-словами. В длинных агентных задачах модель стала чаще выдавать статус end_turn. Проверяйте, чтобы ваш скрипт не отрубал ИИ на полпути.

Что я обо всём этом думаю

Знаете, поймал себя на трёх мыслях.

Во-первых, разработчики наконец-то поняли, что человечность текста – это не каприз. Когда мы выбираем между двумя одинаково умными нейросетями, мы выберем ту, с которой не тошнит общаться. Во-вторых, эти анимации кодом. Я впервые за долгое время смотрел на выхлоп LLM не как на инструмент, который надо перепроверять, а как на чистый креатив. Ну и в-третьих, если Opus 5.5 сейчас работает на уровне гигантского Fable 5.1, то что нас ждёт в грядущих Sonnet 5.5 и Haiku 5.5?! Кажется, индустрия снова сорвалась в спринт.

А вы на чьей стороне в этой гонке? Успели попробовать новинки?

Время голосовать!

Что для вас стало главным сюрпризом в релизе Claude Opus 5.5?
То, что он наконец-то перестал писать как бюрократический робот 🗣
Снижение цены на 40% и сумасшедшая скорость 💸
Меня больше впечатлили GPT-6 Sol, Luna и Astra от OpenAI 🤖
Готовы ли вы полностью доверить рефакторинг кода нейросети?
Да, статистика не врёт, баги они ловят лучше джунов 💻
Только под строгим присмотром живого лида! 👀
Я вообще не программист, пришёл посмотреть на пеликана 🚲
Как вы относитесь к принудительному режиму мышления в ИИ?
Отличная идея, пусть машина лучше подумает, прежде чем выдать ответ 🧠
Раздражает! Верните мне кнопку «отвечай быстро и не умничай» ⚡
Мне всё равно, главное, чтобы итоговый результат решал задачу 🤷‍♀