Anthropic представила Claude Opus 5.5
Claude Opus 5.5 — первый релиз после призыва к освоению новых технологий . Перед выпуском он был протестирован внешними экспертами, включая Frontier Design и METR . В автоматизированном поведенческом аудите Anthropic, самом всестороннем тесте на соответствие стандартам, Opus 5.5 показал лучшие результаты среди всех протестированных моделей. Он также включает в себя средства защиты, разработанные для наиболее эффективных моделей.
Вот некоторые из улучшений, которые мы получили в Opus 5.5:
Производительность. Opus 5.5 — значительный шаг вперед по сравнению с Opus 5. Это новая ведущая модель, и первые тестировщики отметили существенное повышение производительности при выполнении самых сложных задач.
Один из тестировщиков завершил миграцию кода объемом 680 000 строк менее чем за день — работа, на которую команде инженеров потребовались бы недели. Он хорошо справляется с поиском и устранением неэффективности в программном обеспечении: когда мы попросили его сократить время загрузки каждой страницы веб-приложения, Opus 5.5 справился с задачей в 39 случаях из 40, в то время как Opus 5 внес более незначительные улучшения, которые также изменили поведение приложения.
Другой тестировщик использовал несколько моделей Claude для создания игры из одного запроса; Opus 5.5 показал лучшие результаты, чем любая другая модель, благодаря качеству графики и проработке.
Безопасность. Opus 5.5 демонстрирует лучшие результаты среди всех моделей на сегодняшний день в автоматизированном поведенческом аудите Anthropic — комплексе тестов, проверяющем Claude на тысячах смоделированных сценариев. Он гораздо реже, чем последние модели, совершает труднообратимые действия или выходит за заданные рамки, и более устойчив, чем Opus 5, к внедрению подсказок.
Anthropic также расширили тестирование на соответствие, включив в него более длинные задачи, невыполнимые задачи и сценарии, смоделированные на основе реальных инцидентов, хотя оно все еще имеет ограничения. Полная информация о оценке доступна в карточке Opus 5.5.
Поскольку Opus 5.5 сопоставим с Claude Mythos 5.1 в области биологии и кибербезопасности, Anthropic внедрили его с мерами защиты, аналогичными тем, что используются в Claude Fable 5.1.
Проверенные организации могут уже сегодня подать заявку на участие в программе верификации в области биологических наук , чтобы использовать Opus 5.5 для биологических исследований. В ближайшие недели также расширится доступ к программе киберверификации , и проверенные специалисты по кибербезопасности смогут использовать Opus 5.5 в своей работе.
В ближайшие недели выйдут Claude Sonnet 5.5 и Claude Haiku 5.5, в которых будут внесены многие улучшения в производительность, эффективность и безопасность.
Производительность и экономическая эффективность
По результатам тестов, Claude Opus 5.5 лидирует в программировании агентов, использовании компьютеров и работе с интеллектуальными ресурсами. Однако, при таком уровне возможностей обнаружено, что разница в результатах тестов стала менее надежным показателем реальных различий. В собственном опыте Anthropic разрыв между Opus 5.5 и Claude Fable 5.1 оказался меньше, чем показывают эти результаты.
Главное преимущество Opus 5.5 — эффективность. Стоимость одного токена ниже, чем в Opus 5, и на выполнение задачи требуется меньше токенов, что в итоге приводит к снижению затрат на 40%.
Программирование
Opus 5.5 особенно хорошо справляется с длительными и масштабными задачами, такими как миграция и аудит всего кода. Один из первых тестировщиков использовал его для аудита и исправления кода объемом 200 000 строк менее чем за три часа, в то время как Opus 5 потребовалось более 20 часов и в 2,5 раза больше токенов.
В ходе внутреннего тестирования Anthropic попросила Opus 5.5 и Fable 5.1 перевести HAProxy, широко используемое программное обеспечение для балансировки нагрузки веб-трафика между серверами, с языка C на Rust. Оба варианта переписанных кода прошли почти все собственные регрессионные тесты HAProxy, но Opus 5.5 завершил работу за 9,5 часов по сравнению с 12 часами для Fable 5.1 и обошелся на 51% дешевле.
Opus 5.5 демонстрирует передовые результаты в области агентного программирования при значительно меньших затратах. При стандартном уровне сложности на FrontierCode он превосходит GPT-6 Astra, обходясь примерно на 20% дешевле за задачу. На Terminal Bench 4.0 он сравнялся с Astra, обходясь примерно на 40% дешевле, а на CursorBench превзошел GPT-5.6 Sol на 11 пунктов, обходясь примерно на треть дешевле.
Безопасность
На прошлой неделе генеральный директор Anthropic Дарио Амодей утверждал, что прогресс в области ИИ должен развиваться постепенно, чтобы меры безопасности опережали возможности моделей. Постепенный прогресс — подход к обеспечению безопасности ИИ, сохранению конкурентоспособности по отношению к Китаю и реализации преимуществ ИИ, особенно в таких областях, как биология и медицина.
В целом Anthropic понимает риски, которые представляют современные модели, и они хорошо подготовлены к управлению ими. Однако по мере совершенствования возможностей могут быстро возникнуть более серьезные риски, и необходимо готовиться к ним уже сейчас. По этой причине работа Anthropic в области безопасности ведется одновременно в двух временных горизонтах:
-> Меры безопасности для современных моделей. Современное поколение моделей основано на устоявшемся наборе методов: обширное тестирование на соответствие стандартам, предрелизная оценка сторонними организациями, такими как METR и Frontier Design, а также меры защиты, соответствующие возможностям каждой модели в областях высокого риска, таких как кибербезопасность и биология. Anthropic совершенствует эти методы с каждым релизом. Они соответствуют самым серьезным рискам, которые представляют современные модели, и дают широкое, хотя и не идеальное, представление о диапазоне серьезных рисков.