Разбор слухов о Claude Opus 5
В четверг 23 июля сообщество ждало Claude Opus 5. Polymarket в пике давал под 88% на релиз в тот же день. Трекеры моделей сообщали о «раскатке по провайдерам». В лентах писали, что сегодня, возможно, крупнейший день релизов за год.
Ничего не вышло. Ни в четверг, ни сегодня. На сайте Anthropic по-прежнему нет ни анонса, ни карточки модели, ни идентификатора в API, ни строки в прайс-листе. Действующий флагман линейки Opus — версия 4.8 от 28 мая.
При этом к моменту несостоявшегося релиза модель уже успели сравнить с конкурентами, оценить по бенчмаркам и объявить причиной устаревания GPT-5.6 и Grok 5. Вот характерный список того, что о ней «известно», разошедшийся по лентам:
- превосходит Fable 5 в рассуждениях и программировании;
- 90%+ на SWE-bench Verified;
- автономные агенты на 10+ часов;
- почти нулевые галлюцинации в пределах 1 млн токенов;
- создаёт и отлаживает полноценные приложения по одному промпту;
- дешевле и быстрее Opus 4.8;
- делает GPT-5.6 и Grok 5 устаревшими.
Ни один пункт не имеет источника в Anthropic. Разберём, что за ними стоит на самом деле — и почему разбор интереснее самого списка.
Что реально есть
Единственный весомый артефакт — модель под названием Honeycomb EAP, которая примерно 8–9 июля ненадолго появилась в списке моделей редактора Cursor и была убрана в течение нескольких часов. В карточке значились: контекстное окно в миллион токенов, режим повышенного усилия «xhigh», покомандные ограничения и поведение с откатом на Opus 4.8 при срабатывании защиты.
Вторым сигналом стало упоминание строки claude-opus-5 в каталоге Google Vertex AI около 14 июля — устойчивого подтверждения ни от Google, ни от Anthropic на него нет. Похожая последовательность предшествовала выходу Sonnet 5, поэтому наблюдатели считают её значимой.
И третье — календарь. Opus 4.6 вышел 5 февраля, 4.7 — 16 апреля, 4.8 — 28 мая. Все три релиза пришлись на четверг. К 23 июля с момента выхода 4.8 прошло 56 дней — самый длинный перерыв в линейке с февраля. Отсюда и сложилась дата: сначала ждали 20–21 июля, когда окно прошло впустую — переключились на ближайший четверг.
Всё. Ни цены, ни бенчмарков, ни имени.
Теперь по пунктам
«Превосходит Fable 5 в рассуждениях и программировании». Это утверждение противоречит самой содержательной части доступных сообщений. Отраслевые обозреватели, разбиравшие происхождение слуха, отследили его до кластера почти идентичных постов в соцсетях — а профильные издания, наоборот, пишут, что новая модель ожидается на уровне Fable 5 и не предполагается обгоняющей её по основным тестам. Фокус, по этим сообщениям, смещён на надёжность и корпоративное развёртывание, а не на рекорды.
Это не мелочь, и ниже я объясню, почему так и должно быть.
«90%+ на SWE-bench Verified». Здесь самая интересная подмена. SWE-bench существует в нескольких вариантах, и Verified — заметно более лёгкий, чем Pro. Opus 4.7 ещё в апреле показывал на Verified 87,6% против 80,8% у предшественника. То есть «90% на Verified» — это прирост в два с половиной пункта к модели трёхмесячной давности, а вовсе не прорыв.
Флагманский результат Fable 5, которым Anthropic оперирует в анонсах, — 80,3% на SWE-bench Pro, на сложной версии. Opus 4.8 там же даёт 69,2%. Цифры из разных тестов сопоставлять нельзя, но в списке слухов они соседствуют так, будто это одна шкала. Читатель, не различающий Verified и Pro, видит скачок с 80 до 90 — которого нет.
«Автономные агенты на 10+ часов». Источника нет. Для линейки Opus 4 заявлялась автономная работа порядка семи с лишним часов, так что цифра выглядит как округление вверх от известного, а не как чья-то утечка.
«Почти нулевые галлюцинации в пределах 1 млн токенов». Контекстное окно в миллион токенов действительно фигурирует в утечке Honeycomb. Вторая половина фразы — про нулевые галлюцинации — не имеет вообще никакого основания ни в утечках, ни в чьих-либо заявлениях. Это самый слабый пункт списка: конструкция, где к реальной детали пристёгнуто желаемое, чтобы всё вместе выглядело как инсайд.
«Создаёт и отлаживает полноценные приложения по одному промпту». Рекламная формулировка без источника и без способа проверки.
«Дешевле и быстрее Opus 4.8». Единственный пункт, у которого есть косвенная опора — не утечка, а тренд. Opus 4 в 2025 году стоил $15 за миллион входных и $75 за миллион выходных токенов. Opus 4.8 стоит $5 и $25 — падение примерно втрое за год. Ожидание удешевления разумно. Подтверждения конкретно для новой модели нет.
«Делает GPT-5.6 и Grok 5 устаревшими». Оценочное суждение о неанонсированной модели. Для контекста: OpenAI по собственным замерам утверждает, что GPT-5.6 Sol обходит Fable 5 на 11,4 пункта при среднем уровне рассуждений и вчетверо меньшей стоимости, тогда как на SWE-bench Pro Fable 5 держит 80,3% против 64,6% у Sol. Обе стороны публикуют цифры, полученные на своей оснастке. Это не значит, что кто-то врёт, — это значит, что «устарел» в такой ситуации не измеряется.
Более интересный вопрос: зачем Anthropic Opus 5, который не обгоняет Fable 5
Если отбросить хайп, остаётся структурная загадка, и она объясняет многое.
Год назад Opus был вершиной линейки. Сейчас он зажат с двух сторон.
Снизу — Sonnet 5, вышедший 30 июня. На агентном программировании он даёт 63,2% против 69,2% у Opus 4.8 — заметно ниже, но на тесте по knowledge work набирает 1618 против 1615, то есть слегка обходит флагман. Стоит при этом $2–3 за миллион входных токенов против $5. Для значительной части задач разница в качестве не оправдывает разницу в цене.
Сверху — Fable 5, вышедший 9 июня в новом классе Mythos, который Anthropic поставила над Opus. Цена вдвое выше, чем у Opus 4.8, результат на сложном коде — на одиннадцать пунктов лучше.
Отсюда следует неприятная для маркетинга вещь: новый Opus, который обгонит Fable 5, обесценит Fable 5. Компания сама выстроила иерархию, в которой Opus — средний уровень. Модель, ломающая эту иерархию через полтора месяца после запуска верхнего класса, ударит по продукту, за который платят вдвое дороже, а с 19 июля — ещё и отдельными кредитами вместо включения в подписку.
Это ровно тот вопрос, который обсуждают в сообществе: как выпустить новый флагман Opus, не подорвав ценник на Fable 5.
Есть и деталь, которая усложняет картину. В утечке Honeycomb фигурирует откат на Opus 4.8 при срабатывании защитных механизмов — та же схема, что используется уровнем выше, у Fable 5, где чувствительные темы автоматически переводятся на Opus 4.8 (Anthropic заявляет, что 95% сессий с этим не сталкиваются). Если новая модель наследует именно такую архитектуру, она позиционируется ближе к фронтиру, чем предполагает её номер.
Стоит помнить и прецедент: при запуске Opus 4.7 в апреле Дарио Амодеи публично признал, что Opus уступает невыпущенной модели класса Mythos. Компания уже делала так, что публичный флагман официально не был её сильнейшей моделью.
Что означает сама задержка
Прогнозные рынки ошиблись. Polymarket давал 87–88% на четверг и оказался неправ; вероятность релиза до 24 июля осела к 62%, до 31 июля — около 85%. Это неплохая иллюстрация того, чем являются такие котировки: агрегированное ожидание толпы, а не осведомлённость. Толпа читает те же утечки, что и все остальные, и уверенно ошибается вместе.
Свежие новости из мира AI — в моём Telegram-канале «AI за 5 минут»: t.me/ai_digest_5min. Короткие посты на русском, релизы моделей и исследования в реальном времени. Канал собирается автоматически из англоязычных источников — без необходимости самому читать Twitter каждый день.