GPT-5.6 против Claude Opus 5: что каждая модель реально умеет и какую брать под свои задачи
За две недели рынок ИИ пережил два запуска, которые меняют расклад для всех, кто строит на этих моделях продукты. 9 июля OpenAI выпустила семейство GPT-5.6. 24 июля Anthropic ответила Claude Opus 5.
Обе компании объявили себя лидерами. Обе показали графики, где их модель выигрывает. Разобраться, кто прав, по пресс-релизам невозможно — и это не фигура речи, а техническая реальность, к которой мы ещё вернёмся отдельно.
Ниже — разбор по первоисточникам: что нового у каждой, где кто объективно сильнее, сколько это стоит и какую модель под какую бизнес-задачу разумно брать.
Что произошло: краткая предыстория
GPT-5.6 вышла 9 июля как семейство из трёх моделей — это ключевое изменение подхода. Раньше был один флагман, теперь три уровня: Sol (флагман для самых сложных задач), Terra (сбалансированная для повседневной работы) и Luna (самая дешёвая для массовых операций). OpenAI прямо говорит, что цифра означает поколение, а Sol, Terra и Luna — постоянные уровни, которые дальше будут развиваться каждый в своём темпе.
Главные нововведения: режим ultra, который по умолчанию запускает четыре агента параллельно на одну задачу, и Programmatic Tool Calling — возможность модели писать и исполнять небольшие программы, координирующие вызовы инструментов, вместо того чтобы гонять каждый ответ инструмента через саму модель.
Claude Opus 5 вышла 24 июля. Anthropic позиционирует её иначе — не как лестницу тиров, а как одну модель с регулируемым «усилием» (от low до max), где пользователь сам решает, сколько ресурсов потратить на конкретный запрос. Заявленная суть: подойти близко к возможностям более дорогой Claude Fable 5, но за половину цены.
Отдельно отмечу деталь, важную для корпоративных внедрений: Anthropic сообщает, что по внутреннему поведенческому аудиту Opus 5 стала их наиболее «выровненной» моделью — с самым низким уровнем обманчивого поведения и наименьшей подверженностью манипуляциям. Для задач, где модель работает автономно с реальными системами, это не абстракция, а параметр риска.
Важная оговорка: почему большинству сравнений в интернете нельзя верить
Прежде чем перейти к цифрам, придётся вставить блок, без которого вся статья была бы недобросовестной. Готовя материал, я проверил популярные агрегаторы бенчмарков — и нашёл в них системные искажения. Три типовые проблемы.
Первая: подмена режима. Агрегаторы указывают у GPT-5.6 Sol результат BrowseComp 92,2% и Terminal-Bench 91,9%. Но в официальной таблице OpenAI эти цифры принадлежат режиму Sol Ultra, где параллельно работают четыре агента. Базовый Sol на тех же тестах даёт 90,4% и 88,8%. Сравнивать четырёхагентный режим с одиночным запуском конкурента — это как сравнивать бригаду с одним рабочим.
Вторая: подмена тира. В одном из агрегаторов у Sol указан индекс кодинга 77,4 — но по таблице самой OpenAI это результат Terra, средней модели. У Sol там 80.
Третья: несопоставимые методики. OpenAI прямо пишет в сноске, что их подсчёт по HealthBench Professional выполнен по методике оригинальной статьи и несопоставим с результатами, которые публикует Anthropic в своих системных картах. То есть даже одинаково названный тест у двух вендоров может мерить по-разному.
И четвёртое, самое очевидное, но упускаемое: страница OpenAI опубликована 9 июля — за пятнадцать дней до выхода Opus 5. Все её заявления о «новом state-of-the-art» и все сравнения с Claude сделаны против предыдущих моделей Anthropic, а не против Opus 5. Аналогично, Anthropic сравнивает Opus 5 в основном со своей же линейкой.
Вывод, который стоит запомнить: прямого сопоставимого сравнения этих двух моделей не существует. Есть два набора вендорских замеров на разных стендах. Ниже я привожу только те цифры, где сравнение хотя бы приблизительно осмысленно, — и честно помечаю, где его нет.
Где сильнее Claude Opus 5
Работа с реальными кодовыми базами. На SWE-bench Pro — тесте, где модель чинит настоящие задачи в репозиториях — Opus 5 показывает 79,2% против 64,6% у Sol. Разрыв почти в 15 пунктов, и это один из немногих случаев, где обе цифры измерены достаточно похоже, чтобы им доверять.
Автономная работа с компьютером. На OSWorld 2.0, где модель управляет интерфейсом операционной системы, у Opus 5 порядка 70,6% против 62,6% у Sol. Anthropic отдельно подчёркивает, что превосходит здесь все модели при любой заданной стоимости задачи.
Решение принципиально новых задач. ARC-AGI-3 проверяет способность справляться с тем, чего модель раньше не видела. Здесь разрыв драматический: около 30% у Opus 5 против 7,78% у Sol. Anthropic заявляет трёхкратное превосходство над ближайшим конкурентом, и данные OpenAI это косвенно подтверждают — у них самих на этом тесте скромные цифры.
Бизнес-процессы от начала до конца. На Zapier AutomationBench, который проверяет, доводит ли модель реальную рабочую задачу до конца, у Opus 5 около 26% против 18,1% у Sol. Показателен комментарий CEO Zapier: модель взяла сырую таблицу состояния клиентских аккаунтов и полностью отработала сценарий предотвращения оттока — пометила аккаунты в зоне риска, оповестила ответственных, подготовила сводку. Предыдущие модели этот тест не проходили вовсе.
Профессиональная работа по оценке людей. На GDPval-AA v2, где результаты моделей оценивают эксперты, у Opus 5 около 1861 Elo против примерно 1736 у Sol.
Где сильнее GPT-5.6
Академические знания и наука. На GPQA Diamond — тесте вопросов уровня PhD — Sol показывает 94,6%. Это один из лучших результатов на рынке. Сопоставимой публичной цифры по Opus 5 в первоисточниках я не нашёл, так что здесь честнее сказать: у GPT-5.6 сильная документированная позиция, а прямого сравнения нет.
Математика. На FrontierMath v2 у Sol 89% на первых трёх уровнях сложности и 83% на четвёртом. Опять же — публичного сопоставимого результата Opus 5 нет.
Кибербезопасность. Здесь расклад определяется не только способностями, но и политикой вендоров. GPT-5.6 показывает сильные результаты (например, 73,5% на ExploitBench и 96,7% на CTF-задачах). Anthropic же осознанно не обучает Opus 5 на кибератакующих задачах и ограничивает такие сценарии классификаторами. Если ваша задача — наступательная безопасность, выбор фактически предопределён политикой, а не бенчмарком.
Мультимодальность. MMMU Pro у Sol — 83% (84,6% с инструментами). Публичных сопоставимых цифр Opus 5 в первоисточниках нет.
Терминальные и командные сценарии. На Terminal-Bench 2.1 у Sol 88,8%, а в четырёхагентном режиме Ultra — 91,9%.
Параллельные агенты как встроенная функция. Режим ultra координирует четыре агента по умолчанию, а в API доступен мульти-агентный бета-режим. У Anthropic аналог достигается архитектурой на стороне разработчика, а не переключателем.
Цены и экономика: где на самом деле считаются деньги
Официальные цены за миллион токенов:
Claude Opus 5 — $5 на вход, $25 на выход. Плюс режим Fast, работающий примерно в 2,5 раза быстрее по удвоенной цене.
GPT-5.6 Sol — $5 на вход, $30 на выход. Terra — $2,50 и $15. Luna — $1 и $6.
По прайсу флагман Anthropic на выходе дешевле на 17%. Но для бизнеса это почти бесполезное сравнение, и вот почему.
Реальная стоимость считается не за токен, а за успешно выполненную задачу. В неё входят: длина ответа, количество повторных попыток при провале, стоимость отката на другую модель и — самое дорогое — время сотрудника на проверку и доработку результата. Модель, которая дороже за токен, но решает задачу с первого раза и коротко, на практике часто выходит дешевле болтливой и дешёвой.
Это подтверждается и данными обеих сторон. Anthropic указывает, что на CursorBench 3.2 Opus 5 подходит к результату более дорогой Fable 5 при половинной стоимости задачи. OpenAI приводит отзыв клиента, у которого GPT-5.6 сохранил качество, потратив на 24% меньше выходных токенов и завершив задачи на 28% быстрее.
Практический вывод для бюджета: у GPT-5.6 сильная сторона — лестница тиров. Рутину можно увести на Luna за $1/$6, а флагман оставить только на сложное. У Anthropic внутри одного поколения такого набора нет, но есть регулятор усилия, позволяющий экономить на простых запросах в рамках одной модели.
Что брать под конкретные задачи
Разберу по реальным сценариям, которые чаще всего встречаются в бизнесе. Оговорка одна на все: это отправная точка для вашего теста, а не готовый ответ.
Обработка входящего потока документов — счета, накладные, договоры, резюме. Извлечь поля, разложить по категориям, привести к единому формату. Берите GPT-5.6 Luna ($1/$6). Это тот случай, где флагман — выброшенные деньги: задача типовая, ошибки дёшевы и заметны на выходном контроле. Разница в цене с флагманом пятикратная, а качество на такой рутине упирается не в модель, а в качество исходных сканов. Переходите на Terra, только если увидите систематические ошибки на сложных макетах.
Поддержка клиентов первой линии — ответы на типовые вопросы, маршрутизация обращений. Terra ($2,50/$15) как рабочая лошадка, с эскалацией на флагман для сложных случаев. Логика простая: 80% обращений типовые, и гонять их через самую дорогую модель незачем. Ключевой момент здесь не модель, а правило эскалации — определите заранее, по какому признаку обращение уходит на более сильную модель или к человеку.
Агент, который сам доводит рабочий процесс до конца — например, ежедневно собирает данные из нескольких систем, находит проблемные места и передаёт их ответственным. Opus 5. Именно здесь у неё самый убедительный результат: на AutomationBench 26% против 18,1%, и кейс Zapier ровно об этом — модель отработала полный сценарий предотвращения оттока без человека, где предыдущие модели не справлялись вовсе. Практический совет: начните с medium усилия и поднимайте только если задача не решается. Максимальное усилие на всех запросах — самый частый способ сжечь бюджет впустую.
Разбор и доработка большой кодовой базы — легаси, рефакторинг, поиск причины плавающего бага. Opus 5, разрыв на SWE-bench Pro в 15 пунктов (79,2% против 64,6%) слишком велик, чтобы им пренебречь. Если работаете через Cursor или подобный инструмент — там модель обычно выбирается прямо в настройках, отдельная интеграция не нужна.
Массовая генерация кода по чётким спецификациям — типовые компоненты, тесты, миграции. Здесь Terra или GPT-5.6 Sol конкурентоспособны по цене задачи, а на DeepSWE у Sol даже лучше результат (72,7% против 68,8%). Это как раз тот случай, где стоит померить оба варианта на своих задачах — разница невелика, и решать будет ваша специфика.
Аналитика и подготовка документов для руководства — сводки, презентации, финансовые модели. Разделите по типу работы. Если нужна опора на научные или отраслевые знания и точные вычисления — GPT-5.6 Sol (94,6% на GPQA Diamond, 89% на FrontierMath). Если задача длинная и многошаговая, с итерациями по обратной связи — Opus 5, у неё сильнее позиция на GDPval-AA, где работу оценивают живые эксперты.
Автоматизация действий в интерфейсах — заполнение форм, работа с внутренними системами без API. Opus 5 по результатам OSWorld 2.0 (70,6% против 62,6%). Но перед внедрением обязательно ограничьте права доступа: автономная работа с боевыми системами — тот случай, где цена ошибки измеряется не токенами.
Задачи по безопасности — аудит кода, разбор инцидентов. GPT-5.6, и это вопрос не качества, а политики: Anthropic намеренно не обучает Opus 5 наступательным сценариям и ограничивает их классификаторами. Даже легитимная работа может упереться в блокировку.
Отдельно про выбор поставщика в целом. Не привязывайте продукт к одному вендору жёстко. Держите слой маршрутизации, где модель меняется настройкой, а не переписыванием кода. Практический минимум: логируйте, какая модель на каком запросе отработала, с какими затратами и был ли результат принят. Через месяц эти логи ответят на вопрос выбора точнее любой статьи, включая эту.
Как проверить это у себя, а не поверить на слово
Раз официальные бенчмарки несопоставимы, единственный надёжный способ — собственный замер. Минимальная честная методика выглядит так.
Соберите набор из 20–50 реальных задач вашего бизнеса, включая заведомо сложные. Прогоните обе модели в одинаковых условиях: те же инструменты, тот же контекст, те же лимиты и правила повторов. Оценивайте результаты вслепую, не зная, какая модель что выдала. И считайте не стоимость запроса, а стоимость принятой задачи — с учётом повторов и времени проверяющего.
Это несколько дней работы, которые сэкономят месяцы разбирательств.
Что в итоге
Короткая честная сводка: Opus 5 выглядит сильнее на автономной агентной работе, реальном коде и управлении компьютером. GPT-5.6 — на академических знаниях, математике, мультимодальности и кибербезопасности, и предлагает более гибкую ценовую лестницу из трёх моделей. Единого победителя нет, и любой, кто вам его называет, либо продаёт, либо не проверял методику.
А вот что действительно изменилось за эти две недели: планка «модель работает автономно несколько часов и доводит рабочую задачу до конца» перестала быть обещанием и стала предметом измерения. Для бизнеса это важнее, чем то, чей график выше.
Расскажите в комментариях: что вы уже гоняли на реальных задачах и что показала практика? Особенно интересны замеры, где результат разошёлся с обещаниями вендора, — и то, на чём в итоге остановились и почему.