$6,5 тыс. за взлом OpenAI с помощью Claude? Легко

Три исследователя, меньше 72 часов, две уязвимости и PR во внутреннем репозитории OpenAI. Хорошая новость: хакеры оказались белыми.

$6,5 тыс. за взлом OpenAI с помощью Claude? Легко

Обычно Claude и ChatGPT сравнивают по качеству кода, текстов и способности не потерять мысль на двадцатом сообщении. Но команда Hacktron решила устроить моделям куда более интересный сравнительный тест: использовала Claude, чтобы взломать OpenAI.

И это не фигура речи. Исследователи получили доступ к аккаунтам ChatGPT и Codex сотрудников OpenAI, а затем добрались до внутреннего репозитория компании. Весь путь от первоначальной находки до доказательства доступа занял меньше 72 часов.

Кстати, если вам хочется столкнуть модели OpenAI и Anthropic в менее экстремальных условиях, они доступны в SYNTX.AI. Можно просто дать им одну и ту же задачу и посмотреть, кто справится лучше. Внутренний GitHub OpenAI при этом трогать совершенно необязательно.

Для всех читателей скидка 15% на любой тариф с промокодом SLEZAMNEVERIT

Всё началось с картинки

Самое забавное, что никакого хитрого джейлбрейка ChatGPT в этой истории вообще не было.

Исследователи Hacktron изучали community.openai.com, официальный форум OpenAI, работающий на платформе Discourse. В цепочке обработки загружаемых изображений они нашли проблему в libheif, библиотеке для работы с HEIF/HEIC. Уязвимость позволяла добиться удалённого выполнения кода через специально подготовленное изображение. Позже Discourse опубликовал отдельный security advisory и оценил проблему в 8,8 балла из 10 по CVSS.

И вот здесь в историю входит Claude.

Сначала команда работала с Claude Opus 4.8. Модель помогла исследователям заметить, что в установленной версии libheif отсутствовали некоторые важные исправления безопасности, и участвовала в разработке proof of concept. Но довести атаку до стабильного рабочего состояния оказалось сложнее.

А вечером 24 июля Anthropic как раз выпустила Claude Opus 5. Исследователи дали новой модели ту же задачу, и, по данным Hacktron, уже примерно за три часа она смогла продвинуться там, где предыдущая версия буксовала. На следующий день команда подтвердила возможность выполнения кода через загрузку изображения.

Очень удачный релиз. Особенно если вы не OpenAI.

Но картинка была только первым ключом

Сам по себе взлом форума ещё не означал доступ ко внутренним системам OpenAI. Настоящая проблема обнаружилась дальше.

Для входа на форум можно было использовать Sign in with OpenAI, и исследователи нашли ошибку в системе SSO. В сочетании с уже полученным доступом к форуму она позволяла перехватывать аккаунты ChatGPT и Codex пользователей без дополнительных действий с их стороны.

В итоге Hacktron получили доступ к нескольким аккаунтам сотрудников OpenAI.

И тут им особенно повезло: у одного из сотрудников Codex был подключён к GitHub организации OpenAI.

Теоретически это открывало дорогу к внутренним репозиториям компании и связанным сервисам. Но Hacktron работали как white hat исследователи, поэтому читать исходники и гулять по инфраструктуре дальше они не стали.

Вместо этого через Codex скомпрометированного сотрудника они создали безобидный pull request во внутреннем монорепозитории openai/openai. Просто чтобы доказать: да, доступ действительно есть. После этого тестирование остановили и сообщили OpenAI о проблеме.

То есть последовательность получилась примерно такая:

уязвимое изображение → форум OpenAI → проблема с авторизацией → аккаунт сотрудника → Codex → внутренний GitHub.

И где-то рядом всё это время Claude помогал превращать найденные уязвимости в работающую цепочку.

Меньше 72 часов

Вот эта часть истории, пожалуй, интереснее самого факта взлома.

Hacktron утверждает, что путь от первоначального обнаружения проблемы до доступа к внутреннему репозиторию OpenAI занял меньше трёх суток. Причём над исследованием работала команда всего из трёх человек.

В более широком исследовательском проекте HEIF Heist команда тестировала похожие проблемы в инфраструктуре разных крупных сервисов. За два месяца они потратили на модели меньше $3 тыс. в токенах, а адаптация атаки под новую систему часто занимала один-два дня. При этом сами исследователи отдельно подчёркивают: это не был полностью автономный «ИИ-хакер». Люди с серьёзной экспертизой всё ещё направляли работу модели и принимали ключевые решения.

Но соотношение ресурсов уже выглядит довольно занятно.

То, для чего раньше могла понадобиться большая команда специалистов и недели работы, ИИ помогает сжимать до нескольких человек и нескольких дней.

И это, пожалуй, главный вывод этой истории. Не «Claude научился взламывать OpenAI одной кнопкой» — такого не произошло. А то, что модели становятся достаточно сильными, чтобы заметно удешевлять и ускорять сложную работу по поиску и эксплуатации уязвимостей.

Причём прогресс виден буквально между соседними версиями одной модели: Hacktron пишет, что Opus 4.8 несколько раз не смог решить часть задачи, а свежий Opus 5 справился с ней уже в первые часы после релиза.

И чем всё закончилось?

На удивление мирно.

Hacktron сообщили об уязвимостях OpenAI и Discourse. OpenAI подтвердила исправление своей части проблемы примерно через 14 часов после первоначального отчёта, а Discourse подготовил исправление к понедельнику и дополнительно усилил изоляцию обработки изображений.

1 сентября OpenAI закрыла отчёт и выплатила исследователям $6 500. В компании отдельно уточнили, что сам форум Discourse формально не входил в scope bug bounty: вознаграждение было выплачено именно за найденную проблему на стороне OpenAI с SSO.

Так что финальный счёт выглядит примерно так:

Hacktron получила $6,5 тыс.OpenAI получила закрытую уязвимость.Discourse получила патч.Claude получил очень неплохой кейс в портфолио.

А мы получили ещё одно довольно наглядное напоминание о том, что гонка ИИ теперь происходит не только в бенчмарках. Модели уже помогают искать уязвимости, писать код для исследований и за несколько дней выполнять работу, которая ещё недавно требовала куда больше времени и ресурсов.

Для всего остального Claude, GPT и другие модели можно тестировать в SYNTX.AI. Там сценарии всё-таки поспокойнее: код, ресёрч, тексты, анализ данных и обычная работа с ИИ. Хотя после этой истории слово «обычная» звучит уже немного подозрительно.

44