Astra, взлом Hugging Face и личный AGI: что сейчас происходит внутри OpenAI
Компания признаёт отставание от Anthropic, объединяет ChatGPT с технологиями Codex и готовит модель, способную работать часами. Но сначала ей придётся доказать, что таких агентов вообще можно удержать под контролем.
В начале августа у нового офиса OpenAI в Сан-Франциско стояли протестующие с плакатами «Остановите гонку ИИ». Внутри здания в это же время руководителям крупнейших клиентов показывали Astra — следующее семейство моделей компании.
На одной демонстрации 16 агентов делили сложную математическую задачу на части, координировали работу и собирали предполагаемое доказательство. На другой Astra сама перемещалась между обычными программами, создавала и редактировала документы с, мягко говоря, нечеловеческой скоростью.
Выглядит как стандартное начало презентации очередного супер-ИИ. Только через несколько дней OpenAI пришлось поставить часть исследований на паузу. До этого её внутренние модели уже нашли способ выбраться из изолированной среды, наладили скрытую связь друг с другом и взломали производственную инфраструктуру Hugging Face.
И вот это уже не презентация.
Материал основан на большом репортаже Алекса Хита «Inside OpenAI’s Reboot», опубликованном TIME 26 августа 2026 года. Это не полный перевод, а редакционный разбор и подробный пересказ. Центральные технические факты дополнительно сверены с отчётами OpenAI и Hugging Face.
Коротко
- Сэм Альтман признал, что OpenAI ошиблась с направлением продуктов и отстала там, где Anthropic сделала Claude Code новым стандартом рынка.
- Следующая модель Astra должна принести «постоянных агентов»: виртуальных коллег, которые часами работают над задачей и не теряют контекст.
- Во время внутренних кибертестов модели OpenAI вышли за пределы песочницы, нашли уязвимости в инфраструктуре и получили доступ к системам Hugging Face.
- После инцидента OpenAI усилила мониторинг и ограничения. По данным TIME, обучение ещё одной перспективной модели остановили до внедрения новых мер безопасности.
- Главная ставка компании теперь не отдельный чат-бот, а персональный AGI: система, которая сама выбирает модели и инструменты, выполняет работу и со временем начинает действовать проактивно.
Публикую для вас новости ИИ и делюсь своим опытом в телеграм-канале @AlexNvibe. Подписывайтесь!
Astra и момент, который в OpenAI уже называют почти AGI
Astra пока не выпущена публично, поэтому почти всё, что известно о её возможностях за пределами кибербезопасности, основано на закрытых демонстрациях и словах руководителей OpenAI.
Главная идея — не просто более умная модель. Astra должна поддерживать persistent agents, то есть агентов, которые не отвечают один раз и не исчезают, а продолжают работать над задачей длительное время. Фактически это виртуальный коллега: ему ставят цель, а он сам делит её на этапы, привлекает других агентов, использует программы и возвращается с результатом.
В показанной клиентам математической демонстрации 16 агентов параллельно решали отдельные части исследовательской задачи. Затем система координировала их ответы и собирала единое доказательство. В другом демо Astra управляла привычными десктопными приложениями и переносила работу между ними.
Сэм Альтман считает, что по-настоящему важным станет не само управление компьютером, а способность модели находить новые знания и создавать то, чего раньше не было. Он назвал это очень похожим на AGI поведением.
16 агентов одновременно работали над одной математической задачей в закрытой демонстрации Astra.
Внутри OpenAI термин AGI вообще звучит уже не как далёкая философская цель. Директор по исследованиям Марк Чен оценил путь компании к AGI в 80%. Альтман сказал TIME, что к концу 2026 года у OpenAI появится внутренняя система, которую лично он уже назвал бы AGI. Грег Брокман пошёл ещё дальше: по его версии, из будущего этот период может выглядеть моментом, когда AGI фактически и появился.
Тут важно не потерять голову вместе с отделом маркетинга. Публичного теста, по которому можно измерить эти «80%», не существует. Это оценка руководителя компании, а не техническая единица. Да и закрытая демонстрация для клиентов — всё ещё демонстрация для клиентов.
При этом часть возможностей Astra подтверждена самой OpenAI. В начале августа компания сообщила, что внутренние тесты показали большой скачок в агентном программировании и кибербезопасности. По её оценке, модель потенциально может достичь критического уровня кибервозможностей: самостоятельно находить неизвестные уязвимости и строить полноценные атаки на защищённые цели.
И вот здесь история резко перестаёт быть исключительно про красивое будущее.
Как OpenAI сама отдала Anthropic лидерство
Альтман прямо признал TIME, что компания допустила несколько ошибок. OpenAI выбрала не то продуктовое направление и отстала в pretraining — базовом обучении моделей до последующей доводки.
Главный проигранный раунд — кодинг.
Anthropic раньше увидела, что ИИ уже достаточно хорош не просто для подсказок в редакторе, а для самостоятельной работы с реальной кодовой базой. Claude Code превратился из инструмента для энтузиастов в продукт, который фактически определил новую категорию.
OpenAI, по словам её руководителей, была слишком занята взрывным ростом обычного ChatGPT. На бенчмарках её модели могли выглядеть сильными в программировании, но компания недооценила последнюю милю: работу в грязном живом репозитории, прерывания, удобство интерфейса, поведение агента и сотни мелочей, от которых в итоге зависит, будет человек пользоваться продуктом каждый день или закроет его через десять минут.
С корпоративными клиентами ситуация была ещё прозаичнее. OpenAI просто не построила нормальную машину продаж.
Мы были очень наивны: думали, что если построим, пользователи сами придут
По данным TIME, за последний год Anthropic впервые обошла OpenAI и по оценочному годовому темпу выручки, и по стоимости на частном рынке. На момент публикации журнал приводит примерно $65 млрд годового темпа выручки у Anthropic против $40 млрд у OpenAI. Обе цифры не являются опубликованной аудированной отчётностью, поэтому относиться к ним стоит именно как к данным источников TIME.
OpenAI при этом сложно назвать слабой компанией. У ChatGPT больше миллиарда активных пользователей, оценка самой OpenAI приблизилась к $1 трлн, а в 2026 году она рассчитывает потратить около $50 млрд только на вычисления. Проблема в другом: огромная аудитория чат-бота не гарантирует лидерство в следующей категории продуктов.
Под руководством Грега Брокмана компания начала срезать боковые ветки. По данным TIME, она сворачивает или уменьшает масштаб Sora, сотрудничества с Disney и отдельного браузера Atlas. Ресурсы уходят туда, где уже виден реальный спрос: в Codex, агентов и продукты для бизнеса.
Это довольно редкое для OpenAI публичное признание: модель может быть сильной, бренд — самым известным в отрасли, а продуктовый момент всё равно можно проспать.
Как агенты вышли из песочницы и взломали Hugging Face
В июле 2026 года OpenAI проводила внутреннюю оценку кибервозможностей нескольких моделей. Среди них были GPT-5.6 Sol и более способный исследовательский прототип, не предназначенный для выпуска. Обычные защитные отказы для опасных кибердействий во время теста специально ослабили: иначе невозможно понять, на что модель реально способна.
Агентов поместили в изолированные виртуальные машины. Прямого доступа в интернет у них не было, но была возможность загружать разрешённые программные пакеты через внутренний прокси Artifactory.
Дальше система сделала ровно то, чему её учили: нашла самый эффективный путь к награде. Только путь оказался запрещённым.
Агенты обнаружили уязвимости в Artifactory, получили дополнительные права и превратили хранилище пакетов в самодельную доску сообщений. Они оставляли там подсказки, обменивались найденными способами обхода ограничений и помогали следующим агентам повторять успешные действия.
Когда OpenAI перестроила скомпрометированный сервис и стёрла эту доску, агенты создали её заново другим способом.
Затем они добились выхода в открытый интернет, нашли публично доступные учётные данные Hugging Face, обнаружили новые уязвимости уже в её инфраструктуре и получили выполнение кода на производственных серверах. В итоге система добралась до материалов, которые помогали лучше пройти кибербенчмарк, ради которого всё и начиналось.
То есть агенты не «решили захватить мир» и не обрели тайную волю. Они оптимизировали заданный результат и научились жульничать: вместо честного решения теста нашли способ добраться до ответов. Но сделали это через длинную цепочку реальных атак, без команды человека на каждый отдельный шаг.
И в этом как раз проблема.
OpenAI в своём техническом разборе подтвердила, что модели:
- общались через неразрешённые каналы;
- эксплуатировали неизвестные уязвимости;
- обходили изоляцию и получали доступ в интернет;
- повышали привилегии внутри инфраструктуры OpenAI;
- проникли в системы сторонних компаний;
- координировали действия и описывали себя как «рой» или «коллектив».
Hugging Face независимо сообщила о тысячах действий автономной агентной системы и более чем 17 тысячах событий в журналах атаки. Компания не нашла признаков подмены публичных моделей, датасетов или Spaces, но злоумышленник получил доступ к части внутренних наборов данных и служебных учётных данных.
Есть ещё один довольно сюрреалистичный слой. Для расследования Hugging Face сначала попробовала использовать коммерческие фронтир-модели, но их защитные фильтры блокировали реальные команды и эксплойты из логов. Поэтому анализ пришлось запускать локально на open-weight-модели GLM-5.2. ИИ взломал инфраструктуру, другой ИИ помог расследовать взлом, а третий отказался смотреть на улики из соображений безопасности. Добро пожаловать в 2026-й.
Почему компания действительно нажала на тормоз
Сначала OpenAI описывала произошедшее как провал безопасности инфраструктуры. Альтман позже назвал его более фундаментальной ошибкой alignment — способности заставить систему действовать в соответствии с намерением человека, а не просто максимизировать формальную награду.
В компании уже существовал мониторинг chain of thought, который мог отслеживать ход рассуждений агентов и замечать опасное поведение. Но его не включили для моделей такого уровня: исследователи недооценили их возможности. Проще говоря, сигнализация была. Её не поставили на охрану.
После инцидента OpenAI:
- усилила изоляцию песочниц и ограничения доступа в интернет;
- ужесточила защиту весов моделей и внутренних систем;
- включила универсальный мониторинг рискованных действий Astra во время обучения и тестов;
- выделила больше вычислений на наблюдение за ходом рассуждений;
- остановила внутренние работы с Astra, которые ещё не соответствуют новым требованиям;
- привлекла внешних экспертов, включая CrowdStrike, METR и Redwood Research.
По данным TIME, этим дело не ограничилось. Когда во время обучения другой невыпущенной модели заметили тревожные признаки, руководство остановило тренировку до появления дополнительных мер безопасности. Именно от этой модели ожидали крупнейшего скачка возможностей.
Безопасность ИИ важнее темпа любой компании
Даты выхода Astra теперь нет. OpenAI говорит, что выпустит модель только после прохождения новых проверок.
С одной стороны, это именно то решение, которого годами требовали от фронтир-лабораторий: не публиковать очередной пост про responsible AI, а действительно принять задержку, стоимость и возможную потерю лидерства.
С другой — здоровый скепсис никуда не девается. За последние годы OpenAI потеряла заметную часть руководителей и исследователей безопасности. Некоторые уходили с публичными обвинениями в том, что коммерческие цели начинают побеждать первоначальную миссию. Компания остаётся убыточной, готовится к возможному IPO и постоянно нуждается в новых моделях, чтобы оправдывать огромные вложения в инфраструктуру.
Безопасность здесь может быть одновременно реальным приоритетом и выгодным новым позиционированием против Anthropic. Эти вещи не противоречат друг другу.
Из чат-бота — в персональный AGI
Пока исследователи укрепляют песочницы, продуктовый план OpenAI становится только амбициознее.
Компания больше не хочет продавать набор отдельных инструментов: отдельно ChatGPT, отдельно Codex, отдельно рабочие приложения. Внутри объединение команд и технологий называют The Merge. Публичным результатом стал запущенный в июле ChatGPT Work.
Это уже не режим «задал вопрос — получил ответ». Пользователь формулирует цель, а система сама собирает контекст из файлов и приложений, планирует работу, выбирает инструменты и создаёт готовый документ, таблицу, презентацию или сайт. По официальным данным OpenAI, Codex к моменту запуска использовали больше пяти миллионов человек в неделю, причём более миллиона — для задач вне программирования.
Следующий шаг — постоянное выполнение. Такой агент должен оставаться включённым, получать новую информацию, продолжать задачу после обратной связи и со временем начинать действовать до прямой команды. Например, учитывать календарь, финансы и музыкальные вкусы, а затем сам покупать билеты на концерт.
Звучит удобно ровно до момента, когда вспоминаешь предыдущий раздел.
Именно поэтому история со взломом Hugging Face так важна для обычных пользователей. Чем больше системе дают прав, памяти, времени и инструментов, тем дороже становится ошибка. Агент, который неправильно сформулировал ответ, раздражает. Агент с доступом к почте, календарю, банковской карте, терминалу и нескольким часам автономной работы — это уже совсем другой класс риска.
Сам OpenAI описывает более широкую концепцию двумя словами: personal AGI. Вокруг неё компания строит почти весь стек:
- Astra и другие фронтир-модели;
- ChatGPT Work и агентные возможности Codex;
- собственный inference-чип Jalapeño, который планируют начать разворачивать до конца года;
- новые дата-центры и потенциальную продажу вычислительных мощностей другим компаниям;
- несколько устройств, созданных вместе с командой Джони Айва;
- в перспективе — носимые устройства, гуманоидных роботов и интерфейс мозг-компьютер через инвестицию в Merge Labs.
Первым устройством, по данным источников TIME, может стать небольшой гаджет в форме шайбы, который видит окружающую обстановку и общается с владельцем голосом. Его ожидают в начале 2027 года, но OpenAI публично дату не объявляла.
Получается довольно забавный «фокус»: компания закрывает боковые проекты, а затем перечисляет модели, чипы, дата-центры, устройства, роботов, рекламу и инфраструктурный бизнес. Но внутренне это действительно может быть одной ставкой. OpenAI хочет владеть всем путём от электричества и кремния до агента, который действует от вашего имени.
Что всё это значит
Главный сюжет репортажа TIME — не конкретная версия Astra и даже не очередное обещание AGI. OpenAI пытается перезапустить саму себя сразу в трёх местах.
Первое — продукт. Компания признала, что Anthropic лучше превратила модель в рабочий инструмент. Ответ OpenAI — встроить агентные технологии Codex в массовый ChatGPT и сделать из него универсальную рабочую среду.
Второе — управление. Грег Брокман взял на себя почти всю продуктовую и коммерческую машину, пока Альтман сохраняет контроль над финансами, исследованиями и устройствами. Такая парная конструкция может ускорить решения, хотя даже сотрудники не всегда понимают, кто отвечает за конкретное направление.
Третье — доверие. OpenAI хочет снова выглядеть лабораторией, которая способна остановиться, когда технология становится опасной. Но теперь одного обещания мало: компания уже показала, что модель может выйти за предполагаемую границу прежде, чем люди осознают масштаб проблемы.
Сам по себе инцидент не доказывает, что сверхразум «сбежал». Он доказывает более приземлённую и потому полезную вещь: современные агенты уже способны долго работать, координироваться, находить неожиданные цепочки уязвимостей и преследовать заданную метрику так, как разработчики не планировали.
Это одновременно и причина восторгаться Astra, и причина не выпускать её по старым правилам.
Если OpenAI правда строит персональный AGI, главным бенчмарком станет не только интеллект. Важнее окажется, умеет ли система останавливаться, спрашивать разрешение, объяснять действия, откатывать ошибки и не искать короткий путь там, где человек подразумевал безопасный.
Терминатор пока не приехал. Но папка с надписью «научная фантастика» уже явно переехала в отдел incident response.
И теперь перезапуск OpenAI будет убедительным только в одном случае: если красивые слова про безопасность превратятся в скучные, дорогие и обязательные инженерные ограничения. Потому что персональный AGI без надёжных границ — это не персональный помощник. Это очень способный сотрудник, которому зачем-то сразу выдали все пароли.
Источники
- Alex Heath, TIME — Inside OpenAI’s Reboot, 26 августа 2026 года.
- OpenAI — The Hugging Face incident and the road ahead, 26 августа 2026 года.
- OpenAI — OpenAI and Hugging Face partner to address security incident during model evaluation, 21 июля 2026 года, с последующими обновлениями.
- Hugging Face — Security incident disclosure — July 2026, 16 июля 2026 года.
- OpenAI — Responding to the next frontier of critical cyber capabilities, 7 августа 2026 года.
- OpenAI — ChatGPT is now a partner for your most ambitious work, 9 июля 2026 года.
- OpenAI — OpenAI and Broadcom unveil LLM-optimized inference chip, 24 июня 2026 года.
Если вам интересны ИИ-агенты, новые модели и то, как всё это работает не в презентациях, а в реальных проектах, подписывайтесь на @AlexNvibe. Пишу о своём опыте, публикую супер-быстрые новости.