🤯 Что вообще происходит с GPT-6 Astra и почему она уже успела устареть
GPT-6 Astra вышла всего 3 сентября, но за последнюю неделю вокруг неё произошло столько всего, что пора собрать картину целиком.
Сама Astra не выглядит каким-то радикальным скачком по базовым характеристикам: миллион токенов контекста и вывод до 128К уже стали привычными для флагманов. Гораздо интереснее то, насколько она стала лучше именно как агент.
На OSWorld Astra выполняет компьютерные задачи примерно на 47% быстрее GPT-5.6 Sol. На Terminal-Bench 4.0 результат вырос с 37,3% у Sol до 57,9%, а на научном Terminal-Bench Science вообще с 22,4% до 64,6%. При этом на Agents' Last Exam Astra использует примерно на 65% меньше выходных токенов, чем Claude Opus 5.
Но самая безумная часть релиза вообще не про код.
OpenAI заявила, что её система получила решение задачи Навье-Стокса — одной из семи задач тысячелетия, сформулированных Институтом Клэя в 2000 году. Она описывает движение жидкостей и газов: например, воздуха вокруг самолёта, воды в океане или потоков в атмосфере. Проблема в том, что уравнения Навье-Стокса давно известны, но математики до сих пор не смогли доказать, всегда ли для них существуют гладкие решения без разрывов и бесконечных значений или же в некоторых случаях течение может «взорваться» за конечное время. За доказательство этой части задачи назначена премия в $1 млн, а полноценного решения не было больше 200 лет с момента появления самих уравнений. Около 10 000 агентов работали параллельно 88 часов, отправили 2,7 млн сообщений и сгенерировали примерно 130 млрд токенов. Затем ещё 17 часов ушло на формализацию и проверку доказательства в Lean (языка программирования, который позволяет формально проверять математические доказательства).
Важная деталь: само решение нашла не Astra.
OpenAI прямо пишет, что использовала новую внутреннюю модель, которая «значительно мощнее GPT-6 Astra». Её начали обучать только 28 августа, обучение всё ещё продолжается, причём во время эксперимента агентов уже переводили на более свежую версию чекпойнта. Astra использовали на финальном этапе для Lean.
И вот здесь начинается самое интересное.
OpenAI показала график Astra против этой новой модели на наборе открытых математических задач. На максимальном показанном test-time compute новая модель решает примерно 48% задач против ~17% у Astra. То есть модель, которая вышла неделю назад и сама считается огромным скачком, уже выглядит почти в три раза слабее на этом тесте. Причём новая модель ещё обучается.
А дальше слухи начинают становиться совсем весёлыми.
OpenAI уже официально подтвердила, что после Навье-Стокса получила «существенный прогресс» ещё по одной задаче тысячелетия и сейчас решает, как правильно опубликовать результат. Название задачи компания пока не раскрывает.
По неподтверждённой информации, речь может идти о гипотезе Ходжа (о связи между геометрическими объектами и алгебраическими циклами). Параллельно ходит слух, что OpenAI или Anthropic приблизились к гипотезе Бёрча - Свиннертона-Дайера (о связи между числом рациональных решений эллиптической кривой и её аналитическими свойствами). Вот эти две конкретики пока лучше воспринимать именно как слухи, а не как состоявшиеся решения.
На фоне всего этого бытовые демки Astra выглядят почти смешно, хотя сами по себе они тоже впечатляют. Один разработчик дал модели робота, кисть и камеру, после чего Astra постепенно научилась физически рисовать Golden Gate Bridge. Другой за несколько промптов сделал «сонар» для MacBook: ноутбук издаёт ультразвук около 20 кГц, слушает отражение микрофоном и по эффекту Доплера понимает движение руки, позволяя скроллить вообще без камеры.
Ещё одна забавная история касается xHigh. В сети разошлось наблюдение, что более высокий reasoning иногда расходует меньше, а не больше ресурсов, потому что Astra быстрее находит решение и делает меньше действий. Такое действительно видно на некоторых агентных тестах. Но превращать это в правило «всегда ставьте xHigh, он дешевле» пока не стоит: на обычных задачах независимые тесты показывают и обратную картину, где xHigh просто думает дольше и тратит больше токенов.
И получается довольно странная ситуация.
Неделю назад мы обсуждали Astra как новый флагман OpenAI. Сегодня гораздо интереснее обсуждать модель после Astra, которая уже существует, всё ещё обучается и которой OpenAI дала рой из 10 000 агентов решать задачи тысячелетия.
Название, дата релиза, цена и вообще факт публичного выпуска следующей модели пока не объявлены. Историю про то, что OpenAI уже «выбирает ей название», я бы пока не выдавал за подтверждённый факт.
Но сам монстр точно существует.
И, кажется, Astra была не финалом поколения, а первым публичным намёком на то, что у них сейчас происходит внутри.
Пользуясь случаем, приглашаю в мой Telegram-канал.