Напишет симфонию: тесты и отзывы о GPT-6 Astra
Её называют лучшей в 3D-моделировании, хвалят работу с кодом и более человечный стиль общения.
- Как пишет The Verge, в преддверии IPO компания хочет привлечь внимание громкими заявлениями, которые не подтверждаются независимыми бенчмарками. Но первые тестировщики GPT-6 Astra заметили улучшения в работе с кодом, 3D-сценами, умелое управление компьютером и новый стиль общения.
Astra действительно «понимает», что я имею в виду. До этого так могла только Fable. Когда я даю задачу, постоянно ловлю себя на мысли, что стоило подробнее объяснить, как действовать. А потом читаю её план и думаю: «Она делает всё, как я и представлял».
Лучшая модель для 3D и игр: как отзываются тестировщики
- Глава по возможностям ИИ в проекте AI Arena Питер Гостев получил к Astra ранний доступ и протестировал её на своих задачах. Он считает, что модель продвинулась в оптимизации кода: сократила сгенерированный код с 33 тысяч строк до 1,8 тысячи «без потери качества». Она лучше проводила миграцию кода и «великолепно» управляла компьютером.
- Он также оценил, как Astra управляет субагентами в Codex, задаёт уточняющие вопросы через всплывающие окна и оставляет заметки с результатами исследований.
- По его наблюдениям, «рассуждения» стали лучше даже на уровне Low, хотя раньше он использовал минимум режим High. Гостев также считает, что Astra достигла «невероятного» уровня в разработке игр и создании 3D-сцен.
- Предприниматель Мэтью Берман считает, что улучшения особенно заметны на задачах в один промпт — модели почти ничего не надо объяснять дважды. Сильнее всего он заметил прогресс в играх, которые стали «действительно интересными».
- Несколько тестировщиков отмечают, что модель стала писать чисто, лаконично и понятно, без «ИИ-флёра», в отличие от предшественниц.
Заявления OpenAI против независимых тестов
- Astra набрала 99,9% в бенчмарке ARC-AGI 3 на агентные задачи. Однако такого результата она добилась с «обвязкой» для тестирования, предоставленной OpenAI — она частично скрывает «рассуждения» модели. Без неё Astra прошла тест на 62,7%.
- Модель улучшила показатели в задачах с длинным контекстом. В бенчмарке OpenAI она получила 100% при объёме токенов в 256-512 тысяч и 96,3% при объёме до 1 млн токенов.
- В тесте независимых исследователей Artificial Analysis модели проверяли на проектах, работа над которыми длилась несколько недель, со множеством подзадач и тысячами исходных файлов.
- GPT-6 Astra набрала столько же баллов, сколько предыдущая GPT-5.6 Sol, и уступила Claude Fable 5.1 на 5 пунктов. В бенчмарке на агентное программирование Astra обошла GPT-5.6 Sol на 2 балла. В лидерах по-прежнему Fable 5.1.
Сравнения с Fable 5.1 в работе и по цене
- По ощущениям Питера Гостева, Fable 5.1 превосходит Astra во многих задачах — это модели с сопоставимыми возможностями. Разница больше в общении и стиле работы.
- В тестах Artificial Analysis модель от OpenAI обошлась дешевле Fable 5.1 и даже Opus 5. Усреднённая цена за одну задачу — $2,57. Из них $0,63 ушло на рассуждения и $0,74 на кэширование. У Fable 5.1 — $6,12, $1,90, и $1,18 , у Opus 5 — $4, 21, $0,80 и $2,07 соответственно.
Модель скрывает свои «мысли»: что обсуждают исследователи
- 1 сентября 2026 года издание The Information со ссылкой на источники сообщило, что для Astra разработали новую архитектуру — «зацикленный» трансформер со «скрытыми рассуждениями». Цепочка шагов для решения задачи проходит не через все слои модели, а только через нужный, что помогает сэкономить вычислительные ресурсы, пишет Fortune.
- Но «размышления» модели оказываются скрыты — так сложнее заметить опасное поведение, считают опрошенные изданием эксперты.
- В официальном релизе OpenAI от 3 сентября указано, что «рассуждения» Astra «сложнее отслеживать». Когда модель прямо просили скрывать свои «мысли», она справлялась лучше, чем GPT-5.6 Sol, на простых задачах. В сложных тестах Astra пока хуже контролирует запись исходных «рассуждений». Прямого упоминания архитектуры «зацикленных» трансформеров в анонсе OpenAI нет.
- Статья The Information вызвала опасения среди экспертов в области безопасности, пишет Fortune. Они считают, что шаг OpenAI нормализует эту технологию, и её будут использовать другие ИИ-компании, которые могут уделять меньше внимания безопасности.
Развитие технологии может привести к масштабированию непрозрачных рассуждений до такой степени, когда модель будет рассуждать полностью или почти полностью в скрытом пространстве. Тогда с высокой долей вероятности цепочка рассуждений станет бесполезна для мониторинга и контроля.
Надеюсь, ещё не поздно отказаться от архитектур, вызывающих наибольшие опасения, и OpenAI остановится на этом этапе.
- В ответ главный научный сотрудник OpenAI Джейкоб Пачоцки заявил, что OpenAI «глубоко обеспокоена» вопросом отслеживания цепочки «рассуждений» и ограничила внедрение «зацикленной» архитектуры так, чтобы процесс мышления модели был понятен человеку.