OpenAI выпустила GPT-6 Astra
Сегодня ночью вышла новая флагманская модель OpenAI. Я уже писал отдельно про ее возможности в кибербезопасности, а теперь модель вышла в релиз и можно оценить и модель и цены и бенчмарки и первые независимые тесты.
Модель в API называется gpt-6-astra. Главный скачок у Astra сейчас виден в агентных задачах. В AutomationBench она набрала 41.4% против 18.1% у Sol и 31.4% у Fable 5.1. В Terminal-Bench 4.0 получила 57.9% против 37.3% у Sol и 55.8% у Fable 5.1, а в Terminal-Bench Science уже 64.6% против 22.4% и 52.6%. В OSWorld 2.0, где модель работает за компьютером, Astra набрала 72.6%.
В кодинге картина похожая. На DeepSWE 1.1 у Astra 74.1% против 72.7% у Sol и 67.4% у Fable 5.1. Artificial Analysis в своем Coding Agent Index дала Astra 67 баллов, примерно уровень Fable 5, при этом лидер Fable 5.1 набрал 70.
А вот Artificial Analysis слегка включает холодный душ и остужает восторги. В их общем Intelligence Index Astra получила 61 балл, ровно столько же, сколько Sol, а Fable 5.1 набрала 66. Причем Astra расходует примерно на 10% меньше выходных токенов, чем Sol, но из-за выросшей цены одна задача в этом тесте обходится примерно на 75% дороже. То есть какого-то огромного скачка в общем reasoning независимые тесты пока не показывают.
Зато в агентном кодинге экономика совсем другая. Astra использовала примерно в три раза меньше токенов, чем Sol max, и примерно в пять раз меньше, чем Opus 5. В итоге при 67 баллах стоимость задачи получилась примерно такой же, как у Sol, и меньше половины стоимости Fable 5 с сопоставимым результатом. Похоже, эффективность длинной работы стала одной из главных фишек модели.
Отдельная история с ARC-AGI-3, где OpenAI заявила почти идеальные 99.9%. Звучит круто! Но тут есть важный нюанс: на стандартном harness Astra набрала 62.7%, а 99.9% получила уже с адаптером OpenAI, который сохраняет reasoning между запросами, делает compaction и помогает модели удерживать состояние. Это еще раз показывает насколько важной становится обвязка вокруг модели: память, инструменты, как организована длинная работа агента и пр.
Данные из описания модели в API:
– Контекст 1.05 млн токенов,
– Vаксимальный output 128 тысяч токенов, а
– Reasoning effort low, medium, high, xhigh, max.
– В Responses API модель умеет работать с web search, файлами, code interpreter, shell, computer use, MCP, Skills и tool search.
Цены: $10/$50. Sol стоит $4 и $20, то есть Astra в 2.5 раза дороже.
Astra раскатывают постепенно на Plus, Pro, Business и Enterprise, и полностью раскатка займет несколько дней. Tibo в Твиттере отдельно написал, что для OpenAI было важно дать Astra всем Plus-подписчикам, а лимиты на модель будут общие по тарифу. Это кайф!
И бонус, за медленную раскатку OpenAI решила немного извиниться лимитами. Tibo пообещал давать подписчикам по одному сбросу лимиту за каждый день, пока Astra еще не появилась у них в аккаунте. То есть чем позже до вас доберется Astra, тем больше сохраненных сбросов лимита получите. Скажем спасибо Тибо! 🤌
В API лимиты зависят от вашего уровня Tier (больше тратишь, выше тир). На Tier 1 дают до 500 запросов и 500 тысяч токенов в минуту, а на Tier 5 уже 15 тысяч запросов и 40 млн токенов в минуту.
Если модель уже добралась до вас, бегом тестить. У меня пока нет и я жду свой сброс в копилочку сбросов😏