Когда ARC-AGI-3 выпустили в марте, его авторы писали: лучшие frontier-модели набирают меньше 1%.
На этой неделе OpenAI показал GPT-6 Astra:
99,9%.
Меньше чем за полгода.
Ну и интернет, естественно:
«Всё. AGI приехал».
Вот только 99,9% здесь вообще не означает, что ИИ стал человеком на 99,9%.
63,4% в медицине не означает, что он правильно лечит 63,4% пациентов.
95,9% в CAD не означает, что перед нами инженер на 95,9%.
Потому что вся эта красивая табличка - не одна линейка «умности».
Это семь совершенно разных экзаменов. И проценты в них означают разные вещи.
99,9% ARC-AGI-3 ≠ 99,9% человеческого интеллекта.
Сейчас переведу с бенчмарочного на человеческий.
Сначала маленькая проблема со словом AGI
Единого определения нет.
OpenAI исторически описывала AGI как высокоавтономную систему, превосходящую людей в большинстве экономически ценных видов работы.
ARC Prize смотрит немного иначе: общий интеллект - это способность осваивать новые навыки с человеческой эффективностью.
Похоже.
Но уже не одно и то же.
Поэтому сертификата Росстандарта «AGI, 100%, ГОСТ пройден» пока не существует 😉
Что вообще означают эти семь цифр?
ТестAstraЧто на самом деле проверяютTerminal-Bench Science 0.164,6%Может ли агент довести настоящую научную задачу до проверяемого результатаAutomationBench41,4%Может ли он целиком выполнить длинный рабочий бизнес-процессFrontierMath Tier 497,6%Исследовательская математика запредельной сложностиTerminal-Bench 4.057,9%Работа с кодом, терминалом, системами и длинными техническими цепочкамиHealthBench Professional63,4%Качество ответа по подробным медицинским критериямBenchCAD95,9%Насколько точно модель восстанавливает реальную 3D-геометриюARC-AGI-399,9%Насколько эффективно модель осваивает совершенно незнакомую среду
А теперь три строки из этой таблицы, которые, по-моему, важнее всех остальных.
1. AutomationBench: 41,4%
Вот эту цифру я бы вообще обвёл красным.
Здесь никакой высшей математики.
- CRM
- почта
- календарь
- таблицы
- корпоративные правила
- продажи
- финансы
- HR
Например:
найти нужную информацию → понять внутреннее правило → обновить запись → отправить правильное письмо → ничего лишнего не сломать.
Причём проверка беспощадная.
Правильным должен оказаться весь конечный результат.
Частично сделал - ноль.
И вот здесь суперумная Astra получает:
41,4%.
То есть полностью доводит до конца примерно 4 из 10 таких сложных процессов.
Запомним эту цифру.
2. FrontierMath Tier 4: 97,6%
А вот тут начинается натуральная чертовщина.
Tier 4 состоит из 43 математических задач исследовательского уровня.
Не олимпиада для школьников.
Профильному исследователю типичная задача может потребовать нескольких часов, а некоторые - дней работы.
Astra:
97,6%.
Вот это уже результат, мимо которого трудно пройти.
Потому что класс задач, который ещё совсем недавно считался крайне тяжёлым даже для профессиональных математиков, AI теперь почти полностью закрывает.
И получается первая странность.
Исследовательская математика: 97,6%.
Обычная длинная работа в корпоративных системах: 41,4%.
Но дальше ещё интереснее.
3. ARC-AGI-3: 99,9%
Вот отсюда и началась вся истерика про AGI.
Модель бросают в совершенно незнакомый интерактивный мир.
Правила ей не говорят.
Цель не говорят.
Нужно самому:
- потыкаться;
- посмотреть, что произошло;
- найти закономерности;
- построить внутреннюю модель этого мира;
- понять, чего вообще требуется добиться;
- придумать план;
- выполнить его.
Причём мало найти решение методом миллиона случайных тыков.
ARC-AGI-3 сравнивает ещё и количество действий с человеком, который тоже видит эту среду впервые.
Поэтому 99,9% здесь означает примерно следующее:
На этом конкретном тесте Astra практически достигла человеческой эффективности обучения в новой неизвестной среде с нуля.
OpenAI сообщает, что Astra превзошла human action-efficiency baseline на 96% уровней.
ARC Prize называет результат фактически human parity на этом benchmark.
Вот это серьёзно.
Но всё ещё не:
«99,9% человеческого интеллекта».
А теперь самое странное
Перед нами система, которая почти идеально решает исследовательскую математику.
Восстанавливает сложную 3D-геометрию.
За несколько попыток понимает правила совершенно незнакомого мира.
Работает с научными задачами, кодом, медициной.
И одновременно не может безошибочно закончить большую часть сложных офисных процессов.
Вот такой получился разум.
В одном кабинете - математик мирового уровня.
В соседнем - инженер.
В третьем - исследователь.
А потом просишь его найти нужного Сергея, перенести встречу, обновить CRM и отправить правильный файл...
...и лучше всё-таки проверить, что он там натворил 😉
И здесь есть ещё одна заноза
Эта картинка - слайд самого OpenAI, а не таблица Менделеева.
OpenAI прямо пишет, что показывает максимальные результаты на доступных уровнях reasoning effort, а некоторые тесты запускаются с конкретными агентскими harness и инструментами.
То есть довольно часто мы уже измеряем не «голую нейросеть».
А систему:
модель + рассуждение + память + инструменты + агентская обвязка
И вот здесь, по-моему, появляется гораздо более интересный вопрос.
Может, мы вообще неправильно ждём AGI?
Мы почему-то представляем его как одну дату в календаре.
Вчера AGI не было.
Сегодня OpenAI выпустил новую модель.
Всё.
Приехали.
Но судя по этой таблице, общий интеллект может появляться совсем не так.
Кусками.
В исследовательской математике - почти приехал.
В некоторых инженерных задачах - тоже.
В способности разобраться в совершенно незнакомом мире - судя по ARC-AGI-3, уже где-то совсем рядом.
А в способности просто взять длинную настоящую работу и без няньки довести её от начала до конца:
41,4%.
Вот такой странный переходный период.
Поэтому я бы сейчас следил не столько за очередными красивыми 99,9%.
А за двумя гораздо более скучными цифрами:
СейчасAutomationBench41,4%Terminal-Bench57,9%
Когда именно они начнут превращаться в условные 80-90%, спор «наступил AGI или нет?» действительно станет сильно менее философским.
Потому что вместо него появится вопрос гораздо неприятнее.
И гораздо практичнее.