Когда ARC-AGI-3 выпустили в марте, его авторы писали: лучшие frontier-модели набирают меньше 1%.

На этой неделе OpenAI показал GPT-6 Astra:

99,9%.

Меньше чем за полгода.

Ну и интернет, естественно:

«Всё. AGI приехал».

Вот только 99,9% здесь вообще не означает, что ИИ стал человеком на 99,9%.

63,4% в медицине не означает, что он правильно лечит 63,4% пациентов.

95,9% в CAD не означает, что перед нами инженер на 95,9%.

Потому что вся эта красивая табличка - не одна линейка «умности».

Это семь совершенно разных экзаменов. И проценты в них означают разные вещи.

99,9% ARC-AGI-3 ≠ 99,9% человеческого интеллекта.

Сейчас переведу с бенчмарочного на человеческий.

Сначала маленькая проблема со словом AGI

Единого определения нет.

OpenAI исторически описывала AGI как высокоавтономную систему, превосходящую людей в большинстве экономически ценных видов работы.

ARC Prize смотрит немного иначе: общий интеллект - это способность осваивать новые навыки с человеческой эффективностью.

Похоже.

Но уже не одно и то же.

Поэтому сертификата Росстандарта «AGI, 100%, ГОСТ пройден» пока не существует 😉

Что вообще означают эти семь цифр?

ТестAstraЧто на самом деле проверяютTerminal-Bench Science 0.164,6%Может ли агент довести настоящую научную задачу до проверяемого результатаAutomationBench41,4%Может ли он целиком выполнить длинный рабочий бизнес-процессFrontierMath Tier 497,6%Исследовательская математика запредельной сложностиTerminal-Bench 4.057,9%Работа с кодом, терминалом, системами и длинными техническими цепочкамиHealthBench Professional63,4%Качество ответа по подробным медицинским критериямBenchCAD95,9%Насколько точно модель восстанавливает реальную 3D-геометриюARC-AGI-399,9%Насколько эффективно модель осваивает совершенно незнакомую среду

А теперь три строки из этой таблицы, которые, по-моему, важнее всех остальных.

1. AutomationBench: 41,4%

Вот эту цифру я бы вообще обвёл красным.

Здесь никакой высшей математики.

  • CRM
  • почта
  • календарь
  • таблицы
  • корпоративные правила
  • продажи
  • финансы
  • HR

Например:

найти нужную информацию → понять внутреннее правило → обновить запись → отправить правильное письмо → ничего лишнего не сломать.

Причём проверка беспощадная.

Правильным должен оказаться весь конечный результат.

Частично сделал - ноль.

И вот здесь суперумная Astra получает:

41,4%.

То есть полностью доводит до конца примерно 4 из 10 таких сложных процессов.

Запомним эту цифру.

2. FrontierMath Tier 4: 97,6%

А вот тут начинается натуральная чертовщина.

Tier 4 состоит из 43 математических задач исследовательского уровня.

Не олимпиада для школьников.

Профильному исследователю типичная задача может потребовать нескольких часов, а некоторые - дней работы.

Astra:

97,6%.

Вот это уже результат, мимо которого трудно пройти.

Потому что класс задач, который ещё совсем недавно считался крайне тяжёлым даже для профессиональных математиков, AI теперь почти полностью закрывает.

И получается первая странность.

Исследовательская математика: 97,6%.

Обычная длинная работа в корпоративных системах: 41,4%.

Но дальше ещё интереснее.

3. ARC-AGI-3: 99,9%

Вот отсюда и началась вся истерика про AGI.

Модель бросают в совершенно незнакомый интерактивный мир.

Правила ей не говорят.

Цель не говорят.

Нужно самому:

  • потыкаться;
  • посмотреть, что произошло;
  • найти закономерности;
  • построить внутреннюю модель этого мира;
  • понять, чего вообще требуется добиться;
  • придумать план;
  • выполнить его.

Причём мало найти решение методом миллиона случайных тыков.

ARC-AGI-3 сравнивает ещё и количество действий с человеком, который тоже видит эту среду впервые.

Поэтому 99,9% здесь означает примерно следующее:

На этом конкретном тесте Astra практически достигла человеческой эффективности обучения в новой неизвестной среде с нуля.

OpenAI сообщает, что Astra превзошла human action-efficiency baseline на 96% уровней.

ARC Prize называет результат фактически human parity на этом benchmark.

Вот это серьёзно.

Но всё ещё не:

«99,9% человеческого интеллекта».

А теперь самое странное

Перед нами система, которая почти идеально решает исследовательскую математику.

Восстанавливает сложную 3D-геометрию.

За несколько попыток понимает правила совершенно незнакомого мира.

Работает с научными задачами, кодом, медициной.

И одновременно не может безошибочно закончить большую часть сложных офисных процессов.

Вот такой получился разум.

В одном кабинете - математик мирового уровня.

В соседнем - инженер.

В третьем - исследователь.

А потом просишь его найти нужного Сергея, перенести встречу, обновить CRM и отправить правильный файл...

...и лучше всё-таки проверить, что он там натворил 😉

И здесь есть ещё одна заноза

Эта картинка - слайд самого OpenAI, а не таблица Менделеева.

OpenAI прямо пишет, что показывает максимальные результаты на доступных уровнях reasoning effort, а некоторые тесты запускаются с конкретными агентскими harness и инструментами.

То есть довольно часто мы уже измеряем не «голую нейросеть».

А систему:

модель + рассуждение + память + инструменты + агентская обвязка

И вот здесь, по-моему, появляется гораздо более интересный вопрос.

Может, мы вообще неправильно ждём AGI?

Мы почему-то представляем его как одну дату в календаре.

Вчера AGI не было.

Сегодня OpenAI выпустил новую модель.

Всё.

Приехали.

Но судя по этой таблице, общий интеллект может появляться совсем не так.

Кусками.

В исследовательской математике - почти приехал.

В некоторых инженерных задачах - тоже.

В способности разобраться в совершенно незнакомом мире - судя по ARC-AGI-3, уже где-то совсем рядом.

А в способности просто взять длинную настоящую работу и без няньки довести её от начала до конца:

41,4%.

Вот такой странный переходный период.

Поэтому я бы сейчас следил не столько за очередными красивыми 99,9%.

А за двумя гораздо более скучными цифрами:

СейчасAutomationBench41,4%Terminal-Bench57,9%

Когда именно они начнут превращаться в условные 80-90%, спор «наступил AGI или нет?» действительно станет сильно менее философским.

Потому что вместо него появится вопрос гораздо неприятнее.

И гораздо практичнее.

А что именно в моей работе человеку всё ещё приходится делать самому?