Новый математический тест показал, что ИИ пока уступает людям в решении исследовательских задач
Новый математический тест First Proof показал, что даже самые сильные современные ИИ-модели пока уступают профессиональным математикам в решении исследовательских задач. В первом официальном раунде проекта лучший результат среди моделей составил 6 правильных решений из 10, тогда как все задачи уже были ранее решены людьми.
Проект First Proof создан как попытка проверить одну из самых сложных способностей искусственного интеллекта — умение самостоятельно строить математические доказательства. В отличие от большинства существующих бенчмарков, здесь модели решали не стандартные олимпиадные задачи и не известные теоремы, а новые исследовательские проблемы, которые еще нигде не публиковались.
Это важное отличие. Один из главных вопросов в оценке ИИ сегодня — способен ли он действительно рассуждать или лишь воспроизводит увиденные в обучении шаблоны. Чтобы исключить второй вариант, организаторы попросили десять математиков предоставить задачи из собственных еще неопубликованных исследований. Таким образом, модели столкнулись с материалом, который физически не мог попасть в их тренировочные данные.
First Proof запустила группа известных математиков из США и Великобритании. Среди авторов проекта — Мохаммед Абузейд (Stanford), Дэниел Спилман (Yale), Лорен Уильямс (Harvard), Нихил Шривастава (UC Berkeley), Мартин Хайрер (Imperial College London) и еще несколько исследователей. Они опубликовали описание проекта в феврале 2026 года как академическую инициативу по более строгой проверке ИИ в математике.
Второй раунд First Proof, результаты которого опубликовали в июне, стал первым полностью контролируемым тестом такого рода: организаторы сами запускали модели, а ответы проверяли математики. В нем участвовали четыре системы. OpenAI выставила ChatGPT 5.5 Pro, а еще три решения подготовили исследовательские группы из UCLA, Принстона и ETH Zurich. Они строились поверх существующих языковых моделей вроде ChatGPT, Gemini и Claude, используя так называемые harness-системы — автоматизированные цепочки, где один ИИ генерирует решение, а другой помогает проверять и уточнять промежуточные шаги.
Лучший результат показала именно модель OpenAI, решившая шесть задач из десяти. Но даже этот показатель оказался недостаточным, чтобы говорить о паритете с человеком. В математике важно не только получить правильный ответ, но и построить строгое доказательство, которое выдерживает проверку специалистов. Для оценки решений организаторы собрали группу из 30 математиков, которые вручную анализировали каждую работу.
Именно на этапе доказательств проявилось главное ограничение нынешних моделей. Во многих случаях они предлагали убедительно звучащие рассуждения, которые при внимательном разборе оказывались неполными или содержали логические разрывы. Это типичная слабость генеративных моделей: они хорошо воспроизводят структуру аргументации, но пока нестабильно удерживают длинные цепочки строгого вывода.
Результаты появились вскоре после другой громкой новости из мира ИИ-математики: в мае модель OpenAI смогла решить задачу, поставленную Полом Эрдёшем около 80 лет назад. Но First Proof показывает, что единичные прорывы пока не означают системного превосходства над экспертами.
Для самих математиков это, впрочем, не выглядит разочарованием. Даже шесть решенных исследовательских задач — результат, который еще несколько лет назад казался недостижимым. Скорее всего, ближайшая роль таких систем — не заменить исследователя, а стать его инструментом: помогать проверять доказательства, искать промежуточные шаги и ускорять работу над гипотезами.