Смогут ли «рассуждающие» модели решить простую для человека задачку?
Некоммерческая организация Arc Prize Foundation, основанная разработчиком и исследователем искусственного интеллекта Франсуа Шолле, анонсировала новое по-настоящему сложное испытание для современных нейросетей. Речь о бенчмарке, который проверит, достигли ли модели уровня AGI — общего искусственного интеллекта, сопоставимого с естественным.
Вообще, AGI — то, к чему устремлены умы всех разработчиков ИИ современности. То, чем мы пользуемся сейчас, — это нейросети довольно узкоспециализированные, способные решать только конкретные задачи. Например, они могут сгенерировать картинку или решить уравнение. А вот общий искусственный интеллект AGI — система универсальная, умеющая мыслить на человеческом уровне. И даже круче: принимать решения самостоятельно. Потому что принятие решений — это то, чем обычный человек занимается ежедневно и систематически.
AGI пытаются создать все. Сэм Альтман, например, написал в своем личном блоге, что они в OpenAI уже понимают, как его сделать, и в 2025 году готовы представить первые наработки.
Довольно амбициозно. Особенно теперь, когда оказалось, что новый тест на AGI ни одна из современных больших языковых моделей не прошла.
Первый тест от Arc Prize Foundation получил название ARC-AGI. В отличие от бенчмарков, которые пытаются «гонять» нейросети по ультрасложным вопросам, достойным ума доктора наук, ARC-AGI дает моделям сравнительно простые по человеческим меркам задачи.
Тест представляет из себя загадку, в которой нейросети нужно идентифицировать визуальные паттерны в коллекции разноцветных квадратов и сгенерировать правильный «ответ». Задачи были спроектированы так, чтобы заставить ИИ решать проблемы, с которыми они ранее не сталкивались.
Однако нейросети оказались хитрее и использовали «грубую силу» — свои вычислительные способности. Разработчикам бенчмарка тоже пришлось быть хитрее, так что 24 марта они релизнули ARC-AGI-2 — вторую версию своего сборника задач для AGI.
В своей социальной сети X (бывший Twitter, запрещен в России) Франсуа Шолле называет ARC-AGI-2 «тестом на гибкий интеллект, а не на навыки запоминания» — задачами, с которыми нейросеть никогда до этого не сталкивалась, а значит, не может просто взять ответ из своей базы данных. Все задания прошли «человеческую калибровку»: их попытались выполнить 400 человек, и только те из них, которые были выполнены как минимум несколькими, ушли в работу. Так что бенчмарк действительно посилен человеку — и предположительно должен быть посилен и AGI.
Но, увы и ах, современные модели его не прошли.
Согласно лидерборду Arc Prize Foundation, «рассуждающие» модели вроде OpenAI o1-pro и DeepSeek R1, набрали от 1% до 4%, в то время как обычные нейросети, среди которых GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, едва добрались до 1%.
Так что можно с уверенностью сказать, что до общего искусственного интеллекта нам пока далеко. С другой стороны, Сэм Альтман явно наметил какой-то прорыв — и очень интересно будет посмотреть, насколько хорошо его новая задумка, запланированная на 2025 год, пройдет испытание на гибкое мышление.