Агенты забывали задачи, но справились: чему учит формализация теоремы Ферма
По сообщению Anthropic, первые попытки агентов Claude формализовать доказательство Великой теоремы Ферма не удались: агенты теряли состояние проекта и переставали эффективно сотрудничать.
Помогла платформа Prove2Me. Она хранила зависимости между теоремами, помогала выбирать следующие задачи и использовать готовые доказательства. С ней десятки агентов за 11 дней написали 13 миллионов строк Lean. Компания сообщает, что результат прошёл компьютерную проверку; человек изредка давал общие указания.
Для разработчиков продуктов с ИИ здесь конкретный вывод: возможности агентов зависят и от организации работы. При планировании долгих задач стоит предусмотреть хранение общего состояния, зависимостей и проверку результата. Нынешний сбой ещё не означает, что задача останется недоступной.
Проект потребовал около шести миллиардов выходных токенов внутренней исследовательской модели. Стоимость и сравнение затрат с работой людей не приведены, поэтому вывод об экономии делать рано.
Но обсуждать будущее работы уже пора. Практический шаг для команды: выбрать задачу с проверяемым результатом, оценить возможности агентов и определить, какие навыки понадобятся людям для постановки задачи и контроля качества. Ждать безошибочного ИИ, прежде чем начинать учиться с ним работать, вряд ли разумно.