Сегодня я отписался от парочки AI-авторов и занёс их в список нейрослоперов.

Повод банальный. Вчера по всем лентам разлетелась новость: искусственный интеллект уже выполняет 16% реальной работы фрилансеров. Заголовки один страшнее другого, «фрилансу конец», «профессии умирают». Я насчитал с десяток пересказов одной и той же цифры. И ни в одном не было признака, что автор ходил дальше пресс-релиза.

Я сходил. Рассказываю, что там внутри на самом деле. Спойлер: новость интереснее, чем её репосты, но совсем не тем, чем пугают.

Что за замер

Remote Labor Index (RLI) делают CAIS (нонпрофит по безопасности ИИ) и Scale AI. Позиционирование у замера красивое, лучшее из всего, что я видел в бенчмарках. По заявке авторов: вместо тестов с вопросиками они взяли 240 настоящих заказов с фриланс-биржи UpWork, с реальным ТЗ, реальными входными файлами и реальным бюджетом. В сумме больше 6 000 часов работы живых профи на 140 тысяч долларов, есть заказы дороже 10 тысяч.

Каждый заказ отдали ИИ-агенту. Потом живые эксперты сравнили результат с работой профессионала, которому за неё когда-то заплатили. Критерий один: не хуже, чем у профи.

Заметьте: всё в предыдущих двух абзацах мы знаем со слов самих авторов. Держите это в голове, дальше станет понятно, почему это важно.

Свежий результат, который все и репостят: Claude Fable 5 сдала 16,1% заказов. Восемь месяцев назад, на старте бенча, лучший агент вытягивал 2,5%.

Цифра сильная. Методика красивая. А теперь то, что видно, только если зайти внутрь.

Находка первая: в открытом доступе 10 задач из 240

Полный набор заказов закрыт. Публично выложены 10 задач из 240, это 4%. По ним можно посмотреть ТЗ, входные файлы и работу человека-эталона.

Помните заявку про «240 реальных заказов на 140 тысяч долларов»? Пощупать из неё можно ровно эти 4%. Остальное, включая сам масштаб бенчмарка, принимается на веру. Кайфово, да: у меня есть бенчмарк, но я вам дам только выводы?

Работ Fable 5, той самой модели с 16%, в открытом датасете нет вообще. Есть выходы старых моделей: Grok 4, Manus, Sonnet 4.5. Единственное место, где можно увидеть работу Fable, это три картинки в блоге самого CAIS: 3D-кольцо, рекламный ролик, планировка квартиры.

И вишенка: про эти три примера CAIS сам пишет, что ни один из них клиент бы не принял как готовую работу.

Находка вторая: цифру нельзя проверить. Вообще никак

Оценки делают люди из Scale AI. Scale соавтор бенчмарка. Хочешь прогнать свою модель, пиши им на почту.

Может, заменить людей автоматическим судьёй? CAIS попробовали сами. Построили LLM-судью, откалибровали на старых моделях, применили к новым. Судья завысил результаты в 2,3-2,9 раза. Причина красивая: чтобы проверить работу агента, надо открыть файлы в профессиональных программах и оценить их глазами клиента. Это ровно те навыки, которых агентам не хватает. Проверяющий ИИ болеет тем же, чем работающий.

То есть 16,1% это число, которое существует только внутри связки CAIS + Scale. Независимо его не воспроизвёл никто.

Находка третья: у победителя бюджет втрое больше

На каждый заказ агенту выделяли до 50 долларов на токены. Всем, кроме Fable 5. Ей дали 150, потому что её токены дороже и в полтинник она не помещается.

У CAIS есть объяснение, и оно разумное: без этого дорогая модель просто не доработает до конца задачи. Но факт остаётся фактом: лидер лидерборда играл с бюджетом x3. В пересказах этого нет ни у кого.

Находка четвёртая: дата

Результаты опубликованы 1 июля. В тот самый день, когда Fable 5 вернули в общий доступ после трёх недель правительственной блокировки. 218 из 240 задач успели прогнать до отключения модели.

Совпадение? Возможно. CAIS живёт на теме «ИИ опасно быстро развивается», и громкая цифра в день громкого возвращения работает на них. А заодно и на Anthropic, у которой модель-возвращенец сходу порвала бенчмарк труда. Не находите?

Теперь честно в другую сторону

Если бы я на этом остановился, получился бы вброс наоборот, «всё фейк, расходимся». Это не так, и вот почему.

Закрытый набор задач это не жульничество, а стандартная защита: выложи все 240 заказов в открытый доступ, и через полгода они окажутся в обучающих данных всех моделей, бенчмарк умрёт. Ну, хотя бы в теории.

Худший сценарий CAIS раскрыл сам: даже если считать, что Fable провалила все 22 неоценённые задачи, выходит 14,6%, всё равно первое место. Лидерборд никого не щадит: Gemini 3 Pro набрала 1,25%, GPT-5 1,67%. И тон у авторов сдержанный: «агенты по-прежнему далеки от автоматизации реальной работы».

Так что мой ответ на вопрос «бенчмарк или маркетинг»: это хороший замер автоматизации труда, которому хотелось бы верить на слово. Но я не буду.

Направлению (2,5 → 16 за восемь месяцев, подтверждено серией замеров) верю. Точному числу нет: его никто снаружи не проверял и проверить не может. Закрытый бенчмарк это всегда два продукта в одном: научный инструмент и пиар-поверхность. Вопрос только в пропорции, а её снаружи не видно.

Сети или обвязка: за счёт чего на самом деле рост

И ещё один вопрос, который стоит задать этой цифре: что именно выросло в шесть раз, модели или обвязка вокруг них?

CAIS сам даёт половину ответа в методике.
На старте бенча гоняли готовые агент-продукты как есть, лучший (Manus) дал 2,5%.
Теперь агентам собирают боевую среду: Claude Code и Codex CLI с computer use, полный Linux-десктоп с 30 профессиональными программами, до 24 часов на заказ, GPU под рендер.
И главное, цикл «работник-критик»: отдельный агент открывает файлы и проверяет работу как придирчивый клиент, а работник переделывает, пока критик не примет.
CAIS прямо пишет: работники слишком оптимистичны насчёт своего результата, внешний критик заметно улучшает итог.

Промежуточная точка выдаёт механику: Opus 4.6 в скаффолде Cowork дал 4,17% задолго до новых моделей. Сколько процентов принесла модель, а сколько обвязка, CAIS не раскладывает.
Но, как мне кажется, второе даже важнее. Для владельца бизнеса вывод конкретный: агент «из коробки» и агент с инструментами, бюджетом и внешним проверяющим это два разных работника. Второго вы собираете сами.

Как читать такие цифры, чтобы не попасть в нейрослоперы

Мой чеклист после этого похода:

  1. Направление и число это разные вещи. Тренд подтверждён серией замеров, точное «16,1» проверить нельзя, держите в голове «где-то заметно больше десяти».
  2. Смотрите, кто платит и кто выигрывает. Соавтор оценивает, победитель возвращается в продажу в день публикации. Это не приговор, но это контекст.
  3. Ищите, что можно потрогать. Есть открытые задачи? Есть работы модели? Если из 240 задач показывают 10, а работ победителя ноль, у вас есть право на скепсис.
  4. Проверяйте равенство условий. Бюджет, время, доступ к инструментам. «Победил с бюджетом втрое больше» и «победил» это разные новости.
  5. Чем громче цифра в заголовках, тем важнее сходить в первоисточник. У меня весь поход занял вечер: блог, сайт бенча, репозиторий, статья. Ни одной находки из этого текста не было в пересказах.

Что дальше

И признание напоследок.
Пока листал примеры, поймал себя на неудобной мысли: я работаю с AI каждый день, но в половину этих доменов даже не заглядывал. 3D-модели, CAD, планировки, чертежи.
Считал это территорией специализированного софта, куда с языковой моделью не ходят. А там, оказывается, уже сдают заказы, пусть пока и не на уровне профи.
Если даже я не открывал целые домены, сколько ещё таких белых пятен на моей карте? И на вашей? Возьмите из списка RLI домен, в который вы не заглядывали, и потратьте на него вечер. Возможно, найдёте что-то полезное. Это точно дешевле, чем узнать о домене из чужого прайса.

Те 10 открытых задач можно скачать: ТЗ, файлы, эталон профи, и у CAIS есть готовая платформа для сравнения «человек против ИИ» на своей машине. Я собираюсь прогнать эти задачи через свою связку агентов и посмотреть на результат своими глазами, а не глазами пресс-релиза. Расскажу, что выйдет.

А вы, когда видите «ИИ уже делает N% работы», идёте смотреть, откуда цифра? Напишите в комментариях, какие бенчмарки разобрать следующими.

1