«Наш ИИ обошел человека»: почему цифрам, которыми хвастаются нейросети, верить нельзя

Каждую неделю выходит новость: очередная модель обошла человека в тестах или возглавила рейтинг. Звучит внушительно, покупается легко. Загвоздка в том, что эти цифры давно превратились в маркетинг: тесты переполнены, модели учат прямо на них, а результаты подкручивают, и на этом уже ловили за руку крупных игроков. А главное, даже честный балл почти ничего не говорит о том, справится ли модель с вашей задачей. Разбираемся, почему так вышло и как выбирать ИИ на самом деле.

Что не так с цифрами, которыми хвастаются

Начну с трех проблем, которые незаметно превратили тесты в рекламу. Первая это насыщение. Знаменитый экзамен MMLU за несколько лет прошел путь от очень сложного до тривиального, и сегодня передовые модели кучкуются на 92-94 процентах, где разница в баллах на верхушке это уже статистический шум, а не разница в силе. Вторая проблема это загрязнение данных. Модель учат на огромном массиве текстов из интернета, куда попадают и сами тестовые вопросы с ответами, так что высокий балл нередко означает не понимание, а подсмотренный ответ. Единого способа ловить такое загрязнение к 2026 году в индустрии нет, и балл на замусоренном тесте это потолок возможностей, а не их честная оценка.

Третья проблема самая некрасивая, потому что это уже осознанная накрутка. В апреле 2025 года Meta выкатила Llama 4 и отчиталась о втором месте в народном рейтинге Chatbot Arena с рейтингом 1417. Позже выяснилось, что на арену подсунули специальную, недоступную публике версию, заточенную нравиться людям, а обычная публичная модель болталась на 32-35 местах. The Verge вышла с заголовком про то, что Meta поймали на накрутке бенчмарков, а Ян Лекун из самой Meta потом признал в интервью, что результаты немного подкрутили. Вдобавок крупные лаборатории могли гонять на арене по десятку закрытых версий и публиковать только удачные, набирая порядка сотни очков за такую подгонку. Андрей Карпаты, бывший инженер Tesla и OpenAI, честно написал, что заподозрил неладное, когда высоко стоявшая в рейтинге модель провалилась в его собственных тестах. Лидерборд меряет не столько способности, сколько усилия по натаскиванию на него.

Почему даже честный балл не про вашу задачу

Тут важно не свалиться в другую крайность и не объявить бенчмарки бесполезными, это неправда. Без общей линейки было бы хуже: тесты дают сопоставимую историю и проверяемые заявления, а не вкусовщину. Беда не в том, что они врут, а в том, что каждый из них это очень узкое заявление, которое продавцы выдают за общий приговор. Модель с 94 процентами на экзамене знаний не знает всего, а первое место в разговорном рейтинге не значит, что именно эта модель лучшая для вашей работы. Разрыв между витриной и реальностью измерен: на корпоративных агентских задачах результат в бою отстает от лабораторного балла примерно на 37 процентов, а стоимость при схожей точности может отличаться в 50 раз. На сложных экспертных экзаменах лучшие модели набирают около 35 процентов там, где живые специалисты дают под 90.

Причина проста, если задуматься, из чего вообще состоит тест. Бенчмарк проверяет короткие, чистые задачки на знание и рассуждение. Реальная работа требует другого: длинного контекста, умения пользоваться инструментами и устойчивости на многоступенчатых задачах, где нельзя ошибиться на пятом шаге. Это буквально разные способности, и высокий балл за первое почти ничего не говорит про второе. Продавец показывает вам спринтерский секундомер, а нанимаете вы модель на марафон с препятствиями.

Российский пример, где это видно в лоб

Лучшую иллюстрацию к этому дал наш рынок, и она стоит подробного разбора. На русскоязычном бенчмарке MERA в июле 2026 года модель GigaChat 3.1 Ultra набрала 0,712, обойдя и GPT-5.2 с ее 0,707, и тем более GPT-4o с 0,642. Красивая домашняя победа, готовый заголовок. Но стоило прогнать модели по прикладным задачам, как картина перевернулась. В тесте из 12 рабочих заданий отечественные GigaChat и YandexGPT не выиграли ни одного. А в агентском аудите файрвола GigaChat Max нашел 0 из 7 заложенных уязвимостей там, где зарубежная модель нашла все 7, и обошелся при этом втрое дороже.

Вдумайтесь в этот контраст. По рейтингу модель выше GPT, а на живой задаче находит ноль угроз против семи у конкурента. Никакого мошенничества тут нет, просто MERA меряет знания и рассуждение на коротких вопросах, а работа требовала длинного контекста, инструментов и устойчивости. Разные способности, о чем и речь. Добавьте сюда приземленную деталь: контекстное окно YandexGPT Pro на 32 тысячи токенов это примерно 50-60 страниц, куда договор, техзадание или выгрузка из CRM попросту не влезают. И это не наезд на российские модели, зарубежные накручивают тесты ничуть не меньше. Это самый наглядный пример того, что цифра в рейтинге и пригодность под конкретную работу это две разные вещи.

Как бизнесу на самом деле выбирать ИИ

Практический вывод один: перестаньте покупать по лидербордам и начните с собственной задачи. Соберите маленький свой тест из 10-20 типичных для вас заданий с заранее known-good ответами и прогоните по нему каждую модель-кандидата. Такой замер на ваших же задачах перевесит любой публичный балл. Проверяйте на реальных объемах данных, а не на игрушечных, потому что если ваши документы не влезают в контекст, чемпион рейтинга для вас бесполезен. Считайте стоимость против точности именно на вашей работе, помня про тот пример, где втрое дороже означало ноль результата вместо семи. Независимые площадки вроде MERA или зарубежных Epoch AI и Allen AI полезнее, чем самоотчеты вендоров, но и к ним относитесь как к узким заявлениям, а не как к вердикту.

И обязательно гоняйте платный пилот до того, как завяжете на модель процессы. Итог простой и немного отрезвляющий. Балл в бенчмарке это рекламный заголовок с очень узкой областью действия, а единственная цифра, которая для вас что-то значит, это то, как модель справляется с работой, которую вы ей реально дадите. Поэтому заставляйте поставщика доказывать качество на ваших задачах, а не на чужом лидерборде. Тот, кто усвоил это, выбирает ИИ по делу и не переплачивает за красивую позицию в таблице, которую собрали не для него.