На Arena.ai можно случайно протестировать AI, которого ещё не выпустили

На Arena.ai можно случайно протестировать AI, которого ещё не выпустили

Допустим, тебе нужно провести сложный ресерч, собрать сайт, написать код или сделать видео, но ты не знаешь, какой AI справится лучше. На Arena.ai можно взять свою настоящую задачу и бесплатно отдать её сразу двум моделям. Ты не видишь их названий, сначала выбираешь лучший результат и только потом узнаёшь, где был GPT, Claude, Gemini или кто-то ещё.

Получается довольно простой способ не спорить о моделях по чужим рейтингам, а проверить их на своей работе. Но именно здесь начинается куда более интересная история: иногда одной из двух моделей оказывается AI, который ещё официально не выпустили.

Прямо сейчас в данных Image Arena, например, появилось кодовое имя spicy-mayo. Кто сделал эту модель, официально неизвестно. В интернете уже предполагают, что это может быть следующее поколение Nano Banana от Google, но подтверждений этому пока нет. Отдельно выбрать spicy-mayo тоже нельзя: встретить её можно только случайно во время такого слепого сравнения.

Я регулярно разбираю такие AI-продукты и необычные механики роста в Telegram-канале «Ещё не единорог». Но Arena особенно интересна тем, что здесь необычный пользовательский продукт постепенно превратился в очень серьёзный бизнес.

Ты думаешь, что сравниваешь AI. В это время AI-компании тестируют модели на тебе

Для Arena такие секретные модели давно не исключение. AI-компании приносят туда будущие версии своих продуктов под вымышленными именами и проверяют их на реальных запросах ещё до релиза. Уже к апрелю 2025 года через площадку прошло больше 300 таких дорелизных тестов.

Так, Gemini 2.5 Pro тестировалась под именем nebula, а GPT-5 под именем summit. Пользователь при этом не знает ни производителя, ни громкого бренда и выбирает только тот результат, который действительно оказался полезнее.

Для разработчиков это довольно ценный эксперимент. Можно сколько угодно показывать модель на внутренних тестах, но в итоге людям всё равно придётся использовать её для странных и непредсказуемых задач: написать письмо начальнику, разобраться в договоре, найти баг в коде, переделать фотографию или придумать маршрут путешествия. Arena позволяет посмотреть, что произойдёт именно в таких условиях.

Самая показательная история произошла с Nano Banana. В августе 2025 года в Image Arena появилась неизвестная модель с довольно несерьёзным названием и неожиданно начала очень уверенно обыгрывать конкурентов. За время теста пользователи больше 2,5 млн раз выбрали именно её, а общий эксперимент собрал свыше 5 млн голосов. Отрыв Nano Banana в рейтинге достиг рекордных 171 пункта.

Потом выяснилось, что под бананом всё это время скрывалась новая Gemini 2.5 Flash Image от Google. Получается, человек мог зайти в Arena просто убрать лишний объект с фотографии и случайно оказаться одним из первых тестировщиков следующей модели Google, причём сначала проголосовать за неё и только потом узнать, что вообще тестировал.

82 миллиона раз люди уже сказали Arena, какой AI им нравится больше

И вот здесь Arena становится гораздо интереснее обычного сайта с рейтингом. Сейчас площадкой пользуются больше 10 млн человек в месяц, а за всё время пользователи сделали уже 82 млн выборов между двумя результатами AI.

Представьте каждый такой выбор как очень маленький эксперимент. Двум моделям дают одну и ту же задачу, после чего реальный человек говорит: «вот этот результат помог мне больше». И так десятки миллионов раз на коде, текстах, поиске, изображениях и других задачах.

Для создателей AI это совсем другой тип данных, чем классические тесты. Бенчмарк может показать, насколько хорошо модель решает подготовленный набор математических задач. Arena может показать, какой ответ человек выбирает в реальной работе и против какого конкурента.

На этом и появился бизнес. В сентябре 2025 года Arena запустила платные оценки для разработчиков моделей и компаний. Они получают уже не просто место в публичном рейтинге, а подробные данные о том, где их модель выигрывает, где проигрывает и как пользователи реагируют на разные версии продукта.

Всего через восемь месяцев коммерческое направление Arena достигло темпа в $100 млн выручки в год. Если перевести это в более понятный месячный масштаб, получается примерно $8 млн в месяц при текущем темпе. При этом TechCrunch отдельно отмечал, что это не обычная подписочная выручка: компании платят за использование сервиса оценки моделей.

Получилась почти идеальная схема. Пользователи приходят бесплатно пользоваться дорогими моделями, Arena получает миллионы сравнений, а разработчики AI платят за возможность понять, почему их модель нравится реальным людям или почему проигрывает конкурентам.

И чем больше хороших моделей AI-компании приносят на тест, тем интереснее Arena становится пользователям. А чем больше приходит пользователей, тем ценнее становятся собранные Arena данные.

Но есть одна проблема: мы выбираем не только лучший ответ

У этой модели есть слабое место. Если рейтинг строится на человеческом выборе, то нужно сначала понять, что именно человек считает хорошим ответом.

Arena сама обнаружила довольно забавный эффект. Люди чаще выбирают более длинные ответы, любят заголовки, списки, жирный текст и аккуратное оформление. Когда исследователи попробовали статистически убрать влияние длины и форматирования, позиции некоторых моделей в рейтинге изменились.

С поиском обнаружилась похожая история. Пользователям нравятся подробные ответы с большим количеством источников, причём само наличие большего числа ссылок уже повышало вероятность победы. Получается, модель может казаться более убедительной ещё до того, как человек проверил, действительно ли все эти ссылки подтверждают написанное.

Поэтому летом 2026 года Arena добавила отдельную проверку фактической точности. Теперь для части рейтингов учитывается не только то, какой ответ чаще выбирают люди, но и насколько содержащиеся в нём утверждения соответствуют фактам. Для этого Arena уже разметила больше 2 млн отдельных утверждений из реальных разговоров.

Это важная оговорка ко всей истории. Первое место в Arena не означает «самая умная модель на Земле». Оно скорее показывает, какую модель люди чаще предпочитают на таких задачах, а это не совсем одно и то же.

А что если вообще перестать выбирать между GPT и Claude?

Самое интересное произошло, когда Arena решила использовать накопленные сравнения не только для рейтингов. В феврале 2026 года появился Max.

Идея максимально простая. Вместо того чтобы сначала думать, открыть GPT, Claude или Gemini, ты просто пишешь свою задачу в Arena. Max смотрит, какие модели лучше показывали себя на подобных запросах, и сам отправляет задачу той, которая подходит больше всего. Он обучен на миллионах реальных сравнений пользователей.

Позже Arena расширила эту механику. Теперь Max умеет выбирать модели не только для обычного текста, но и для поиска информации, работы с изображениями, генерации картинок и создания интерфейсов. Для разных задач за одним и тем же окном фактически могут работать разные AI.

Мне кажется, здесь Arena нащупывает вещь гораздо интереснее ещё одного рейтинга. Сегодня рынок AI всё ещё во многом строится вокруг брендов: люди спорят, кто лучше, сравнивают новый GPT с Claude, ждут следующий Gemini и вручную переключаются между сервисами.

Но моделей становится слишком много. Более того, одна модель может лучше писать код, другая искать информацию, третья работать с изображениями, четвёртая быть быстрее и дешевле. Обычному человеку совершенно не обязательно помнить всё это.

Поэтому следующим большим интерфейсом AI может оказаться не ещё один чат с собственной моделью. Это может быть слой между человеком и десятками моделей, которому ты просто говоришь: «вот что я хочу сделать», а он уже сам решает, кого позвать на работу.

И в этом контексте 82 млн голосов Arena выглядят уже совсем иначе. Сначала люди бесплатно помогали ей составлять рейтинг моделей, затем эти данные начали покупать создатели AI, а теперь на тех же выборах Arena учится автоматически решать, какую модель дать каждому из нас под конкретную задачу.

Возможно, через несколько лет вопрос «какой AI ты используешь?» будет звучать примерно так же странно, как сегодня вопрос «какой сервер обработал твой поисковый запрос?». Нам будет важен результат, а выбор конкретной модели постепенно исчезнет где-то под интерфейсом.

Если интересны такие продукты и механики, я регулярно разбираю их в Telegram-канале «Ещё не единорог»: AI, стартапы, необычный рост и бизнес-модели, которые обычно интереснее очередного списка «10 нейросетей недели».

1