Какая нейросеть самая умная в октябре 2026. Я открыла шесть независимых рейтингов, и у каждого свой победитель

6 октября я свела в одну таблицу Artificial Analysis, Arena, Epoch AI, ARC Prize, METR и SWE-bench. Единого лидера нет. Зато видно, почему вопрос «какая модель лучше» почти всегда задан неправильно и что спрашивать вместо него, если вы выбираете ИИ для команды.

Какая нейросеть самая умная в октябре 2026. Я открыла шесть независимых рейтингов, и у каждого свой победитель

Мне задают вопрос примерно раз в неделю, кто лучше. Раньше я отвечала по ощущениям. В этот раз решила проверить по цифрам и не брать ничего из пересказов.

Пересказы, кстати, первыми и отвалились. Агрегаторы вроде benchlm и swfte показывали три разных расклада, а один уверенно называл лидером модель, которая вышла больше полугода назад. Поэтому дальше только первоисточники: сами рейтинги, их таблицы, даты обновления и погрешности.

Короткий ответ

Если нужен один универсальный кандидат, по совокупности лучше всех выглядит Claude Opus 5.5. Он первый в индексе Artificial Analysis (58 баллов), первый в сводном индексе Epoch (ECI 167) и первый в WebDev Arena (1815 ± 16).

Но стоит открыть конкретные тесты, и картина рассыпается.

GPT-6 Astra от OpenAI сильнее в сложной математике и абстрактных головоломках. Gemini 4 Argon от Google на первом месте у людей в слепом голосовании. А среди агентов, которые сами берут инструменты и доводят задачу до конца, лидирует Claude Fable 5.1.

Что меряет каждый рейтинг

Это важнее самих мест. Рейтинги отвечают на разные вопросы, и путать их всё равно что сравнивать бегуна и пловца по одному секундомеру.

Artificial Analysis гоняет модели по своему набору задач и выдаёт сводный балл. Плюс считает цену и скорость. Лидер Opus 5.5 в максимальном режиме: 58 баллов, $5,98 за задачу, 97 токенов в секунду. Дальше Sonnet 5.5 (56), GPT-6 Astra и Gemini 4 Argon (по 53). Даты обновления таблицы на сайте нет, так что я могу только сказать, что считала её 6 октября.

Epoch ECI склеивает 39 бенчмарков в один индекс. Opus 5.5 — 167, GPT-6 Astra и GPT-6.1 Sol — по 166, Sonnet 5.5 и Fable 5.1 — по 165. Разница в один балл ничего не значит, у каждого значения интервал в несколько пунктов.

Arena — это люди, которые не знают, какая модель им отвечает, и выбирают лучший ответ. 8,6 миллиона голосов. В текстовой арене первый Gemini 4 Argon с 1525 ± 9. Но у него пока 4 932 голоса против десятков тысяч у старых моделей, и сама Arena помечает результат как предварительный.

Arena Agent проверяет, как модель работает агентом: сама пользуется инструментами и доводит задачу. Fable 5.1 — 14,31%, Opus 5.5 — 13,82%, Sonnet 5.5 — 12,52%, GPT-6 Astra — 12,27%. Погрешность у всех около двух процентных пунктов, поэтому честно здесь можно сказать только одно: явного победителя нет.

ARC-AGI даёт задачи, которых модель точно не видела, и проверяет, сможет ли она найти правило. На ARC-AGI-2 лучший GPT-6 Astra с 95%, Opus 5.5 — 93,3%. Люди решают 100%.

FrontierMath от Epoch — математика, над которой профессиональные математики сидят часами. GPT-6 Astra и GPT-6.1 Sol делят первое место с 93,7%, Opus 5.5 — 91,2%.

Какая нейросеть самая умная в октябре 2026. Я открыла шесть независимых рейтингов, и у каждого свой победитель

Модель, которая почти всех обходит в тестах и проваливается у людей

Самая показательная история в этом отчёте — GPT-6 Astra.

На FrontierMath она первая, на сложных вопросах уровня аспирантуры GPQA набирает 96%, на ARC-AGI-3 даёт лучший результат среди всех. А в текстовой Arena, где люди просто выбирают понравившийся ответ, она на 29-м месте.

Модель, которая решает олимпиадную математику, людям в обычном разговоре нравится меньше, чем десятки других.

Для тех, кто внедряет ИИ в компании, это знакомая ситуация. Вы выбрали самую сильную модель по бенчмаркам, а сотрудники говорят, что она «какая-то не та». Бенчмарк и пользовательское ощущение — две разные метрики, и оптимизировать нужно ту, которая важна для вашей задачи.

Какая нейросеть самая умная в октябре 2026. Я открыла шесть независимых рейтингов, и у каждого свой победитель

Один и тот же тест: 62,7% или 98,6%

Это место меня удивило сильнее всего.

ARC-AGI-3 проверяет, может ли агент освоиться в совершенно новой интерактивной среде: исследовать её, понять цель, научиться по ходу. GPT-6 Astra в максимальном режиме и стандартной обвязке, одинаковой для всех моделей, набирает 62,7%. Та же Astra в том же режиме, но с фирменной обвязкой от OpenAI, которая сохраняет ход рассуждений между шагами и управляет контекстом, набирает 98,6%. В режиме High с этой обвязкой — вообще 99,9%.

Модель та же. Разница в 36 процентных пунктов — это то, как её подключили.

Какая нейросеть самая умная в октябре 2026. Я открыла шесть независимых рейтингов, и у каждого свой победитель

ARC Prize специально разводит эти режимы по разным колонкам. Первый говорит, насколько хороша модель. Второй — насколько хороша система «модель плюс инфраструктура провайдера».

Мне кажется, это главный вывод всего отчёта для тех, кто управляет ИИ-проектами. Качество итоговой системы зависит не только от того, какую модель вы выбрали, но и от того, что вы вокруг неё построили. Промпты, память, инструменты, контекст. Иногда это весит больше, чем переход на модель следующего поколения.

Сколько стоит первое место

Самая сильная модель редко оказывается разумным выбором для продакшена.

В Arena Agent Opus 5.5 в режиме High отстаёт от лидера Fable 5.1 на полпроцента, в пределах погрешности. При этом задача у Opus стоит $1,57, а у Fable $5,38. Разница в 3,4 раза за результат, который статистически не отличается.

У OpenAI похожая история с GPT-6.1 Sol. В Artificial Analysis он набирает 52 балла за $0,72 за задачу. Astra даёт 53 за $3,26, Opus 5.5 — 58 за $5,98. Шесть баллов разницы с лидером и в восемь раз дешевле.

Если у вас тысячи запросов в день, вопрос «какая модель лучшая» быстро превращается в вопрос «какая модель достаточно хорошая и сколько мы на ней сэкономим».

Какая нейросеть самая умная в октябре 2026. Я открыла шесть независимых рейтингов, и у каждого свой победитель

Где рейтинги отстали от жизни

За последний месяц вышли Claude Opus 5.5 и GPT-6 Sol (22 сентября), Claude Sonnet 5.5 (28 сентября), GPT-6.1 Sol (29 сентября). Часть рейтингов за этим не успевает.

METR, который измеряет, задачи какой длины агент выполняет сам, последний раз обновлял основную таблицу 8 мая. Свежих моделей там нет. Для GPT-5.6 Sol METR позже дал оценку 11,3 часа, но с интервалом от 5 до 40 часов и с прямой оговоркой, что измерению нельзя доверять.

Официальный SWE-bench с одинаковой средой для всех моделей застрял в феврале: лидер там Claude 4.5 Opus с 76,8%. Ни Opus 5.5, ни GPT-6 в сопоставимой таблице нет.

Так что если кто-то в октябре ссылается на SWE-bench как на доказательство, что модель X лучше всех в коде, стоит посмотреть на дату.

Какая нейросеть самая умная в октябре 2026. Я открыла шесть независимых рейтингов, и у каждого свой победитель

Что я теперь отвечаю на вопрос «какая самая умная»

Встречный вопрос: для чего.

Какая нейросеть самая умная в октябре 2026. Я открыла шесть независимых рейтингов, и у каждого свой победитель
  • Для сложного анализа, кода и работы агентом я бы начинала с Claude Opus 5.5, а для экономии смотрела бы на его режим High.
  • Если задача про строгую математику и формальные рассуждения — GPT-6 Astra.
  • Если нужен приятный собеседник для текстов и общения, стоит попробовать Gemini 4 Argon, но с поправкой на то, что голосов у него пока мало.
  • Если важна цена на большом потоке запросов — GPT-6.1 Sol.

И что бы вы ни выбрали, обвязка вокруг модели может дать больше, чем смена модели. Это я теперь видела в цифрах, а не только на своих проектах.

Через месяц расклад, скорее всего, поменяется. Ещё 3 сентября Epoch писал, что рекорд ECI поставила GPT-6 Astra, а к 6 октября первым стал Opus 5.5. Я планирую пересобирать эту таблицу раз в месяц и сравнивать.

А вы как выбираете модель для работы: по рейтингам, по совету коллег или просто пользуетесь той, к которой привыкли?

Источники (все данные считаны 6 октября 2026 года):

  • Artificial Analysis — artificialanalysis.ai/leaderboards/models
  • Arena: Text, Agent, WebDev, Vision — arena.ai/leaderboard
  • Epoch AI: ECI, FrontierMath, GPQA Diamond — epoch.ai/benchmarks
  • ARC Prize — arcprize.org/leaderboard
  • METR — metr.org/time-horizons
  • SWE-bench — swebench.com
22