Какая нейросеть лучше пишет код: 5 моделей на одной задаче

Какая нейросеть лучше пишет код: 5 моделей на одной задаче

Claude Opus 5 берёт 96% на SWE-bench Verified, Claude Fable 5 — 95%, GPT-5.5 — 88,7%. При этом прогон команды из 50 инженеров стоит $500 000 в месяц на Claude Fable 5 и $100 000 на Claude Sonnet 5. Пятикратный разрыв в цене при разнице в качестве в пару процентных пунктов — вот где начинается реальный выбор.

Пять действий, которые дают эффект сразу:

— Считайте месячный бюджет на команду, а не цену за миллион токенов.

— Сверяйте модели на SWE-bench Pro: первое место там у Claude Mythos Preview с 77,8%.

— Разводите черновик, рефакторинг и дебаг по разным моделям.

— Держите в контуре дешёвую модель для рутины: DeepSeek-V4-Pro набрал 80,60 на SWE-bench Verified.

— Для сверхдлинных задач смотрите на GLM-5.3 с 42,5% на SWE-Marathon, а не на верхушку общего рейтинга.

Верхнюю строчку оспаривают сами источники

Рейтинг SWE-bench Verified за сентябрь 2026 года включает 69 моделей. Верхняя часть таблицы BenchLM.ai выглядит так:

— Claude Opus 5 — 96%.

— Claude Fable 5 — 95%.

— Claude Mythos Preview — 93,9%.

— Claude Opus 4.8 — 88,6%.

— Claude Sonnet 5 — 85,2%.

DataLearnerAI в августе 2026 года называет SOTA ту же модель — Claude Opus 5 с 96,00%. А таблица Onyx Coding LLM Leaderboard отдаёт лучшее место в своём датасете другому продукту — Claude Fable 5 с 95% при цене API $10/$50 за 1M токенов вход/выход. Прямого противоречия здесь нет: наборы задач у таблиц разные. Но большинство читателей видят первую строчку и делают вывод о единственном победителе, которого на самом деле нет.

Практическая деталь важнее спора о первом месте: отрыв лидера от предыдущей волны моделей — почти 8 п.п. То есть разница между поколениями одной линейки больше, чем разница между двумя топовыми продуктами внутри одного поколения. Обновление модели даёт больше, чем смена вендора.

На агентных задачах разрыв шире

SWE-bench Verified — это в основном изолированные патчи в небольшом контексте. SWE-bench Pro проверяет агентный кодинг, где модель сама ходит по файлам и запускает команды, и картина там другая. Оценено 30 моделей, распределение выглядит так:

— Claude Mythos Preview — 77,8%.

— Claude Opus 4.7 (Adaptive) — 64,3%.

— GPT-5.5 — 58,6%.

— DeepSeek V4 Flash (Max) — 52,6%, DeepSeek V4 Pro — 52,1% (лучшие среди открытых).

— Qwen3.5 397B — 50,9%, Kimi K2.5 — 50,7%.

Разрыв между первым и третьим местом — 19,2 п.п. На классическом SWE-bench Verified разброс в топе исчисляется единицами процентных пунктов, здесь — почти двумя десятками. Вывод простой: чем длиннее агентный цикл, тем сильнее лидер уходит вперёд и тем меньше смысла экономить на модели.

Инструментальная часть движется туда же. По метрикам GitHub на 19.09.2026 репозиторий browser-use/jev-ultrafast (Python, создан 16.09.2026) набрал 5939 звёзд за трое суток, плагин для Claude Code tamaratran/fast-jev-compaction (TypeScript, создан 17.09.2026) — 3484 звезды. Логика плагина показательна: каждый вызов инструмента и его результат скорится одним быстрым запросом, устаревшее отбрасывается. Тренд на сжатие контекста вокруг агентного кодинга — прямое следствие того, что стоит длинная цепочка шагов.

Расчёт: 400 000 долларов на одной команде

Возьмём типичную нагрузку команды из 50 инженеров — 10 млн выходных токенов в месяц. По данным Onyx месячный прогон распределяется так:

— Claude Sonnet 5 — $100 000.

— Claude Opus 4.8 — $250 000.

— GPT-5.5 — $300 000.

— Claude Fable 5 — $500 000.

Разность между самой дорогой и самой дешёвой позицией в этом списке — $400 000 в месяц на одну команду. Claude Fable 5 дороже Claude Sonnet 5 ровно в пять раз, Claude Opus 4.8 — в 2,5 раза, GPT-5.5 — в три раза.

Тарифы объясняют эту кратность почти без остатка. По прайсу от 18.08.2026 Claude Sonnet 5 стоит $2/$10 за 1M токенов, Claude Opus 5 — $5/$25, GPT-5.6 Sol — $5/$30, Kimi K3 — $3/$15. Claude Opus 4.8 идёт по $5/$25, Claude Fable 5 — по $10/$50. То есть Fable 5 ровно вдвое дороже Opus 4.8 по обоим направлениям, и ровно во столько же раз дороже его месячный прогон. Никакой скрытой экономии на масштабе здесь нет: разница в счёте равна разнице в тарифе.

Отдельный сюжет — Claude Fable 5.1, вышедший 01.09.2026. Контекст 1M токенов, максимум вывода 128K, цена $10/$50. Модель берёт первое место по LiveCodeBench с 90,52% и второе по Terminal-Bench 2.1 с 85,02%, уступая только GPT-5.6 Sol с 85,77%. По Vibe Code Bench — 90,26%. В Vals Index — 67,87% против 67,21% у Claude Opus 5, в RSI Index — 35,03% против 32,10%. При этом стоимость прогона — $1481 против $1886, то есть на 21% дешевле при более высоких метриках. Это редкий случай, когда новая версия выигрывает и по качеству, и по цене одновременно.

Дешёвый сегмент тихо подтянулся

По данным DataLearnerAI на август 2026 года лучшая открытая и одновременно лучшая китайская модель — DeepSeek-V4-Pro с 80,60 по SWE-bench Verified. Отставание от лидера — 15,4 п.п., и это в разы меньше, чем два года назад. Рядом стоят Gemini 3.1 Pro Preview с 80,60, Kimi K2.6 от Moonshot со свободной коммерческой лицензией с 80,20, Claude Opus 4.6 с 80,84 и Claude Sonnet 4.5 с 82,00. Плотность в этом диапазоне высокая, и выбирать внутри него по бенчмарку бессмысленно.

Экономика здесь решает больше. Сравнение DeepSeek V4 Pro (1,6T параметров MoE, контекст 1M, лицензия MIT) и Qwen3.6-35B-A3B (35B MoE, контекст 262K, Apache 2.0) показывает расчётную месячную нагрузку $566 против $370. Разница — $196 в месяц в пользу Qwen при том, что по MMLU Pro DeepSeek V4 Pro впереди лишь на 2,3 п.п. Qwen дополнительно умеет vision и мультимодальность, DeepSeek выигрывает по structured outputs.

На подписках арифметика ещё нагляднее. GitHub Copilot Pro стоит $10 в месяц и включает $15 AI Credits, Claude Pro — $20, ChatGPT Plus — $20, Cursor Pro — $20, Kimi Code — от $19. Самая дешёвая платная связка — Copilot Pro за $10. При этом Cursor Ultra стоит $200 в месяц, то есть в десять раз дороже Copilot Pro.

Сверхдлинные задачи меняют расстановку

SWE-Marathon проверяет то, что не видно на коротких патчах: компиляторы, оптимизацию ядер, продакшн-сервисы. Обновление за сентябрь 2026 года охватывает пять моделей:

— GLM-5.3 (Zhipu, 753B, контекст 1M) — 42,5%.

— Kimi K3 (Moonshot, 2,8T) — 42,0%.

— Hy4 preview (Tencent) — 31,9%.

— Grok 4.5 — 29,0%.

— GLM-5.2 — 13,0%.

Обратите внимание на две вещи. Первая: GLM-5.3 — самая дешёвая модель в группе лидеров и при этом первая. Вторая: разрыв между двумя поколениями одной линейки — 42,5% против 13,0%, то есть больше чем втрое. Ни одна из моделей верхушки SWE-bench Verified в этом списке не фигурирует.

Практический смысл в том, что «лучшая модель для кода» не существует как одна сущность. Для автодополнения, для генерации тестов, для рефакторинга legacy-кода и для многочасовой агентной задачи лидеры разные. Единый рейтинг усредняет их и теряет именно ту информацию, которая нужна при выборе.

Чек-лист для команды перед сменой модели

— Посчитайте месячный бюджет на модель, взяв за основу нагрузку 10 млн выходных токенов.

— Разложите задачи на четыре группы: черновик, тесты, рефакторинг, сложный дебаг.

— Поставьте на черновик и тесты DeepSeek, на рефакторинг и финальную сборку — Claude Sonnet 5, на сложный дебаг и ревью — GPT.

— Проверьте, не требует ли дешёвая модель жёстких ограничений в промпте: это съедает экономию на ревью.

— Сверьте контекст: 1M токенов у GPT-5.4, Claude Opus 4.6 и DeepSeek V4 Pro, 2M у Gemini 3 Pro, 262K у Qwen3.6-35B-A3B, 128K у DeepSeek V3.2 и Qwen3.5.

— Не берите дорогую модель под генерацию DTO и boilerplate: это избыточно и дорого.

— Сделайте замер на своём репозитории перед покупкой годового плана.

Где эта схема не работает

Разделение задач по моделям плохо масштабируется там, где нет выделенного человека на инфраструктуру. Каждый дополнительный провайдер — это отдельный ключ, отдельный лимит, отдельный учёт и отдельный набор инструкций для команды. Для коллектива из трёх-пяти человек такая экономия чаще убыточна: административные издержки выше сэкономленных $196.

Второе ограничение — эффект кэша. У DeepSeek кэш-хит стоит примерно 3% от промаха кэша: кэшированный системный промпт на 2000 токенов экономит $426 на миллион запросов в off-peak и $852 в peak. Эти цифры достигаются только при стабильном системном промпте. Если промпт переписывается каждый день, экономия исчезает, а тариф остаётся.

Третье: бенчмарк не равен вашему стеку. В русскоязычном тесте восьми моделей (генерация функций, исправление багов, рефакторинг, тесты) расклад оказался иным, чем в международных таблицах: Claude Opus 4.6 — 9,5 из 10, GPT-5.4 — 9,0, Claude Sonnet 4.6 — 8,5 при цене в пять раз ниже Opus, Gemini 3 Pro — 8,0, DeepSeek V3.2 — 7,5, Qwen3.5 — 7,0, Gemini 3 Flash — 7,0. Подписки здесь тоже расходятся: Claude Opus 4.6 в Claude Pro выдал рабочий код с первой попытки примерно в 80% случаев против 65% у GPT-5.4 в ChatGPT Plus, а вместе обе подписки стоят $40 в месяц.

Если у вас другая ситуация

Если команда меньше десяти человек, агентный контур на 10 млн токенов не нужен — берите подписки: Copilot Pro за $10, Claude Pro за $20 или ChatGPT Plus за $20, Kimi Code от $19. Claude Code в Pro идёт по умолчанию на Sonnet 5, то есть за $20 в месяц закрывается и чат, и CLI-агент.

Если нужен один провайдер без зоопарка ключей, смотрите на роутинг через OpenRouter: наценки на вывод токенов там нет, цены каталога совпадают с прайсом провайдеров (Claude Opus 5 — $5/$25, Claude Opus 4.8 и 4.7 — $5/$25, Claude Sonnet 5 — $2/$10, Claude Haiku 4.5 — $1/$5), платформенный сбор — 5,5% при пополнении картой и 5% криптой, в каталоге 141 модель. BYOK-надбавка 5% включается только выше $25 000 листовой стоимости инференса в месяц, то есть для большинства команд она не срабатывает.

✍ Автор: Neo AI Radar — обзоры ИИ-инструментов и нейросетей.

✅ Подписывайтесь на канал ВК - ТГ - MAX

⚠ Информация носит познавательный характер. Инструменты и подходы меняются — проверяйте актуальность перед использованием.

✅ Подписывайтесь на канал и ставьте лайк!

33