SpaceXAI выпустила модель Grok 4.6 для длинных многошаговых задач ИИ-агентов

По одному из сводных индексов от исследователей Artificial Analysis она идёт вровень с GPT-5.6 Sol.

Источник: SpaceXAI
Источник: SpaceXAI
  • Grok 4.6 разрабатывали прежде всего для «долгоработающих» агентов, которые выполняют задачи с кодовой базой, создают приложения, анализируют данные и исследуют темы, и для «интерактивной и визуальной работы».
  • В индексе Artificial Analysis Intelligence Index, который учитывает показатели девяти бенчмарок, Grok 4.6 получила 61 балл. Для сравнения: у GPT-5.6 Sol и Fable 5 с максимальным уровнем «рассуждений» — столько же и 62 соответственно.
  • На бенчмарке GDPval-AA, который проверяет модели на реальных рабочих задачах из 44 профессий и девяти крупных отраслей, Grok 4.6 набрала 1753 балла против 1741 у Fable 5 и 1728 у GPT-5.6 Sol.
  • В наборе тестов DeepSWE на решение длинных задач по разработке ПО модель SpaceXAI справилась с 65,9% заданий. У Fable 5 и GPT-5.6 Sol — 70% и 73% соответственно.
  • Grok 4.6 уже добавили в ИИ-редактор кода Cursor и CLI-агента для программирования Grok Build, в API, а также в сторонние сервисы, среди которых OpenRouter, Vercel и Cloudflare.
  • 1 млн входных токенов будет стоить $2, а 1 млн выходных — $6. Ускоренная версия модели обойдётся вдвое дороже.
  • Предшественница Grok 4.6 — Grok 4.5, разработанная вместе с Cursor. Её представили в начале июля 2026 года. Глава Cursor Майкл Труэлл писал, что Grok 4.5 — это модель «класса Opus, быстрая и с низкой стоимостью».
  • 11 августа SpaceXAI выпустила бета-версию сервиса Grok Bot — это «команда агентов», которым можно поручить «настоящую работу». Он доступен в подписках SuperGrok Heavy, Cursor Ultra и Cursor Teams Premium на десктопе и iOS.
10
4