Grok 4.6 от SpaceXAI: на уровне GPT-5.6 Sol, в части тестов выше Fable 5

12 августа 2026 года SpaceXAI (бывшая xAI) выпустила языковую модель Grok 4.6. Об этом компания написала в официальном анонсе: модель заточена под длинные агентные сценарии, программирование и работу, которая не заканчивается одним ответом в чате.

По сводному рейтингу Artificial Analysis Intelligence Index новинка набрала 61 балл: столько же, сколько GPT-5.6 Sol Max от OpenAI, и на один балл меньше Claude Fable 5 Max. В части отдельных тестов Grok 4.6 обходит обоих. Для практики важнее не слоган «догнала фронтир», а где именно она сильнее, где проседает и сколько это стоит в API.

Grok 4.6 от SpaceXAI: на уровне GPT-5.6 Sol, в части тестов выше Fable 5

Что анонсировали 12 августа

По заявлению SpaceXAI, Grok 4.6 продолжает линейку Grok 4.5 и сильнее держит многошаговые задачи: исследование темы, разбор незнакомого кода, сборка приложения из сырой идеи и несколько кругов правок. Компания отдельно отмечает самопроверку: на длинных траекториях модель чаще тестирует собственный результат, прежде чем идти дальше.

Тот же день в экосистеме SpaceXAI и Cursor: модель сразу доступна в Cursor и Grok Build. Первую неделю обещают удвоенный included usage, чтобы 4.6 можно было потрогать без отдельной настройки биллинга. Через API модель идёт под идентификатором grok-4.6, плюс партнёры: OpenRouter, Vercel и Cloudflare.

Независимый разбор выложила Artificial Analysis 12 августа 2026 года. Коротко: +5 пунктов к Grok 4.5 (та вышла чуть больше месяца назад) и +23 к Grok 4.3. SpaceXAI снова в группе лидеров рядом с OpenAI, впереди по индексу остаются модели Anthropic.

Бенчмарки Grok 4.6: где она на уровне, где впереди

Artificial Analysis Intelligence Index, это композит из девяти тестов. 61 балл у Grok 4.6 High совпадает с GPT-5.6 Sol (max). Claude Fable 5 (max with fallback) стоит на 62, Claude Opus 5 (max) на 63. То есть «сопоставима с Fable 5» звучит честно, но абсолютный лидер индекса сейчас не она.

Официальная таблица SpaceXAI (режим High / Max, цифры конкурентов: лучший из самоотчёта или публичных лидербордов):

ТестGrok 4.6Grok 4.5GPT-5.6 SolFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v2 (Elo)1753152617281741
CursorBench v3.269,9%66,7%67,2%70,5%
DeepSWE v1.165,9%54%73%70%
FrontierCode v1.1 Extended61,3%56,6%60,6%63,6%
APEX-Agents57,5%47,1%56,7%59,2%
Terminal-Bench v3.026%15,7%34,6%34,1%
APEX-SWE56,4%53,6%нет данных58,8%
AA-Briefcase (Elo)1577131315021574
Harvey LAB (Vals)15,8%12,9%2,5%11,3%

Где Grok 4.6 обходит и Sol, и Fable 5:

  • GDPVal-AA v2: 1753 против 1728 у Sol и 1741 у Fable. Это агентная «офисная» работа, не викторина.
  • AA-Briefcase: 1577 против 1502 и 1574. Длинные knowledge-work задачи.
  • Harvey LAB: 15,8% против 2,5% и 11,3%. Юридический eval, абсолютные проценты у всех низкие, сравнивать нужно внутри этой шкалы.

По CursorBench, FrontierCode и APEX-Agents новинка чуть выше Sol, но всё ещё ниже Fable 5. На DeepSWE v1.1 и Terminal-Bench v3.0 отставание уже заметное: 65,9% против 73% у Sol и 26% против 34,6%. Для чистого software-engineering это важнее красивого среднего балла.

Не путайте версии Terminal-Bench

В разборе Artificial Analysis фигурирует Terminal-Bench v2.1: 88,4%, уровень лидеров. В таблице SpaceXAI стоит Terminal-Bench v3.0: 26%. Это разные поколения теста, а не «вчера 88, сегодня 26». Если в чужом обзоре мелькает одна цифра без версии, её лучше не переносить в свои выводы.

Там же AA даёт ещё два агентных результата: 50,7% на τ³-Banking (второй результат после Qwen3.8 Max с 51,3%) и сильный GDPVal. Картина складывается ровная: модель хорошо выглядит на длинных задачах с инструментами и слабее на части «голого» SWE.

Почему это важно на практике

Для владельца сайта, разработчика и небольшой команды новость не в том, что «вышла ещё одна цифра в таблице». Меняется экономика агентной работы.

Базовая цена API не выросла относительно Grok 4.5: $2 за миллион токенов ввода и $6 за миллион вывода при контексте до 200k токенов в запросе. У GPT-5.6 Sol Artificial Analysis указывает $5 / $30, у Claude Opus 5: $5 / $25. На reasoning-нагрузке дороже всего выход, поэтому разрыв по выводу здесь важнее красивого «на балл меньше Fable».

AA оценивает стоимость задачи в $0,84 и ставит Grok 4.6 на парето-фронтир «интеллект / цена». На AA-Briefcase модель в среднем закрывает задачу за ~53 хода и ~0,5B входных токенов. У Claude Opus 5 (max) в том же материале: ~103 хода и ~2,0B входа. Даже при сопоставимом качестве длинный агент, который ходит вдвое короче, дешевле не только из-за прайса за токен.

Контекст: 500k токенов, как у 4.5. Нюанс из официального прайса: если промпт пересекает 200k токенов, счётчик для всего запроса удваивается ($4 / $1 cache / $12). Cache hit подорожал с $0,30 до $0,50 за миллион. Fast / priority-вариант в анонсе и в документации идёт по двойной ставке.

Как попробовать Grok 4.6

Самый короткий путь: выбрать модель в Cursor или открыть Grok Build. Для своей обвязки: ключ в консоли SpaceXAI, база API https://api.x.ai/v1, модель grok-4.6. Документация даёт такой минимальный вызов:

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{
    "model": "grok-4.6",
    "input": "Fix this function and explain the bug: function median(a){a.sort();return a[a.length/2]}"
}'

Тот же endpoint можно дергать через OpenAI-совместимый клиент с base_url="https://api.x.ai/v1". Ключ в репозиторий и в чат не класть. Команду вида curl … | bash для установки CLI с x.ai компания тоже публикует; для рабочего сервера я бы сначала скачал скрипт, прочитал его и только потом запускал, а не скармливал шеллу с ходу.

Если уже сидите в другом coding-агенте, имеет смысл не «переезжать с барабанным боем», а прогнать один и тот же набор задач: незнакомый репозиторий, длинный рефакторинг, вёрстка интерактивного экрана, многошаговый разбор логов. Именно такие сценарии SpaceXAI ставит во главу релиза. Сравнение с другими editor-агентами на сайте уже было, например в материале про переход на OpenCode.

Рядом вышел Grok Bot. Это другой продукт

11 и 12 августа SpaceXAI отдельно показала Grok Bot: команду облачных агентов, которые сами заходят в приложения, делят задачи и работают, даже если ноутбук закрыт. Это продукт после сделки вокруг Cursor, а не «ещё одно имя модели». Бета, по отраслевым сообщениям, завязана на старшие подписки (SuperGrok Heavy, Cursor Ultra, Cursor Teams Premium).

Путать Bot и 4.6 не стоит. Модель, это мозг. Bot, это обвязка с доступом к чужим интерфейсам. Ошибка чата остаётся текстом. Ошибка агента с CRM, почтой и счетами уже операционный инцидент. Для рабочего контура права, подтверждения и журнал действий нужны заранее, а не «после первого сюрприза».

Где обычно ломается ожидание

  • Один индекс не выбирает модель. 61 балл рядом с Sol не отменяет просадку на DeepSWE и Terminal-Bench v3.0.
  • Самоотчёты вендоров и независимый прогон AA иногда расходятся по версии теста. Смотрите название бенчмарка целиком.
  • Первая неделя с 2x usage закончится. Дальше считает либо подписка Cursor / Grok Build, либо токены API.
  • Длинный промпт (>200k) удваивает ставку на весь запрос. На больших репозиториях это легко не заметить.
  • Автономный агент с логином в чужие сервисы требует минимальных прав и человека на шагах «отправить», «оплатить», «удалить».

Вывод

Grok 4.6, это не косметический плюс к 4.5, а возвращение SpaceXAI на фронтир: 61 в Artificial Analysis, паритет с GPT-5.6 Sol и победы над Sol и Fable 5 на GDPVal, AA-Briefcase и Harvey LAB. Слабее модель выглядит на части классического software-engineering. Дата релиза: 12 августа 2026 года.

Если уже работаете с агентами в Cursor или Grok Build, первую неделю разумно потратить на свои задачи, а не на пересказ чужих графиков. Если смотрите API, считать нужно не только $2/$6, но и порог 200k, cache и double-price fast-режим. Бенчмарк подсказывает, с чего начать сравнение. Решает прогон на вашем коде и ваших документах.

Источники


Комментарии загружаются…