12 августа 2026 года SpaceXAI (бывшая xAI) выпустила языковую модель Grok 4.6. Об этом компания написала в официальном анонсе: модель заточена под длинные агентные сценарии, программирование и работу, которая не заканчивается одним ответом в чате.
По сводному рейтингу Artificial Analysis Intelligence Index новинка набрала 61 балл: столько же, сколько GPT-5.6 Sol Max от OpenAI, и на один балл меньше Claude Fable 5 Max. В части отдельных тестов Grok 4.6 обходит обоих. Для практики важнее не слоган «догнала фронтир», а где именно она сильнее, где проседает и сколько это стоит в API.
Что анонсировали 12 августа
По заявлению SpaceXAI, Grok 4.6 продолжает линейку Grok 4.5 и сильнее держит многошаговые задачи: исследование темы, разбор незнакомого кода, сборка приложения из сырой идеи и несколько кругов правок. Компания отдельно отмечает самопроверку: на длинных траекториях модель чаще тестирует собственный результат, прежде чем идти дальше.
Тот же день в экосистеме SpaceXAI и Cursor: модель сразу доступна в Cursor и Grok Build. Первую неделю обещают удвоенный included usage, чтобы 4.6 можно было потрогать без отдельной настройки биллинга. Через API модель идёт под идентификатором grok-4.6, плюс партнёры: OpenRouter, Vercel и Cloudflare.
Независимый разбор выложила Artificial Analysis 12 августа 2026 года. Коротко: +5 пунктов к Grok 4.5 (та вышла чуть больше месяца назад) и +23 к Grok 4.3. SpaceXAI снова в группе лидеров рядом с OpenAI, впереди по индексу остаются модели Anthropic.
Бенчмарки Grok 4.6: где она на уровне, где впереди
Artificial Analysis Intelligence Index, это композит из девяти тестов. 61 балл у Grok 4.6 High совпадает с GPT-5.6 Sol (max). Claude Fable 5 (max with fallback) стоит на 62, Claude Opus 5 (max) на 63. То есть «сопоставима с Fable 5» звучит честно, но абсолютный лидер индекса сейчас не она.
Официальная таблица SpaceXAI (режим High / Max, цифры конкурентов: лучший из самоотчёта или публичных лидербордов):
| Тест | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| DeepSWE v1.1 | 65,9% | 54% | 73% | 70% |
| FrontierCode v1.1 Extended | 61,3% | 56,6% | 60,6% | 63,6% |
| APEX-Agents | 57,5% | 47,1% | 56,7% | 59,2% |
| Terminal-Bench v3.0 | 26% | 15,7% | 34,6% | 34,1% |
| APEX-SWE | 56,4% | 53,6% | нет данных | 58,8% |
| AA-Briefcase (Elo) | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15,8% | 12,9% | 2,5% | 11,3% |
Где Grok 4.6 обходит и Sol, и Fable 5:
- GDPVal-AA v2: 1753 против 1728 у Sol и 1741 у Fable. Это агентная «офисная» работа, не викторина.
- AA-Briefcase: 1577 против 1502 и 1574. Длинные knowledge-work задачи.
- Harvey LAB: 15,8% против 2,5% и 11,3%. Юридический eval, абсолютные проценты у всех низкие, сравнивать нужно внутри этой шкалы.
По CursorBench, FrontierCode и APEX-Agents новинка чуть выше Sol, но всё ещё ниже Fable 5. На DeepSWE v1.1 и Terminal-Bench v3.0 отставание уже заметное: 65,9% против 73% у Sol и 26% против 34,6%. Для чистого software-engineering это важнее красивого среднего балла.
Не путайте версии Terminal-Bench
В разборе Artificial Analysis фигурирует Terminal-Bench v2.1: 88,4%, уровень лидеров. В таблице SpaceXAI стоит Terminal-Bench v3.0: 26%. Это разные поколения теста, а не «вчера 88, сегодня 26». Если в чужом обзоре мелькает одна цифра без версии, её лучше не переносить в свои выводы.
Там же AA даёт ещё два агентных результата: 50,7% на τ³-Banking (второй результат после Qwen3.8 Max с 51,3%) и сильный GDPVal. Картина складывается ровная: модель хорошо выглядит на длинных задачах с инструментами и слабее на части «голого» SWE.
Почему это важно на практике
Для владельца сайта, разработчика и небольшой команды новость не в том, что «вышла ещё одна цифра в таблице». Меняется экономика агентной работы.
Базовая цена API не выросла относительно Grok 4.5: $2 за миллион токенов ввода и $6 за миллион вывода при контексте до 200k токенов в запросе. У GPT-5.6 Sol Artificial Analysis указывает $5 / $30, у Claude Opus 5: $5 / $25. На reasoning-нагрузке дороже всего выход, поэтому разрыв по выводу здесь важнее красивого «на балл меньше Fable».
AA оценивает стоимость задачи в $0,84 и ставит Grok 4.6 на парето-фронтир «интеллект / цена». На AA-Briefcase модель в среднем закрывает задачу за ~53 хода и ~0,5B входных токенов. У Claude Opus 5 (max) в том же материале: ~103 хода и ~2,0B входа. Даже при сопоставимом качестве длинный агент, который ходит вдвое короче, дешевле не только из-за прайса за токен.
Контекст: 500k токенов, как у 4.5. Нюанс из официального прайса: если промпт пересекает 200k токенов, счётчик для всего запроса удваивается ($4 / $1 cache / $12). Cache hit подорожал с $0,30 до $0,50 за миллион. Fast / priority-вариант в анонсе и в документации идёт по двойной ставке.
Как попробовать Grok 4.6
Самый короткий путь: выбрать модель в Cursor или открыть Grok Build. Для своей обвязки: ключ в консоли SpaceXAI, база API https://api.x.ai/v1, модель grok-4.6. Документация даёт такой минимальный вызов:
curl https://api.x.ai/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $XAI_API_KEY" \
-d '{
"model": "grok-4.6",
"input": "Fix this function and explain the bug: function median(a){a.sort();return a[a.length/2]}"
}'
Тот же endpoint можно дергать через OpenAI-совместимый клиент с base_url="https://api.x.ai/v1". Ключ в репозиторий и в чат не класть. Команду вида curl … | bash для установки CLI с x.ai компания тоже публикует; для рабочего сервера я бы сначала скачал скрипт, прочитал его и только потом запускал, а не скармливал шеллу с ходу.
Если уже сидите в другом coding-агенте, имеет смысл не «переезжать с барабанным боем», а прогнать один и тот же набор задач: незнакомый репозиторий, длинный рефакторинг, вёрстка интерактивного экрана, многошаговый разбор логов. Именно такие сценарии SpaceXAI ставит во главу релиза. Сравнение с другими editor-агентами на сайте уже было, например в материале про переход на OpenCode.
Рядом вышел Grok Bot. Это другой продукт
11 и 12 августа SpaceXAI отдельно показала Grok Bot: команду облачных агентов, которые сами заходят в приложения, делят задачи и работают, даже если ноутбук закрыт. Это продукт после сделки вокруг Cursor, а не «ещё одно имя модели». Бета, по отраслевым сообщениям, завязана на старшие подписки (SuperGrok Heavy, Cursor Ultra, Cursor Teams Premium).
Путать Bot и 4.6 не стоит. Модель, это мозг. Bot, это обвязка с доступом к чужим интерфейсам. Ошибка чата остаётся текстом. Ошибка агента с CRM, почтой и счетами уже операционный инцидент. Для рабочего контура права, подтверждения и журнал действий нужны заранее, а не «после первого сюрприза».
Где обычно ломается ожидание
- Один индекс не выбирает модель. 61 балл рядом с Sol не отменяет просадку на DeepSWE и Terminal-Bench v3.0.
- Самоотчёты вендоров и независимый прогон AA иногда расходятся по версии теста. Смотрите название бенчмарка целиком.
- Первая неделя с 2x usage закончится. Дальше считает либо подписка Cursor / Grok Build, либо токены API.
- Длинный промпт (>200k) удваивает ставку на весь запрос. На больших репозиториях это легко не заметить.
- Автономный агент с логином в чужие сервисы требует минимальных прав и человека на шагах «отправить», «оплатить», «удалить».
Вывод
Grok 4.6, это не косметический плюс к 4.5, а возвращение SpaceXAI на фронтир: 61 в Artificial Analysis, паритет с GPT-5.6 Sol и победы над Sol и Fable 5 на GDPVal, AA-Briefcase и Harvey LAB. Слабее модель выглядит на части классического software-engineering. Дата релиза: 12 августа 2026 года.
Если уже работаете с агентами в Cursor или Grok Build, первую неделю разумно потратить на свои задачи, а не на пересказ чужих графиков. Если смотрите API, считать нужно не только $2/$6, но и порог 200k, cache и double-price fast-режим. Бенчмарк подсказывает, с чего начать сравнение. Решает прогон на вашем коде и ваших документах.