SpaceXAI выпустила Grok 4.6 12 августа 2026 года, через несколько недель после появления Grok 4.5. Модель получила более длительное дополнительное обучение и ориентирована на многошаговые агентные сценарии — исследование, работу с кодовой базой, анализ информации и создание приложений. В независимом Artificial Analysis Intelligence Index она набрала 61 балл, на 5 больше Grok 4.5 и на уровне GPT-5.6 Sol.

Grok 4.6 рассчитан на задачи, которые продолжаются десятки шагов
В официальном анонсе SpaceXAI делает акцент на способности Grok 4.6 удерживать сложную задачу на протяжении длинной последовательности действий. Такой сценарий отличается от обычного вопроса в чат: агент может сначала собрать информацию, затем изучить файлы проекта, написать код, проверить результат, исправить ошибки и продолжить работу после обратной связи.
Именно здесь компания видит основное развитие по сравнению с Grok 4.5. Внутренние тесты SpaceXAI показывают, что Grok 4.6 чаще проверяет собственную работу на длинных траекториях и способен за один проход собрать более цельный первый вариант визуального или интерактивного проекта. В качестве примеров компания приводит исследование незнакомой предметной области, проектирование структуры приложения, реализацию основных взаимодействий и последующие итерации.
Окно контекста при этом осталось прежним — 500 000 токенов. Его хватает для крупных наборов документов, длинной истории диалога или значительной части кодовой базы, хотя фактический объём помещающегося проекта зависит от языка программирования, формата данных и количества служебной информации в запросе.
Более длинное обучение Grok 4.6 сосредоточили на инженерных и агентных задачах
SpaceXAI раскрыла часть процесса подготовки модели. Grok 4.6 прошёл более длинный дополнительный этап обучения, чем Grok 4.5. В него вошли отобранные моделью синтетические данные для рассуждений и сложных технических концепций, инженерные данные высокого качества, обновлённый оптимизатор и изменённая схема обучения.
Следующий этап связан с SFT — supervised fine-tuning, то есть дообучением на примерах желаемого поведения. Для него Grok 4.5 использовали, чтобы заново сформировать траектории решения задач с разной глубиной рассуждений, разными агентными оболочками и предметными областями. В списке SpaceXAI фигурируют STEM, разработка программного обеспечения и knowledge work — работа с информацией, документами и аналитическими задачами.
После SFT модель обучали с подкреплением в агентных средах. Среди них компания прямо называет общие задачи программирования, оптимизацию вычислительных ядер, веб-разработку и CAD. Такая схема хорошо объясняет, почему в релизе так много внимания уделено автономной работе с инструментами и сохранению качества на длинной цепочке действий.
Artificial Analysis зафиксировал прирост на 5 баллов за одно поколение
Независимый Artificial Analysis оценил Grok 4.6 в 61 балл по своему Intelligence Index. Grok 4.5 набирал 56 баллов. GPT-5.6 Sol в той же системе получил 61 балл, Claude Fable 5 — 62, а Claude Opus 5 — 63.
Картина по отдельным тестам неоднородная, и именно она лучше показывает характер обновления. В опубликованной SpaceXAI таблице Grok 4.6 заметно прибавляет в агентных и инженерных задачах:
| Тест | Grok 4.6 High | Grok 4.5 High | Изменение |
| Artificial Analysis Intelligence Index | 61 | 56 | +5 |
| GDPVal-AA v2 | 1753 | 1526 | +227 |
| CursorBench v3.2 | 69,9% | 66,7% | +3,2 п.п. |
| DeepSWE v1.1 | 65,9% | 54,0% | +11,9 п.п. |
| FrontierCode v1.1 Extended | 61,3% | 56,6% | +4,7 п.п. |
| APEX-Agents | 57,5% | 47,1% | +10,4 п.п. |
| AA-Briefcase | 1577 | 1313 | +264 |
В DeepSWE v1.1 модель всё ещё уступает GPT-5.6 Sol с 73% и Claude Fable 5 с 70%. В CursorBench v3.2 Grok 4.6 набирает 69,9%, почти вплотную подходя к 70,5% у Fable 5 и опережая 67,2% у GPT-5.6 Sol. В GDPVal-AA v2 результат Grok 4.6 достигает 1753 против 1728 у GPT-5.6 Sol и 1741 у Fable 5 в таблице SpaceXAI.
Artificial Analysis отдельно выделяет долгие агентные сценарии. В его закрытом тесте AA-Briefcase Grok 4.6 получил Elo 1577 и в среднем завершал задачу примерно за 53 шага. Для Claude Opus 5 Max аналитики приводят около 103 шагов. Такое различие влияет на расходы в длинных цепочках, поскольку каждый новый шаг снова использует часть накопленного контекста.
Цена Grok 4.6 осталась прежней до порога в 200 тысяч токенов
Базовый тариф API сохранился на уровне Grok 4.5: $2 за миллион входных токенов и $6 за миллион выходных. При работе с большим контекстом появляется второй тарифный уровень. Как только длина входного запроса достигает 200 000 токенов, повышенная ставка применяется ко всему запросу.
| Режим API | Вход | Кэшированный вход | Выход |
| Контекст до 200 000 токенов | $2 / 1 млн | $0,50 / 1 млн | $6 / 1 млн |
| Контекст от 200 000 токенов | $4 / 1 млн | $1 / 1 млн | $12 / 1 млн |
У Grok 4.5 кэшированный вход стоил $0,30 за миллион токенов в коротком контексте и $0,60 в длинном. У Grok 4.6 эти значения выросли до $0,50 и $1 соответственно. Для агентных систем с повторным использованием одной и той же большой истории эта деталь может заметно менять итоговую стоимость, даже при неизменных базовых ставках на обычный вход и выход.
Artificial Analysis оценил среднюю стоимость одной задачи в своём наборе тестов в $0,84. По расчётам организации, Grok 4.6 при результате 61 балл оказался на границе Парето по соотношению качества и стоимости: среди моделей с сопоставимым уровнем интеллекта у него один из наиболее низких расходов на выполнение тестовой задачи.
API получил режим xhigh и сохранил контекст на 500 тысяч токенов
В документации Grok 4.6 указано окно контекста в 500 000 токенов и дата отсечения знаний 1 февраля 2026 года. Модель принимает текст и изображения, а результат формирует в виде текста. Для актуальных событий после даты отсечения API поддерживает веб-поиск и поиск по X.
Уровень рассуждений теперь можно задавать четырьмя режимами: low, medium, high и xhigh. Значением по умолчанию остаётся high. Grok 4.5 в июльской документации предлагал три уровня — low, medium и high, поэтому xhigh стал отдельным расширением новой версии.
Через API модель может использовать function calling, веб-поиск, поиск по X и выполнение кода. Она доступна через Responses API и Chat Completions. В документации SpaceXAI также указано отсутствие фиксированного текстового лимита на длину ответа со стороны самой модели.
На старте Grok 4.6 появился в Grok Build, Cursor и API SpaceXAI. Компания перечисляет среди партнёрских шлюзов OpenRouter, Vercel и Cloudflare. Для Cursor и Grok Build на первую неделю объявлен удвоенный включённый объём использования.
В релизе выросли возможности агентов, а архитектура модели остаётся закрытой
SpaceXAI связывает Grok 4.6 с более длительным обучением, новым набором SFT-траекторий и расширенными задачами reinforcement learning. Компания также заявляет о своей самой широкой на момент релиза серии проверок перед развёртыванием и о дополнительном тестировании после запуска, включая сторонние оценки. Подробных количественных результатов по безопасности в основном анонсе нет.
Число параметров Grok 4.6 и устройство архитектуры компания публично не раскрыла. Это оставляет без подтверждения ранние оценки размера модели, которые появлялись до релиза. Документация фиксирует те характеристики, с которыми уже можно работать: 500-тысячный контекст, текстовый и графический ввод, четыре уровня рассуждений, агентные инструменты и двухуровневую тарификацию.
Grok 4.6 прибавил 5 баллов в Artificial Analysis Intelligence Index и двузначные процентные пункты в отдельных агентных тестах, сохранив базовые ставки API. Теперь вопрос смещается к реальным длительным рабочим процессам: насколько результаты лабораторных тестов сохранятся в кодовых базах, исследованиях и многочасовых агентных сессиях за пределами контролируемых бенчмарков?