Grok 4.6 усилил длинные агентные задачи — модель сравнялась с GPT-5.6 Sol в Artificial Analysis

SpaceXAI выпустила Grok 4.6 12 августа 2026 года, через несколько недель после появления Grok 4.5. Модель получила более длительное дополнительное обучение и ориентирована на многошаговые агентные сценарии — исследование, работу с кодовой базой, анализ информации и создание приложений. В независимом Artificial Analysis Intelligence Index она набрала 61 балл, на 5 больше Grok 4.5 и на уровне GPT-5.6 Sol.

Grok 4.6 усилил длинные агентные задачи
Grok 4.6 усилил длинные агентные задачи

Grok 4.6 рассчитан на задачи, которые продолжаются десятки шагов

В официальном анонсе SpaceXAI делает акцент на способности Grok 4.6 удерживать сложную задачу на протяжении длинной последовательности действий. Такой сценарий отличается от обычного вопроса в чат: агент может сначала собрать информацию, затем изучить файлы проекта, написать код, проверить результат, исправить ошибки и продолжить работу после обратной связи.

Именно здесь компания видит основное развитие по сравнению с Grok 4.5. Внутренние тесты SpaceXAI показывают, что Grok 4.6 чаще проверяет собственную работу на длинных траекториях и способен за один проход собрать более цельный первый вариант визуального или интерактивного проекта. В качестве примеров компания приводит исследование незнакомой предметной области, проектирование структуры приложения, реализацию основных взаимодействий и последующие итерации.

Окно контекста при этом осталось прежним — 500 000 токенов. Его хватает для крупных наборов документов, длинной истории диалога или значительной части кодовой базы, хотя фактический объём помещающегося проекта зависит от языка программирования, формата данных и количества служебной информации в запросе.

Более длинное обучение Grok 4.6 сосредоточили на инженерных и агентных задачах

SpaceXAI раскрыла часть процесса подготовки модели. Grok 4.6 прошёл более длинный дополнительный этап обучения, чем Grok 4.5. В него вошли отобранные моделью синтетические данные для рассуждений и сложных технических концепций, инженерные данные высокого качества, обновлённый оптимизатор и изменённая схема обучения.

Следующий этап связан с SFT — supervised fine-tuning, то есть дообучением на примерах желаемого поведения. Для него Grok 4.5 использовали, чтобы заново сформировать траектории решения задач с разной глубиной рассуждений, разными агентными оболочками и предметными областями. В списке SpaceXAI фигурируют STEM, разработка программного обеспечения и knowledge work — работа с информацией, документами и аналитическими задачами.

После SFT модель обучали с подкреплением в агентных средах. Среди них компания прямо называет общие задачи программирования, оптимизацию вычислительных ядер, веб-разработку и CAD. Такая схема хорошо объясняет, почему в релизе так много внимания уделено автономной работе с инструментами и сохранению качества на длинной цепочке действий.

Artificial Analysis зафиксировал прирост на 5 баллов за одно поколение

Независимый Artificial Analysis оценил Grok 4.6 в 61 балл по своему Intelligence Index. Grok 4.5 набирал 56 баллов. GPT-5.6 Sol в той же системе получил 61 балл, Claude Fable 5 — 62, а Claude Opus 5 — 63.

Картина по отдельным тестам неоднородная, и именно она лучше показывает характер обновления. В опубликованной SpaceXAI таблице Grok 4.6 заметно прибавляет в агентных и инженерных задачах:

ТестGrok 4.6 HighGrok 4.5 HighИзменение
Artificial Analysis Intelligence Index6156+5
GDPVal-AA v217531526+227
CursorBench v3.269,9%66,7%+3,2 п.п.
DeepSWE v1.165,9%54,0%+11,9 п.п.
FrontierCode v1.1 Extended61,3%56,6%+4,7 п.п.
APEX-Agents57,5%47,1%+10,4 п.п.
AA-Briefcase15771313+264

В DeepSWE v1.1 модель всё ещё уступает GPT-5.6 Sol с 73% и Claude Fable 5 с 70%. В CursorBench v3.2 Grok 4.6 набирает 69,9%, почти вплотную подходя к 70,5% у Fable 5 и опережая 67,2% у GPT-5.6 Sol. В GDPVal-AA v2 результат Grok 4.6 достигает 1753 против 1728 у GPT-5.6 Sol и 1741 у Fable 5 в таблице SpaceXAI.

Artificial Analysis отдельно выделяет долгие агентные сценарии. В его закрытом тесте AA-Briefcase Grok 4.6 получил Elo 1577 и в среднем завершал задачу примерно за 53 шага. Для Claude Opus 5 Max аналитики приводят около 103 шагов. Такое различие влияет на расходы в длинных цепочках, поскольку каждый новый шаг снова использует часть накопленного контекста.

Цена Grok 4.6 осталась прежней до порога в 200 тысяч токенов

Базовый тариф API сохранился на уровне Grok 4.5: $2 за миллион входных токенов и $6 за миллион выходных. При работе с большим контекстом появляется второй тарифный уровень. Как только длина входного запроса достигает 200 000 токенов, повышенная ставка применяется ко всему запросу.

Режим APIВходКэшированный входВыход
Контекст до 200 000 токенов$2 / 1 млн$0,50 / 1 млн$6 / 1 млн
Контекст от 200 000 токенов$4 / 1 млн$1 / 1 млн$12 / 1 млн

У Grok 4.5 кэшированный вход стоил $0,30 за миллион токенов в коротком контексте и $0,60 в длинном. У Grok 4.6 эти значения выросли до $0,50 и $1 соответственно. Для агентных систем с повторным использованием одной и той же большой истории эта деталь может заметно менять итоговую стоимость, даже при неизменных базовых ставках на обычный вход и выход.

Artificial Analysis оценил среднюю стоимость одной задачи в своём наборе тестов в $0,84. По расчётам организации, Grok 4.6 при результате 61 балл оказался на границе Парето по соотношению качества и стоимости: среди моделей с сопоставимым уровнем интеллекта у него один из наиболее низких расходов на выполнение тестовой задачи.

API получил режим xhigh и сохранил контекст на 500 тысяч токенов

В документации Grok 4.6 указано окно контекста в 500 000 токенов и дата отсечения знаний 1 февраля 2026 года. Модель принимает текст и изображения, а результат формирует в виде текста. Для актуальных событий после даты отсечения API поддерживает веб-поиск и поиск по X.

Уровень рассуждений теперь можно задавать четырьмя режимами: low, medium, high и xhigh. Значением по умолчанию остаётся high. Grok 4.5 в июльской документации предлагал три уровня — low, medium и high, поэтому xhigh стал отдельным расширением новой версии.

Через API модель может использовать function calling, веб-поиск, поиск по X и выполнение кода. Она доступна через Responses API и Chat Completions. В документации SpaceXAI также указано отсутствие фиксированного текстового лимита на длину ответа со стороны самой модели.

На старте Grok 4.6 появился в Grok Build, Cursor и API SpaceXAI. Компания перечисляет среди партнёрских шлюзов OpenRouter, Vercel и Cloudflare. Для Cursor и Grok Build на первую неделю объявлен удвоенный включённый объём использования.

В релизе выросли возможности агентов, а архитектура модели остаётся закрытой

SpaceXAI связывает Grok 4.6 с более длительным обучением, новым набором SFT-траекторий и расширенными задачами reinforcement learning. Компания также заявляет о своей самой широкой на момент релиза серии проверок перед развёртыванием и о дополнительном тестировании после запуска, включая сторонние оценки. Подробных количественных результатов по безопасности в основном анонсе нет.

Число параметров Grok 4.6 и устройство архитектуры компания публично не раскрыла. Это оставляет без подтверждения ранние оценки размера модели, которые появлялись до релиза. Документация фиксирует те характеристики, с которыми уже можно работать: 500-тысячный контекст, текстовый и графический ввод, четыре уровня рассуждений, агентные инструменты и двухуровневую тарификацию.

Grok 4.6 прибавил 5 баллов в Artificial Analysis Intelligence Index и двузначные процентные пункты в отдельных агентных тестах, сохранив базовые ставки API. Теперь вопрос смещается к реальным длительным рабочим процессам: насколько результаты лабораторных тестов сохранятся в кодовых базах, исследованиях и многочасовых агентных сессиях за пределами контролируемых бенчмарков?

При использовании материалов сайта необходимо указывать ссылку на TGLand.ru. Если вы копируете фрагменты текста в интернете, прямая гиперссылка, доступная для индексации поисковыми системами, должна быть размещена в начале материала.

Вам также может понравиться