12 августа xAI (хотя уже SpaceXAI) выкатила Grok 4.6. Прошло чуть больше месяца с релиза 4.5, а модель уже официально «на фронтире» – по версии Artificial Analysis.

По совокупному индексу интеллекта модель почти сравнялась с GPT‑5.6 Sol и отстаёт от Claude Fable 5 всего на один балл. Grok 4.6 набирает на пять баллов больше, чем Grok 4.5, по индексу интеллекта всего через месяц после выхода предыдущей версии, и на 23 балла больше чем Grok 4.3.

Сегодня разберём, что именно изменилось в Grok 4.6, почему одни бенчмарки выросли на 10+ пунктов, а другие остались на месте, кто реально выиграл этот раунд, и – да – заденем скандальную репутацию xAI.

Что произошло

Официальный анонс описывает Grok 4.6 довольно скромно: модель развивает Grok 4.5 с прицелом на «долгоиграющих» агентов и более амбициозную интерактивную и визуальную работу. Она умеет держаться за сложную многошаговую задачу – исследовать тему, анализировать данные, работать по всей кодовой базе или превращать идею в готовое приложение.

Звучит как обычный питч, скажете вы, и будете правы!

Но за этими формулировками – конкретика: модель достигает уровня фронтира сразу по нескольким агентным бенчмаркам и кодингу, показывая результат вровень с GPT-5.6 Sol на композитном AA Intelligence Index – индексе, который считается по девяти разным замерам разом.

Кое-кто из команды xAI (rayhotate) заявил, что для команды это была лишь промежуточная веха в RSI-усилиях (recursive self-improvement – рекурсивное самоулучшение, если по-простому: модель, которая помогает делать следующую модель). Модель тренировали и тестировали на реальных инженерных задачах, ускоряющих разработку самой модели. И эти оптимизации уже пошли в продакшн.

Где модель прибавила

Artificial Analysis в своём разборе указывает, что Grok 4.6 набрал 61 балл по Intelligence Index – это ровно уровень GPT-5.6 Sol, чуть позади Claude Opus 5 (63) и Claude Fable 5 (62), и чуть впереди китайской Kimi K3.

При этом прирост относительно Grok 4.5 составил целых 5 баллов всего за месяц – а относительно ещё более старой Grok 4.3 разрыв достиг 23 баллов.

AA также отмечает, что стоимость выполнения задачи у Grok 4.6 составляет $0,84 (ровно как у Kimi K3, но с более высоким интеллектом), и это ставит модель на так называемую границу Парето по соотношению «интеллект/цена».

Grok 4.6 cost vs intelligence chart

Тут стоит на секунду остановиться и объяснить: граница Парето в этом контексте – это воображаемая линия на графике, за которую пока не может «зайти» ни одна другая модель: либо она умнее, но дороже, либо дешевле, но глупее.

По агентным задачам модель тоже показывает себя достойно: GDPval-AA v2 Elo на уровне 1753 – уступает только Claude Opus 5, но пересекается по доверительным интервалам с Claude Fable 5.

На банковском бенчмарке τ³-Banking результат 50,7% – второй по счёту, сразу за Qwen3.8 Max (51,3%). А на Terminal-Bench v2.1 – 88,4%, наравне с лидерами.

Отдельно любопытен пункт про turn-эффективность – модель умеет решать задачи за меньшее число ходов. В среднем Grok 4.6 закрывает задачу примерно за 53 хода и ~0,5 млрд входных токенов, а Claude Opus 5 (max) тратит на аналогичную работу около 103 ходов и ~2 млрд входных токенов. Разница почти в четыре раза.

Таблица: что изменилось между 4.5 и 4.6

Можно свести основные отличия в одну таблицу:

Параметр

Grok 4.5

Grok 4.6

Дата релиза

8 июля 2026

12 августа 2026

Контекст

500000 токенов

500000 токенов

Уровни рассуждений

low/medium/high

low/medium/high/xhigh

Цена (вход/выход)

2/6 за 1M токенов

2/6 за 1M токенов

AA Intelligence Index

56

61

DeepSWE 1.1

~53–54%

65,9%

CursorBench 3,2

66,7%

69,9%

Terminal-Bench (v2.1)

83,3%

88,4%

AA-Briefcase (Elo)

1313

1577

Размер модели

Илон Маск сообщил, что Grok 4.6 – это модель на 1.5 триллиона параметров, с существенно улучшенными SFT (supervised fine-tuning, т. е. контролируемое дообучение) и RL (reinforcement learning, обучение с подкреплением). Буквально через несколько недель должна выйти Grok 4.7 – модель уже на 2.1 трлн, которая, по словам Маска, будет лучше 4.6 буквально во всём, кроме скорости – чуть медленнее, зато токен-эффективнее.

Занятно, что в анонсе Grok 4.6 сравнивали именно с GPT-5.6 Sol и Claude Fable 5, а это модели, предположительно, размером 5 триллионов параметров и выше. Но почему-то не сравнивали с Opus или Sonnet, хотя те ближе по классу цены. Получается асимметрия: xAI выбрала в конкуренты моделей покрупнее и подороже – видимо, чтобы подчеркнуть эффективность «на грамм параметров».

Нам нужно поговорить о происхождении данных

К вопросу дистилляции.

В обсуждениях постоянно всплывает мысль: не является ли Grok просто «настроенной» версией китайской Kimi K3 или ещё какого-нибудь открытого веса. Сам Маск, что характерно, фактически признавал, что «в целом все AI-компании занимаются дистилляцией» – фраза настолько нейтральная, что интерпретировать можно как угодно.

Но есть и более убедительная версия происхождения супермощности модели: покупка Cursor. Тот самый популярный AI-редактор кода теперь принадлежит SpaceXAI, и, вероятно, именно доступ к гигантскому массиву реальных юзерских данных программирования (а не какая-то магическая дистилляция) и объясняет резкий скачок качества в кодинге.

Кстати, о Cursor: в агентном CAD-проектировании среди всех моделей Grok 4.6 показывает лучшее соотношение цены к интеллекту:

Тесты в 3D-моделировании

В одном из тестов моделям (Grok 4.6 High vs Opus 5 High vs Fable 5 High vs GPT 5.6 Sol High) дали задание построить (на основе библиотеки Three.js) 3D-модель вертолёта Airbus H145:

Что ж, ближе всего получилось у Fable 5 и как раз Grok 4.6. Детали теста неизвестны, но, похоже, модели рисовали «по памяти».

Ещё один заезд – на этот раз Gemini 3.7 Flash High/Claude Opus 5 High/Grok 4.6 High/Qwen 3.8 27B с часовым механизмом-вертолётом (детализированная 3D clockwork-модель):

Gemini 3.7 Flash сделала это быстрее всех – за минуту (оправдывая своё имя). Qwen3.8 27B неожиданно показал результат, сопоставимый с гигантами.

Бенчмарки от xAI и Arena

В оригинальном анонсе имеются бенчмарки, где Grok 4.6 сравнивается по девяти категориям агентной и кодинговой работы.

В разделе про безопасность xAI говорит о расширенных safety-механизмах, откалиброванных под возросшие возможности модели, включая «самый широкий на сегодня набор тестов перед деплоем» – по капабилити и по калибровке защитных механизмов.

Сразу же по горячим следам выяснилось, что системный промпт модели, добавляемый ко всем запросам через API, оказался довольно… лаконичным. Пользователь опубликовал утечку промпта, где модели предписывается «не помогать пользователям, явно занимающимся преступной деятельностью», «не писать эксплойты», а также содержится строка о недопустимости определенного контента.

Насколько такой короткий текстовый промпт вообще может служить полноценной защитой? Можно сравнить с попыткой «уговорить» инструмент вместо инженерного решения проблемы. Сорее похоже на алхимию, чем на инженерию.

Arena сообщила, что в Code Arena: WebDev релиз сразу занял #7 место с 1618 очками, тогда как Grok 4.5 держался на #13 с 1553 очками – то есть модель одним скачком поднялась на шесть строчек и почти сравнялась с GPT-5.6 Sol xHigh (1622) и Claude Fable 5 (1627). Разрыв между тройкой составляет всего 4-9 очков.

Доступность

С точки зрения доступности всё стандартно:

  • Grok 4.6 доступна в Cursor,

  • в собственном агентном инструменте компании – Grok Build,

  • а также через GPTunneL.

На первую неделю после релиза xAI включила двойной лимит использования внутри Grok Build и Cursor. Многие признались, что именно этот бонус подтолкнул их протестировать модель.

Кодинг-агенты

  • Один из авторов, тестировавший модель на React- и Java-проектах, отметил, что модель стала заметно лучше понимать крупные кодовые базы, лучше следует инструкциям и меньше вносит лишних правок «от себя». При этом он всё равно предпочитает держать отдельную подписку на GPT Sol – по его словам, тот стабильнее на по-настоящему сложных задачах. Впрочем, это не всегда оптимально – модель Sol на максимальном режиме рассуждений имеет «маниакальное желание перепроверять всё», из-за чего застревает в циклах «внести правку → перепроверить с саб-агентами → найти проблему → исправить → перепроверить снова». Это знакомо, наверное, каждому, кто работал с коллегой-перфекционистом.

  • Другой автор, тоже сравнивавший модель с GPT Sol, назвал Grok 4.6 «абсолютной находкой прямо сейчас» – по интеллекту и цене.

Reddit discussion screenshot on Grok 4.6 pricing debate
Reddit discussion screenshot on Grok 4.6 pricing debate
  • И снова – мнения по соотношению цены/качества значительно разделились. Выяснилось, что по бенчмарку DeepSWE Grok-4.6 на максимальных рассуждениях набирает 67 баллов и стоит $5,50 за задачу, хотя GPT-5.6 Luna Max набирает те же 67 баллов, но всего за $0,61; при этом DeepSeek V4 Pro показывает чуть более скромные 63 балла, но обходится всего в 6-10 центов – и это, по мнению исследователя, уже настоящая «выгодная сделка».

12 августа Grok 4.6 стала доступна в GitHub Copilot. И вот здесь вопросы возникли совсем не про качество кода. Часть сообщества принципиально отказалась использовать модель, ссылаясь на прошлые скандалы вокруг платформы X, включая широко обсуждавшуюся историю с генерацией неприемлемого контента. Что касается технической стороны – отмечают, что консольный интерфейс Grok Build оказался неожиданно хорош.

Бенчмарк здравоохранения и юридической аналитики

Через неделю после релиза Маск выдвинул мнение, что Grok 4.6 заняла первое место на MedAgentBench – бенчмарке для оценки агентных задач в медицине с реальными сценариями:

«Grok 4.6 только что заняла #1 место на MedAgentBench – одном из самых интересных бенчмарков для реальных агентных задач в здравоохранении, и у Grok теперь два поколения моделей в топ-3: #1 Grok 4.6 (~95,9%), #2 GPT-5.6 Sol (~94,7%), #3 Grok 4.5 (~93,4%)».

Похожая история – с юридической аналитикой. Аккаунт XFreeze привёл цифры по агентной работе с регуляторными и административными юридическими исследованиями в США:

  • Grok 4.6 набирает 62,12% при цене $1,52 за тест,

  • тогда как GPT-5.6 Sol показывает результат чуть хуже – 60,61%, но при этом стоит почти в 13 раз дороже – $19.69 за тест.

  • Claude Opus 5 действительно оказывается точнее – 65,15%, – но здесь ценник в четыре раза выше Grok.

И снова про цену

Отдельно стоит остановиться на прямом сравнении с GPT-5.6 Sol, которое Маск повторял несколько раз за последние недели.

Grok 4.6 vs GPT-5.6 Sol pricing chart
Grok 4.6 vs GPT-5.6 Sol pricing chart

По его словам, обе модели набирают одинаковые 61 балл на Artificial Analysis, но при этом:

Провайдер

Вход ($/1M токенов)

Выход ($/1M токенов)

GPT-5.6 Sol

$5

$30

Grok 4.6

$2

$6

То есть по входным токенам Grok дешевле в 2,5 раза, а по выходным – в целых 5 раз.

Что дальше

Что интересно, вся эта картина – уже устаревшая новость на момент, когда вы это читаете.

Маск ещё в конце июля заявил, что Grok 4.5 и Opus 5 «одни на границе Парето», и сразу же пообещал: Grok 4.6 через две недели, Grok 4.7 – через четыре. И позже подтвердил, что Grok 4.7 «значительно лучше 4.6» и должна быть готова через 3–4 недели после релиза 4.6:

«Начальное обучение завершено, и сейчас мы добавляем огромный массив корпоративных данных SpaceX в дополнительное обучение. Это будет нечто особенное».

Что примечательно – упоминание именно корпоративных данных SpaceX. Это вызвало понятное любопытство: какие именно данные ракетной компании могут пригодиться языковой модели? Скорее всего, речь об инженерных данных (расчётах, симуляциях, оптимизации сложных технических систем), что логично укладывается в упомянутый фокус на R&D enablement (усиление возможностей для собственных инженерных исследований и разработок).

И снова всплывает уже знакомая ирония: мы вновь получили очередной инкрементальный шаг с обещанием, что настоящий скачок – уже совсем скоро, буквально за углом. Линия горизонта каждый раз отодвигается ровно на «три-четыре недели».

Подытоживая

Grok 4.6 действительно закрывает разрыв, который ещё год назад казался пропастью. xAI больше не выглядит «третьим лишним» рядом с OpenAI и Anthropic – команда ворвалась в тройку лидеров, во многом благодаря купленному Cursor и его данным, а также агрессивной ценовой политике, которая делает модель практически незаменимой там, где важен баланс между качеством и стоимостью.

Следующие несколько недель (до анонса Grok 4.7 на 2.1 трлн параметров) покажут, была ли «пятибалльная» прибавка случайным всплеском или же началом устойчивой траектории роста.

Комментарии (2)


  1. Dhwtj
    21.08.2026 14:30

    По агентным задачам модель тоже показывает себя достойно: GDPval-AA

    Я бы не очень доверял этим тестам. Этот агентный но вовсе не про программирование: найти документы/источники, накидать саммари. Программистских тестов кот наплакал. SWE вообще теперь умеют все кому не лень. Я уже не знаю на что ориентироваться

    И вообще, судя по статистике arena.ai программирование в запросах к LLM составляет 10-15%


  1. Fenogik
    21.08.2026 14:30

    Я без тестов и только по по собственным ощущениям, могу сказать - Cursor по сравнению с Opus тупее в кодинге. Грок уже отчитывается "Можно в продакшн", а Клауд делает ревью и выкатывает 10 замечаний, которые требуют допилинга (5 из них правда обычно не существенные).