Эта статья — перевод оригинальной статьи «Introducing Grok 4.6».

Также я веду телеграм канал «Frontend по‑флотски», где рассказываю про интересные вещи из мира разработки интерфейсов и AI.

Вступление

Сегодня мы выпускаем Grok 4.6. Новая версия развивает возможности Grok 4.5, уделяя особое внимание долго работающим агентам, а также более сложным интерактивным и визуальным задачам.

Grok 4.6 лучше справляется с комплексными задачами, требующими множества последовательных шагов: от исследования темы и анализа информации до работы с большой кодовой базой и превращения идеи в полноценное, отполированное приложение или готовый рабочий материал.

Grok 4.6 демонстрирует передовой уровень возможностей в ряде бенчмарков, оценивающих агентное программирование и интеллектуальные рабочие задачи. В Artificial Analysis Intelligence Index — сводном рейтинге, объединяющем результаты девяти бенчмарков, модель показывает результат на уровне GPT-5.6 Sol.

AA Intelligence
GDPVal-AA
DeepSWE 1.1
CursorBench 3.2
FrontierCode 1.1

Grok 4.6 уже доступен в Cursor и Grok Build. В течение первой недели мы удваиваем включённый объём использования Grok 4.6 в Grok Build и Cursor, чтобы вы могли сразу начать тестировать новую версию.

Обучение Grok 4.6

Grok 4.6 прошёл более длительный этап дополнительного обучения, чем Grok 4.5. Для него использовались тщательно отобранные данные, сгенерированные моделями, в том числе для развития рассуждений и понимания сложных технических концепций, а также высококачественные инженерные данные, улучшенный оптимизатор и обновлённая методика обучения. Всё это позволило создать более прочную основу для последующих этапов SFT и RL.

Затем мы использовали Grok 4.5, чтобы заново сгенерировать SFT-траектории для различных уровней сложности рассуждений, агентных окружений и таких областей, как STEM, разработка ПО и интеллектуальная работа. Проблемные цепочки при этом отфильтровывались с помощью автоматических проверок на базе моделей. Полученный после SFT чекпоинт показал высокую производительность и более качественное поведение модели.

Grok 4.6 также обучался с помощью reinforcement learning на широком наборе агентных задач: от интеллектуальной работы и программирования общего назначения до специализированных сред, связанных с оптимизацией ядер, веб-разработкой, системами автоматизированного проектирования (CAD) и другими областями.

От амбициозной идеи к работающему проекту

Мы протестировали Grok 4.6 на проектах, специально подобранных так, чтобы проверить широту его возможностей и способность последовательно работать над задачей на протяжении большого количества шагов. Особенно хорошо модель показала себя в превращении общей продуктовой идеи в первую рабочую версию. Она может самостоятельно изучить незнакомую предметную область, продумать структуру приложения, реализовать ключевые сценарии взаимодействия, а затем продолжать улучшать результат в несколько итераций с учётом обратной связи.

На более длинных последовательностях работы мы также стали чаще замечать элементы самопроверки и верификации: прежде чем двигаться дальше, модель проверяет результаты собственной работы.

В визуальных и интерактивных проектах Grok 4.6 уже с первой попытки выдаёт более качественный результат, чем мы обычно наблюдали у Grok 4.5. Получив конкретную продуктовую идею, модель способна за один проход сформировать как структуру приложения, так и его визуальный язык. Это делает её особенно полезной в проектах, где быстрее всего прийти к хорошему результату можно, сразу начав с достаточно полноценной версии, а затем последовательно улучшая её в процессе итераций.

Безопасность и возможности

Механизмы защиты Grok 4.6 были улучшены и откалиброваны с учётом возросших возможностей модели.

Наша система безопасности спроектирована так, чтобы максимально сочетать полезность и защищённость в легитимных сценариях использования. Благодаря этому Grok 4.6 может эффективно и безопасно применяться, например, для устранения уязвимостей, ускорения инженерного проектирования и поддержки исследований в области ИИ.

Подход к оценке безопасности также был расширен в соответствии с новыми возможностями Grok 4.6. Перед выпуском модель прошла самый широкий набор тестов за всю нашу историю, как на сами возможности, так и на корректность настройки защитных механизмов. После запуска мы также проводим масштабное дополнительное тестирование, включая проверки со стороны независимых третьих сторон.

Оценка качества

Benchmark

Grok 4.6 High

Grok 4.5 High

GPT-5.6 Sol Max

Fable 5 Max

AA Intelligence Index

61

56

61

62

GDPVal-AA v2

1753

1526

1728

1741

CursorBench v3.2

69.9%

66.7%

67.2%

70.5%

DeepSWE v1.1

65.9%

54%

73%

70%

FrontierCode v1.1 (Extended)

61.3%

56.6%

60.6%

63.6%

APEX-Agents

57.5%

47.1%

56.7%

59.2%

Terminal-Bench v3.0

26%

15.7%

34.6%

34.1%

APEX-SWE

56.4%

53.6%

58.8%

AA-Briefcase

1577

1313

1502

1574

Harvey LAB (Vals)

15.8%

12.9%

2.5%

11.3%

Начало работы с Grok 4.6

Grok 4.6 уже доступен в Cursor и Grok Build. Модель также можно использовать через API, а также на платформах партнёров, включая OpenRouter, Vercel и Cloudflare.

Стоимость начинается от $2 за миллион входных токенов и $6 за миллион выходных токенов. Кроме того, доступна ускоренная версия модели, которая стоит в два раза дороже.

В течение первой недели мы удваиваем включённый объём использования Grok 4.6 в Grok Build и Cursor, чтобы вы могли сразу начать знакомство с новой версией.

Комментарии (7)


  1. maxnoosphere
    12.08.2026 18:32

    самопроверка это интересная фишка но вопрос в том насколько модель действительно проверяет себя а не просто генерирует более уверенный текст, и работает ли это за пределами кодовых задач где можно запустить тесты?


  1. yuriiyudin
    12.08.2026 18:32


  1. Dhwtj
    12.08.2026 18:32

    Как был grok x.ai на 4-5 местах в агентском программировании так и остаётся где-то рядом с qwen z.ai, с переменным успехом обгоняя Gemini

    Первые 3 места крепко держат Claude, GPT и выскочка Kimi

    Хотя тут неплохие независимые оценки

    https://artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis

    Ну, посмотрим что остальные рейтинги скажут, не все вышли ещё


  1. Andchir
    12.08.2026 18:32

    https://andchir.github.io/llm_coding_test/results_2026-08-08_site/index.html
    https://andchir.github.io/llm_coding_test/results_2026-08-08_dino/index.html

    По моим тестам GLM-5.2 всех побивает по соотношению цена/качество. У Grok'a прогресса вообще не видно.


    1. OrEsHeK124
      12.08.2026 18:32

      Интересное сравнение, но если упор идет на ожидание готового результата по промпту из примерно 10 слов, то как-будто бы таких нейронок нет и, по-моему скромному мнению, таковых не появится в ближайшие годы. Любой готовый продукт требует внимательного анализа со всех сторон для удобной дальнейшей поддержки и модернизации, а не лишь бы красиво выглядело, а что там под капотом - упустим из виду (это подходит больше к генераторам изображений/видео). Все-таки раз уж мы рассматриваем такого рода проекты, то будет резонно сравнивать их подход в коде, а не в готовом результате по очень скромным по описанию промптам. Иначе какая разница, если на средней паршивости проект вы потратите условные 5 долларов вместо 20, но с каждым не самым крупным обновлением та же самая нейронка будет переписывать львиную долю кода, тратя при этом все больше и больше ресурсов, т.к. фундамент на любое изменение так и норовит расколоться:)


      1. Andchir
        12.08.2026 18:32

        Там ещё есть системный промпт.

        но если упор идет на ожидание готового результата по промпту из примерно 10 слов, то как-будто бы таких нейронок нет и, по-моему скромному мнению, таковых не появится в ближайшие годы

        Как это нет? Вы даже не смотрели результаты, а уже напечатали такой большой комментарий. И да, я не претендую на универсальный тест, здесь нейронке даётся творческая свобода.


      1. Andchir
        12.08.2026 18:32

        то будет резонно сравнивать их подход в коде, а не в готовом результате по очень скромным по описанию промптам

        Тут тоже классно. Будем смотреть на код и не важно нам, что в игру невозможно играть, главное, что код красивый :)