Gemini 4 Argon вышел с таблицей, где он лидирует в 12 тестах из 18. Ровно такую таблицу Google показывала в феврале — для Gemini 3.1 Pro. Тот потом проиграл Claude в реальной работе больше чем на 300 очков.

У релизов Gemini сложился сценарий, и Argon пока идёт по нему шаг в шаг. Дело при этом не только в Google: победа в бенчмарках сегодня значит всё меньше.

Сценарий в трёх актах

У каждого релиза Gemini последний год один сюжет.

Акт первый: Google публикует таблицу, где новая модель первая почти во всём. Акт второй: разработчики садятся с ней работать, и на форуме появляются треды вроде «Почему опытные пользователи тихо уходят от Gemini к Claude и ChatGPT». Акт третий: Google обещает, что следующая версия всё исправит.

Gemini 3 Pro осенью 2025-го собирал первые места в рейтингах. При этом, когда не знал ответа, выдумывал его в 88% случаев.

Gemini 3.1 Pro в феврале лидировал в 12 тестах из 18. А в задачах из реальных профессий отстал от Claude больше чем на 300 очков.

Gemini 3.5 Pro до первого акта не дожил: его сначала отложили, а потом и вовсе отменили. По оценке аналитиков, на обучение успели сжечь до $400 млн. За это время из Google ушли Джефф Дин, Джон Джампер и Ноам Шазир.

И, наконец, 30 сентября выходит Gemini 4 Argon. Лидер в 12 тестах из 18. Даже шаблон анонса менять не пришлось.

Акт первый: таблица

Таблица Argon честная: где её можно сверить с независимыми замерами, цифры совпадают. Врать Google не пришлось. Хватило умения выбирать.

Выбрать строки: проигрыши в таблице есть: в программировании Argon уступает Claude Opus 5.5 и GPT-6 Astra по 9–11 пунктов. В тексте анонса о них ни слова. А программирование — ровно то, из-за чего отменили Gemini 3.5 Pro.

Выбрать соперников: Claude Sonnet 5.5 вышел за два дня до анонса и в таблицу не попал. В программировании он Argon обходит.

Выбрать рейтинг: в независимом индексе Artificial Analysis новый король делит третье место за Claude Opus 5.5 и Sonnet 5.5. Зато в Vals Index он первый — с отрывом в пределах погрешности.

Выбрать единицу цены: за токен Argon в 2,5 раза дешевле GPT-6 Astra. Только токенов на задачу он тратит в 2,3 раза больше, и по полной цене задача у него выходит дороже. Дешевле Argon только на промо, срока которого не назвали.

Выбрать рекорд: миллион токенов в одном ответе Google называет лучшим лимитом в индустрии. Зачем он в обычной работе, Google не объяснили.

Акт второй начался досрочно

Обычно разочарование приходит через пару недель после релиза, от разработчиков. В этот раз оно пришло в день релиза, от сотрудников Google. По данным Bloomberg, модель слабо кодит и слабо делает фронтенд, а двое собеседников считают, что её натаскали на тесты. Google это отрицает.

Публичные замеры показывают то же. Когда приложения Argon проверяет робот, модель вторая из 106. Когда сайты сравнивают живые люди в WebDev Arena, она восьмая. Робот проверяет, нажимаются ли кнопки. Человек же выбирает, каким сайтом хочет пользоваться.

С офисными задачами та же история: проверочный чек-лист Argon закрывает лучше всех, а за оформление получает заметно меньше.

Выносить приговор при этом рано. В DeepSWE Argon первый, в Text Arena тоже, а доля выдуманных ответов упала с 88% до 15%. Это настоящий прогресс.

Натаскивание по публичным данным не доказать. Сильную модель Google сделала. Лучшей её сделала таблица.

Почему победа в бенчмарках говорит всё меньше

Беда шире Google, и причин три.

  1. Тест стал целью. Когда первое место в тесте попадает в пресс-релиз, лаборатории начинают учить модель сдавать именно этот тест. Gemini 3 Pro и 3.1 Pro — результат в чистом виде: таблицы выиграны, работа проиграна.

  2. Тестов слишком много. Из десятков тестов любая сильная модель соберёт таблицу побед. Поэтому Argon одновременно первый в Vals, третий у Artificial Analysis и восьмой в WebDev Arena. Какое место попадёт в анонс, решает маркетинг.

  3. Лидеры упёрлись в потолок. На олимпиадных задачах по программированию у Argon и GPT-6 Astra по 100%. Тесты выгорают так быстро, что Vals с мая пять раз меняли состав своего индекса.

Победа в бенчмарках доказывает, что модель хорошо сдаёт бенчмарки. Чем лучше лаборатории учатся их сдавать, тем меньше эта победа говорит обо всём остальном.

Акт третий не написан

Попробовать Argon пока нельзя: доступ есть только у специалистов по кибербезопасности из программы Fairwind. Когда модель получат остальные, не сообщили.

Всё, что известно об Argon — тесты, которые выбрала Google, независимые замеры и слова анонимных сотрудников. Нет ни одного разработчика, который неделю писал с ним код.

Сценарий сломается, если через месяц после открытия доступа разработчики будут выбирать Argon. Тогда жалобы сотрудников придётся отнести к ранней версии, и Google впервые за год выиграет что-то кроме таблицы.

До тех пор к любому релизу стоит задавать три вопроса:

  1. Где модель проигрывает в той же таблице и есть ли эти строки в тексте анонса?

  2. Каких свежих конкурентов в таблице нет?

  3. Сколько стоит решённая задача?

Первый акт Argon отыграл без единой ошибки. Остальные увидим, когда сможем его потыкать.


Разборы AI-релизов и рынка — в Telegram-канале @emedoedov.

Комментарии (5)


  1. Wesha
    02.10.2026 23:42


    1. orekh
      02.10.2026 23:42

      Теперь не только статья написана нейросетью, но и комментарии к ней.


      1. medoedov Автор
        02.10.2026 23:42

        Еще и прочитана нейросетями


      1. Wesha
        02.10.2026 23:42

        Теперь не только статья написана нейросетью, но и комментарии к ней.

        Нарисованы!


  1. Worst_su
    02.10.2026 23:42

    Главное - что бы gemma хорошая потом получилась из неё