Gemini 4 Argon вышел с таблицей, где он лидирует в 12 тестах из 18. Ровно такую таблицу Google показывала в феврале — для Gemini 3.1 Pro. Тот потом проиграл Claude в реальной работе больше чем на 300 очков.
У релизов Gemini сложился сценарий, и Argon пока идёт по нему шаг в шаг. Дело при этом не только в Google: победа в бенчмарках сегодня значит всё меньше.
Сценарий в трёх актах
У каждого релиза Gemini последний год один сюжет.

Акт первый: Google публикует таблицу, где новая модель первая почти во всём. Акт второй: разработчики садятся с ней работать, и на форуме появляются треды вроде «Почему опытные пользователи тихо уходят от Gemini к Claude и ChatGPT». Акт третий: Google обещает, что следующая версия всё исправит.
Gemini 3 Pro осенью 2025-го собирал первые места в рейтингах. При этом, когда не знал ответа, выдумывал его в 88% случаев.
Gemini 3.1 Pro в феврале лидировал в 12 тестах из 18. А в задачах из реальных профессий отстал от Claude больше чем на 300 очков.
Gemini 3.5 Pro до первого акта не дожил: его сначала отложили, а потом и вовсе отменили. По оценке аналитиков, на обучение успели сжечь до $400 млн. За это время из Google ушли Джефф Дин, Джон Джампер и Ноам Шазир.
И, наконец, 30 сентября выходит Gemini 4 Argon. Лидер в 12 тестах из 18. Даже шаблон анонса менять не пришлось.
Акт первый: таблица
Таблица Argon честная: где её можно сверить с независимыми замерами, цифры совпадают. Врать Google не пришлось. Хватило умения выбирать.

Выбрать строки: проигрыши в таблице есть: в программировании Argon уступает Claude Opus 5.5 и GPT-6 Astra по 9–11 пунктов. В тексте анонса о них ни слова. А программирование — ровно то, из-за чего отменили Gemini 3.5 Pro.
Выбрать соперников: Claude Sonnet 5.5 вышел за два дня до анонса и в таблицу не попал. В программировании он Argon обходит.
Выбрать рейтинг: в независимом индексе Artificial Analysis новый король делит третье место за Claude Opus 5.5 и Sonnet 5.5. Зато в Vals Index он первый — с отрывом в пределах погрешности.
Выбрать единицу цены: за токен Argon в 2,5 раза дешевле GPT-6 Astra. Только токенов на задачу он тратит в 2,3 раза больше, и по полной цене задача у него выходит дороже. Дешевле Argon только на промо, срока которого не назвали.
Выбрать рекорд: миллион токенов в одном ответе Google называет лучшим лимитом в индустрии. Зачем он в обычной работе, Google не объяснили.
Акт второй начался досрочно
Обычно разочарование приходит через пару недель после релиза, от разработчиков. В этот раз оно пришло в день релиза, от сотрудников Google. По данным Bloomberg, модель слабо кодит и слабо делает фронтенд, а двое собеседников считают, что её натаскали на тесты. Google это отрицает.
Публичные замеры показывают то же. Когда приложения Argon проверяет робот, модель вторая из 106. Когда сайты сравнивают живые люди в WebDev Arena, она восьмая. Робот проверяет, нажимаются ли кнопки. Человек же выбирает, каким сайтом хочет пользоваться.
С офисными задачами та же история: проверочный чек-лист Argon закрывает лучше всех, а за оформление получает заметно меньше.
Выносить приговор при этом рано. В DeepSWE Argon первый, в Text Arena тоже, а доля выдуманных ответов упала с 88% до 15%. Это настоящий прогресс.
Натаскивание по публичным данным не доказать. Сильную модель Google сделала. Лучшей её сделала таблица.
Почему победа в бенчмарках говорит всё меньше
Беда шире Google, и причин три.
Тест стал целью. Когда первое место в тесте попадает в пресс-релиз, лаборатории начинают учить модель сдавать именно этот тест. Gemini 3 Pro и 3.1 Pro — результат в чистом виде: таблицы выиграны, работа проиграна.
Тестов слишком много. Из десятков тестов любая сильная модель соберёт таблицу побед. Поэтому Argon одновременно первый в Vals, третий у Artificial Analysis и восьмой в WebDev Arena. Какое место попадёт в анонс, решает маркетинг.
Лидеры упёрлись в потолок. На олимпиадных задачах по программированию у Argon и GPT-6 Astra по 100%. Тесты выгорают так быстро, что Vals с мая пять раз меняли состав своего индекса.

Победа в бенчмарках доказывает, что модель хорошо сдаёт бенчмарки. Чем лучше лаборатории учатся их сдавать, тем меньше эта победа говорит обо всём остальном.
Акт третий не написан
Попробовать Argon пока нельзя: доступ есть только у специалистов по кибербезопасности из программы Fairwind. Когда модель получат остальные, не сообщили.
Всё, что известно об Argon — тесты, которые выбрала Google, независимые замеры и слова анонимных сотрудников. Нет ни одного разработчика, который неделю писал с ним код.
Сценарий сломается, если через месяц после открытия доступа разработчики будут выбирать Argon. Тогда жалобы сотрудников придётся отнести к ранней версии, и Google впервые за год выиграет что-то кроме таблицы.
До тех пор к любому релизу стоит задавать три вопроса:
Где модель проигрывает в той же таблице и есть ли эти строки в тексте анонса?
Каких свежих конкурентов в таблице нет?
Сколько стоит решённая задача?
Первый акт Argon отыграл без единой ошибки. Остальные увидим, когда сможем его потыкать.
Разборы AI-релизов и рынка — в Telegram-канале @emedoedov.
Wesha
orekh
Теперь не только статья написана нейросетью, но и комментарии к ней.
medoedov Автор
Еще и прочитана нейросетями
Wesha
Нарисованы!