Бенчмарки нужны для того, чтобы инженер мог проверить свой проект, посмотреть на конкурентов и сравнить себя с ними. У каждого бенчмарка своя цель.

ARC‑AGI-3 создан фондом ARC Prize Foundation, основатель Франсуа Шолле, для оценки общего интеллекта и способности ИИ‑агентов к обучению. Сложные интерактивные задачи в виде игр подразумевали, что решить их сможет только тот искусственный интеллект, который умеет исследовать незнакомый мир, понимает правила на лету, планирует действия и адаптируется к новым условиям. То есть умеет обучаться.

Ряд проектов заявляют о показателе в этом бенчмарке в 100%. Но это не победа. В этой статье я разбираю почему.

Что такое ARC‑AGI-3

Бенчмарк ARC стартовал в 2019 году с задач на цветных сетках, когда модель должна была по двум примерам решить задачу. Шолле ориентировался на то, что для каждой задачи своё правило, и его нет в обучающих данных. То есть модель выводит его непосредственно в моменте. Сам Шолле сформулировал это как измерение эффективности приобретения навыка, а не самого навыка.

ARC‑AGI-1 продержался пять лет. Первые решения достигали единиц процентов. Потом использовали алгоритмы перебора, создается набор элементарных операций над сеткой и банальный поиск комбинации, подходящей под примеры.В какой‑то мере это работало, но из‑за комбинаторного взрыва не поддавалось масштабированию. Первых реальных успехов добились рассуждающие LLM, их показатель превысил 70%.

ARC‑AGI-2, как ответ, вышел в 2025 году, для решения задачи требовалось использовать несколько правил и удерживать контекст. Текущие LLM этого не смогли.

ARC‑AGI-3, последний на сегодня вариант, изменил формат задач. Задачи превратились в интерактивные игры в стиле Атари. Если в статической задаче агент соревновался в первую очередь за вычислительную мощность перебора, то в игре неизвестны правила, цель, и выявить их можно только в непосредственном действии. При этом оценивается количество действий..

Метрика RHAE ориентируется на два показателя: сколько уровней пройдено и сколько действий на это ушло. Эталоном служит усредненный человек, играющий впервые. Предполагалось, что если агент действительно выводит правила из наблюдений, он потратит мало действий. Если занимается перебором, то действий будет существенно больше. 

Как решают бенчмарк нейросети

По сути для нейросетей можно выделить три подхода:

Прямое взаимодействие. Игра отдаёт модели состояния игры, нейросеть выдаёт следующее действие. Нет обвязки, максимум рассуждение в контексте. показатели так себе, модель теряет нить, повторяет ошибки, галлюцинирует.

Обучение с подкреплением. Классический вариант для нейросетей, но само устройство бенчмарка не позволяет набрать нужный объём датасета.

Агентная обвязка. Модель работает в цикле с инструкцией, памятью, файловой системой и исполняемым кодом. Этот подход показал максимальный результат.

Хочу отметить, что бенчмарк, измеряющий способность к обучению, фактически проверяет качество инженерной обвязки вокруг нейросети.

Проект Сергея Родионова

Попробуем разобрать проект Сергея Родионова, PhD из SingularityNET, чистый пример третьего подхода. Я разбирал первый препринт, затем послушал доклад Сергея, со свежими результатами, а после посмотрел его вторую работу, где автор сам анализирует свой проект.

Очень грубо схема проекта: агент — это Codex с доступом к Linux‑окружению, файлам и питону. Алгоритмический контроллер отправляет агенту промпты, управляет циклом игры. Агент наблюдает состояние, строит гипотезу об устройстве мира, действует, проверяет результат, правит гипотезу.

В первом препринте было заявлено три идеи.

Исполняемая модель мира. Игровая задача бенчмарка максимально точно симулируется в питон‑программе.

Смещение к простоте. Агент периодически пытался заменить частные случаи общими правилами. То есть практический суррогат принципа минимальной длины описания.

Проверка воспроизведением. От модели требуется точное воспроизведение каждого записанного наблюдения. Не сходится — гипотеза отбрасывается.

Мои предварительные выводы после чтения первого препринта: правилам ARC-3 агент соответствует, духу — нет. Это именно связная конструкция инженера, когда проект заточен под бенчмарк. Работать такое будет только на простых, ограниченных искусственных мирах — потому что упирается в два барьера того же самого комбинаторного взрыва: написание кода для чуть более сложной задачи и поиск решения внутри симуляции. А самое главное, задачи продолжают решаться перебором — генерация идей, проверка. цикл начинается снова. Почему для бенчмарка это выглядит как достижение? Потому что в этом случае проверка гипотез вынесена наружу бенчмарка, её производит система LLM — питон‑симулятор. Это замечание я озвучил на докладе, на что получил вполне справедливый ответ — а кто, сказал, что тот же человек не решает перебором? Здесь я соглашусь, если отбросить романтику озарений, инсайтов и видений, то по большому счёту ни наука (что печально), ни философия (что ожидалось), не могут сказать по этому поводу ничего определённого.

Абляция

Непосредственно во время доклада Сергей Родионов меня достаточно неожиданно удивил. Оказывается, у него была вторая работу, исследующая вопрос, какая из трёх идей как влияет на результат. В ней он последовательно производил абляцию (отключал один из элементов своей системы) и оценивал как это в итоге влияет на результат бенчмарка.

Первый вывод: Каждый вариант улучшается при более сильной модели LLM и при большем объёме рассуждения.Прочие различия между вариантами меньше ожидаемых, а эффекты отдельных компонентов не выражены.

Фактически идея исполняемой модели мира не доказала свою полезность. Текстовый вариант (контекст LLM) обгоняет вариант с исполняемой моделью в обеих настройках старшей модели. На докладе Родионов подтвердил, что отдельная исполняемая модель не нужна, кодовому агенту достаточно контекста.

Питон‑симулятор, вынесенный в заголовок первой работы, проиграл простому текстовому рассуждению.

Полная верификация занимает первое место во всех четырёх настройках, хотя тратит существенно больше ресурсов. Упрощение помогает в трёх настройках из четырёх.

То есть выделенная модель мира оказалась LLM не нужна. Полезны генерация идей (LLM), их отбор, и сжатие описания (LLM).

И результат на лучшей модели около 99% RHAE. Что приводит меня к двум неприятным выводам: 

  1. Бенчмарк не ищет AGI, потому что иначе chatGPT уже и есть тот самый AGI. 

  2. Работы исследователей с этим бенчмарком на базе современных LLM исследовательски бессмысленны, и представляют собой инженерное тестирование флагманских моделей.

Впрочем, Сергей Родионов так конечно не считает. Как я понял из доклада организаторы бенчмарка отказались от официальной верификации его проекта, видимо, как и я, подразумевая размытое понятие духа AGI. Что вполне обоснованно раздражает многих инженеров. Если у бенчмарка есть объективные показатели, которые модель выполняет, значит модель должна участвовать в бенчмарке, если нет, то меняйте правила или закрывайте бенчмарк.

К сожалению, похоже пока авторы ARС‑AGI-3 не готовы ни к первому, ни к второму.

Почему LLM побеждают

Вывод, который сделал Сергей Родионов: кодовые агенты могут быть универсальными решателями для детерминированных, эффективно низкоразмерных сред. Вывод достаточно аккуратный и осторожный. И если так, то следовательно граница AGI должна смещаться к действию в условиях неопределённости и возможности сведения высокоразмерных миров к пригодным внутренним моделям.

Почему LLM успешны в низкоразмерных мирах? Я вижу две причины, первая вполне логичная, вторая более фундаментальная.

Первая причина: Игры ARC‑AGI-3 разрабатывает небольшая команда. Тогда как в обучающих данных LLM лежат десятилетия работы десятков тысяч геймдизайнеров: что в игре нельзя трогать, от чего надо убегать, что нужно подбирать, как обычно устроен уровень, где искать выход. Тысячи разнообразнейших паттернов.

Фактически модель переводит происходящее на экране в текст, ищет знакомые паттерны из игр, строит гипотезы и проверяет их. Комбинаторный взрыв снимается не поиском, а тем, что пространство гипотез уже сформировано извне..

Крайне сомнительно, что у авторов ARC‑AGI-3 фантазии больше, чем у людей, которые придумывают игры профессионально.

То есть природа успеха не вывод правил на месте, а узнавание выученного. LLM работает как интерактивная библиотека: не решает задачу, а находит в базе похожий паттерн и пробует его. Тот же перебор, но перебор умный. Что, надо сказать, само по себе достижение. Библиотеки такого масштаба и такой доступности раньше не было.

И вторая причина: Вспомните Канемана. Система 1 быстрое мышление, система 2 медленное. Так вот система 2 по определению не может работать с тем объемом данных, которое переваривает система 1. По факту, если мы будем подавать в систему 2 тот же объем данных, смысл в её существовании теряется. Именно поэтому пользы от модели мира на питоне у Сергея не было. Система 2 должна уметь работать с абстракциями, но как правильно абстрагировать внешний мир в детерминированной среде, никто толком не может сказать. А вот LLM делает легко и просто в силу своего устройства. Она описывает мир текстом, языком. Пиксель, при касании которого управляемый пиксель уничтожается, называется охотником. И у LLM идёт поток гипотез из выученных паттернов — убежать, спрятаться, найти оружие… Это не мышление в человеческом смысле, но в малоразмерных мирах, созданных людьми этого вполне достаточно.

То есть текстовое описание для LLM это и есть та нативная форма абстракции, которая необходима для системы 2. И именно поэтому, она работает лучше, чем абсолютно точная симуляция игры на питоне.

Что бенчмарк не может измерить

И тогда видна структурная проблема ARC‑AGI-3.

RHAE измеряет объективный результат — сколько уровней пройдено и за сколько действий. У бенчмарка нет доступа к способу, которым результат получен. Перебор и настоящее мышление неразличимы, когда оба дают одинаковый ответ на задачах бенчмарка.

Стоимость действия должна была это контролировать, то есть перебор дорог, а понимание дёшево. Но штраф считается за действия внутри игровой системы, а действия внутри симуляции не считаются. Агент может сколько угодно гонять гипотезы в питоне или в рассуждении, а потом отдать правильное решение. То есть размер, скорость и мощность выигрывают у понимания.

Это не лазейка, это прямое следствие того, что бенчмарк измеряет выход модели, а не устройство решения. Впрочем, другого решения предложить никто не может.

Основная проблема

Попробую объяснить, что я имею в виду под настоящим мышлением. Возьмем простую задачу и маленькую нейросеть.

Микросеть обучается определять, отсортирована ли последовательность чисел — скажем, длины от 3 до 10. Обучается прекрасно, точность единица, но если подать длину последовательности 14–20 ошибается. Не помогает ни индуктивность, ни введение второй микросети с другим диапазоном длин, ни увеличение сети вчетверо.

При введении дельты (разницы между соседними числами) — микросеть задачу выполняет и переносит решение на новую длину..

То есть решение существует, оно простое, содержится в данных, но сеть его не видит.

Причём это абсолютно логично. В мире сети, то есть в распределении обучающих данных, дельта всегда хуже: дороже в вычислениях, дороже в представлении, при том же результате. Сеть оптимизирует относительно данного распределения. Требование «работать на любой длине» предъявляю сети только я.

Я провел ряд экспериментов, обучение на сплошном диапазоне длин, проба, восстанавливающая дельту из скрытых состояний, измерение внимания на смещении в одну позицию. Результат: задача решается внутри базовых длин последовательностей, за их границей точность падает, дельта в представлении не появляется.

Сеть находит решение‑суррогат, работающий только на обучающих длинах.

Пробовались расширение распределения, давление на минимальность представления через информационное горлышко (bottleneck), вторая сеть с другим диапазоном длин и требование согласия представлений, и так далее. Все варианты работали только внутри контура обучения.

То есть, нейросеть не в состоянии изменить пространство переменных (добавить дельту), хотя её ввод позволил бы упростить (сократить описание) решения до минимума — дельта не меняет знак (здесь критерий становится локальным: если знак дельты не меняется по всей последовательности, она отсортирована. Проверка перестаёт зависеть от длины, каждая позиция проверяется сама по себе, а результат просто объединяется). Единственный способ это подать дельту снаружи, непосредственно как данные, либо через такое изменение архитектуры, где кроме дельты ничего появиться не сможет.

Причина

Бэкпроп оптимизирует функцию. Он принципиально не меняет пространство переменных: меняются координаты внутри параметризации, которую архитектура задала заранее — числом слоёв, механизмом внимания, тем, что позиция может и чего не может видеть.

Loss сравнивает поведение с критерием. Но в поиске нового представления критерий отсутствует. Loss не говорит и не может сказать, какие переменные надо ввести для решения задачи.

Чтобы достичь цели, нужно сделать пространство представлений само изменяемым объектом обучения. Но чем оценивать изменение самого пространства, если целевая функция уже задана?Бэкпроп на это не ответит. И есть подозрение, что все надстройки внутри сети, работающие в бэкпропе, соответственно помочь не смогут.

Если кто‑то сможет так организовать нейросеть, чтобы в задаче определения сортированности последовательности она выводила дельту или её аналог без прямой или косвенной подачи, то весь этот раздел я с радостью выкину.

И пока получается так:

LLM — поиск решения в заданном пространстве представлений. AGI — поиск такого пространства представлений, в котором решение становится достижимым.

А интеллект — способность находить такое представление данных, в котором целевое ожидание становится достижимым. 

Что может сработать

Если внутри системы ответа нет, остаётся вариант искать снаружи.

Можно пробовать: обучать не на фиксированном распределении, а на дрейфующем. Условия задачи меняются быстрее, чем успевает закрепиться решение под текущие. Суррогат ломается при каждом сдвиге, найденный инвариант не ломается. 

То есть критерий приходит из внешнего мира.

Впрочем, уверен, что ещё потребуется что‑то, что не будет бэкпропом.

Заключение

ARC‑AGI-3 по своему духу задумывался как бенчмарк понимания, а не автоматического перебора. По факту, сейчас он измеряет, насколько хорошо кодовый агент, вооружённый чужим опытом, справляется с детерминированным низкоразмерным миром.

Естественно, это не претензия к бенчмарку и не к тем, кто его решает. Сергей Родионов сделал прекрасную инженерную работу, не скрывал её слабых мест.

Претензия к самой идее измерять интеллект по результату. Бенчмарк не может разделить правило и суррогат, различие находится глубже, куда бенчмарк естественно не достаёт. Более того, вероятность придумать задачу, не основанную на паттернах, содержащихся в мировом датасете человеческих знаний, крайне низка. И LLM здесь в выигрышной позиции.

LLM это эффективная интерактивная библиотека, они умеют находить в накопленном то, что подходит к новой задаче, и делают это всё лучше. Но искать пространства, в котором решение становится простым, они не умеют.

А это возможно, иначе не было бы математики как науки. Комплексные числа, орбиты планет, теория множеств. Это всё следствие того, что человек изменил своё пространство представлений.

P. S. Возможно, поиск нового пространства можно организовать через LLM. Язык как связная конструкция может описать что угодно, в том числе и то, чего в данных не было, включая галлюцинации. Но не будет ли это очередной книгой из библиотеки, я пока сказать не могу.

Комментарии (0)