За последний год в мире больших языковых моделей произошел заметный сдвиг. Если раньше основным предметом соревнования были знания модели — насколько хорошо она отвечает на вопросы (общие или специальные), знает факты или пишет код, — то со временем фокус сместился на способность рассуждать.

Практически каждый крупный релиз последних месяцев позиционируется как reasoning-модель. Производители говорят уже не столько о знаниях, сколько о способности строить длинные цепочки рассуждений, решать сложные задачи и принимать решения в условиях неопределенности.

Но вместе с этим возникает закономерный вопрос: а как объективно измерять reasoning?

Почему именно математика?

На первый взгляд кажется, что рассуждения можно проверять практически в любой задаче. Однако на практике большинство открытых лидербордов используют именно математические бенчмарки.

Причина довольно проста. Хороший тест на reasoning должен обладать сразу несколькими свойствами:

  • требовать последовательных рассуждений, а не воспроизведения информации;

  • иметь объективно проверяемый правильный ответ;

  • позволять сравнивать модели между собой воспроизводимым способом;

  • содержать задачи разного уровня сложности.

Именно поэтому математические задачи сегодня стали одним из наиболее надежных прокси для оценки reasoning-моделей.

При этом важно понимать, что reasoning — это не только математика. Но именно математические задачи традиционно позволяют наиболее объективно измерять способность модели строить цепочку рассуждений без необходимости привлекать человека-эксперта для проверки каждого ответа.

А что с русским языком?

Для английского языка уже существует множество математических лидербордов и специализированных наборов данных (AIME, OlymMATH, Math, GSM8K, MiniF2F и другие).

Для русского языка подобных открытых площадок пока значительно меньше. В результате сравнить современные reasoning-модели между собой в едином воспроизводимом окружении оказывается непросто.

Чтобы закрыть этот пробел, мы запускаем публичный лидерборд MERA TEXT, посвященный оценке reasoning-моделей на русском языке.

Это первая часть большого обновления текстовой MERA и своего рода превью следующего релиза платформы, который мы планируем выпустить уже этим летом.

Что входит в лидерборд?

Оценить способность к рассуждению одним датасетом невозможно. Где-то модель должна выполнять длинные вычисления, где-то — искать нестандартную идею, где-то — удерживать десятки промежуточных шагов, а где-то — правильно интерпретировать сложное условие.

Именно поэтому лидерборд объединяет сразу четыре различных набора задач.

Luzitania

Что это?

Luzitania — набор математических задач повышенной сложности, выросший из регламента Kaggle-соревнования AIMO3. В этом соревновании участникам нужно было решить 50 задач уровня международных математических олимпиад за 5 часов, используя одну GPU H100.

Лучший результат в соревновании показала модель GPT-OSS-120B в агентском режиме, то есть с возможностью генерировать и выполнять Python-код. Именно прогоны этой модели мы использовали для оценки сложности задач. Кроме того, из AIMO3 мы переняли жёсткое требование к проверяемости ответа: все ответы в этом подмножестве являются целыми числами.

При отборе задач мы стремились к тому, чтобы они как можно меньше были «засвечены» в ИИ-датасетах и при этом представляли значительную трудность для современных открытых моделей.

Источники

Основу набора составляют задачи с олимпиад высокого уровня — примерно между Всероссийской олимпиадой и IMO. Мы отдавали предпочтение задачам, изначально опубликованным не на английском языке: например, из Румынской олимпиады, Китайской олимпиады для девочек и других национальных и региональных соревнований. Отдельно в набор вошли 30 задач из материалов Турнира городов разных лет.

Также мы добавили задачи из датасетов MathArena и MathArxiv по продвинутой абстрактной математике, выходящей за рамки школьной олимпиадной программы. Эти задачи помогают проверить, переносится ли навык математического рассуждения за пределы привычного олимпиадного формата. Они также полезны для сравнения разных чекпойнтов одной модели: например, можно увидеть, не потеряла ли модель способность к абстрактному математическому мышлению в процессе натаскивания на олимпиадные задачи.

Все задачи были переведены на русский язык и частично переформулированы, чтобы снизить вероятность воспроизведения решений, заученных на этапе предобучения.

В датасет вошли только задачи, прошедшие фильтрацию по трудности. Мы использовали следующее правило: задача должна решаться GPT-OSS-120B не чаще чем в половине случаев при настройках reasoning_effort: high, max_length=65536; при этом правильное решение должно занимать не менее 10 тысяч токенов, включая токены кода. Для каждой задачи мы запускали по 4 попытки в агентском режиме, с использованием Python-инструмента, и по 4 попытки в обычном режиме.

После такой фильтрации осталось 251 задача.

Что проверяет

Luzitania проверяет:

  • способность строить длинные цепочки рассуждений;

  • умение выбирать стратегию решения;

  • устойчивость модели при большом количестве промежуточных шагов;

  • способность использовать инструменты там, где они действительно помогают, и не полагаться на них механически.

Пример

Пусть (n) — натуральное число. Дана доска размером (n \times n), причём единичная клетка в левом верхнем углу изначально окрашена в чёрный цвет, а остальные клетки — в белый. Затем мы применяем к доске серию операций окрашивания. В каждой операции мы выбираем квадрат (2 \times 2), в котором ровно одна клетка окрашена в чёрный цвет, и окрашиваем оставшиеся три клетки этого квадрата (2 \times 2) в чёрный цвет.

Для скольких натуральных чисел (n \leq 4000) мы можем окрасить всю доску в чёрный цвет?

Или:

Последовательность задана условиями (a_1 = 2025) и для всех (n \geq 2)

[
a_n = \frac{a_{n-1}+1}{n}.
]

Определите наименьшее (k), такое что

[
a_k < \frac{1}{2025}.
]

Почему это интересно

Задачи отбирались так, чтобы оставаться трудными даже для моделей, специально обученных математическому рассуждению. В набор попадали задачи, которые решаются нестабильно и требуют по-настоящему длинных выкладок. Даже возможность использовать код помогает моделям далеко не во всех случаях: часто основная трудность заключается не в вычислениях, а в выборе правильной идеи и удержании длинной цепочки рассуждений.

Отдельная ценность набора — подмножество относительно свежих олимпиадных задач, опубликованных после апреля 2025 года. Они с меньшей вероятностью могли попасть в обучающие данные и помогают отличить настоящее рассуждение от воспроизведения заученного решения.

Создатели

Lomonosov Research Institute

TMath

Что это?

TMath представляет собой широкий набор математических задач различной сложности — от школьной программы до более сложных разделов математики.

Набор охватывает алгебру, геометрию, анализ, комбинаторику и другие области.

Что проверяет

  • базовое математическое reasoning;

  • универсальность модели;

  • стабильность качества на разных типах задач.

Пример
В коробке лежат карточки, занумерованные натуральными числами от 1 до 2006. На карточке с номером 2006 лежит карточка с номером 2005, и так далее до 1. За ход разрешается взять одну верхнюю карточку (из любой коробки) и переложить её либо на дно пустой коробки, либо на карточку с номером на единицу больше. Сколько пустых коробок нужно, чтобы переложить все карточки в другую коробку?

Почему это интересно

Бенчмарк создан так, чтобы оставлять разрешающую способность для сильных reasoning моделей. Задачи взяты из двух самых престижных российских школьных олимпиад - Всероссийской олимпиады школьников и Московской олимпиады за период с 1998 по 2025 год. Это олимпиадный уровень сложности с сильным уклоном в комбинаторику, теорию чисел и геометрию — те области, где грубый перебор или прямые вычисления не приводят к ответу, а требуется найти правильную идею и удержать длинную цепочку рассуждений. Медианная длина цепочек рассуждений у Qwen3-32B -  около 16К токенов.

Статистическая устойчивость. 310 задач — это крупнейший русскоязычный матбенч олимпиадного уровня, и, что важнее, он на порядок больше, чем 30-задачный англоязычный  AIME.

Фильтрация. Ради простой и надежной верификации ответа мы исключили задачи, требующие изображения на вход, допускающие несколько корректных решений или имеющие свободный ответ. Кроме того, мы отфильтровали лёгкие задачи, благодаря чему бенчмарк остается актуальным даже для фронтирных моделей.

Создатели

T-bank

MMReD

Что это?

MMReD — синтетический бенчмарк на рассуждение в условиях плотного контекста (dense-context reasoning). Плотным будем называть контекст (с задачей), требующий multi-hop рассуждения по всем предъявленным атомарным фактам. По устройству это прямой антипод классического теста «иголка в стоге сена» (needle-in-a-haystack, NIAH), где правильный ответ локализован в небольшом числе релевантных токенов среди миллионов нерелевантных и вся сложность — в поиске (так устроены, например, сам NIAH и BABILong). В MMReD значим каждый токен: искать нечего — нужно честно обработать всю последовательность.

Задача выглядит так. Дана последовательность из десятков шагов — описание синтетической среды, в которой персонажи перемещаются между комнатами; на каждом шаге в формате JSON зафиксирован полный снимок состояния: кто из персонажей в какой комнате сейчас находится. Вопрос требует не локализовать отдельный факт, а собрать ответ по всей траектории — например, кто провёл больше всего времени в одиночестве или в какой комнате конкретный персонаж пробыл дольше всего. Чтобы ответить, модель должна удержать и корректно проагрегировать все промежуточные состояния: ошибка или пропуск на любом шаге искажает финальный подсчёт.

Данные полностью синтетические и сгенерированы процедурно. Это даёт идеальную эталонную разметку, исключает утечку в обучающие корпуса и позволяет плавно регулировать сложность, наращивая число наблюдений среды. Всего в подмножество для MERA входят пять типов вопросов, по трём длинам каждый.

Что проверяет

  • агрегацию информации по всему контексту, а не извлечение единичного факта;

  • базовый арифметический счёт самой моделью, без вызова внешних инструментов;

  • устойчивость на длинном контексте — удержание десятков промежуточных состояний;

  • логическую согласованность рассуждения: один неверный промежуточный вывод «протекает» в итоговый ответ.

Пример

Условие (сокращённая последовательность из двух шагов):

{"step_id": 1, "rooms": {"Кухня": ["Сандра", "Мария"], "Ванная": ["Иван", "Михаил"], "Сад": [], "Офис": [], "Спальня": ["Даниил"], "Коридор": []}}

{"step_id": 2, "rooms": {"Кухня": ["Сандра"], "Ванная": [], "Сад": ["Даниил"], "Офис": ["Иван", "Мария"], "Спальня": ["Михаил"], "Коридор": []}}

Вопрос: Кто провёл больше всего времени в одиночестве?

Ответ: Даниил
(На шаге 1 в одиночестве только Даниил; на шаге 2 в одиночестве уже трое — Сандра, Даниил и Михаил. Суммарно Даниил провёл один в комнате оба шага — больше всех.)

Настоящие примеры в бенчмарке содержат не два шага, а 32, 64 или 128, так что подобный подсчёт приходится вести по всей длинной траектории.

Почему это интересно

Самое любопытное в MMReD — не то, что задача объективно трудна, а то, как именно современные модели её решают.

Современные reasoning-модели фактически насыщают бенчмарк с точностью 70+ в MCQ на 5 или 6 вариантов ответа — персонажей или комнат, надёжно воспроизводя человеческий паттерн решения на каждом типе вопросов. Но у этого есть цена — и в ней ключевое отличие от NIAH: модель материализует рассуждение, и объём этих токенов линейно растёт с длиной последовательности с довольно большой константой. На самой длинной версии из 128 шагов входной контекст почти фиксирован: медиана составляет ≈8.7 тыс. токенов при максимуме ≈8.8 тыс. Медиана рассуждения при этом ≈20 тыс. токенов, то есть примерно в 2–3 раза больше входа. В отдельных предельных случаях разрыв становится уже на порядок больше: полная генерация может доходить до ≈156 тыс. токенов, когда модель начинает многократно перепроверять собственные выкладки или зацикливаться. Если же рассуждение выключить — заставить модель ответить сразу, без промежуточных шагов, или оборвать его до финального ответа, — качество проваливается почти до уровня случайного угадывания.

Именно это различие между двумя режимами и есть главный результат: он противопоставляет MMReD парадигме NIAH (реализованной, например, в Michelangelo с задачей Latent List и в BABILong) и роднит её с GraphWalks, где модель тоже вынуждена материализовать обход большого графа. По сути это классический multi-hop reasoning (многошаговый вывод), доведённый до предела плотности: если в привычных multi-hop-задачах модель связывает несколько разрозненных фактов, разбросанных по контексту, то в MMReD переходов столько же, сколько наблюдений в последовательности, и пропустить нельзя ни один — поэтому задача остаётся многошаговой, но перестаёт быть задачей поиска.

Разрыв между режимами показывает, что MMReD измеряет не «знание», а вышеупомянутую способность материализовать рассуждение. Модель решает задачу не в одном латентном проходе, а буквально пошагово переигрывает траекторию в явных токенах — ход за ходом отслеживая, кто где находится, и накапливая нужные счётчики. Плотный контекст не оставляет лазейки: здесь нельзя отфильтровать лишнее и вытащить готовый ответ, как в типичных сценариях NIAH, — нужно пройти всю последовательность токенов целиком. Поэтому высокие результаты на MMReD достигаются только моделями с достаточно большим reasoning-бюджетом, которые разворачивают последовательное вычисление во внешних токенах и доводят его до правильного ответа — причём даже в таком режиме не всегда стабильно. Тот же GraphWalks, например, долгое время оставался непокорённым для больших контекстов до 1M токенов и всегда акцентируется в релизах компании Anthropic. Задачи, которые ещё год назад были недоступны моделям без reasoning, сегодня решаются — но лишь ценой длинных явных вычислений.

Создатели

AIRI. Датасет представлен в статье MMReD (Kurkin et al., ICLR 2026, OpenReview); авторы: Куркин*, Широких*, Абдуллаева, Чекалина, Кузнецов.

ruAIME

Что это?

ruAIME — русскоязычный набор олимпиадных математических задач, основанный на формате AIME — American Invitational Mathematics Examination. В датасет вошли задачи американского математического соревнования за период с 1983 по 2025 год. В отличие от задач, которые решаются прямым применением известной формулы или алгоритма, ruAIME требует от модели самостоятельного поиска идеи решения. Здесь важно не просто выполнить вычисления, а увидеть скрытую структуру задачи, провести несколько преобразований и прийти к точному числовому ответу. Набор охватывает ключевые разделы математики: алгебру, геометрию, комбинаторику, теорию чисел, вероятность, статистику и другие области. В лидерборде ruAIME оценивается по метрике Exact Match: модель должна выдать правильный финальный ответ, без частичного зачёта за ход рассуждений. 

Что проверяет

  • олимпиадное математическое мышление;

  • умение находить нестандартную стратегию решения;

  • многошаговую дедукцию;

  • алгебраические преобразования;

  • распознавание закономерностей;

  • способность модели доводить рассуждение до точного числового ответа.

Типичный пример

Задачи ruAIME обычно выглядят компактно, но требуют нетривиального хода.

Например:

Пусть a и b — натуральные числа, для которых 1/a + 1/b = 1/12.

Сколько существует упорядоченных пар (a, b), удовлетворяющих этому условию?

На первый взгляд задача выглядит как простое уравнение, но для решения нужно заметить преобразование:

(a - 12)(b - 12) = 144.

После этого задача сводится к подсчету делителей. Такой формат хорошо показывает, умеет ли модель не просто считать, а находить правильную математическую идею.

Почему это интересно

ruAIME важен как компактный, но достаточно жёсткий тест на математическое reasoning. Условия задач обычно короткие, поэтому модель не может «списать» сложность на длинный контекст или поиск нужного фрагмента в тексте. Основная нагрузка ложится именно на рассуждение. Большой размер набора — 724 задачи — делает оценку более устойчивой, чем у небольших олимпиадных бенчмарков. Это особенно важно для сравнения сильных reasoning-моделей: отдельная удачная или неудачная задача меньше влияет на итоговый результат, а лидерборд лучше отражает реальную стабильность модели. Отдельная ценность ruAIME в том, что он адаптирует международный математический формат под русскоязычную оценку. Это помогает сравнивать модели не только по общему знанию математики, но и по тому, насколько хорошо они работают с олимпиадными задачами именно на русском языке. 

Создатели

Владислав Савенков, Антон Габов, Doubletapp.

Что можно увидеть на лидерборде?

Мы публикуем не просто итоговый рейтинг моделей. Лидерборд позволяет сравнить результаты по каждому из четырех наборов данных, увидеть сильные и слабые стороны моделей и отслеживать появление новых релизов в едином воспроизводимом окружении.

Публичный лидерборд— это открытая система, в которой любой желающий может:

  • воспроизвести опубликованные результаты;

  • протестировать собственную модель;

  • сравнить ее с уже опубликованными моделями;

  • использовать единый пайплайн оценки без необходимости самостоятельно собирать инфраструктуру.

Наша цель — сделать сравнение reasoning-моделей на русском языке прозрачным, воспроизводимым и доступным для исследователей, разработчиков и компаний.

Репозиторий: https://github.com/MERA-Evaluation/MERA/tree/v2_dev

Инструкцию по запуску замера и отправке сабмита: https://github.com/MERA-Evaluation/MERA/tree/v2_dev#mera-open-reasoning-leaderboard

Лидерборд: https://huggingface.co/spaces/MERA-evaluation/MERA_Reason

Рис. 1. Главная страница
Рис. 1. Главная страница
Рис. 2. Описания датасетов
Рис. 2. Описания датасетов
3. Описание лидерборда и процедуры отправки сабмита
3. Описание лидерборда и процедуры отправки сабмита
Рис. 4. Загрузка сабмита
Рис. 4. Загрузка сабмита
Рис. 5. Топ 12 лидерборда
Рис. 5. Топ 12 лидерборда

Это только начало

Этот проект стал возможен благодаря совместной работе участников Альянса в сфере искусственного интеллекта. Партнеры и члены Альянса внесли вклад в создание и развитие наборов задач, которые легли в основу лидерборда, а MERA объединила их в единую открытую инфраструктуру оценки.

Публичный лидерборд — лишь первая часть следующего большого обновления MERA. Мы не рассматриваем MERA как фиксированный набор задач. Наоборот, одна из целей нового публичного лидерборда — сделать его площадкой, которая сможет постепенно расширяться вместе с исследовательским сообществом. Поэтому мы открываем возможность добавления новых наборов задач.

Если вы разрабатываете собственный математический или reasoning-бенчмарк для русского языка, вы сможете интегрировать его в публичный лидерборд и сравнить модели в единой системе оценки. Мы надеемся, что такой подход позволит постепенно сформировать открытую экосистему русскоязычных reasoning-бенчмарков, где новые наборы данных не существуют изолированно, а становятся частью общей воспроизводимой инфраструктуры оценки.

В новом релизе на сайте MERA мы существенно расширим как публичную, так и приватную часть платформы: появятся новые наборы данных, новые направления оценки и новые инструменты для анализа современных моделей.

Следите за обновлениями — совсем скоро расскажем о следующем этапе развития MERA ;)

Комментарии (1)


  1. Ka463
    24.07.2026 08:38

    Посмотрел ваш лидерборд, не увидел в каком режиме использовались модели для бенча, чистая или в агентском режиме ?
    Считаю это важным, так как к примеру по моим тестам, в агентском режиме у меня Gemma-4 12b на тесте ARC-AGI-1 решает 8/10 сложных задач, когда чистая модель показывает 0/10