Привет, друзья! Меня зовут Сабрина!

Одним из двигателей моей любви к моделям, к исследованиям и ко всему, чем я сейчас занимаюсь, является математика. Математические структуры удивительны — открыли ли мы математику или создали — слишком сложный вопрос. Я верю, что открыли и мне очень нравится наблюдать, как математика возникает в моделях.

Так появилось это исследование и так появилась карта. И именно по ней я постараюсь провести вас в этой статье :)

Ссылка

Задача, которую я поставила на входе «Оценить насколько воспроизводима и эквивалента в LM‑моделях математика», где:

Воспроизводимость

Эквивалентность

Результат описан в несколькихN: N \geq 2 статьях

Результат появляется на разных модальностях данных

Результат описан несколькимиN: N \geq 2исследовательскими группами

Результат появляется в разных семействах моделей

Результат появляется в разных классах архитектур моделей

Посмотрим, что из этого получилось.

Заглавная страница, https://ai-math-map.vercel.app
Заглавная страница, https://ai‑math‑map.vercel.app

Критерий попадания в карту

Про то, что структуры возникают в моделях сами по себе — линейные направления, окружности, симплексы, многообразия — написано правда безумно много сотни статей. Однако, математическую структуру описывают не все, так что, чтобы понять карту, как объект, давайте зафиксируем, что я не брала, что брала и как.

Направления, симплекс, многообразия, окружность — определения

Линейное направление.
Определение: единичный векторr_f \in \mathbb{R}^dтакой, что проекцияr_f \cdot x монотонно отражает значение признакаf в контексте, породившем активацию $x$.

Интуиция: числовая ось внутри модели. Двигаясь дальше вдоль этой оси, получаешь «больше» признака, и неважно, где точка находится по остальнымd-1 координатам. В карте: 288 статей, самый плотный узел. 

Окружность.
Определение:S^1 = \{(x,y) : x^2+y^2=1\}, параметризованная углом\theta по модулю2\pi; вложена вd‑мерное пространство как(a\cos\theta,\, a\sin\theta) вдоль выбранной ортонормированной парынаправлений, остальные $d-2$ координаты свободны.

Интуиция: циферблат. Одна переменная наматывается на одну петлю, и, пройдя достаточно далеко в одну сторону, возвращаешься в начало. Для циклического понятия близость надо мерить вдоль петли, а не по прямой сквозь середину. В карте: 33 статьи.

Многообразие.
Определение: топологическое пространствоM размерностиn, у каждой точки которого есть окрестность, гомеоморфная открытому шару в $\mathbb{R}^n$. Пара «окрестность + гомеоморфизм» — карта (chart), набор карт, покрывающий $M$, — атлас.

Интуиция: Земля (классика). Локально вокруг любой точки она выглядит плоской — план города и есть карта, — но глобально это сфера, и ни один плоский лист не покроет её без разрывов и искажений. Многообразие — ровно этот компромисс между локально плоским и глобально изогнутым.

Зачем это в работах про модели: пространство активаций — это\mathbb{R}^d, но активации, которые сеть реально порождает, не обязаны его заполнять. Они могут концентрироваться на многообразииM \subset \mathbb{R}^d гораздо меньшей размерности. Окружность, сфера, тор, аффинное подпространство — всё это многообразия, различающиеся кривизной и топологией. В карте: 33 узла.

Симплекс.
Определение: для категориального понятия с k взаимоисключающими значениями и векторным представлением каждого значения их выпуклая оболочка генерически (то есть в общем случае, за исключением пограничных случаев) образует (k-1)‑мерный симплекс. Вид:

\mathrm{conv}\{\bar\ell_{w_0}, \ldots, \bar\ell_{w_{k-1}}\} = \Big\{\sum_i c_i \bar\ell_{w_i} : c_i \geq 0,\ \sum_i c_i = 1\Big\}

Интуиция: это треугольник для трёх значений, тетраэдр для четырёх. Бинарный признак («это про еду или нет»)кодируется одним направлением; категориальный («млекопитающее / птица / рептилия / рыба») одним направлением не обойдётся — нужна отдельная точка с величиной на каждое значение, чтобы разности между значениями оставались осмысленными. Вершины — чистые значения, точки внутри — их смеси. Симплекс не является многообразием — у него углы и край.

1. Объект — обученная модель. Брались только статьи, вносящие утверждения об активациях, весах или градиентах модели, которую реально обучили. Любая модальность, любая архитектура, любой масштаб. Аналитические модели (не то, что мы считаем AI) и синтетические облака точек объектом не считаются.

2. Claim — конкретная математическая структура. В статье всегда описаны форма, оператор, порядок или измеримое структурное свойство представления — то, что называется на языке математики и в принципе фальсифицируемо (то есть можно доказать, что оно есть или что его нет). Оценка на бенчмарке, дельта точности или ранжирование «какой концепт закодирован сильнее» структурой не являются и они не брались.

3. Доказательство — оригинальное измерение или вмешательство в самой статье. Пересказ чужого измерения не делает статью записью карты — он делает её контекстом.

Типы доказательств

(a) Измерение формы. Количественное измерение геометрической формы или свойства на активациях или весах реальной обученной модели. Например: окружность для дней недели; симплекс состояний убеждений; размерность линейного концептного подпространства.

(b) Причинное вмешательство, привязанное к геометрии. Вмешательство, объектов которого является геометрический объект, дающее измеримое поведенческое или репрезентационное изменение. Например: стиринг вдоль направления; абляция подпространства; проектор, применённый на слое; rank‑one правка весов.

© Структурная характеризация. Измеренная структурная, спектральная или динамическая характеристика, которая не сводится к одной статичной форме и не является причинной. Например: спектры ковариации эмбеддингов; профили внутренней размерности и кривизны по глубине; геометрия разбиения входного пространства; нейронный и размерностный коллапс; латентные метрики и геодезические; как геометрия меняется в ходе обучения; сходимость независимо обученных моделей.

Типы доказательств — классические. Карта НЕ исключает других способов доказать.

4. Нашлось И не навязалось. Если геометрия навязана архитектурой или функцией потерь, наблюдение отклоняется. Круг, который получился потому, что его закодировали синусами и косинусами, — не наблюдение в смысле карты.

На этих четырех правилах в корпус собралось к концу августа: 700 статей, 703 наблюдений, 52 структуры, 14 гипотез (итого 66 единиц тут в статье), 816 моделей. Они отобраны из 1047 просмотренных кандидатов. Все кандидаты проходились так, что читалась вся статья. Получился красивый граф! В нём существует порядок.

Основной граф карты, https://ai-math-map.vercel.app/map
Основной граф карты, https://ai‑math‑map.vercel.app/map
Что есть что.
Что есть что.

Ортогональная классификация

Каждый математический объект в карте классифицирован на две оси — роль (type, 11 значений) — и набор фасетов, которые узел получает независимо от роли.

Роль — ответ на вопрос чем объект является в математическом смысле. Она всегда одна, обязательна, назначается упорядоченным списком вопросов. Она здесь также первичная ось: по ней карта делится на непересекающиеся части.

Фасет — ответ на вопрос какой объект. Фасетов в карте не ограниченное количество.

Роли карты таковы:

Роль

Описание

geometric-object

геометрический объект в ℝᵈ (носитель / подмножество / вложенное множество / направление)

configuration

упорядоченный кортеж из нескольких точек

operator

отображение или матрица, действующая на облако

metric-model

метрика, полунорма или выученная модель расстояния

distribution-property

неконтролируемое свойство распределения

labeled-data-property

свойство размеченных множеств

measurement

вычисленная величина или профиль

dynamical-object

объект, определённый относительно динамической системы

combinatorial-object

порядок, решётка, граф, матроид, комплекс

empirical-pattern

наблюдённая организация данных в конкретной модели

hypothesis

фальсифицируемое общее утверждение

Фасеты — это характеристики: кривизна, топология, гладкость, линейность, размерность, объемлющее пространство, способ задания, выпуклость, гомологии, вид объекта, проходит ли через ноль.

Чтобы это всё не сваливалось в кучу, объекты идут по классификации по упорядоченному списку вопросов. Порядок вопросов важен.

  1. Это фальсифицируемое утверждение, постулирующее объект? → hypothesis

  2. Определено динамической системой и свойствами устойчивости? → dynamical-object

  3. Порядок / решётка / граф / матроид / комплекс? → combinatorial-object

  4. Отношение между кортежем точек? → configuration

  5. Отображение или матрица, действующая на облако? → operator

  6. Вычисленное свойство, а не форма? → по источнику: из меток → labeled-data-property, свойство распределения → distribution-property, вычисленная величина → measurement, наблюдённая организация → empirical-pattern

  7. Иначе это просто множество точек → geometric-object + фасеты

Порядок снимает наложения.

Примеры наложений

Линейный аттрактор — и одномерное многообразие, и аттрактор. Формально: у рекуррентной сети с правилом обновленияh_{t+1}=F(h_t,x_t) неподвижные точки при нулевом входе выстраиваются вдоль почти одномерной кривой. Поперёк неё они притягивающие, а вдоль — нейтральные: старшее собственное число якобиана\lambda_1 \approx 1, то есть возмущение вдоль кривой не затухает и не растёт.

Интуиция: шарик в длинном пологом жёлобе. Толкнёшь поперёк — скатится обратно; толкнёшь вдоль — идет куда толкнули. Это и есть память на непрерывную величину: сеть копит текущую сумму — скажем, перевес позитивных свидетельств над негативными — не забывая её и не улетая в бесконечность.

Концептор — и оператор, и эллипсоид. Формально: по облаку активаций X с корреляционной матрицейR = X^\top X / n и апертурой\alpha строитсяC = R(R + \alpha^{-2}I)^{-1} — положительно полуопределённая матрица0⪯C⪯I.

Интуиция: фейдеры (плавная смена состояний) вместо тумблеров (резкий преключатель). Проекция на подпространство — это набор тумблеров: направление либо сохраняется целиком, либо обнуляется, собственные числа ровно 0 или 1. Концептор приглушает каждое направление тем сильнее, чем меньше у концепта дисперсии вдоль него. Апертура — как параметр: выкрутить вниз — отфильтровано всё, выкрутить вверх — получается обычная проекция. Объект здесь — отображение, а эллипсоид{x : x^\top C^{\dagger} x \le 1} всего лишь его линия уровня.

Концептная решётка — и решётка, и набор конусов. Формально: атрибутуm отвечает направлениеd_m, а концепту, заданному набором атрибутовY, — областьmathcal R(Y) = \{v : v \cdot d_m \ge 0 для всехm \in Y\}, то есть полиэдральный конус. Упорядоченные по вложению, эти области образуют полную решётку: у любой пары концептов есть точная нижняя грань (объединить атрибуты) и точная верхняя (наименьшее общее обобщение).

Интуиция: Каждый атрибут разрезает пространство полуплоскостью; концепт — клин, где выполнены все его атрибуты, и каждый новый атрибут этот клин сужает. Но, в отличие от дерева, у любых двух веток есть и обобщение, и общее пересечение.

Роли получаются взаимно исключающими именно благодаря порядку.

Нюансы
  1. Отдельно пришлось поставить запрет на добавление: geometric-object без различающего фасета. Если про множество установлено только «это какое‑то многообразие», это не взято как объект.

  2. Структура в терминах — это математическая форма: роль плюс фасеты. Направление, подпространство, аффинная функция, конус, тор, открытое одномерное многообразие, иерархия. Таких узлов в карте на начальный выпуск в конце августа 65.

  3. Наблюдение — это конкретное измерение: структура × модель × метод × статья. Наблюдение отвечает на вопрос «что за структура И кто, в чём и чем её померил». Поэтому наблюдений 703, а форм 65: одна и та же форма может быть измерена много раз, разными людьми, в разных моделях.

    Отсюда:

    • Когда статьи согласны о форме, но расходятся о причине или расширяют её на новый домен — это одна запись структуры, напримерrippled-1d-continum.Одно наблюдение, две статьи.

    • Когда статьи делают конкурирующие утверждения о форме данные разделены. refusal-single-directionrefusal-affine-function и refusal-concept-cone — три отдельных наблюдения (направления отказов разных типов) со ссылкой на одну структуру.

  4. Полностью ортогональной схемы не вышло и, наверное, не выйдет. Например, из 65 узлов роль есть у всех — это единственное поле со стопроцентным покрытием. А вот единичные фасеты — нет, так как свойства паттерны и гипотезы не имеют дполнительных структурых характеристик.

Что если классификацию убрать и сделать просто ключевые слова?

Пробовала. Вышла мешанина, 2275 ключевых слова. Тоже симпатично, но нет.

Почему именно такой вид?

В моделях, как в саду — растет всякой разное. Например, линейное подпространство является многообразием — разделы не параллельны, один вложен в другой.

Конус и политоп, наоборот, многообразиями не являются: у конуса особая точка в вершине, у политопа углы. А анизотропия и линейная разделимость — вообще не формы: первое свойство распределения, второе свойство размеченного множества, и ни то, ни другое не живёт в разделе «какая это фигура».

Поэтому пришлось пытаться ортогонализовывать и соглашаться на нюансы.

Что трекается по статьям

Основное.

Во‑первых, я собираю структуры, а во‑вторых — методы, которыми эти структуры были извлечены. Отсюда карта не только красивая, но и полезная — можно искать новые для себя методы.

Карточки методов, https://ai-math-map.vercel.app/methods
Карточки методов, https://ai‑math‑map.vercel.app/methods

Для методов, как и объектов, можно оценить не только факт существования, но и популярность в виде простых визуализаций по группам методов.

Популярность методов по статьям, https://ai-math-map.vercel.app/landscape
Популярность методов по статьям, https://ai‑math‑map.vercel.app/landscape

Деталь 1. Реплицируемость.

Карта состоит из гипотез и наблюдений (если убрать глубину по фасетам и структурам). Но каждая из них может быть воспроизведена и нет. Это вычисляется по карте, благодаря, опять же, классификации. Здесь две категории:

  • breadth — по оси набралось два и больше различных значения. Скажем, структуру видели на двух классах архитектур.

  • replication — те же два значения пришли из статей, не имеющих общих авторов.

Проверка независимости идет фамилиям, отсюда есть погрешность и ошибка, когда идёт, идёт в сторону «независимость не доказана».

Репликация из 66 всего возможных. Подробнее про карту на страничке Why https://ai-math-map.vercel.app/why
Репликация из 66 всего возможных. Подробнее про карту на страничке Why https://ai‑math‑map.vercel.app/why

Деталь 2. Контекст о найденном объекте.

Вид модальность данных x структура, https://ai-math-map.vercel.app/map
Вид модальность данных x структура, https://ai‑math‑map.vercel.app/map

Для объектов трекается класс архитектуры модели, домен данных, семейство/семейства моделей, где объект найден. На самом деле их легко достать из данных благодаря собираемой инфы по каждой статье. Это тоже все можно фильтровать и анализировать на странице главного графа.

Фильтры расположены слева. Справа отображается документация и мини‑контекст по узлам.

Как этим пользоваться и какие вопросы можно задать?

Предварительный анализ данных

Конечно, помимо сносочки выше, карта анализируема и чем она будет больше, тем больше вопросов и ответов она породит. Что есть сейчас:

  1. Частота использования методов имеет длинный хвост. В карте 249 методов, причем 158 методов использованы только в какой‑то одной статье. Методов, имеющих большой вес всего 8:

метод

статей

causal‑interventions

154

linear‑probing

144

pca

89

steering

77

geometric‑analysis

72

diff‑in‑means

64

sparse‑autoencoders

46

activation‑patching

41

Грубо говоря, мы работаем в анализе внутренностей восемью инструментами и периодически изобретаем тот‑самый‑девятый. Это не орошо и не плохо, но забавно.

2. 35 узлов из 66 — держатся только на одной статье. Среди всех структур отсюда реплицировать хоть как‑то удалось только 31.

ось

breadth

replication

статьи без общих авторов

31

классы архитектур

38 (статьи, как правило, дают несколько архитектур)

29

домены

33

28

семейства моделей

48 (статьи, как правило, дают также несколько семейств)

30

3. Из 816 моделей в карте 477 — языковые (58%), 216 — зрение, 39 — аудио, 30 — управление, 30 — алгоритмические задачи, дальше белки, молекулы, настольные игры, музыка. По архитектурам: 331 модель — трансформер‑декодер, 117 — трансформер‑энкодер, 57 — CNN, 55 — диффузия, 42 — RNN.

Скошена карта или скошена область в этих статистиках пока открытый вопрос — сейчас в ней наблюдения с перекосом на 2026 год, и все другие я ещё добираю.

Планы и ограничения проекта

  1. Перекос по годам. 65% корпуса — 2025–2026. Проход до 2020-го не сделан целиком (пока, но я в процессе).

  2. arXiv‑монокультура. 96% статей — препринты (в планах добавить venue или просто масштабировать корпус на иные источники). Я не определила.

  3. Ссылки на код есть у 87 статей из 700 — 12%. Воспроизводимость в инженерном смысле в корпусе (пока) не отслеживается.

  4. Human‑verification. Я делала вычитку 100 примеров глазами, когда отлаживала свой оркестр агентов, но меня одной — мало. В планах набор команды и оценка людьми.

Раз я сказала про агентов, тут детали про них.

1. Pipeline

Задача основных агентов живет в осуществлении 6 шагов:

Discovery → Paper → Verification → Observation → Nodes → Replication
  1. Discovery. Проход по arXiv, OpenAlex и ACL Anthology, разметка кандидатов по критериям (a), (b), © по названию и абстракту. Кандидаты нумеруются в одном сквозном журнале, поэтому ничего не просматривается дважды и ничего не исчезает.

  2. Paper. Фиксация статьи и чтение её полного pdf.

  3. Verification. Идентификатор резолвится, название сходится, читается полный текст. Выписываются точный claim, модель, слой/место, метрика и условия.

  4. Observation. Вытаскивается измеренная claim: структура × модель × метод × статья. Из одной статьи может выйти несколько.

  5. Nodes. Наблюдение связывается со структурой, методом, моделью, семейством — и с гипотезой, если оно её касается.

  6. Replication. Широта и независимость выводятся из записей.

На первом шаге работает один агент. На шагах 2–6 агент с саб‑агентами. Помимо этого отдельный агент проверяет работу по каждой статье, делая ревью. Ещё есть агент, которые отвечает за помощь с сайтом, ибо у меня «лапки» — я Data scientist (здесь должен быть мем «ты че, пес, я математик».

Правила агентов

  • Читать первоисточник целиком, не абстракт и не пересказ. Не полагаться на память о статье и на то, как её описывает другая статья, которая на неё ссылается.

  • Каждый тег структуры — только с текстовым подтверждением. Нужна конкретная цитата, раздел или рисунок, где статья прямо заявляет именно эту форму.

  • Каждый тег метода — метод, которым статья пользуется сама, а не тот, который она упоминает как чужую работу.

  • Каждая модель — точный чекпоинт, а не семейство на глаз: base против instruct, открытая против проприетарной.

  • Проверить пересечение с существующими наблюдениями перед тем, как заводить новое.

  • Звать человека, если

    • не удаётся достать полный текст (пейволл, битая ссылка, только абстракт);

    • заявленная геометрия пограничная между двумя существующими узлами

    • статья вроде бы подтверждает существующее наблюдение, но не на 100% та же форма — неясно, мёрджить или заводить отдельную запись;

    • похоже, что нужен новый узел, но неочевидно, отличается ли он генуинно от существующего или это другое название того же самого;

    • статья на грани критериев включения;

    • любое место, где пришлось бы написать в данные что‑то не подкреплённое прямой цитатой

Что ещё: двойные проверки

Валидатор. validate-content.cjs гоняется перед тем, как правка считается готовой. Он проверяет, что каждый файл соответствует схеме, что каждый id, на который ссылается наблюдение (структура, модели, методы, статьи), действительно существует в своей коллекции, что родитель каждого метода существует, что семейство каждой модели существует, что нет дублей id.

Логи. Каждая правка логируется в structures-log.md / methods-log.md: что сделано, что проверено. Без записи в лог правка не считается завершённой.

Аудит. 15 июля 2026 года я сверила все статьи (около 400), которые тогда были в карте, с исходными PDF. Они породили баги и я их фиксиля перед добором до 700. Так появились, например, чекпойнты моделей и цитаты из текста.

Да корпус НЕ безошибочен. Но в кажддой системе есть доля....: ) И я стараюсь сделать лучше.

В общем, я всё всё улучшаю и пока я не открываю репо, иначе умру под баг‑репортами. Но мне очень поможет фидбек, распространение и идеи — их лучше всего писать мне на почту (sadsobr7@gmail.com) или в чат канала.

Полезнее всего структурный фидбек:

  • структура под неправильной ролью или типом;

  • две записи об одном объекте под разными именами;

  • класс, под который в дереве нет слота;

  • статья, которая проходит правило отбора и отсутствует;

  • утверждение, приписанное статье, которого в ней нет;

  • вы готовы чет предложить поделать;

  • пропущенные работы (лучше списком) — особенно до 2020, не с arXiv и вне языковых моделей.

Надеюсь, она найдет использование, а я буду улучшать.
Огромное спасибо Олегу Смирнову, Михаилу Бурцеву, Елене Еричевой и Чирагу Агарвал за то, что потратили время на ревью карты и фидбек по первому приближению.

Карта: ai‑math‑map.vercel.app 

До новых встреч, и не кидайте много помидорок!

Всем математики и красоты,
Ваш Дата-автор!

Комментарии (1)


  1. ToxaBes
    28.08.2026 14:29

    Классная работа, отдельный респект за то, что replication считается не просто по факту нескольких статей, а с проверкой на отсутствие общих авторов.

    Хочу предложить одно уточнение к критерию независимости.

    Сейчас есть проверка того, что нет общих авторов между статьями. Но отсутствие общих авторов не гарантирует независимость наблюдения: статья B может не иметь общих авторов со статьёй A и при этом прямо ссылаться на A, и по сути наследовать её интерпретацию структуры, а не открывать её заново. Это скорее подтвержденное распространение находки, а не два независимых открытия. По текущей метрике оно попадёт в replication наравне с действительно несвязанными группами.

    Сам шерстю ArXiv практически каждый день, но я практик и ищу применительно к конкретным задачам. Написал плагин в харнесс своему Карасику и он уже сам занимается.