Привет, Хабр! Меня зовут Арсений Иванов, в AIRI в команде «Вычислительный интеллект» я занимаюсь генеративными моделями на основе диффузионных процессов, а также являюсь студентом университетов Сколтеха и ВШЭ. В июле я побывал на ICML 2026, где в том числе представлял две работы на конференции. 

Для меня это была первая очная конференция уровня A*, поэтому поездка была одновременно важной научной возможностью и совершенно новым опытом. Она получилась очень насыщенной и по науке, и по нетворкингу. Сейчас, когда эмоции уже улеглись и мысли устаканились, захотелось поделиться своими впечатлениями и размышлениями о увиденном.

Возле главного монумента конференции, в Expo, где проходила конференция.
Возле главного монумента конференции, в Expo, где проходила конференция.

Про сам ICML и интересную статистику

International Conference on Machine Learning (ICML) — одна из главных конференций в современном машинном обучении. Наряду с NeurIPS и ICLR это одна из наиболее престижных площадок, где ежегодно представляют новые результаты в AI. История ICML начинается ещё в 1980 году, когда в Питтсбурге прошёл первый International Workshop on Machine Learning, а с 1993 года серия проводится под нынешним названием. За это время на ICML появилось немало работ, алгоритмы из которых впоследствии стали хрестоматийными в современном ML. Например, практически ни один учебный курс не обходится без названий Batch Normalization (представлена в 2015 году), Soft Actor-Critic (в 2018-м), EfficientNet (в 2019-м) и CLIP (в 2021-м).

В 2026 году масштаб ICML оказался особенно впечатляющим. В основной review process попало 24 661 статья — почти вдвое больше, чем годом ранее. Из них приняли 6 552 работы, то есть acceptance rate составил 26,6%. При этом только 575 статей получили статус Spotlight, а 168 работ — около 0,7% от общего числа submissions — были отобраны для Oral-презентаций.

Вообще, количество работ на всех крупнейших ML-конференциях продолжает стремительно расти, не только на ICML. На фоне развития LLM и особенно агентных систем стало существенно проще проводить эксперименты, писать код, анализировать результаты и в целом быстрее доводить исследовательскую идею до законченной статьи. Обратная сторона этого процесса тоже ощущается: по моему впечатлению, среди огромного числа работ на ICML встречалось довольно много относительно инкрементальных или даже тривиальных идей — условно, ещё одна вариация уже известного метода с небольшим изменением лосс-функции, архитектуры или рецепта обучения. Из-за этого ориентироваться в десятках тысяч публикаций становится все сложнее.

Но именно поэтому особенно приятно было находить работы, которые действительно заставляли остановиться у постера и подумать: «а вот это интересно». Несмотря на масштаб и неизбежный информационный шум, на ICML было достаточно по-настоящему оригинальных идей. Такие работы предлагали новый взгляд на уже знакомую проблему или открывали направление, которым, как мне кажется, действительно стоит заниматься дальше, а не просто улучшали очередной бенчмарк на несколько процентов. 

Тематика ICML традиционно очень широкая: от теории машинного обучения, оптимизации и RL до ML systems, computer vision, современных генеративных моделей, LLM и агентах. Поэтому охватить даже заметную часть конференции за несколько дней практически невозможно. Дальше я сосредоточусь в основном на тех работах и направлениях, которые ближе всего к моим собственным исследованиям.

Место проведения, участники и AI компании

ICML 2026 проходила с 6 по 11 июля — четыре основных дня и два дня воркшопов. Всё происходило в COEX Convention & Exhibition Center в районе Каннам. И для конференции такого масштаба площадку, на мой взгляд, выбрали подходящую: COEX — один из крупнейших выставочно-конгрессных комплексов Южной Кореи, с более чем 36 тысячами квадратных метров выставочных площадей, четырьмя большими выставочными залами и десятками конференционных пространств. Сам комплекс при этом — далеко не только конференц-центр: он соединён с огромным подземным Starfield COEX Mall, внутри которого находятся рестораны, магазины, кинотеатр, аквариум и, пожалуй, одна из самых узнаваемых библиотек мира — Starfield Library.

У COEX есть и забавная связь с корейской поп-культурой: комплекс находится в самом Каннаме, а рядом установлен знаменитый монумент Gangnam Style с руками из танца PSY. Так что по дороге на конференцию постоянно встречалось довольно буквальное напоминание о том, в каком районе Сеула мы находимся.

Библиотека Starfield Library и монумент Psy
Библиотека Starfield Library и монумент Psy

Масштаб ICML 2026 хорошо передают цифры: в Сеул приехало более 20 тысяч участников, а очная регистрация впервые в истории конференции полностью достигла лимита площадки. Для сравнения более 8 тысяч было годом ранее в Ванкувере. От AIRI на конференцию приехало около 40 исследователей, которые представили 15 работ в основной программе и ещё 19 на воркшопах. На месте масштаб чувствовался сразу: огромные постерные сессии, толпы участников и постоянные переходы между залами COEX.

Обстановка на месте проведения конференции: регистрация, Expo с компаниями и бесконечные переходы между залами COEX
Обстановка на месте проведения конференции: регистрация, Expo с компаниями и бесконечные переходы между залами COEX

Сама конференция состояла из постерных сессий, докладов, туториалов и большого Expo, где свои стенды развернули OpenAI, Google DeepMind, Microsoft, Mistral, ByteDance, Nebius, Turing и множество других компаний. В общем, от крупных бигтехов до стартапов, исследовательских лабораторий и HFT-фондов. Это была хорошая возможность напрямую пообщаться с представителями команд и узнать, над чем они сейчас работают и куда смотрят дальше. Правда, заметную часть стендов занимали рекрутеры: конкуренция за исследователей здесь ощущалась не хуже, чем конкуренция статей за accept. Посмотрите на кол-во промо на Job Board :)

Job Board
Job Board

Основные направления и работы ICML 2026

Как я уже отмечал выше, ICML охватывает практически всё современное машинное обучение, поэтому сделать полноценный обзор нескольких тысяч принятых работ здесь, конечно, невозможно. Если смотреть на конференцию совсем сверху, то среди заметных тем снова были LLM-агенты и автоматизация исследований, reasoning и post-training, evaluation и новые бенчмарки, работы про память, а также огромное количество работ вокруг генеративных моделей. 

Среди множества тем на ICML 2026 особенно выделялось направление дискретных диффузионных моделей для генерации текста, которым как раз я занимаюсь — сейчас вокруг него формируется все больше самостоятельных задач и методов. Для тех, кто не в курсе: в отличие от привычных авторегрессионных моделей, которые генерируют последовательность строго слева направо по одному токену, diffusion language models (DLM) начинают с зашумленной или полностью замаскированной последовательности и постепенно восстанавливают сразу несколько токенов. Все это работает, как и в обычных методах диффузии, VAE, GAN на непрерывных данных (изображения, видео, аудио), но адаптированных к категориально-дискретным представлениям.  Это даёт принципиально другую свободу: можно менять порядок генерации, предсказывать несколько позиций параллельно и потенциально сильно ускорять инференс. Мои коллеги недавно выкатили на Хабр большой обзор по диффузионным языковым моделям, там больше конкретики.

Базовый процесс работы DLM моделей: размаскирование всей последовательности токенов параллельно
Базовый процесс работы DLM моделей: размаскирование всей последовательности токенов параллельно

И судя по ICML 2026, интерес к этой парадигме сейчас очень высокий: на main track и воркшопах были представлены десятки работ посвященых diffusion LLMs. Но среди Oral papers их доля уже составляла 4 из 168, или 2,4%, а одна из двух главных наград Outstanding Paper Award досталась именно работе про diffusion language models.

Причем речь уже далеко не только о том, как обучить ещё одну модель дискретной текстовой диффузии. Вокруг dLLM сформировался целый набор самостоятельных задач: архитектуры (masked diffusions, flow matchings, flow maps, VAE) и scaling, выбор порядка генерации и ремаскинг, паралелльный декодинг, KV caching и ускорение инференса, speculative decoding, reasoning и reinforcement learning, diffusion distillation и post-training. Отдельная линия работ переносит похожие идеи на гибридные непрерывные / дискретные процессы, а также на другие типы дискретных данных — от комбинаторных задач до белков, RNA и DNA.

Для меня это, пожалуй, было одним из самых заметных сдвигов конференции: DLM уже сложно воспринимать просто как экзотическую альтернативу авторегрессионных LLM. Вокруг них постепенно строится полноценный исследовательский мир — от базовой теории и предобучения до ускорения инференса, reasoning и RL.

Outstanding paper award - работы, к которым стоит приглядеться

Представление Outstanding Paper Award наград и статистистики о работах
Представление Outstanding Paper Award наград и статистистики о работах

Любопытно, что обе Outstanding Paper Awards ICML 2026 в итоге достались работам, связанным с diffusion models. Одна — High-Accuracy Sampling for Diffusion Models and Log-Concave Distributions — теоретическая работа про высокоточную генерацию: авторы показывают, как при определённых предположениях сократить зависимость числа шагов семплирования от требуемой точности до полилогарифмической.

Вторая — и более близкая — The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models. Работа получила не только Outstanding Paper Award, но и Oral, который мне как раз удалось послушать вживую.

Идея довольно контринтуитивная. Обычно возможность генерировать токены в произвольном порядке считается одним из главных преимуществ dLLM. Например, при confidence-based декодинге токенов модель может сначала заполнять те позиции, в которых она наиболее уверена. Авторы показывают, что для задач reasoning это может, наоборот, стать ловушкой: модель откладывает наиболее неопределенные токены — именно те «развилки», в которых часто и принимается ключевое решение в цепочке рассуждений. В результате разнообразие reasoning траектории схлопывается.

Решение авторов неожиданно простое – они сделали JustGRPO. Во время RL обучения они фактически отказываются от генерации в произвольном порядке и используют фиксированный порядок слева направо, что позволяет применять обычный policy-gradient метод GRPO. При этом на инференсе модель снова может декодировать токены параллельно. На GSM8K такой минималистичный рецепт достигает 89,1% accuracy, что является SOTA результатом. Мне эта работа особенно запомнилась именно тем, что вместо очередного усложнения алгоритма авторы посмотрели на задачу с другой стороны и заметили интересный факт, который позволил простым решением получить лучшее решение. Все гениальное просто.

Несколько работ, которые мне особенно запомнились

Помимо award-работ, за время конференции я отметил для себя ещё несколько интересных идей, к которым стоит, на мой взгляд, приглядеться и подумать. Чтобы не превращать блог-пост в полноценный survey, кратко пробегусь по ним.

  • Discrete Tilt Matching — альтернативный подход к RL для diffusion LLM, который позволяет делать дообучение с использованием награды без вычисления недоступного логарифма правдоподобия всей последовательности, сводя задачу к локальному согласованию распределений при размаскировании. Работа от команды Michael S. Albergo.

  • d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation — наоборот, работа о том, как достаточно точно оценивать логарифм правдоподобия траектории генерации dLLM и использовать эту оценку в RL-методах на основе градиента политики. Для моделей с произвольным порядком генерации авторы показывают вариант, где правдоподобие траектории можно вычислить всего за один прямой проход модели, что делает метод очень дешёвым. Работа от той самой команды, которая ранее предложила MDLM, одну из работ, давших сильный импульс развитию направления diffusion LLM.

  • Learning Unmasking Policies for Diffusion Language Models — вместо привычных эвристик вроде confidence-based декодинга токенов авторы предлагают обучать сам порядок размаскирования с помощью RL. По сути, семплер становится отдельной небольшой политикой, которая решает, какие токены раскрывать следующими. От EPFL и Apple.

  • Set Diffusion — продолжение популярной работы Block Diffsuion , развитие работы про комбинацию авторегрессионной и диффузионной генерации: модель генерирует не фиксированные блоки, а произвольные множества токенов, сохраняя возможность параллельной генерации и при этом поддерживая KV-cache и многие другие вещи, которые очень важны при сервинге моделей (например vLLM или Sglang).

  • IDLM: Inverse-distilled Diffusion Language Models — работа от AIRI, Сколтеха, MBZUAI и EPITA, применение inverse distillation к дискретным языковым моделям. Идея — научить модель делать за несколько шагов то, что исходная диффузионная модель делает за десятки. Авторы сокращают число шагов деноизинга модели в 4–64 раза, стараясь сохранить распределение модели учителя.

  • Categorical Flow Maps — перенос идеи Flow Maps (оригинальная работа Boffi и Albergo) на категориальные данные. Авторы строят непрерывную динамику в пространстве симплекса и используют самодистилляцию, получая очень быструю генерацию за небольшое число шагов и даже одношаговую генерацию для текста, изображений и молекулярных графов. Хотя качество пока оставляет желать лучшего.

  • Reasoning on the Manifold — авторы предлагают рассматривать reasoning dLLM через геометрию выученных маргинальных распределений: корректные цепочки рассуждений должны попадать в устойчивые области высокой плотности на многообразии, тогда как ошибочные чаще выходят за их пределы. Это позволяет оценивать качество ответа с помощью цикла маскирование → восстановление и использовать полученную оценку согласованности не только для самопроверки модели, но и как плотный сигнал награды при дообучении.

  • Riemannian Metric Matching — работа уже про геометрию распределений: авторы учатся восстанавливать локальную риманову геометрию данных нейросетью, избегая дорогих графовых и kNN методов. Особенно интересно, что инференс такой геометрии получается до сотен раз быстрее классических оценщиков.

  • Learning Hamiltonian Flow Maps — идея заменить большое число маленьких шагов интегрирования в PF-ODE молекулярной динамики на обученный flow map, делающий сразу большой шаг по времени. При этом модель обучается через consistency condition и не требует заранее генерировать дорогие будущие траектории.

  • Autoregressive Boltzmann Generators — вместо нормализующих потоков авторы используют авторегрессионную модель для генерации различных состояний молекул из распределения Больцмана. Такой подход снимает требование строгой обратимости преобразований и лучше масштабируется на более сложные молекулярные системы.

  • DFlash: Block Diffusion for Flash Speculative Decoding — подход к спекулятивному декодированию, в котором вместо авторегрессионной драфтер-модели используется небольшая блочная диффузионная модель, способная предлагать сразу несколько токенов параллельно — по сути, одношаговая MDLM. Затем верификатор проверяет предложенные токены, а драфтер-модель дополнительно использует промежуточные представления основной модели. Авторы показывают более чем 6-кратное ускорение без потери качества и до 2.5 раза больший прирост скорости, чем у EAGLE-3.

Не подступиться к авторам DFlash :)
Не подступиться к авторам DFlash :)
Работа Discrete Tilt Matching от авторов из Harvard про то, как эффективно делать RL-finetuning DLM моделей
Работа Discrete Tilt Matching от авторов из Harvard про то, как эффективно делать RL-finetuning DLM моделей

Что мы представляли на ICML

От AIRI в этом году на ICML было представлено довольно много работ: 15 в основной программе и ещё 19 на воркшопах. Темы при этом были очень разные — от оптимального транспорта и RL до памяти в LLM, дискретных диффузий и ускорения генеративных моделей. Например, в основной программе была работа One-Step Residual Shifting Diffusion, где диффузионная модель для задачи super-resolution дистиллируется до одного шага генерации; Zero-Shot Off-Policy Learning про адаптацию RL-агента к новым задачам без дополнительного обучения и GradMem, где длинный контекст LLM сжимается в небольшое число токенов памяти с помощью нескольких шагов градиентного спуска во время инференса.

Также было представлено и две работы на воркшопах ICML в соавторстве со мной – все по теме генеративно-диффузионных направлений. 

Заключение и несколько мыслей после ICML

Одна из самых интересных мыслей после ICML связана уже не с конкретной работой, а с тем, как меняется сам ресёрч. Почти 24 тысячи заявок статей за год — огромный масштаб, и AI-инструменты явно будут только сильнее ускорять путь от идеи до эксперимента и статьи.

Показательный пример — ICML 2026 Open Reproductions  от Hugging Face: люди с помощью coding агентов пытались воспроизводить результаты работ с конференции. Помимо успешных репродукций, они находили ошибки и спорные требования, но при этом сами агенты тоже нередко ошибались. Получается интересная картина: AI становится не только инструментом для создания исследований, но и инструментом для их проверки.

Наверное, поэтому всё большую ценность приобретает не просто способность быстро провести ещё один эксперимент, а умение выбрать хороший вопрос, критически посмотреть на результат и понять, какой идеей действительно стоит заниматься дальше. И именно за такими идеями на конференциях вроде ICML особенно интересно следить.

Команда AIRI на ICML 2026
Команда AIRI на ICML 2026

Комментарии (0)