Привет, Хабр. Меня зовут Тянчи Ю, я работаю младшим научным сотрудником в группе «Вычислительный интеллект» AIRI и учусь на четвёртом году аспирантуры Сколтеха. Мои научные интересы включают научное машинное обучение и численный анализ, а также применение этих инструментов к задачам вычислительной математики.

Думаю, никому из читателей не нужно объяснять, почему уравнения в частных производных (PDE) столь важны. Их приходится постоянно решать для моделирования физических, инженерных и финансовых систем — причём быстро и с высокой точностью. Однако с ростом размерности задачи вычислительная стоимость классических численных методов стремительно увеличивается.

Спектральные методы обеспечивают исключительно высокую точность в задачах малой размерности. Методы на основе нейронных сетей, напротив, лучше подходят для многомерных задач, но часто уступают с точки зрения точности и эффективности. В 2024 году мы предложили подход, объединяющий преимущества этих двух направлений: спектрально‑информированную нейронную сеть (Spectral Informed Neural Network, SINN). С тех пор нам удалось его усовершенствовать.

Недавно на конференции ICML 2026 мы представили статью, посвящённую новому методу (она, к слову, получила там Spotlight). Здесь же я хотел бы кратко рассказать, что именно мы сделали.

Дисклеймер от редактора блога AIRI.

Наш коллега Тянчи Ю изначально написал статью на английском и попросил нас аккуратно перевести её для читателей Хабра на русский.

В чём сложности в применении спектральных методов для решения многомерных PDE?

Как я уже отметил ранее, спектральные методы находят широкое применение для решения PDE благодаря их высокой точности и эффективности. Однако когда размерность PDE растёт этот подход сталкивается с проклятием размерности. В общем случае решение PDE спектральным методом включает три этапа:

  1. Преобразование PDE из физического пространства в спектральное.

  2. Решение PDE в спектральном пространстве.

  3. Обратное преобразование решения в физическое пространство.

В традиционных спектральных методах все три этапа подвержены проклятию размерности. Например, на первом этапе преобразование из физического пространства в спектральное требует большого числа квадратурных точек при высокой размерности, что приводит к значительным вычислительным затратам. Однако в подобных задачах решение, как правило, обладает низкоразмерной структурой, то есть имеет разреженные коэффициенты в некотором подходящем базисе. Это свойство можно использовать для смягчения проклятия размерности. Насколько нам известно, в настоящее время не существует методов, способных решать PDE высокой размерности в случае действительно плотных коэффициентов.

Итак, предположим, что решение имеет низкоразмерную структуру, то есть может быть представлено приемлемым числом (обозначим за N) базисных функций вида

\phi_{j}(\boldsymbol{x})=\prod_{k=1}^{d} \phi_{j,k}(x_k).

Во‑первых, поскольку число базисных функций конечно, решение PDE в спектральном пространстве сводится к системе с N неизвестными, которую можно эффективно решить. Следовательно, этап решения PDE в спектральном пространстве не страдает от проклятия размерности.

Во‑вторых, основная цель решения PDE высокой размерности обычно заключается в вычислении значения решения в нескольких заданных точках физического пространства. Получается, что нам нужно вычислить решение только в нескольких точках. Предположим, что общее число точек вычисления равно M, то есть:

u(\boldsymbol{x}_i)=\sum_{j=1}^{N} c_j \prod_{k=1}^{d} \phi_{j,k}(x_{i,k})

для i=1,…,M. Тогда вычислительная сложность такого преобразования будет O(MNd). Следовательно, преобразование решения обратно в физическое пространство не будет страдать от проклятия размерности.

Таким образом, мы приходим к тому, что основные проблемы применения спектральных методов к PDE высокой размерности заложены в преобразовании уравнения из физического пространства в спектральное. Поскольку существует только N частот для N базисных функций, на данном этапе нам нужно эффективно вычислить только соответствующие коэффициенты. Иными словами, нужен метод, который позволит определить эти N частот, а также соответствующие им N базисных функций. В традиционных спектральных методах существуют два основных подхода к решению этой задачи.

Первый подход заключается в использовании более широкого пространства частот‑кандидатов, которое, как предполагается, содержит все значимые частоты. Характерный пример — метод гиперболического креста, в котором строится множество индексов гиперболического креста как надмножество неизвестных активных частот. Такое построение, впрочем, по‑прежнему страдает от проклятия размерности.

Множество индексов гиперболического креста. Проблема — нехватка памяти.
Множество индексов гиперболического креста. Проблема — нехватка памяти.

Второй подход состоит в выделении небольшого пространства частот‑кандидатов на основе априорных сведений об PDE с последующим итеративным расширением этого пространства. Характерный пример здесь — это метод штампующего множества (stamping set method), в котором строится штампующее множество как надмножество неизвестных активных частот. Однако этот метод требует заранее что-то знать об PDE и неизбежно пропускает часть частот.

Штампующее множество. Проблема — сильно зависит от конкретного PDE.
Штампующее множество. Проблема — сильно зависит от конкретного PDE.

Спектрально‑информированные нейронные сети

SINN — это новый метод решения PDE в спектральном пространстве. Основная идея SINN состоит в том, чтобы использовать нейронную сеть для предсказания коэффициентов заданных частот, которые подаются на её вход. Нейронная сеть обучается путём минимизации невязки PDE в спектральном пространстве.

Функция потерь SINN определяется следующим образом:

\hat{\mathcal{L}}(\theta) = \lambda_f \hat{\mathcal{L}}_f(\theta)  + \lambda_b \hat{\mathcal{L}}_b(\theta)  + \lambda_i \hat{\mathcal{L}}_i(\theta),

где

\begin{aligned} \hat{\mathcal{L}}_f(\theta) &= \frac{1}{|\mathcal{T}_{f}|N_{p}} \sum_{t\in\mathcal{T}_f}\sum_{j=1}^{N_{p}} \left|  \mathcal{N}\left[ \sum_{\boldsymbol{k} \in \mathcal{K}_{N_f}} \hat{u}_{\boldsymbol{k}}^\theta(t)  \phi_{\boldsymbol{k}}(\boldsymbol{x}_j) \right]\right.  \\ &\left.\quad - \sum_{\boldsymbol{k} \in \mathcal{K}_{N_f}} \hat{f}_{\boldsymbol{k}}  (t)  \phi_{\boldsymbol{k}}(\boldsymbol{x}_j)  \right|^2. \end{aligned} \qquad \text{(1)}\begin{aligned} \hat{\mathcal{L}}_b(\theta) &= \frac{1}{|\mathcal{T}_{b}|N_{p}} \sum_{t\in\mathcal{T}_b}\sum_{j=1}^{N_p} \sum_{\boldsymbol{k} \in \mathcal{K}_{N_b}} \left| \hat{u}_{\boldsymbol{k}}^\theta(t)  \phi_{\boldsymbol{k}}(\boldsymbol{x}_j) -  \hat{g}_{\boldsymbol{k}}(t)  \phi_{\boldsymbol{k}}(\boldsymbol{x}_j) \right|^2, \\ &= \frac{1}{|\mathcal{T}_{b}|} \sum_{t\in\mathcal{T}_b} \sum_{\boldsymbol{k} \in \mathcal{K}_{N_b}} \left| \hat{u}_{\boldsymbol{k}}^\theta(t) - \hat{g}_{\boldsymbol{k}}(t) \right|^2. \end{aligned} \qquad \text{(2)}\begin{aligned}     \hat{\mathcal{L}}_i(\theta) & = \frac{1}{N_{p}}\sum_{j=1}^{N_p} \sum_{\boldsymbol{k} \in \mathcal{K}_{N_i}} \left| \hat{u}_{\boldsymbol{k}}^\theta(0)  \phi_{\boldsymbol{k}}(\boldsymbol{x}_j) - \hat{h}_{\boldsymbol{k}}\phi_{\boldsymbol{k}}(\boldsymbol{x}_j) \right|^2,\\ & =\sum_{\boldsymbol{k} \in \mathcal{K}_{N_i}} \left| \hat{u}_{\boldsymbol{k}}^\theta(0)  - \hat{h}_{\boldsymbol{k}} \right|^2. \end{aligned} \qquad \text{(3)}

Второе равенство в каждом из выражений (2) и (3) выполняется благодаря ортогональности \phi. Включаются ли в слагаемые функции потерь нормировочные множители 1/{|\mathcal{K}_N|}(где N \in \{N_f, N_b, N_i, N_p\}), зависит от реализации дискретного преобразования. Минимизируя \hat{\mathcal{L}}(\theta), сеть обучается аппроксимировать коэффициенты \hat{u} с помощью \hat{u}^\theta. Если требуется получить u(\boldsymbol{x},t) в физической области, можно использовать усечённое обратное преобразование, чтобы вычислить значение решения в любой точке (\boldsymbol{x},t)\in\Omega\times[0,T]. Более того, если спектральный базис по определению удовлетворяет граничному условию — например, условию периодичности для базиса Фурье, однородному условию Дирихле для синусоидального базиса или однородному условию Неймана для косинусоидального базиса, — \hat{\mathcal{L}}_b(\theta) исключается из суммарной функции потерь. Одна из впечатляющих особенностей SINN состоит в том, что для некоторых PDE метод позволяет строго удовлетворять граничным условиям. Более подробную информацию можно найти в нашей статье 2024 года.

В новой работе мы модифицировали исходный метод SINN, встроив в нейронную сеть два априорных знания из гармонического анализа: 1) коэффициенты решения определяются заданными базисными функциями; 2) скорость убывания коэффициентов определяется гладкостью решения. Опираясь на эти два априорных предположения, модифицированный SINN после обучения сети на выявленных частотах может аппроксимировать отсутствующие коэффициенты решения, выучивая его потенциальную структуру.

Эта схема иллюстрирует модифицированный SINN. Фиолетовые круги обозначают входные переменные t и k; синие круги — выходные значения ,  и ; жёлтые квадраты — операторы ( × означает поэлементное умножение); красные прямоугольники — компоненты нейронной сети, где ?, ? и ? — соответствующие обучаемые параметры. Верхняя область, ограниченная пунктирной линией, соответствует исходному SINN, а нижняя — то, что мы добавили в новой работе.
Эта схема иллюстрирует модифицированный SINN. Фиолетовые круги обозначают входные переменные t и k; синие круги — выходные значения \hat{u}, ? и \hat{u}_{\text{md}}; жёлтые квадраты — операторы ( × означает поэлементное умножение); красные прямоугольники — компоненты нейронной сети, где ?, ? и ? — соответствующие обучаемые параметры. Верхняя область, ограниченная пунктирной линией, соответствует исходному SINN, а нижняя — то, что мы добавили в новой работе.

Результаты численных экспериментов

В этой части я покажу, как новая архитектура решает два типа PDE высокой размерности: уравнение Шрёдингера и уравнение Пуассона. Эти эксперименты показывают, как модифицированные SINN превосходят традиционные спектральные методы. 

Уравнение Шрёдингера

Рассмотрим следующее d‑мерное уравнение Шрёдингера с гармоническим потенциалом:

i\hbar \frac{\partial \Psi(\boldsymbol{x},t)}{\partial t} = -\frac{\hbar^2}{2m_e}\nabla^2\Psi(\boldsymbol{x},t)+ 0.1\, k\, \boldsymbol{x}^2\Psi(\boldsymbol{x},t).

Сначала мы решаем задачу с помощью спектрального метода на разреженной сетке (sparse grid spectral method, SGSM). Затем мы маскируем 1 − ? процентов коэффициентов решения и используем SINN для аппроксимации отсутствующих коэффициентов после обучения на незамаскированных коэффициентах. Оценить эффективность такой аппроксимации с помощью SINN, мы используем относительную L2-ошибку:

\mathrm{Relative\,L2}=\frac{\|\boldsymbol{y}-\hat{\boldsymbol{y}}\|_2}{\|\boldsymbol{y}\|_2},

где \boldsymbol{y}\in\mathbb{R}^N — это целевое значение, а \hat{\boldsymbol{y}}\in\mathbb{R}^N— это значение, которое предсказала нейросеть. Результаты приведены в таблице ниже. Улучшение (promotion) определяется как уменьшение относительной ошибки за счёт использования коэффициентов, аппроксимированных методом SINN, N_{VALID} — число валидных коэффициентов.

Metric

DIM = 2

DIM = 5

DIM = 8

SGSM (s = 1.0)

2.62×10−7

4.42×10−6

3.89×10−4

NVALID

1.47×103

1.91×105

8.46×105

SGSM (s = 0.9)

2.28×10−3

9.37×10−2

3.05×10−1

+SINN

8.83×10−5

1.60×10−2

1.23×10−3

Promotion

96.13%

82.92%

99.60%

NVALID

1.32×103

1.72×105

7.62×105

SGSM (s = 0.8)

2.07×10−1

2.43×10−1

4.41×10−1

+SINN

1.10×10−3

3.74×10−2

1.67×10−3

Promotion

99.47%

84.61%

99.62%

NVALID

1.18×103

1.53×105

6.77×105

Уравнение Пуассона

Рассмотрим следующее d‑мерное уравнение Пуассона с периодическими граничными условиями:

\Delta u(\boldsymbol{x}) =\frac{1}{\pi^2} + \frac{1}{130|\mathcal{D}|}\sum_{i\in\mathcal{D}} \cosh\bigl(2(x_i - \pi)\bigr).

Здесь D обозначает выбранные индексы измерений. В этом эксперименте мы сравниваем эффективность SINN с двумя SOTA‑методами машинного обучения для решения PDE: физически‑информированными нейронными сетями с адаптацией по невязке (Physics‑Informed Residual Adaptive Networks, PirateNets), относящимися к классу PINN (Physics‑Informed Neural Networks), и естественными глубокими методами Ритца (Natural Deep Ritz Methods, NDRM), представляющими развитие метода глубокого Ритца (DRM, Deep Ritz Method). Результаты приведены в следующей таблице:

Dim

PINN

DRM

SINN

2

3.20×10−4±6.77×10−5

2.48×10−3±4.36×10−5

1.61×10−4±1.64×10−5

5

5.54×10−3±1.13×10−3

7.95×10−3±1.87×10−4

2.24×10−4±6.80×10−5

10

9.68×10−3±1.34×10−3

1.03×10−2±4.82×10−4

1.99×10−4±3.97×10−5

30

1.70×10−2±2.20×10−3

2.23×10−2±1.45×10−3

2.76×10−4±8.51×10−5

50

3.17×10−2±5.13×10−3

3.20×10−2±5.19×10−3

1.20×10−3±6.20×10−4

100

5.50×10−1±7.46×10−1

5.94×10−2±1.51×10−2

7.75×10−3±1.67×10−3

Они показывают, что SINN превосходит как PINN, так и DRM в ряде задач для PDE различной размерности. Больше экспериментов можно найти у нас в статье.

Заключение

Таким образом, обновлённый SINN здорово расширяет стандартный подход PINN, включая спектральное представление решения и контроль его мод. Метод продемонстрировал более точное и устойчивое решение рассмотренных дифференциальных уравнений и при этом позволяет использовать глобальную структуру решения и потенциально сократить потребность в очень плотных коллокационных сетках. Конечно, результат зависит от выбора базиса, числа спектральных мод и настройки функции потерь. Тем не менее, при правильном подборе параметров SINN может ускорить решение многомерных PDE со сложной осциллирующей пространственно‑временной динамикой.

Дисклеймер от редактора блога AIRI.

Если у вас есть комментарии и вопросы к автору, вы можете написать их на русском, но если вы сразу напишете по‑английски, будет лучше:)

Комментарии (0)