Метод оптимизации Нелдера — Мида. Пример реализации на Python / forpes.ru

Главная
Метод оптимизации Нелдера — Мида. Пример реализации на Python

Метод оптимизации Нелдера — Мида. Пример реализации на Python +33

02.07.2017 17:58

FUNNYDMAN 17 9200 Источник

Метод Нелдера — Мида — метод оптимизации (поиска минимума) функции от нескольких переменных. Простой и в тоже время эффективный метод, позволяющий оптимизировать функции без использования градиентов. Метод надежен и, как правило, показывает замечательные результаты, хотя и отсутствует теория сходимости. Может использоваться в функции optimize из модуля scipy.optimize популярной библиотеки для языка python, которая используется для математических расчетов.

Алгоритм заключается в формировании симплекса (simplex) и последующего деформирования в направлении минимума, посредством трех операций:

1) Отражение (reflection);
2) Растяжения (expansion);
3) Сжатие (contract);

Симплекс представляет из себя геометрическую фигуру, являющуюся n — мерным обобщением треугольника. Для одномерного пространства — это отрезок, для двумерного — треугольник. Таким образом n — мерный симплекс имеет n + 1 вершину.

Алгоритм

1) Пусть

$inline$ функция, которую необходимо оптимизировать. На первом шаге выбираем три случайные точки (об этом чуть позже) и формируем симплекс (треугольник). Вычисляем значение функции в каждой точке:

$inline$ ,

$inline$ .

Сортируем точки по значениям функции

$inline$ в этих точках, т.е. получаем двойное неравенство:

$inline$ ?

$inline$ .

Мы ищем минимум функции, а следовательно, на данном шаге лучшей будет та точка, в которой значение функции минимально. Для удобства переобозначим точки следующим образом:
b =

$inline$ , g =

$inline$ , w =

$inline$ , где best, good, worst — соответственно.

2) На следующем шаге находим середину отрезка, точками которого являются g и b. Т.к. координаты середины отрезка равны полусумме координат его концов, получаем:

$mid = \left ( \frac {x_1 + x_2} 2; \frac {y_1 + y_2} 2 \right)$

В более общем виде можно записать так:

$mid = \frac 1 n\sum_{i=1}^n x_i$

3) Применяем операцию отражения:
Находим точку

$inline$ , следующим образом:

$display$

Т.е. фактически отражаем точку w относительно mid. В качестве коэффициента берут как правило 1. Проверяем нашу точку: если f(

$inline$ ) < f(g), то это хорошая точка. А теперь попробуем расстояние увеличить в 2 раза, вдруг нам повезет и мы найдем точку еще лучше.

4) Применяем операцию растяжения:
Находим точку

$inline$ следующим образом:

$display$

В качестве ? принимаем ? = 2, т.е. расстояние увеличиваем в 2 раза.

Проверяем точку

$inline$ :

Если f(

$inline$ ) < f(b), то нам повезло и мы нашли точку лучше, чем есть на данный момент, если бы этого не произошло, мы бы остановились на точке

$inline$ .

Далее заменяем точку w на

$inline$ , в итоге получаем:

5) Если же нам совсем не повезло и мы не нашли хороших точек, пробуем операцию сжатия.
Как следует из названия операции мы будем уменьшать наш отрезок и искать хорошие точки внутри треугольника.

Пробуем найти хорошую точку

$inline$ :

$display$

Коэффициент ? принимаем равным 0.5, т.е. точка

$inline$ на середине отрезка wmid.

Существует еще одна операция — shrink (сокращение). В данном случае, мы переопределяем весь симплекс. Оставляем только «лучшую» точку, остальные определяем следующим образом:

$display$

Коэффициент ? берут равным 0.5.

По существу передвигаем точки по направлению к текущей «лучшей» точке. Преобразование выглядит следующим образом:

Необходимо отметить, что данная операция дорого обходится, поскольку необходимо заменять точки в симплексе. К счастью было установлено, при проведении большого количества экспериментов, что shrink — трансформация редко случается на практике.

Алгоритм заканчивается, когда:

1) Было выполнено необходимое количество итераций.
2) Площадь симплекса достигла определенной величины.
3) Текущее лучшее решение достигло необходимой точности.

Как и в большинстве эвристических методов, не существует идеального способа выбора инициализирующих точек. Как уже было сказано, можно брать случайные точки, находящиеся недалеко друг от друга для формирования симплекса; но есть решение и получше, которое используется в реализации алгоритма в MATHLAB:

Выбор первой точки

$inline$ поручаем пользователю, если он имеет некоторое представление о возможном хорошем решении, в противном случае выбирается случайным образом. Остальные точки выбираются исходя из

$inline$ , на небольшом расстоянии вдоль направления каждого измерения:

$V_{i + 1} = V_i + h(V_1, i)*U_i$

где

$inline$ — единичный вектор.

$inline$ определяется таким образом:

$inline$ = 0.05, если коэффициент при

$inline$ в определении

$inline$ не нулевой.

$inline$ = 0.00025, если коэффициент при

$inline$ в определении нулевой.

Пример:

Найти экстремум следующей функции:

$inline$

В качестве начальных возьмем точки:

$display$

Вычислим значение функции в каждой точке:

$inline$

$inline$

Переобозначим точки следующим образом:

$display$

Находим середину отрезка bg:

$mid = \frac{b+g}2 = \left(\frac 1 2; \frac 1 2 \right)$

Находим точку

$inline$ (операция отражения):

$display$

если ?=1, тогда:

$x_r = 2*mid - w = 2 \left(\frac 1 2; \frac 1 2 \right) - \left(0, 0 \right) = (1, 1)$

Проверяем точку

$inline$ :

$inline$ , т.к.

$inline$ пробуем увеличить отрезок (операция растяжения).

$display$

если ? = 2, тогда:

$display$

$x_e = 2(1, 1) - \left(\frac 1 2, \frac 1 2 \right) = (1.5, 1.5)$

Проверяем значение функции в точке

$inline$ :

$inline$

Оказалось, что точка

$inline$ «лучше» точки b. Следовательно мы получаем новые вершины:

$display$

И алгоритм начинается сначала.

Таблица значений для 10 итераций:

Best	Good	Worst
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$
$inline$	$inline$	$inline$

Аналитически находим экстремум функции, он достигается в точке

$inline$ .
После 10 итераций мы получаем достаточно точное приближение:

$inline$

Еще о методе:

Алгоритм Нелдера — Мида в основном используется для выбора параметра в машинном обучении. В сущности, симплекс метод используется для оптимизации параметров модели. Это связано с тем, что данный метод оптимизирует целевую функцию довольно быстро и эффективно (особенно там, где не используется shrink — модификация).

С другой стороны, в силу отсутствия теории сходимости, на практике метод может приводить к неверному ответу даже на гладких (непрерывно дифференцируемых) функциях. Также возможна ситуация, когда рабочий симплекс находится далеко от оптимальной точки, а алгоритм производит большое число итераций, при этом мало изменяя значения функции. Эвристический метод решения этой проблемы заключается в запуске алгоритма несколько раз и ограничении числа итераций.

Реализация на языке программирования python:

Создаем вспомогательный класс Vector и перегружаем операторы для возможности производить с векторами базовые операции. Я намерено не использовал вспомогательные библиотеки для реализации алгоритма, т.к. в таком случае зачастую снижается восприятие.

class Vector(object):
    def __init__(self, x, y):
        """ Create a vector, example: v = Vector(1,2) """
        self.x = x
        self.y = y

    def __repr__(self):
        return "({0}, {1})".format(self.x, self.y)

    def __add__(self, other):
        x = self.x + other.x
        y = self.y + other.y
        return Vector(x, y)

    def __sub__(self, other):
        x = self.x - other.x
        y = self.y - other.y
        return Vector(x, y)

    def __mul__(self, other):
        x = self.x * other
        y = self.y * other
        return Vector(x, y)

    def __truediv__(self, other):
        x = self.x / other
        y = self.y / other
        return Vector(x, y)

    def c(self):
        return (self.x, self.y)
        


def f(point):
    x, y = point
    return x**2 + x*y + y**2 - 6*x - 9*y

def nelder_mead(alpha=1, beta=0.5, gamma=2):
    v1 = Vector(0, 0)
    v2 = Vector(1.0, 0)
    v3 = Vector(0, 1)

    for i in range(10):
        adict = {v1:f(v1.c()), v2:f(v2.c()), v3:f(v3.c())}
        points = sorted(adict.items(), key=lambda x: x[1])
        b = points[0][0]
        g = points[1][0]
        w = points[2][0]
        
        mid = (g + b)/2
        xr = mid * 2 - w
        if f(xr.c()) < f(g.c()):
            w = xr
        else:
            if f(xr.c()) < f(w.c()):
                w = xr
            c = (w + mid)/2
            if f(c.c()) < f(w.c()):
                w = c
        if f(xr.c()) < f(b.c()):
            xe = xr * 2 - mid
            if f(xe.c()) < f(xr.c()):
                w = xe
            else:
                w = xr
        if f(xr.c()) > f(g.c()):
            xc = mid * (1 - beta) + w * beta
            if f(xc.c()) < f(w.c()):
                w = xc
        v1 = w
        v2 = g
        v3 = b
    print(b)
        
nelder_mead()

P.S. Может у кого-нибудь есть реализация алгоритма на других языках программирования? С радостью расширю статью, естественно указав автора реализации.

Спасибо за чтение статьи. Надеюсь она была Вам полезна и Вы узнали много нового.
С вами был FUNNYDMAN. Удачной оптимизации!)

Поделиться с друзьями

-->

Комментарии (17)

Andy_U
02.07.2017 22:51
#10294642
-4
Хмм, а чем Ваша реализация лучше, чем вот эта: https://docs.scipy.org/doc/scipy-0.19.0/reference/optimize.minimize-neldermead.html#optimize-minimize-neldermead?
1. FUNNYDMAN
  02.07.2017 22:55
  #10294646
  +5
  Спасибо за Ваш комментарий. Цель моей статьи не показать алгоритм лучше, а рассказать о методе и представить возможную реализацию.
  1. Andy_U
    04.07.2017 12:34
    #10296872
    Как забавно получилось, вы молча добавили первый абзац к своей публикации после моего второго комментария, а я в результате получил кучу минусов.
    
    И, да, вы ошиблись, утверждая, что обсуждаемый метод:
    
    Используется по умолчанию в функции optimize из модуля scipy.optimize
    
    Нас самом деле по умолчанию используются: one of BFGS, L-BFGS-B, SLSQP, depending if the problem has constraints or bounds.
    
    FUNNYDMAN
    04.07.2017 12:45
    #10296904
    Спасибо за ваш ответ, Andy_U. Первый абзац был изначально, и я его никак не видоизменял. Да, вы правы. По умолчанию используется BFGS, L-BFGS-B, SLSQP. Обязательно внесу поправки в статью. Спасибо за уточнение. Всего доброго!
    
    Andy_U
    04.07.2017 14:07
    #10297132
    И вам спасибо за совет не читать статьи по диагонали.

Andy_U
02.07.2017 23:19
#10294666
-3
Может быть, тогда стоило начать статью с какой-нибудь подобной фразы?

redfs
02.07.2017 23:54
#10294704
+1
Может у кого-нибудь есть реализация алгоритма на других языках программирования? С радостью расширю статью, естественно указав автора реализации

А каков смысл?
Деформируемый многогранник Нелдера-Мида — метод старый, реализаций немеряно. У меня со студенчества (это середина 80-х) остались реализации на Алголе для БЭСМ-6 и Фортране для ЕС и СМ-4. Не думаю, что расширение ими статьи будет кому-то полезно:)
1. Kazancev
  03.07.2017 19:29
  #10295830
  +1
  Писал этой весной на Scilab, затем переносил в ANSYS APDL — сначала не увидел встроенных процедур, а когда их абсолютно случайно увидел их в СТАРОМ 11-м Хэлпе и прогнал примеры — не понравилась точность встроенных в ANSYS оптимизаторов. Ничётак получилось, несколько процентов форы отжал у ANSYS =)
  И автор прав, требуется гонять алгоритм несколько раз до победного и правильно выбирать длину вектора старта и вектора корректировки на очередном витке цикла, иначе велик шанс не дойти до точки минимума. Хотя сам алгоритм работает шустро.

dmagin
03.07.2017 10:14
#10294970
Интересно, спасибо. Странно, правда, что в этом методе не используются значения функции в точках, — все равно же их считать приходится. Ну то есть те же производные по направлениям, соединяющим точки. Ясно же, что если в одном направлении функция уменьшается на 8, а в другом только на 5, то логичнее сделать шаг в первом направлении в 8/5 раза больше, чем во втором. Быстрее сходиться должно. Думаю, такой алгоритм тоже известен.
1. FUNNYDMAN
  03.07.2017 12:26
  #10295184
  +1
  Здравствуйте, dmagin! Спасибо за Ваш комментарий. Под ваше описание подходит метод покоординатного спуска (градиентные методы).
1. iroln
  04.07.2017 01:52
  #10296212
  Тут смысл именно в том, что это derivative free метод поиска (т. н. direct search). Функции могут быть шумные и негладкие, да вообще любые. Кстати, более продвинутые методы direct search также давно существуют, например, Generalized Pattern Search, Mesh Adaptive Search, но они и более медленные.
  1. dmagin
    04.07.2017 08:28
    #10296358
    Да, спасибо, я уже заглянул в вики, чтобы понять, в чем фишка. В статье об этом не упомянуто, а пример приведен на гладкой функции, что и вызвало вопрос.

makondo
03.07.2017 13:39
#10295324
Я когда-то на Delphi писал для диплома )
Еще на Фортране у меня был, откуда-то качал из математических библиотек.
Нелдер-Мид хорош, когда функция недифференцируема.

jetu
04.07.2017 10:06
#10296512
+1
Спасибо за статью, все очень доходчиво и понятно.

Arastas
04.07.2017 13:56
#10297100
Офтопик, но в каком пакете Вы делали геометрические картинки?
1. FUNNYDMAN
  04.07.2017 20:56
  #10297824
  Здравствуйте, Arastas. Я использовал сайт: http://yotx.ru/

againHelloWorld
04.07.2017 20:54
#10297822
+1
Писала этот алгоритм (он еще в некоторых источниках называется «метод деформируемого многогранника») на c++ для оптимизации функции с неограниченным количеством параметров.