Метод радиальных базисных функций

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Математический аппарат и Архитектура)
(В исторической справке добавлено упоминание метода потенциальных функций)
 
Строка 10: Строка 10:
Исторически RBF-сети возникли как решение задачи многомерной интерполяции. Предпосылкой к созданию метода стала необходимость преодолеть ограничения [[Многослойный перцептрон|многослойных перцептронов]] (MLP), в частности, проблемы [[Затухание градиента|затухающего градиента]] и длительной [[Сходимость|сходимости]].
Исторически RBF-сети возникли как решение задачи многомерной интерполяции. Предпосылкой к созданию метода стала необходимость преодолеть ограничения [[Многослойный перцептрон|многослойных перцептронов]] (MLP), в частности, проблемы [[Затухание градиента|затухающего градиента]] и длительной [[Сходимость|сходимости]].
-
Фундаментальное обоснование метода было заложено в работе D. Broomhead и D. Lowe (1988)<ref>Broomhead D. S., Lowe D., 1988</ref>, которые первыми предложили использовать радиальные базисные функции в контексте проектирования нейронных сетей, опираясь на [[Теория регуляризации|теорию регуляризации]]. Важнейшую математическую базу обеспечила теорема Миккелли (1986)<ref>Micchelli C. A., 1986</ref>, строго доказавшая, что для широкого класса радиальных функций (включая [[Функция Гаусса|гауссианы]] и мультиквадрики) интерполяционная матрица является [[Обратимая матрица|невырожденной]] при условии уникальности точек данных. Это математически гарантирует существование точного решения задачи строгой интерполяции.
+
Важнейшей исторической и теоретической предтечей RBF-сетей (а также ядерных методов в целом) является [[Метод потенциальных функций|метод потенциальных функций]], разработанный советской школой машинного обучения. В фундаментальном труде М. А. Айзермана, Э. М. Бравермана и Л. И. Розоноэра «Метод потенциальных функций в теории обучения машин» (1970)<ref>Айзерман М. А. и др., 1970</ref> была предложена элегантная физическая аналогия: каждый прецедент обучающей выборки создаёт в пространстве признаков некое «поле» или «потенциал», убывающий по мере удаления от точки. Если выбрать функцию потенциала изотропной (зависящей исключительно от расстояния между объектами), то классификатор МПФ становится структурно и математически эквивалентен RBF-сети. Более того, в рамках этой работы были заложены концептуальные основы [[Ядерный трюк|ядерного перехода (kernel trick)]]: авторы показали, что вычисление функции потенциала эквивалентно вычислению скалярного произведения признаков в спрямляющем [[Гильбертово пространство|гильбертовом пространстве]] бесконечной размерности.
 +
 
 +
В современном виде фундаментальное обоснование метода RBF для нейронных сетей было заложено в работе D. Broomhead и D. Lowe (1988)<ref>Broomhead D. S., Lowe D., 1988</ref>, которые первыми предложили использовать радиальные базисные функции в контексте проектирования нейронных сетей, опираясь на [[Теория регуляризации|теорию регуляризации]]. Важнейшую математическую базу обеспечила [[Теорема Миккелли|теорема Миккелли]] (1986)<ref>Micchelli C. A., 1986</ref>, строго доказавшая, что для широкого класса радиальных функций (включая [[Функция Гаусса|гауссианы]] и мультиквадрики) интерполяционная матрица является [[Обратимая матрица|невырожденной]] при условии уникальности точек данных. Это математически гарантирует существование точного решения задачи строгой интерполяции.
== Математический аппарат и Архитектура ==
== Математический аппарат и Архитектура ==
Строка 46: Строка 48:
== Современные подходы и State-of-the-Art (SOTA) ==
== Современные подходы и State-of-the-Art (SOTA) ==
Хотя классические RBF-сети уступили место глубоким [[Многослойный перцептрон|MLP]] и [[Трансформер (модель)|трансформерам]] в задачах [[Компьютерное зрение|компьютерного зрения]] и [[Обработка естественного языка|NLP]], они переживают мощный ренессанс в специфических научно-инженерных доменах:
Хотя классические RBF-сети уступили место глубоким [[Многослойный перцептрон|MLP]] и [[Трансформер (модель)|трансформерам]] в задачах [[Компьютерное зрение|компьютерного зрения]] и [[Обработка естественного языка|NLP]], они переживают мощный ренессанс в специфических научно-инженерных доменах:
-
* '''Физико-информированные нейросети (PINNs):''' При решении [[Дифференциальное уравнение в частных производных|дифференциальных уравнений в частных производных]] (PDE) RBF обеспечивают аналитическую гладкость производных старших порядков, в отличие от [[ReLU|ReLU-сетей]]. Использование RBF-активаций позволяет существенно повысить точность аппроксимации физических процессов локально в вычислительной сетке.
+
* '''[[Физико-информированная нейросеть|Физико-информированные нейросети]] (PINNs):''' При решении [[Дифференциальное уравнение в частных производных|дифференциальных уравнений в частных производных]] (PDE) RBF обеспечивают аналитическую гладкость производных старших порядков, в отличие от [[ReLU|ReLU-сетей]]. Использование RBF-активаций позволяет существенно повысить точность аппроксимации физических процессов локально в вычислительной сетке.
-
* '''Суррогатное моделирование:''' RBF остаются индустриальным SOTA-стандартом в задачах [[Глобальная оптимизация|оптимизации дорогостоящих функций (Black-box optimization)]], где вычислительный бюджет ограничен десятками симуляций, и требуется построить предельно точную поверхность отклика.
+
* '''[[Суррогатное моделирование]]:''' RBF остаются индустриальным SOTA-стандартом в задачах [[Глобальная оптимизация|оптимизации дорогостоящих функций (Black-box optimization)]], где вычислительный бюджет ограничен десятками симуляций, и требуется построить предельно точную поверхность отклика.
== См. также ==
== См. также ==
Строка 54: Строка 56:
* [[Искусственная нейронная сеть]]
* [[Искусственная нейронная сеть]]
* [[Метрический классификатор]]
* [[Метрический классификатор]]
 +
* [[Метод потенциальных функций]]
== Примечания ==
== Примечания ==
Строка 59: Строка 62:
== Литература ==
== Литература ==
 +
* {{книга | автор = Айзерман М. А., Браверман Э. М., Розоноэр Л. И. | заглавие = Метод потенциальных функций в теории обучения машин | год = 1970 | издательство = Наука | страницы = 384 }}
* {{статья | автор = Broomhead D. S., Lowe D. | заглавие = Multivariable functional interpolation and adaptive networks | издание = Complex Systems | год = 1988 | том = 2 | страницы = 321–355 }}
* {{статья | автор = Broomhead D. S., Lowe D. | заглавие = Multivariable functional interpolation and adaptive networks | издание = Complex Systems | год = 1988 | том = 2 | страницы = 321–355 }}
* {{статья | автор = Micchelli C. A. | заглавие = Interpolation of scattered data: distance matrices and conditionally positive definite functions | издание = Constructive Approximation | год = 1986 | том = 2 | страницы = 11–22 }}
* {{статья | автор = Micchelli C. A. | заглавие = Interpolation of scattered data: distance matrices and conditionally positive definite functions | издание = Constructive Approximation | год = 1986 | том = 2 | страницы = 11–22 }}

Текущая версия

Статья написана с использованием LLM Gemini 3.1 Pro и проверена участником Artem Abdulmanov 16:49, 17 июня 2026 (MSD)

Промпт приводится полностью в Обсуждение:Метод радиальных базисных функций


Содержание

Введение

Метод радиальных базисных функций (англ. Radial Basis Function Network, RBF) — это архитектура искусственных нейронных сетей, использующая радиально-симметричные функции в качестве функций активации. С геометрической точки зрения метод осуществляет нелинейное отображение входного пространства признаков в скрытое пространство более высокой размерности, где задача аппроксимации функций или разделения классов может быть решена линейными методами. Суть решаемой проблемы заключается в построении гладкой гиперповерхности в многомерном пространстве, которая интерполирует или аппроксимирует заданный набор обучающих данных, рассматривая каждый нейрон как локальный рецептор, реагирующий на близость входного вектора к определённому центру.

Мотивировка и историческая справка

Исторически RBF-сети возникли как решение задачи многомерной интерполяции. Предпосылкой к созданию метода стала необходимость преодолеть ограничения многослойных перцептронов (MLP), в частности, проблемы затухающего градиента и длительной сходимости.

Важнейшей исторической и теоретической предтечей RBF-сетей (а также ядерных методов в целом) является метод потенциальных функций, разработанный советской школой машинного обучения. В фундаментальном труде М. А. Айзермана, Э. М. Бравермана и Л. И. Розоноэра «Метод потенциальных функций в теории обучения машин» (1970)[1] была предложена элегантная физическая аналогия: каждый прецедент обучающей выборки создаёт в пространстве признаков некое «поле» или «потенциал», убывающий по мере удаления от точки. Если выбрать функцию потенциала изотропной (зависящей исключительно от расстояния между объектами), то классификатор МПФ становится структурно и математически эквивалентен RBF-сети. Более того, в рамках этой работы были заложены концептуальные основы ядерного перехода (kernel trick): авторы показали, что вычисление функции потенциала эквивалентно вычислению скалярного произведения признаков в спрямляющем гильбертовом пространстве бесконечной размерности.

В современном виде фундаментальное обоснование метода RBF для нейронных сетей было заложено в работе D. Broomhead и D. Lowe (1988)[1], которые первыми предложили использовать радиальные базисные функции в контексте проектирования нейронных сетей, опираясь на теорию регуляризации. Важнейшую математическую базу обеспечила теорема Миккелли (1986)[1], строго доказавшая, что для широкого класса радиальных функций (включая гауссианы и мультиквадрики) интерполяционная матрица является невырожденной при условии уникальности точек данных. Это математически гарантирует существование точного решения задачи строгой интерполяции.

Математический аппарат и Архитектура

Архитектура RBF-сети строго структурирована и состоит из трёх слоёв:

  • Входной слой: передаёт входной вектор \mathbf{x} \in \mathbb{R}^n на скрытый слой без преобразований.
  • Скрытый слой: состоит из нелинейных нейронов, каждый из которых параметризован вектором центра \mathbf{c}_i \in \mathbb{R}^n и параметром ширины \sigma_i.
  • Выходной слой: линейно комбинирует отклики скрытого слоя.

Математически отклик сети вычисляется как линейная комбинация радиальных функций:

 f(\mathbf{x}) = \sum_{i=1}^{N} w_i \phi(||\mathbf{x} - \mathbf{c}_i||)

где:

  • f(\mathbf{x}) — выход сети;
  • N — количество нейронов скрытого слоя;
  • w_i — весовой коэффициент связи между i-м нейроном скрытого слоя и выходным узлом;
  • \phi(\cdot) — радиальная базисная функция;
  • ||\cdot||евклидова норма (расстояние).

Наиболее распространённым выбором функции \phi является функция Гаусса (гауссиана):

 \phi(r) = \exp\left(-\frac{r^2}{2\sigma_i^2}\right)

где r = ||\mathbf{x} - \mathbf{c}_i|| — расстояние от входа до центра, а \sigma_i — ширина окна, определяющая радиус влияния нейрона. Чем ближе входной вектор \mathbf{x} к центру \mathbf{c}_i, тем сильнее отклик активации (максимум равен 1 при \mathbf{x} = \mathbf{c}_i).

Схема обучения и рекомендации

В отличие от классического сквозного обратного распространения ошибки, для RBF-сетей предпочтителен гибридный двухэтапный подход (two-stage training):

  1. Обучение без учителя для скрытого слоя: Расположение центров \mathbf{c}_i обычно подбирается методами кластеризации (чаще всего K-Means). Ширины \sigma_i задаются эвристически, например, равными среднему расстоянию до k ближайших центров, что обеспечивает адекватное перекрытие базисных функций.
  2. Обучение с учителем для выходного слоя: Поскольку выход сети линейно зависит от весов w_i, после фиксации параметров скрытого слоя оптимальные веса можно вычислить аналитически в один шаг с помощью псевдообратной матрицы Мура-Пенроуза (решение задачи наименьших квадратов) или обучить стандартным градиентным спуском, что займёт минимальное количество эпох из-за выпуклости функции потерь по отношению к этим весам.

Частые ошибки инженеров:

  • Проклятие размерности: В пространствах высокой размерности (сотни признаков) евклидово расстояние между любыми двумя точками стремится к одной и той же величине. В результате отклики всех Гауссиан становятся неразличимы (либо все равны нулю, либо константе), и сеть теряет выразительную способность.
  • Неоптимальный выбор ширины окна: Слишком малые значения \sigma приводят к катастрофическому переобучению (нейроны реагируют только на точечные попадания из обучающей выборки), а слишком большие — к сильному сглаживанию и недообучению, так как сеть вырождается в глобальную константу.
  • Избыточное количество центров: Размещение центра для каждого объекта обучающей выборки делает матрицу интерполяции громоздкой и вычислительно неэффективной (ошибка строгой интерполяции вместо сглаживающей аппроксимации).

Современные подходы и State-of-the-Art (SOTA)

Хотя классические RBF-сети уступили место глубоким MLP и трансформерам в задачах компьютерного зрения и NLP, они переживают мощный ренессанс в специфических научно-инженерных доменах:

См. также

Примечания


Литература

  • Айзерман М. А., Браверман Э. М., Розоноэр Л. И. Метод потенциальных функций в теории обучения машин. — Наука, 1970. — С. 384.
  • Broomhead D. S., Lowe D. Multivariable functional interpolation and adaptive networks // Complex Systems. — 1988. — Т. 2. — С. 321–355.
  • Micchelli C. A. Interpolation of scattered data: distance matrices and conditionally positive definite functions // Constructive Approximation. — 1986. — Т. 2. — С. 11–22.
  • Хайкин С. Нейронные сети: полный курс. — Вильямс, 2006. — С. 1104.
Личные инструменты