Метод радиальных базисных функций
Материал из MachineLearning.
(В текст добавлены ссылки на ключевые термины) |
(В исторической справке добавлено упоминание метода потенциальных функций) |
||
| (4 промежуточные версии не показаны) | |||
| Строка 10: | Строка 10: | ||
Исторически RBF-сети возникли как решение задачи многомерной интерполяции. Предпосылкой к созданию метода стала необходимость преодолеть ограничения [[Многослойный перцептрон|многослойных перцептронов]] (MLP), в частности, проблемы [[Затухание градиента|затухающего градиента]] и длительной [[Сходимость|сходимости]]. | Исторически RBF-сети возникли как решение задачи многомерной интерполяции. Предпосылкой к созданию метода стала необходимость преодолеть ограничения [[Многослойный перцептрон|многослойных перцептронов]] (MLP), в частности, проблемы [[Затухание градиента|затухающего градиента]] и длительной [[Сходимость|сходимости]]. | ||
| - | + | Важнейшей исторической и теоретической предтечей RBF-сетей (а также ядерных методов в целом) является [[Метод потенциальных функций|метод потенциальных функций]], разработанный советской школой машинного обучения. В фундаментальном труде М. А. Айзермана, Э. М. Бравермана и Л. И. Розоноэра «Метод потенциальных функций в теории обучения машин» (1970)<ref>Айзерман М. А. и др., 1970</ref> была предложена элегантная физическая аналогия: каждый прецедент обучающей выборки создаёт в пространстве признаков некое «поле» или «потенциал», убывающий по мере удаления от точки. Если выбрать функцию потенциала изотропной (зависящей исключительно от расстояния между объектами), то классификатор МПФ становится структурно и математически эквивалентен RBF-сети. Более того, в рамках этой работы были заложены концептуальные основы [[Ядерный трюк|ядерного перехода (kernel trick)]]: авторы показали, что вычисление функции потенциала эквивалентно вычислению скалярного произведения признаков в спрямляющем [[Гильбертово пространство|гильбертовом пространстве]] бесконечной размерности. | |
| + | |||
| + | В современном виде фундаментальное обоснование метода RBF для нейронных сетей было заложено в работе D. Broomhead и D. Lowe (1988)<ref>Broomhead D. S., Lowe D., 1988</ref>, которые первыми предложили использовать радиальные базисные функции в контексте проектирования нейронных сетей, опираясь на [[Теория регуляризации|теорию регуляризации]]. Важнейшую математическую базу обеспечила [[Теорема Миккелли|теорема Миккелли]] (1986)<ref>Micchelli C. A., 1986</ref>, строго доказавшая, что для широкого класса радиальных функций (включая [[Функция Гаусса|гауссианы]] и мультиквадрики) интерполяционная матрица является [[Обратимая матрица|невырожденной]] при условии уникальности точек данных. Это математически гарантирует существование точного решения задачи строгой интерполяции. | ||
== Математический аппарат и Архитектура == | == Математический аппарат и Архитектура == | ||
| Строка 19: | Строка 21: | ||
Математически отклик сети вычисляется как [[Линейная комбинация|линейная комбинация]] радиальных функций: | Математически отклик сети вычисляется как [[Линейная комбинация|линейная комбинация]] радиальных функций: | ||
| - | ::<tex> f(\mathbf{x}) = \sum_{i=1}^{N} w_i \phi(||\mathbf{x} - \mathbf{c}_i||) | + | ::<tex> f(\mathbf{x}) = \sum_{i=1}^{N} w_i \phi(||\mathbf{x} - \mathbf{c}_i||) </tex> |
где: | где: | ||
| Строка 29: | Строка 31: | ||
Наиболее распространённым выбором функции <tex>\phi</tex> является функция Гаусса (гауссиана): | Наиболее распространённым выбором функции <tex>\phi</tex> является функция Гаусса (гауссиана): | ||
| - | ::<tex> \phi(r) = \exp\left(-\frac{r^2}{2\sigma_i^2}\right) | + | ::<tex> \phi(r) = \exp\left(-\frac{r^2}{2\sigma_i^2}\right) </tex> |
где <tex>r = ||\mathbf{x} - \mathbf{c}_i||</tex> — расстояние от входа до центра, а <tex>\sigma_i</tex> — ширина окна, определяющая радиус влияния нейрона. Чем ближе входной вектор <tex>\mathbf{x}</tex> к центру <tex>\mathbf{c}_i</tex>, тем сильнее отклик активации (максимум равен 1 при <tex>\mathbf{x} = \mathbf{c}_i</tex>). | где <tex>r = ||\mathbf{x} - \mathbf{c}_i||</tex> — расстояние от входа до центра, а <tex>\sigma_i</tex> — ширина окна, определяющая радиус влияния нейрона. Чем ближе входной вектор <tex>\mathbf{x}</tex> к центру <tex>\mathbf{c}_i</tex>, тем сильнее отклик активации (максимум равен 1 при <tex>\mathbf{x} = \mathbf{c}_i</tex>). | ||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
| - | |||
== Схема обучения и рекомендации == | == Схема обучения и рекомендации == | ||
| Строка 97: | Строка 47: | ||
== Современные подходы и State-of-the-Art (SOTA) == | == Современные подходы и State-of-the-Art (SOTA) == | ||
| - | Хотя классические RBF-сети уступили место глубоким MLP и [[Трансформер ( | + | Хотя классические RBF-сети уступили место глубоким [[Многослойный перцептрон|MLP]] и [[Трансформер (модель)|трансформерам]] в задачах [[Компьютерное зрение|компьютерного зрения]] и [[Обработка естественного языка|NLP]], они переживают мощный ренессанс в специфических научно-инженерных доменах: |
| - | * '''Физико-информированные нейросети (PINNs):''' При решении [[Дифференциальное уравнение в частных производных|дифференциальных уравнений в частных производных]] (PDE) RBF обеспечивают аналитическую гладкость производных старших порядков, в отличие от [[ReLU|ReLU-сетей]]. Использование RBF-активаций позволяет существенно повысить точность аппроксимации физических процессов локально в вычислительной сетке. | + | * '''[[Физико-информированная нейросеть|Физико-информированные нейросети]] (PINNs):''' При решении [[Дифференциальное уравнение в частных производных|дифференциальных уравнений в частных производных]] (PDE) RBF обеспечивают аналитическую гладкость производных старших порядков, в отличие от [[ReLU|ReLU-сетей]]. Использование RBF-активаций позволяет существенно повысить точность аппроксимации физических процессов локально в вычислительной сетке. |
| - | * '''Суррогатное моделирование:''' RBF остаются индустриальным SOTA-стандартом в задачах [[Глобальная оптимизация|оптимизации дорогостоящих функций (Black-box optimization)]], где вычислительный бюджет ограничен десятками симуляций, и требуется построить предельно точную поверхность отклика. | + | * '''[[Суррогатное моделирование]]:''' RBF остаются индустриальным SOTA-стандартом в задачах [[Глобальная оптимизация|оптимизации дорогостоящих функций (Black-box optimization)]], где вычислительный бюджет ограничен десятками симуляций, и требуется построить предельно точную поверхность отклика. |
== См. также == | == См. также == | ||
| Строка 106: | Строка 56: | ||
* [[Искусственная нейронная сеть]] | * [[Искусственная нейронная сеть]] | ||
* [[Метрический классификатор]] | * [[Метрический классификатор]] | ||
| + | * [[Метод потенциальных функций]] | ||
== Примечания == | == Примечания == | ||
| Строка 111: | Строка 62: | ||
== Литература == | == Литература == | ||
| + | * {{книга | автор = Айзерман М. А., Браверман Э. М., Розоноэр Л. И. | заглавие = Метод потенциальных функций в теории обучения машин | год = 1970 | издательство = Наука | страницы = 384 }} | ||
* {{статья | автор = Broomhead D. S., Lowe D. | заглавие = Multivariable functional interpolation and adaptive networks | издание = Complex Systems | год = 1988 | том = 2 | страницы = 321–355 }} | * {{статья | автор = Broomhead D. S., Lowe D. | заглавие = Multivariable functional interpolation and adaptive networks | издание = Complex Systems | год = 1988 | том = 2 | страницы = 321–355 }} | ||
* {{статья | автор = Micchelli C. A. | заглавие = Interpolation of scattered data: distance matrices and conditionally positive definite functions | издание = Constructive Approximation | год = 1986 | том = 2 | страницы = 11–22 }} | * {{статья | автор = Micchelli C. A. | заглавие = Interpolation of scattered data: distance matrices and conditionally positive definite functions | издание = Constructive Approximation | год = 1986 | том = 2 | страницы = 11–22 }} | ||
Текущая версия
| | Статья написана с использованием LLM Gemini 3.1 Pro и проверена участником Artem Abdulmanov 16:49, 17 июня 2026 (MSD)
Промпт приводится полностью в Обсуждение:Метод радиальных базисных функций |
|
Введение
Метод радиальных базисных функций (англ. Radial Basis Function Network, RBF) — это архитектура искусственных нейронных сетей, использующая радиально-симметричные функции в качестве функций активации. С геометрической точки зрения метод осуществляет нелинейное отображение входного пространства признаков в скрытое пространство более высокой размерности, где задача аппроксимации функций или разделения классов может быть решена линейными методами. Суть решаемой проблемы заключается в построении гладкой гиперповерхности в многомерном пространстве, которая интерполирует или аппроксимирует заданный набор обучающих данных, рассматривая каждый нейрон как локальный рецептор, реагирующий на близость входного вектора к определённому центру.
Мотивировка и историческая справка
Исторически RBF-сети возникли как решение задачи многомерной интерполяции. Предпосылкой к созданию метода стала необходимость преодолеть ограничения многослойных перцептронов (MLP), в частности, проблемы затухающего градиента и длительной сходимости.
Важнейшей исторической и теоретической предтечей RBF-сетей (а также ядерных методов в целом) является метод потенциальных функций, разработанный советской школой машинного обучения. В фундаментальном труде М. А. Айзермана, Э. М. Бравермана и Л. И. Розоноэра «Метод потенциальных функций в теории обучения машин» (1970)[1] была предложена элегантная физическая аналогия: каждый прецедент обучающей выборки создаёт в пространстве признаков некое «поле» или «потенциал», убывающий по мере удаления от точки. Если выбрать функцию потенциала изотропной (зависящей исключительно от расстояния между объектами), то классификатор МПФ становится структурно и математически эквивалентен RBF-сети. Более того, в рамках этой работы были заложены концептуальные основы ядерного перехода (kernel trick): авторы показали, что вычисление функции потенциала эквивалентно вычислению скалярного произведения признаков в спрямляющем гильбертовом пространстве бесконечной размерности.
В современном виде фундаментальное обоснование метода RBF для нейронных сетей было заложено в работе D. Broomhead и D. Lowe (1988)[1], которые первыми предложили использовать радиальные базисные функции в контексте проектирования нейронных сетей, опираясь на теорию регуляризации. Важнейшую математическую базу обеспечила теорема Миккелли (1986)[1], строго доказавшая, что для широкого класса радиальных функций (включая гауссианы и мультиквадрики) интерполяционная матрица является невырожденной при условии уникальности точек данных. Это математически гарантирует существование точного решения задачи строгой интерполяции.
Математический аппарат и Архитектура
Архитектура RBF-сети строго структурирована и состоит из трёх слоёв:
- Входной слой: передаёт входной вектор
на скрытый слой без преобразований.
- Скрытый слой: состоит из нелинейных нейронов, каждый из которых параметризован вектором центра
и параметром ширины
.
- Выходной слой: линейно комбинирует отклики скрытого слоя.
Математически отклик сети вычисляется как линейная комбинация радиальных функций:
где:
-
— выход сети;
-
— количество нейронов скрытого слоя;
-
— весовой коэффициент связи между
-м нейроном скрытого слоя и выходным узлом;
-
— радиальная базисная функция;
-
— евклидова норма (расстояние).
Наиболее распространённым выбором функции является функция Гаусса (гауссиана):
где — расстояние от входа до центра, а
— ширина окна, определяющая радиус влияния нейрона. Чем ближе входной вектор
к центру
, тем сильнее отклик активации (максимум равен 1 при
).
Схема обучения и рекомендации
В отличие от классического сквозного обратного распространения ошибки, для RBF-сетей предпочтителен гибридный двухэтапный подход (two-stage training):
- Обучение без учителя для скрытого слоя: Расположение центров
обычно подбирается методами кластеризации (чаще всего K-Means). Ширины
задаются эвристически, например, равными среднему расстоянию до
ближайших центров, что обеспечивает адекватное перекрытие базисных функций.
- Обучение с учителем для выходного слоя: Поскольку выход сети линейно зависит от весов
, после фиксации параметров скрытого слоя оптимальные веса можно вычислить аналитически в один шаг с помощью псевдообратной матрицы Мура-Пенроуза (решение задачи наименьших квадратов) или обучить стандартным градиентным спуском, что займёт минимальное количество эпох из-за выпуклости функции потерь по отношению к этим весам.
Частые ошибки инженеров:
- Проклятие размерности: В пространствах высокой размерности (сотни признаков) евклидово расстояние между любыми двумя точками стремится к одной и той же величине. В результате отклики всех Гауссиан становятся неразличимы (либо все равны нулю, либо константе), и сеть теряет выразительную способность.
- Неоптимальный выбор ширины окна: Слишком малые значения
приводят к катастрофическому переобучению (нейроны реагируют только на точечные попадания из обучающей выборки), а слишком большие — к сильному сглаживанию и недообучению, так как сеть вырождается в глобальную константу.
- Избыточное количество центров: Размещение центра для каждого объекта обучающей выборки делает матрицу интерполяции громоздкой и вычислительно неэффективной (ошибка строгой интерполяции вместо сглаживающей аппроксимации).
Современные подходы и State-of-the-Art (SOTA)
Хотя классические RBF-сети уступили место глубоким MLP и трансформерам в задачах компьютерного зрения и NLP, они переживают мощный ренессанс в специфических научно-инженерных доменах:
- Физико-информированные нейросети (PINNs): При решении дифференциальных уравнений в частных производных (PDE) RBF обеспечивают аналитическую гладкость производных старших порядков, в отличие от ReLU-сетей. Использование RBF-активаций позволяет существенно повысить точность аппроксимации физических процессов локально в вычислительной сетке.
- Суррогатное моделирование: RBF остаются индустриальным SOTA-стандартом в задачах оптимизации дорогостоящих функций (Black-box optimization), где вычислительный бюджет ограничен десятками симуляций, и требуется построить предельно точную поверхность отклика.
См. также
- Метод опорных векторов
- Кластеризация методом k-средних
- Искусственная нейронная сеть
- Метрический классификатор
- Метод потенциальных функций
Примечания
Литература
- Айзерман М. А., Браверман Э. М., Розоноэр Л. И. Метод потенциальных функций в теории обучения машин. — Наука, 1970. — С. 384.
- Broomhead D. S., Lowe D. Multivariable functional interpolation and adaptive networks // Complex Systems. — 1988. — Т. 2. — С. 321–355.
- Micchelli C. A. Interpolation of scattered data: distance matrices and conditionally positive definite functions // Constructive Approximation. — 1986. — Т. 2. — С. 11–22.
- Хайкин С. Нейронные сети: полный курс. — Вильямс, 2006. — С. 1104.

