Обсуждение участника:Dovlat Demin
Материал из MachineLearning.
Dovlat Demin, поздравляем с успешной регистрацией на MachineLearning.ru
Перед началом работы рекомендуем ознакомиться с двумя основными документами:
- Концепция Ресурса — короткий документ, в котором объясняется, чем наш Ресурс отличается от Википедии, как его можно использовать для совместной научной и учебной работы, и каким он должен стать в перспективе;
- Инструктаж — длинный документ, в котором мы постарались собрать все сведения, необходимые для работы с Ресурсом, включая правила вики-разметки и сведения об основных категориях Ресурса.
Ссылки на эти и другие справочные материалы собраны на странице Справка.
В нашем сообществе принято представляться. Поэтому, прежде чем приступить к созданию или редактированию страниц, заполните, пожалуйста, свою страницу участника. Сделать это очень просто — достаточно кликнуть на Ваше имя Участника (оно показывается в самой верхней строке на любой странице Ресурса). Желательно, чтобы кроме обычных формальностей (фамилии, имени, отчества, места работы или учёбы, степени, звания, и т.д.) Вы указали свои научные интересы. Удобнее всего сделать это в виде списка ссылок на интересные Вам статьи или категории нашего Ресурса. Не беда, если некоторые из них окажутся «красными ссылками» — это означает, что таких статей пока нет, и у Вас есть шанс их написать. Кстати, вики-движок собирает все «красные ссылки» в список требуемых статей — в него тоже стоит заглянуть. Для создания новой статьи достаточно кликнуть по «красной ссылке» или набрать её название в строке поиска.
По любым вопросам, связанным с работой нашего Ресурса, обращайтесь к Администраторам (см. список администраторов).
С уважением,
ваш M.L.Ru
article = """== Современные методы градиентного спуска: Muon, производные методы и новое поколение оптимизаторов ==
Автор: редактор MachineLearning.ru Дата: 2026 Категории: Оптимизация, Глубокое обучение, Нейронные сети, Градиентный спуск
Аннотация
Статья посвящена обзору современных методов стохастической оптимизации, пришедших на смену десятилетнему господству адаптивных алгоритмов семейства Adam. Рассматривается эволюция градиентных методов от классического SGD до нового поколения оптимизаторов, использующих геометрию пространства параметров, ортогонализацию обновлений и спектральные ограничения. Центральное место занимает анализ оптимизатора Muon (MomentUm Orthogonalized by Newton–Schulz), его теоретических оснований, масштабируемости для обучения больших языковых моделей (LLM), а также производных методов: AdaMuon, NorMuon, LiMuon, Gluon и Muown. Особое внимание уделено вычислительным издержкам, практической применимости и открытым проблемам. По методу Luon рецензируемых публикаций на момент написания статьи не обнаружено; соответствующий раздел содержит пояснение об отсутствии научного консенсуса.
1. Введение
Задача обучения нейронной сети формализуется как минимизация функции потерь:
где — вектор параметров модели,
— функция потерь на отдельном примере. Для решения этой задачи в глубоком обучении доминировали адаптивные методы первого порядка, прежде всего Adam и AdamW. Однако по мере роста масштабов моделей — от миллионов до триллионов параметров — классические адаптивные оптимизаторы сталкиваются с фундаментальными ограничениями: высокими требованиями к памяти, неоптимальной геометрией обновлений и сложностью переноса гиперпараметров между масштабами.
В 2024–2025 гг. исследовательское сообщество увидело появление принципиально нового семейства оптимизаторов, основанных на ортогонализации матричных обновлений. Флагманом этого направления стал оптимизатор Muon, продемонстрировавший при обучении языковых моделей двукратное превосходство в вычислительной эффективности над AdamW. Статья прослеживает эволюцию от классических методов к современным алгоритмам нового поколения, анализирует их математические основания и практические результаты.
2. Эволюция градиентных методов: от SGD к AdamW
2.1. Классический градиентный спуск и стохастическая аппроксимация
Базовый метод градиентного спуска обновляет параметры по правилу:
где — скорость обучения (learning rate). В условиях больших выборок вычисление полного градиента становится неэффективным, и на смену приходит стохастический градиентный спуск (SGD), использующий несмещённую оценку градиента по мини-батчу.
2.2. Моментум и ускорение Нестерова
Для преодоления осцилляций в оврагах ландшафта потерь вводится моментум (Momentum):
где — стохастический градиент,
— коэффициент экспоненциального затухания. Nesterov Momentum модифицирует правило, вычисляя градиент в точке предварительного шага, что обеспечивает оптимальную сходимость для выпуклых задач.
2.3. Адаптивные методы
AdaGrad адаптирует скорость обучения для каждого параметра на основе накопленной истории квадратов градиентов. RMSProp устраняет проблему монотонного убывания скорости обучения, заменяя полное накопление на экспоненциальное скользящее среднее.
Adam (Adaptive Moment Estimation) объединяет идеи моментума и адаптивности:
AdamW декомпонирует регуляризацию весов (weight decay) от градиентного шага, что приводит к более корректной реализации -регуляризации и улучшенной обобщаемости. На протяжении 2017–2023 гг. AdamW стал де-факто стандартом для обучения трансформеров, LLM и других фундаментальных моделей.
2.4. Lion: знаковая оптимизация
Lion (EvoLved SIgn Momentum), предложенный в 2023 г., использует знак момента для обновления параметров, что делает величину шага независимой от масштаба градиента и снижает требования к памяти (только один вектор состояния вместо двух у Adam). Lion продемонстрировал превосходство над AdamW в задачах компьютерного зрения и обучения диффузионных моделей.
3. Ограничения адаптивной оптимизации при масштабировании
Несмотря на эмпирический успех, Adam и AdamW обладают рядом фундаментальных ограничений, критичных при обучении крупных моделей:
- Память. AdamW хранит два вектора состояния на каждый параметр (момент первого и второго порядка), что удваивает требования к памяти оптимизатора по сравнению с SGD.
- Геометрия обновлений. Элемент-wise адаптация скорости обучения игнорирует структуру параметров как матриц. Для линейных слоёв размерностей
градиент является матрицей той же размерности, но Adam обрабатывает её как вектор, разрушая информацию о межнейронных корреляциях.
- Высокое число обусловленности. Эмпирически установлено, что градиенты и обновления, порождаемые Adam и SGD для матричных параметров трансформеров, имеют очень высокое число обусловленности: они почти вырождены, с доминированием нескольких сингулярных значений.
- Чувствительность к гиперпараметрам. Перенос настроек AdamW между различными масштабами моделей требует тщательного перебора.
Эти ограничения мотивировали поиск альтернатив, способных использовать матричную структуру параметров и геометрию пространства весов.
4. Muon: оптимизатор с ортогонализацией обновлений
4.1. Идея и мотивация
Muon (MomentUm Orthogonalized by Newton–Schulz) был предложен Keller Jordan и соавторами в 2024 г. как оптимизатор, специально разработанный для матричных (2D) параметров скрытых слоёв нейронных сетей. Ключевая идея состоит в том, чтобы после вычисления моментума (как в SGD) применить к матрице обновления операцию приближённой ортогонализации, прежде чем использовать её для обновления весов.
Пусть — матрица обновления (моментум градиента для матричного параметра). Muon заменяет её ближайшей полуортогональной матрицей:
где — фробениусова норма. Эта операция эквивалентна замене обновления на
, где
— сингулярное разложение (SVD).
4.2. Итерации Ньютона–Шульца
Прямое вычисление SVD на каждом шаге обучения было бы вычислительно неприемлемо. Muon использует итерации Ньютона–Шульца (Newton–Schulz iterations) для приближённого вычисления ортогонализации. Для матрицы с сингулярными значениями в
итерации имеют вид:
начиная с нормализованной матрицы , где
— спектральная (операторная) норма. Обычно используется 5 итераций для достижения хорошего приближения при умеренных вычислительных затратах.
4.3. Разделение параметров
Muon применяется только к матричным параметрам (весам линейных слоёв, эмбеддингам) размерности . Все остальные параметры — скалярные смещения (biases), нормализационные параметры, головы классификации — оптимизируются вспомогательным AdamW. Такой гибридный подход позволяет Muon сосредоточиться на структурно значимых параметрах, сохраняя стабильность для остальных.
4.4. Спектральная нормализация и весовое затухание
Важным теоретическим результатом является установление связи Muon с ограниченной спектральной нормой. Chen, Li и Liu (2025) показали, что Muon (с декомпозированным весовым затуханием) неявно решает задачу оптимизации с ограничением на спектральную норму матриц весов:
gде — коэффициент weight decay. Это объясняет регуляризующий эффект Muon: он ограничивает максимальное сингулярное значение матрицы весов, что способствует улучшению обобщаемости и устойчивости модели.
5. Масштабируемость Muon для больших языковых моделей
Первоначальные эксперименты с Muon проводились на относительно небольших моделях (CIFAR-10, NanoGPT). Масштабирование на LLM потребовало решения двух ключевых проблем, идентифицированных Liu и соавторами (2025) в работе «Muon is Scalable for LLM Training»:
- Добавление weight decay. В отличие от оригинального Muon, для больших моделей необходимо декомпозированное весовое затухание, аналогичное AdamW.
- Масштабирование обновлений. Требуется корректировка масштаба обновления для каждого параметра, чтобы выровнять RMS (root mean square) обновлений Muon с AdamW. Это позволяет напрямую переиспользовать настроенные скорости обучения AdamW без дополнительного подбора.
С учётом этих модификаций масштабные эксперименты показали, что Muon достигает сопоставимого качества с AdamW примерно при 52% вычислительных затратах (FLOPs) при оптимальном по вычислениям обучении. На основе этих результатов компания Moonshot AI обучила модель Moonlight (3B активных / 16B общих параметров, Mixture-of-Experts) на 5.7 трлн токенов с использованием Muon, продемонстрировавшую новый парето-оптимальный фронт по соотношению качество / затраты на обучение.
6. Производные методы и улучшения
6.1. AdaMuon
AdaMuon (Si, Zhang, Shen, 2025) комбинирует элемент-wise адаптивность Adam с ортогональными обновлениями Muon. Метод вводит два механизма:
1. Элемент-wise оценку второго момента, применяемую к ортогонализованному направлению обновления. 2. Знаковую стабилизацию: моментум сначала преобразуется функцией sign, затем ортогонализуется.
Кроме того, AdaMuon использует стратегию масштабирования RMS обновлений для совместимости с существующими планировщиками скорости обучения. Эксперименты на GPT-2 и Qwen2.5 показали, что AdaMuon превосходит AdamW более чем на 40% по эффективности обучения в крупномасштабных сценариях, при этом сохраняя стабильность.
6.2. NorMuon
NorMuon (Li et al., 2025) решает проблему неравномерности норм нейронов после ортогонализации. Хотя Muon эффективно снижает число обусловленности обновлений, полученные обновления демонстрируют высокую неравномерность норм по строкам (нейронам), что приводит к дисбалансу в использовании представлений. NorMuon добавляет нейрон-wise адаптивные скорости обучения на основе второго момента, применяя пост-ортогонализационную нормализацию по строкам. Эксперименты на моделях 1.1B и 5.4B параметров показали сокращение шагов обучения на 21.74% по сравнению с Adam и на 11.31% по сравнению с Muon. Распределённая реализация NorMuon совместима с FSDP2 и обеспечивает сопоставимый с Muon объём памяти.
6.3. LiMuon
LiMuon (Light and Fast Muon, Huang et al., 2025) направлен на снижение вычислительной и памятной сложности Muon для очень больших моделей. Метод использует рандомизированное SVD и техники уменьшения дисперсии на основе моментума. Теоретический анализ показывает, что LiMuon обладает сложностью выборки для нахождения
-стационарной точки в неявных стохастических задачах при обобщённых условиях гладкости, что ниже, чем у базового Muon. Эксперименты на Mamba-130M, Qwen2.5-0.5B и ViT подтвердили эффективность подхода.
6.4. Gluon
Gluon (Riabinin et al., 2025) предлагает унифицированный теоретический фреймворк для анализа оптимизаторов на основе Linear Minimization Oracle (LMO), к которым относятся Muon и Scion. Авторы вводят новую модель слой-wise (L₀, L₁)-гладкости, которая учитывает анизотропную структуру современных глубоких сетей. В рамках этой модели Gluon обеспечивает гарантии сходимости с практически значимыми размерами шага, впервые замкнув разрыв между теорией и практикой для слой-wise оптимизаторов. Gluon воспроизводит Muon и Scion как частные случаи, предоставляя их теоретическое обоснование.
6.5. Muown
Muown (Lion et al., 2025) фокусируется на контроле норм строк (row-norm control). Авторы показывают, что дрейф спектральной нормы в Muon обусловлен именно ростом величин строк, а не когерентности. Muown явно выделяет вектор норм строк как переменную оптимизатора и обновляет его в геометрии , применяя Muon к оставшейся компоненте. Метод достигает оптимальных скоростей сходимости в стохастическом режиме и улучшает перплексию на FineWeb-Edu для моделей от 124M до 2.7B параметров.
7. О методе Luon
Важное примечание. На момент написания данной статьи (2026 г.) в рецензируемых научных журналах и авторитетных репозиториях препринтов (arXiv, OpenReview, NeurIPS, ICML, ICLR, JMLR) не обнаружено публикаций, посвящённых методу оптимизации с названием «Luon». Упоминание Luon в различных неформальных источниках и обсуждениях не подкреплено воспроизводимыми экспериментами или теоретическим анализом. Поэтому метод Luon не может быть представлен как общепринятый стандарт и не включён в сравнительный анализ. При появлении рецензируемых публикаций данный раздел может быть дополнен.
8. Геометрия пространства параметров и теоретические основания
Современные оптимизаторы нового поколения используют геометрические свойства пространства параметров следующим образом:
- Ортогонализация устраняет избыточную межнейронную корреляцию в обновлениях, повышая число эффективных направлений оптимизации.
- Спектральные ограничения неявно регуляризуют модель, ограничивая максимальное сингулярное значение матриц весов, что улучшает обобщаемость.
- Матричное представление позволяет учитывать структуру линейных преобразований, игнорируемую векторными оптимизаторами.
Теоретический анализ Chen, Li и Liu (2025) помещает Muon в семейство Lion-\\mathcal{K} оптимизаторов с ядерной нормой () в качестве выпуклой функции
. Это обеспечивает гарантии сходимости к точкам Karush–Kuhn–Tucker (KKT) задачи с ограничением спектральной нормы как в детерминированном, так и в стохастическом случаях.
9. Вычислительные издержки и практическая применимость
9.1. Дополнительные вычисления
Основная вычислительная нагрузка Muon связана с ортогонализацией:
- Итерации Ньютона–Шульца требуют
операций для матрицы
при
итерациях.
- При распределённом обучении требуется синхронизация матриц моментума между устройствами.
Однако практические измерения показывают, что при эффективной реализации (распределение вычислений ортогонализации по GPU) временные накладные расходы составляют всего 2.8–3.0% от времени шага AdamW. При этом Muon требует вдвое меньше памяти для состояний оптимизатора по сравнению с AdamW (один вектор моментума вместо двух).
9.2. Применение в современных архитектурах
Новые оптимизаторы уже применяются в:
- Обучении LLM — Moonlight (Moonshot AI), эксперименты Kimi.ai;
- Mixture-of-Experts — Muon особенно эффективен для разреженных архитектур;
- Трансформерах — улучшение сходимости attention-слоёв;
- Мультимодальных моделях — стабилизация обучения при объединении различных модальностей;
- Фундаментальных моделях — достижение парето-оптимального фронта качество / затраты.
10. Сравнительная таблица методов
| Метод | Моментум | Адаптивность | Матричная структура | Ортогонализация | Доп. вычисления | Память состояний | Масштабируемость | Пригодность для LLM | Преимущества | Ограничения |
|---|---|---|---|---|---|---|---|---|---|---|
| SGD | — | — | — | — | Нет | 0 | Высокая | Низкая | Простота, низкая память | Медленная сходимость, чувствительность к LR |
| Momentum | + | — | — | — | Нет | 1× | Высокая | Низкая | Ускорение в оврагах | Неадаптивность |
| Nesterov | + | — | — | — | Нет | 1× | Высокая | Низкая | Оптимальная сходимость (выпукл.) | Сложность настройки |
| AdaGrad | — | + (накопл.) | — | — | Нет | 1× | Средняя | Низкая | Адаптация к разреженности | Монотонное убывание LR |
| RMSProp | — | + (EMA) | — | — | Нет | 1× | Средняя | Низкая | Устранение проблемы AdaGrad | Локальные минимумы |
| Adam | + | + | — | — | Нет | 2× | Высокая | Высокая | Универсальность, стабильность | Высокая память, неоптимальная геометрия |
| AdamW | + | + | — | — | Нет | 2× | Высокая | Высокая | Корректная регуляризация | Высокая память, неоптимальная геометрия |
| Lion | + | — (sign) | — | — | Нет | 1× | Высокая | Средняя | Низкая память, инвариантность к масштабу | Требует перенастройки LR |
| Muon | + | — | + | + (NS) | ~3% времени | 1× | Высокая | Высокая | Спектральная регуляризация, 2× эффективность | Только матричные параметры, требует гибрида |
| AdaMuon | + | + | + | + (sign+NS) | ~3% времени | 2× | Высокая | Высокая | Совмещает адаптивность и ортогонализацию | Повышенная память |
| NorMuon | + | + (нейрон-wise) | + | + (NS) | ~3% времени | 1× | Высокая | Высокая | Сбалансированные нейроны, FSDP2 | Дополнительная нормализация |
| LiMuon | + | — | + | + (ранд. SVD) | Снижены | 1× | Высокая | Высокая | Низкая сложность выборки | Аппроксимация SVD |
11. Открытые проблемы и направления исследований
1. Полная интеграция всех параметров. В настоящее время Muon применяется гибридно с AdamW для нематричных параметров. Полное включение всех параметров в единый ортогонализующий фреймворк остаётся открытой задачей.
2. Расширение на нормы Шаттена. Muon соответствует спектральной норме (норма Шаттена ). Обобщение на произвольные
может открыть новые регуляризационные свойства.
3. Несоответствие предобучение–дообучение. Модели, предобученные AdamW, часто демонстрируют субоптимальные результаты при дообучении Muon, и наоборот. Теоретическое понимание этого феномена необходимо для совместимости с существующими чекпоинтами.
4. Теория для стохастической адаптивности. Гарантии сходимости для адаптивных вариантов (AdaMuon, NorMuon) в стохастическом режиме с произвольными скоростями обучения требуют дальнейшего изучения.
5. Аппроксимации ортогонализации. Исследование более быстрых приближений (рандомизированные алгоритмы, структурированные проекции) для снижения вычислительных издержек при огромных размерностях.
6. Применение в других парадигмах. Распространение идей ортогонализации на обучение с подкреплением, генеративные модели, графовые нейронные сети.
12. Список литературы
1. Bottou L., Curtis F.E., Nocedal J. Optimization Methods for Large-Scale Machine Learning // SIAM Review, 2018, Vol. 60, No. 2, P. 223–311. 2. Nocedal J., Wright S.J. Numerical Optimization. — Springer, 2006. 3. Goodfellow I., Bengio Y., Courville A. Deep Learning. — MIT Press, 2016. 4. Jordan K., Jin Y., Boza V., You J., Cesista F., Newhouse L., Bernstein J. Muon: An optimizer for hidden layers in neural networks. — 2024. URL: https://kellerjordan.github.io/posts/muon/ 5. Liu J., Su J., Yao X., Jiang Z., Lai G., Du Y., Qin Y., Xu W., Lu E., Yan J. et al. Muon is Scalable for LLM Training // arXiv preprint arXiv:2502.16982, 2025. 6. Si C., Zhang D., Shen W. AdaMuon: Adaptive Muon Optimizer // arXiv preprint arXiv:2507.11005, 2025. 7. Li Z. et al. NorMuon: Making Muon more efficient and scalable // arXiv preprint arXiv:2510.05491, 2025. 8. Huang F. et al. LiMuon: Light and Fast Muon Optimizer for Large Models // arXiv preprint arXiv:2509.14562, 2025. 9. Riabinin A., Shulgin E., Gruntkowska K., Richtárik P. Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs) // OpenReview, 2025. 10. Chen L., Li J., Liu Q. Muon Optimizes Under Spectral Norm Constraints // arXiv preprint arXiv:2506.15054, 2025. 11. Lion K., Hübler F., Li B., Orvieto A., He N. Muown: Row-Norm Control for Muon Optimization // arXiv preprint arXiv:2605.10797, 2025. 12. Kingma D.P., Ba J. Adam: A Method for Stochastic Optimization // ICLR, 2015. 13. Loshchilov I., Hutter F. Decoupled Weight Decay Regularization // ICLR, 2019. 14. Chen X., Liang C., Huang D., Real E., Wang K., Pham H., Dong X., Luong T., Hsieh C.-J., Lu Y. et al. Symbolic Discovery of Optimization Algorithms // NeurIPS, 2023. 15. Duchi J., Hazan E., Singer Y. Adaptive Subgradient Methods for Online Learning and Stochastic Optimization // JMLR, 2011, Vol. 12, P. 2121–2159. 16. Tieleman T., Hinton G. Lecture 6.5—RMSProp: Divide the gradient by a running average of its recent magnitude. — COURSERA, 2012. 17. Sutskever I. et al. On the importance of initialization and momentum in deep learning // ICML, 2013. 18. Nesterov Y. A method for unconstrained convex minimization problem with the rate of convergence O(1/k²) // Doklady AN USSR, 1983, Vol. 269, P. 543–547. 19. Shah I. et al. Practical efficiency of muon for pretraining // arXiv preprint arXiv:2505.02222, 2025. 20. Shen W., Huang R., Huang M., Shen C., Zhang J. On the convergence analysis of muon // arXiv preprint arXiv:2505.23737, 2025. 21. Li J., Hong M. A note on the convergence of muon and further // arXiv preprint arXiv:2502.02900, 2025. 22. Kovalev D. Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization // arXiv preprint arXiv:2503.12645, 2025. 23. Gupta V., Koren T., Singer Y. Shampoo: Preconditioned Stochastic Tensor Optimization // ICML, 2018. 24. Bernstein J., Newhouse L. Old optimizer, new norm: An anthology // arXiv preprint arXiv:2409.20325, 2024. 25. Lau T.T.-K., Long Q., Su W. Polargrad: A class of matrix-gradient optimizers from a unifying preconditioning perspective // arXiv preprint arXiv:2505.21799, 2025.
См. также
- Градиентный спуск
- Метод стохастического градиента
- Adam
- AdamW
- Lion
- Оптимизация в глубоком обучении
- Регуляризация весов
- Трансформер (модель)
- Большие языковые модели
"""
- Сохраняем в файл
with open('/mnt/agents/output/muon_optimizers_article.txt', 'w', encoding='utf-8') as f:
f.write(article)
print(f"Статья сохранена. Длина: {len(article)} символов")

