Обсуждение:Катастрофическое забывание

Материал из MachineLearning.

Перейти к: навигация, поиск

Напиши подробную академическую статью для machinelearning.ru в формате MediaWiki по теме «Катастрофическое забывание». Целевая аудитория — студенты и специалисты по машинному обучению, анализу данных и прикладной математике. Стиль — энциклопедический, строгий, но понятный новичку.

Все формулы, переменные, индексы и математические обозначения оформляй только через .... Важные термины оформляй как внутренние ссылки ....

Добавь преамбулу с определением, разделы:

«Терминология и базовые понятия» — дай определение катастрофического забывания (catastrophic forgetting, catastrophic interference) как явления, при котором искусственная нейронная сеть при обучении на новой задаче резко теряет способность решать ранее усвоенные задачи. Раскрой связь с непрерывным обучением (continual learning), трансферным обучением, многозадачным обучением, тонкой настройкой и обучением представлений. Объясни, почему это явление особенно остро проявляется в глубоких нейронных сетях из-за конфликта градиентов и перезаписи весов.

«Исторический контекст» — опиши историю открытия явления: работы Роберта Мак-Клоски (Robert McCloskey) и Нила Коэна (Neal Cohen) в конце 1980-х годов, статья «Catastrophic Interference in Connectionist Networks» (McCloskey & Cohen, 1989), затем работа Ратклиффа (Ratcliff, 1990). Покажи, как проблема была переосмыслена с развитием глубокого обучения и появлением больших моделей.

«Математическая постановка» — формализуй проблему катастрофического забывания в терминах обучения нейронной сети на последовательности задач. Введи множество задач \{\mathcal{T}_1, \mathcal{T}_2, \ldots, \mathcal{T}_k\}, для каждой из которых имеется функция потерь \mathcal{L}_i. Покажи, что при последовательном обучении на задачах \mathcal{T}_1, \dots, \mathcal{T}_n сеть подстраивает веса \theta, минимизируя \mathcal{L}_n, но при этом теряет способность решать \mathcal{T}_1. Приведи пример конфликта градиентов для двух задач: если градиенты для разных задач противоположно направлены, обновление весов для новой задачи ухудшает решение старой. Покажи, как это связано с дилеммой стабильности-пластичности (stability-plasticity dilemma).

«Механизмы возникновения» — опиши причины катастрофического забывания в глубоких сетях: перезапись общих весов при обучении на новой задаче, конфликт градиентов, отсутствие механизмов сохранения важных весов. Объясни связь с регуляризацией: L1- и L2-регуляризация не решают проблему. Отметь, что проблема усугубляется с увеличением модели (чем больше параметров, тем больше конфликт).

«Методы борьбы с катастрофическим забыванием» — подробно опиши три основных подхода:

1. Методы регуляризации весов (regularization-based):

  - Elastic Weight Consolidation (EWC) — добавление штрафа к функции потерь, пропорционального важности весов для предыдущих задач. Приведи формулу с матрицей Фишера F. 
  - SI (Synaptic Intelligence) — аналогичный подход с локальными оценками важности.
  - Memory Aware Synapses (MAS) — оценка важности весов на основе влияния на выход модели.
  - LwF (Learning without Forgetting) — использование дистилляции знаний для сохранения старых задач.

2. Методы воспроизведения опыта (replay-based):

  - Experience Replay (ER) — хранение буфера с примерами из предыдущих задач и их повторное использование при обучении.
  - A-GEM (Averaged Gradient Episodic Memory).
  - Generative Replay — использование генеративных моделей для синтеза примеров из старых задач, чтобы не хранить данные.
  - Dark Experience Replay (DER).

3. Методы изоляции параметров (architecture-based, isolation-based):

  - Progressive Neural Networks — добавление новых колонок для каждой новой задачи с сохранением старых.
  - PackNet — сжатие важных весов для освобождения места под новые задачи.
  - Hard Attention to the Task (HAT) — маскировка весов для разных задач.

«Оценка катастрофического забывания» — опиши метрики оценки: точность на каждой задаче после обучения на последовательности задач (accuracy matrix), забывание (forgetting) как разность между максимальной точностью на задаче и текущей, усреднённая точность, площадь под кривой обучения. Приведи примеры бенчмарков: Split-MNIST, Permuted-MNIST, Split-CIFAR10/100, CORe50, CLRS, CLEAR, Stream-51.

«Применения и последствия» — покажи, почему проблема критична для: систем непрерывного обучения в робототехнике, автономных агентов, персонализированных рекомендаций, медицинских систем (каждый новый пациент — новая задача), больших языковых моделей при дообучении (как избежать забывания ранее усвоенных знаний). Приведи примеры из литературы и практики.

«Сравнение подходов» — сравни эффективность методов: регуляризационные — эффективны при малом числе задач, replay-методы — более универсальны, но требуют памяти, архитектурные — надёжны, но не масштабируются. Приведи сравнительные таблицы из исследований (например, EWC vs ER vs PackNet).

«Ограничения и открытые вопросы» — опиши нерешённые проблемы: масштабируемость на сотни задач, интерпретируемость памяти, теоретические гарантии, связь с биологией мозга, проблема «холодного старта» для новых методов.

«Практические рекомендации» — дай советы по выбору метода в зависимости от: количества задач, доступной памяти, вычислительных ресурсов, необходимости объяснимости.

«См. также», «Примечания» с , «Литература» (не менее 15 реальных источников, включая основополагающие работы McCloskey & Cohen 1989, Kirkpatrick et al. 2017 EWC, Shin et al. 2017 Generative Replay, Lopez-Paz & Ranzato 2017 A-GEM, и современные обзоры), «Ссылки» и категории.

Используй только реальные надёжные научные источники и оформляй их через [1]. Статья должна быть интересной, с интуитивными объяснениями и практическими примерами, и не содержать следов LLM. Итог выдай сразу полным MediaWiki-кодом, готовым для вставки на страницу.