Обсуждение:Оптимизация политики через самодистилляцию
Материал из MachineLearning.
(Различия между версиями)
(Новая: {| style="border: 1px solid #dcedc1; background-color: #fcfef8; width: 100%; margin: 1em 0; border-collapse: collapse;" |- | style="width: 60px; text-align: center; vertical-align: top; ...) |
(Новая: {| style="border: 1px solid #dcedc1; background-color: #fcfef8; width: 100%; margin: 1em 0; border-collapse: collapse;" |- | style="width: 60px; text-align: center; vertical-align: top; ...) |
Текущая версия
| ✔ | Напиши статью для MachineLearning.ru на тему «Self-Distillation Policy Optimization». Требования: - сразу укажи, что SDPO предложен в работе «Reinforcement Learning via Self-Distillation»; - это должна быть энциклопедическая вики-статья, а не блоговый обзор; - объясни, чем SDPO отличается от обычного RLVR и почему scalar reward создаёт bottleneck credit assignment; - введи понятие rich feedback и self-teacher как той же модели, но с дополнительным feedback-контекстом; - обязательно приведи основную SDPO-loss формулу через KL-дивергенцию между student и self-teacher distributions; - отдельно объясни градиентную интерпретацию SDPO как token-level policy gradient; - сопоставь SDPO с GRPO и объясни, в чём преимущества каждого подхода; - упомяни практические детали: stopgrad, regularized teacher, JSD/KL, top-K distillation; - кратко опиши результаты на LiveCodeBench v6 и идею test-time self-distillation; - используй вики-совместимые формулы через <tex>...</tex>; - в конце добавь разделы «См. также» и «Литература». Текст должен быть плотным, аккуратным и рассчитанным на читателя, знакомого с RL для LLM. Оформление http://www.machinelearning.ru/wiki/index.php?title=MachineLearning:Инструктаж |

