|
|
| Строка 1: |
Строка 1: |
| - | {{well|Статья написана с использованием LLM ChatGPT (GPT-5.6 Sol) и проверена участником [[Участник:Mariia Shubina|Mariia Shubina]] 23:00, 17 июля 2026 (MSD)}}
| |
| | | | |
| - | {{TOCright}}
| |
| - |
| |
| - | == Неравенство Рао — Крамера ==
| |
| - |
| |
| - | '''Неравенство Рао — Крамера''' (англ. ''Cramér–Rao inequality''), также известное как '''информационное неравенство''' или '''неравенство Крамера — Рао''', — фундаментальное утверждение в [[Математическая статистика|математической статистике]] и [[Теория оценивания|теории оценивания]], устанавливающее нижнюю границу для [[Дисперсия|дисперсии]] [[Несмещённая оценка|несмещённых оценок]] неизвестных параметров вероятностных моделей. Эта граница выражается через [[Фишеровская информация|информацию Фишера]] и определяет теоретический предел точности, достижимый при оценивании параметра по конечной выборке.
| |
| - |
| |
| - | Неравенство играет центральную роль в обосновании [[Метод максимального правдоподобия|метода максимального правдоподобия]], служит инструментом для сравнения оценок и позволяет характеризовать асимптотическую эффективность процедур оценивания. Впервые аналогичные неравенства были получены независимо М. Фреше (1943), [[Крамер, Харальд|Х. Крамером]] (1946) и [[Рао, Кальямпуди Радхакришна|К. Р. Рао]] (1945), причём работа Рао содержала наиболее общую формулировку в терминах информации Фишера<ref name="rao1945">Rao, C. R. (1945). Information and the accuracy attainable in the estimation of statistical parameters. ''Bulletin of the Calcutta Mathematical Society'', 37, 81–89.</ref><ref name="cramer1946">Cramér, H. (1946). ''Mathematical Methods of Statistics''. Princeton University Press.</ref>.
| |
| - |
| |
| - | === Основные понятия ===
| |
| - |
| |
| - | Пусть <tex>X_1, \ldots, X_n</tex> — независимая выборка из распределения, принадлежащего параметрическому семейству <tex>\{P_\theta, \theta \in \Theta \subseteq \mathbb{R}\}</tex>. Предполагается, что плотность (или функция вероятности) каждого наблюдения имеет вид <tex>f(x; \theta)</tex> и удовлетворяет условиям регулярности, обеспечивающим возможность дифференцирования по параметру под знаком интеграла.
| |
| - |
| |
| - | * '''[[Статистическая оценка]]''' — функция <tex>\hat{\theta} = g(X_1, \ldots, X_n)</tex> от выборочных данных, используемая для приближения истинного значения параметра <tex>\theta</tex>.
| |
| - | * '''[[Несмещённая оценка]]''' — оценка, для которой <tex>\mathbb{E}_\theta[\hat{\theta}] = \theta</tex> для всех <tex>\theta \in \Theta</tex>. Иными словами, в среднем оценка не отклоняется от оцениваемого параметра.
| |
| - | * '''[[Дисперсия]] оценки''' — <tex>\mathbb{D}_\theta[\hat{\theta}] = \mathbb{E}_\theta[(\hat{\theta} - \theta)^2]</tex>, характеризующая разброс оценки вокруг истинного значения.
| |
| - | * '''[[Функция правдоподобия]]''' для выборки объёма <tex>n</tex> определяется как
| |
| - | <tex> L(\theta; X_1, \ldots, X_n) = \prod_{i=1}^n f(X_i; \theta)</tex>.
| |
| - | Логарифмическая функция правдоподобия: <tex>\ell(\theta) = \ln L(\theta)</tex>.
| |
| - | * '''[[Фишеровская информация]]''' — мера количества информации, которую выборка несёт о неизвестном параметре. Для одного наблюдения:
| |
| - | <tex> I(\theta) = \mathbb{E}_\theta \left[ \left( \frac{\partial}{\partial \theta} \ln f(X; \theta) \right)^2 \right] = - \mathbb{E}_\theta \left[ \frac{\partial^2}{\partial \theta^2} \ln f(X; \theta) \right],</tex>
| |
| - | при условии, что вторая производная существует и операция дифференцирования и интегрирования перестановочны. Для выборки объёма <tex>n</tex> в силу независимости наблюдений <tex>I_n(\theta) = n I(\theta)</tex>.
| |
| - |
| |
| - | === Формулировка неравенства ===
| |
| - |
| |
| - | '''Классическая форма'''. Пусть <tex>\hat{\theta}_n</tex> — несмещённая оценка параметра <tex>\theta</tex>, построенная по выборке объёма <tex>n</tex>. Тогда при выполнении условий регулярности
| |
| - | <tex>
| |
| - | \mathbb{D}_\theta[\hat{\theta}_n] \ge \frac{1}{I_n(\theta)} = \frac{1}{n I(\theta)}.
| |
| - | </tex>
| |
| - |
| |
| - | '''Пояснение членов''':
| |
| - |
| |
| - | * <tex>\mathbb{D}_\theta[\hat{\theta}_n]</tex> — дисперсия оценки, которую мы стремимся минимизировать.
| |
| - | * <tex>I_n(\theta)</tex> — количество информации Фишера во всей выборке.
| |
| - | * Граница <tex>1/I_n(\theta)</tex> называется '''границей Рао — Крамера''' (или информационной границей). Она показывает минимальную возможную дисперсию несмещённой оценки в данной модели.
| |
| - |
| |
| - | Для многомерного случая, когда <tex>\theta \in \mathbb{R}^d</tex>, неравенство обобщается на матрицы ковариации: разность между ковариационной матрицей несмещённой оценки и обратной матрицей Фишера является неотрицательно определённой матрицей.
| |
| - |
| |
| - | === Условия регулярности ===
| |
| - |
| |
| - | Неравенство справедливо не для всех распределений. Необходимы следующие условия (достаточные, но не строго необходимые):
| |
| - |
| |
| - | # '''Носитель распределения''' не зависит от параметра <tex>\theta</tex>, то есть множество <tex>\{x: f(x; \theta) > 0\}</tex> одинаково для всех <tex>\theta \in \Theta</tex>.
| |
| - | # Функция правдоподобия дважды дифференцируема по <tex>\theta</tex>.
| |
| - | # Операция дифференцирования по <tex>\theta</tex> может быть вынесена за знак интеграла (или суммы), в частности,
| |
| - | <tex>\frac{\partial}{\partial \theta} \int f(x; \theta) dx = \int \frac{\partial}{\partial \theta} f(x; \theta) dx</tex>,
| |
| - | и аналогично для второй производной.
| |
| - | # Информация Фишера <tex>I(\theta)</tex> конечна и положительна для всех <tex>\theta \in \Theta</tex>.
| |
| - |
| |
| - | Нарушение первого условия (зависимость носителя от параметра) часто приводит к тому, что дисперсия некоторых оценок убывает быстрее, чем <tex>1/n</tex>, и неравенство Рао — Крамера становится неинформативным (например, для равномерного распределения <tex>U(0, \theta)</tex>). В таких случаях используются обобщения — например, неравенство Бхаттачарии или неравенство Чепмена — Роббинса.
| |
| - |
| |
| - | === Эффективные оценки ===
| |
| - |
| |
| - | Оценка <tex>\hat{\theta}_n</tex>, для которой неравенство Рао — Крамера обращается в равенство при всех <tex>\theta</tex>, называется '''эффективной''' оценкой. В этом случае <tex>\mathbb{D}_\theta[\hat{\theta}_n] = 1/I_n(\theta)</tex>. Эффективные оценки являются несмещёнными и достигают минимально возможной дисперсии в классе несмещённых оценок. Важно различать эффективность и состоятельность: эффективная оценка всегда состоятельна (при выполнении регулярных условий), но не всякая состоятельная оценка эффективна.
| |
| - |
| |
| - | '''Критерий эффективности''' (равенство в неравенстве Рао — Крамера) эквивалентен тому, что [[Скоринг-функция|производная логарифма правдоподобия]] может быть представлена в виде
| |
| - | <tex>
| |
| - | \frac{\partial \ell(\theta)}{\partial \theta} = I_n(\theta) (\hat{\theta}_n - \theta).
| |
| - | </tex>
| |
| - | Это условие выполняется для [[Экспоненциальное семейство|экспоненциальных семейств]] с естественной параметризацией, где оценка максимального правдоподобия часто оказывается эффективной.
| |
| - |
| |
| - | === Связь с методом максимального правдоподобия и асимптотической нормальностью ===
| |
| - |
| |
| - | Неравенство Рао — Крамера тесно связано с асимптотической теорией оценивания. При выполнении регулярных условий [[Оценка максимального правдоподобия|оценка максимального правдоподобия (ОМП)]] <tex>\hat{\theta}_{MLE}</tex> является:
| |
| - | * состоятельной;
| |
| - | * асимптотически нормальной:
| |
| - | <tex>\sqrt{n}(\hat{\theta}_{MLE} - \theta) \xrightarrow{d} \mathcal{N}\left(0, \frac{1}{I(\theta)}\right)</tex>;
| |
| - | * асимптотически эффективной, то есть её асимптотическая дисперсия достигает границы Рао — Крамера <tex>1/(n I(\theta))</tex>.
| |
| - |
| |
| - | Это означает, что среди всех ''регулярных'' оценок ОМП является наилучшей в асимптотическом смысле. Более того, [[Фишеровская информация]] определяет кривизну логарифма правдоподобия и, следовательно, точность оценивания: чем больше информации, тем уже асимптотическое распределение ОМП.
| |
| - |
| |
| - | === Классические примеры ===
| |
| - |
| |
| - | ==== Нормальное распределение ====
| |
| - |
| |
| - | Пусть <tex>X \sim \mathcal{N}(\mu, \sigma^2)</tex>, параметр <tex>\theta = \mu</tex>, <tex>\sigma^2</tex> известно. Плотность:
| |
| - | <tex>f(x; \mu) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)</tex>.
| |
| - | Логарифм правдоподобия для одного наблюдения: <tex>\ell(\mu) = -\frac{1}{2}\ln(2\pi\sigma^2) - \frac{(x-\mu)^2}{2\sigma^2}</tex>.
| |
| - | Вторая производная: <tex>\partial^2 \ell / \partial \mu^2 = -1/\sigma^2</tex>.
| |
| - | Информация Фишера: <tex>I(\mu) = 1/\sigma^2</tex>.
| |
| - | Для выборки объёма <tex>n</tex>: <tex>I_n(\mu) = n/\sigma^2</tex>.
| |
| - | Граница Рао — Крамера: <tex>\sigma^2/n</tex>.
| |
| - | Оценка <tex>\hat{\mu} = \bar{X}</tex> имеет дисперсию <tex>\sigma^2/n</tex> — равенство достигается, оценка эффективна.
| |
| - |
| |
| - | Если <tex>\theta = \sigma^2</tex>, <tex>\mu</tex> известно, то <tex>I(\sigma^2) = 1/(2\sigma^4)</tex>, граница <tex>2\sigma^4/n</tex>. Несмещённая оценка <tex>\hat{\sigma}^2 = \frac{1}{n}\sum (X_i - \mu)^2</tex> имеет дисперсию <tex>2\sigma^4/n</tex> — эффективна.
| |
| - |
| |
| - | ==== Распределение Бернулли ====
| |
| - |
| |
| - | Пусть <tex>X \sim \text{Bernoulli}(p)</tex>, <tex>p \in (0,1)</tex>. Функция вероятности: <tex>f(x; p) = p^x (1-p)^{1-x}</tex>, <tex>x \in \{0,1\}</tex>.
| |
| - | Логарифм: <tex>\ell(p) = x \ln p + (1-x) \ln(1-p)</tex>.
| |
| - | Вторая производная: <tex>\partial^2 \ell / \partial p^2 = -x/p^2 - (1-x)/(1-p)^2</tex>.
| |
| - | Информация Фишера: <tex>I(p) = 1/[p(1-p)]</tex>.
| |
| - | Для выборки: <tex>I_n(p) = n/[p(1-p)]</tex>.
| |
| - | Граница: <tex>p(1-p)/n</tex>.
| |
| - | Оценка <tex>\hat{p} = \bar{X}</tex> имеет дисперсию <tex>p(1-p)/n</tex> — эффективна.
| |
| - |
| |
| - | ==== Распределение Пуассона ====
| |
| - |
| |
| - | Пусть <tex>X \sim \text{Poisson}(\lambda)</tex>, <tex>\lambda > 0</tex>. Функция вероятности: <tex>f(x; \lambda) = e^{-\lambda} \lambda^x / x!</tex>.
| |
| - | Логарифм: <tex>\ell(\lambda) = -\lambda + x \ln \lambda - \ln x!</tex>.
| |
| - | Вторая производная: <tex>\partial^2 \ell / \partial \lambda^2 = -x/\lambda^2</tex>.
| |
| - | Информация: <tex>I(\lambda) = \mathbb{E}[X]/\lambda^2 = 1/\lambda</tex>.
| |
| - | Граница: <tex>\lambda/n</tex>.
| |
| - | Оценка <tex>\hat{\lambda} = \bar{X}</tex> имеет дисперсию <tex>\lambda/n</tex> — эффективна.
| |
| - |
| |
| - | ==== Экспоненциальное распределение ====
| |
| - |
| |
| - | Пусть <tex>X \sim \text{Exp}(\theta)</tex> с плотностью <tex>f(x; \theta) = \theta e^{-\theta x}</tex>, <tex>x > 0</tex>, <tex>\theta > 0</tex> (параметр интенсивности).
| |
| - | Логарифм: <tex>\ell(\theta) = \ln \theta - \theta x</tex>.
| |
| - | Вторая производная: <tex>\partial^2 \ell / \partial \theta^2 = -1/\theta^2</tex>.
| |
| - | Информация: <tex>I(\theta) = 1/\theta^2</tex>.
| |
| - | Граница: <tex>\theta^2/n</tex>.
| |
| - | Оценка <tex>\hat{\theta} = 1/\bar{X}</tex> является ОМП, но она смещённая. Несмещённая оценка для <tex>\theta</tex> существует (например, <tex>(n-1)/(n \bar{X})</tex>) и её дисперсия равна <tex>\theta^2/(n-2)</tex> для <tex>n>2</tex>, что больше границы <tex>\theta^2/n</tex>. Таким образом, эффективной несмещённой оценки не существует.
| |
| - |
| |
| - | === Применение в машинном обучении и анализе данных ===
| |
| - |
| |
| - | Неравенство Рао — Крамера находит прямое применение в следующих областях:
| |
| - |
| |
| - | * '''Оценивание параметров вероятностных моделей'''. При построении генеративных моделей (например, наивный байесовский классификатор, скрытые марковские модели) знание границы Рао — Крамера позволяет оценить, насколько велика может быть ошибка оценивания параметров при заданном объёме выборки, и, следовательно, планировать необходимый размер обучающей выборки.
| |
| - |
| |
| - | * '''Анализ метода максимального правдоподобия'''. В [[Логистическая регрессия|логистической регрессии]] и других обобщённых линейных моделях (GLM) асимптотическая ковариационная матрица оценок коэффициентов аппроксимируется обратной матрицей информации Фишера. На практике стандартные ошибки коэффициентов вычисляются именно на основе этой аппроксимации, что оправдано неравенством Рао — Крамера и свойством асимптотической эффективности ОМП.
| |
| - |
| |
| - | * '''Байесовская статистика'''. В асимптотическом режиме (большие выборки) апостериорное распределение приближается нормальным со средним, равным ОМП, и дисперсией, равной обратной информации Фишера (теорема Бернштейна — фон Мизеса). Это прямое следствие эффективности ОМП и информационной границы.
| |
| - |
| |
| - | * '''Проектирование экспериментов'''. В активном обучении и оптимальном планировании эксперимента критерии D-оптимальности и A-оптимальности основаны на максимизации информации Фишера, что эквивалентно минимизации объёма эллипсоида ошибок, ограниченного снизу границей Рао — Крамера.
| |
| - |
| |
| - | === Ограничения и типичные ошибки ===
| |
| - |
| |
| - | '''Ограничения:'''
| |
| - |
| |
| - | # '''Несмещённость'''. Неравенство применимо только к несмещённым оценкам. Для смещённых оценок существует обобщённое неравенство Рао — Крамера, учитывающее градиент смещения:
| |
| - | <tex>
| |
| - | \mathbb{D}_\theta[\hat{\theta}_n] \ge \frac{(1 + b'(\theta))^2}{I_n(\theta)},
| |
| - | </tex>
| |
| - | где <tex>b(\theta) = \mathbb{E}[\hat{\theta}_n] - \theta</tex>.
| |
| - | Однако многие полезные оценки (например, регуляризованные, байесовские) смещены, и прямое применение классической формы некорректно.
| |
| - |
| |
| - | # '''Регулярность'''. В случае распределений с параметром, влияющим на носитель, неравенство может давать слишком слабую границу или вообще не выполняться. Пример — равномерное распределение <tex>U(0, \theta)</tex>, где дисперсия оценки <tex>\frac{n+1}{n} X_{(n)}</tex> пропорциональна <tex>1/n^2</tex>, что меньше <tex>1/n</tex>.
| |
| - |
| |
| - | # '''Конечность информации'''. Если информация Фишера обращается в бесконечность или равна нулю, граница становится тривиальной.
| |
| - |
| |
| - | # '''Многомерные обобщения'''. В многомерном случае неравенство имеет матричный вид, и его интерпретация требует осторожности: граница определяется обратной матрицей Фишера, но не любая несмещённая оценка имеет ковариационную матрицу, сравнимую с этой границей в смысле неотрицательной определённости.
| |
| - |
| |
| - | '''Типичные ошибки:'''
| |
| - |
| |
| - | * '''Путаница дисперсии и среднеквадратичной ошибки (MSE)'''. Для смещённых оценок MSE = дисперсия + квадрат смещения; неравенство Рао — Крамера не даёт нижней границы для MSE напрямую. Использование классической границы для оценки MSE смещённой оценки — грубая ошибка.
| |
| - |
| |
| - | * '''Игнорирование условий регулярности'''. Применение неравенства к моделям с зависящим от параметра носителем (например, <tex>U(0, \theta)</tex>) без проверки условий приводит к неверным выводам.
| |
| - |
| |
| - | * '''Смешение эффективности и состоятельности'''. Эффективная оценка всегда состоятельна, но обратное неверно. Утверждение «оценка состоятельна, значит, она эффективна» ошибочно.
| |
| - |
| |
| - | * '''Неправильная интерпретация информации Фишера'''. Иногда полагают, что <tex>I_n(\theta)</tex> — это дисперсия ОМП, хотя на самом деле это теоретическая граница, которая достигается только для эффективных оценок.
| |
| - |
| |
| - | === Резюме ===
| |
| - |
| |
| - | Неравенство Рао — Крамера является краеугольным камнем параметрической теории оценивания. Оно даёт абсолютный нижний предел для дисперсии несмещённых оценок, выражаемый через [[Фишеровская информация|информацию Фишера]], и служит эталоном для сравнения процедур оценивания. Особую ценность неравенство приобретает в контексте [[Метод максимального правдоподобия|метода максимального правдоподобия]], поскольку оценки максимального правдоподобия являются асимптотически эффективными, то есть достигают этой границы при больших выборках.
| |
| - |
| |
| - | Наиболее полезно неравенство в следующих ситуациях:
| |
| - |
| |
| - | * при анализе точности несмещённых оценок в параметрических моделях;
| |
| - | * при обосновании асимптотических свойств ОМП и вычислении стандартных ошибок;
| |
| - | * при планировании экспериментов и определении минимального объёма выборки для достижения требуемой точности;
| |
| - | * в многомерных задачах — для анализа корреляционных структур оценок.
| |
| - |
| |
| - | Важно помнить об ограничениях: неравенство не применимо к смещённым оценкам без модификации и требует выполнения условий регулярности, которые нарушаются в ряде практически важных моделей. Тем не менее, в широком классе задач оно остаётся незаменимым инструментом теоретического и прикладного анализа данных.
| |
| - |
| |
| - | == Литература ==
| |
| - |
| |
| - | <references/>
| |
| - |
| |
| - | * {{книга
| |
| - | | автор = Крамер Х.
| |
| - | | заглавие = Математические методы статистики
| |
| - | | издательство = Мир
| |
| - | | год = 1975
| |
| - | | издание = 2-е
| |
| - | | страниц = 648
| |
| - | | isbn =
| |
| - | }}
| |
| - | * {{книга
| |
| - | | автор = Rao, C. R.
| |
| - | | заглавие = Linear Statistical Inference and Its Applications
| |
| - | | издательство = John Wiley & Sons
| |
| - | | год = 1973
| |
| - | | издание = 2nd
| |
| - | | страниц = 656
| |
| - | | isbn = 0-471-70823-2
| |
| - | }}
| |
| - | * {{книга
| |
| - | | автор = Lehmann, E. L., Casella, G.
| |
| - | | заглавие = Theory of Point Estimation
| |
| - | | издательство = Springer
| |
| - | | год = 1998
| |
| - | | издание = 2nd
| |
| - | | страниц = 588
| |
| - | | isbn = 0-387-98502-6
| |
| - | }}
| |
| - | * {{статья
| |
| - | | автор = Fisher, R. A.
| |
| - | | заглавие = On the mathematical foundations of theoretical statistics
| |
| - | | издание = Philosophical Transactions of the Royal Society A
| |
| - | | год = 1922
| |
| - | | том = 222
| |
| - | | страницы = 309–368
| |
| - | | doi = 10.1098/rsta.1922.0009
| |
| - | }}
| |
| - | * {{статья
| |
| - | | автор = Cramér, H.
| |
| - | | заглавие = A contribution to the theory of statistical estimation
| |
| - | | издание = Skandinavisk Aktuarietidskrift
| |
| - | | год = 1946
| |
| - | | том = 29
| |
| - | | страницы = 85–94
| |
| - | }}
| |
| - | * {{статья
| |
| - | | автор = Rao, C. R.
| |
| - | | заглавие = Information and the accuracy attainable in the estimation of statistical parameters
| |
| - | | издание = Bulletin of the Calcutta Mathematical Society
| |
| - | | год = 1945
| |
| - | | том = 37
| |
| - | | страницы = 81–89
| |
| - | }}
| |
| - |
| |
| - | [[Категория:Математическая статистика]]
| |
| - | [[Категория:Теория оценивания]]
| |
| - | [[Категория:Машинное обучение]]
| |
| - | [[Категория:Энциклопедия анализа данных]]
| |