Условная вероятность

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Новая: '''Условная вероятность''' — это вероятность одного случайного события при усло...)
 
Строка 1: Строка 1:
-
'''Условная вероятность''' — это [[вероятность]] одного [[случайное событие|случайного события]] при условии, что другое событие уже произошло или принято как известное. Если событие <tex>B</tex> имеет ненулевую вероятность, то условная вероятность события <tex>A</tex> при условии <tex>B</tex> определяется как
+
{{TOCright}}
-
:<tex>P(A\mid B)=\frac{P(A\cap B)}{P(B)}</tex>
+
'''Условная вероятность''' — [[вероятность]] одного [[Случайное событие|случайного события]], вычисленная при условии, что другое событие произошло или рассматривается как известное. Она формализует изменение вероятностной оценки после получения дополнительной информации.
-
Эта формула означает, что после получения информации о наступлении <tex>B</tex> рассматриваются только те исходы, в которых <tex>B</tex> произошло. Среди них измеряется доля исходов, в которых одновременно произошло <tex>A</tex>. Условная вероятность является одним из базовых понятий [[теория вероятностей|теории вероятностей]], [[математическая статистика|математической статистики]], [[анализ данных|анализа данных]] и [[машинное обучение|машинного обучения]]. Многие задачи предсказания можно понимать как оценивание распределения целевой переменной <tex>Y</tex> при известных признаках <tex>X</tex>, то есть как работу с величинами вида <tex>P(Y\mid X)</tex> или <tex>p(y\mid x)</tex>.<ref name="Kolmogorov1933">Kolmogorov A. N. ''Grundbegriffe der Wahrscheinlichkeitsrechnung''. Springer, 1933.</ref><ref name="Bishop2006">Bishop C. M. ''Pattern Recognition and Machine Learning''. Springer, 2006.</ref><ref name="Murphy2012">Murphy K. P. ''Machine Learning: A Probabilistic Perspective''. MIT Press, 2012.</ref>
+
Условная вероятность является одним из основных понятий [[Теория вероятностей|теории вероятностей]], [[Математическая статистика|математической статистики]] и [[Машинное обучение|машинного обучения]]. Многие задачи предсказания сводятся к оцениванию распределения целевой переменной при известных признаках объекта<ref name="bishop">{{книга |автор=Bishop C. M. |заглавие=Pattern Recognition and Machine Learning |место=New York |издательство=Springer |год=2006 |isbn=978-0-387-31073-2}}</ref><ref name="murphy">{{книга |автор=Murphy K. P. |заглавие=Probabilistic Machine Learning: An Introduction |место=Cambridge, MA |издательство=MIT Press |год=2022}}</ref>.
 +
 
 +
== Основная идея ==
 +
 
 +
Получение новой информации изменяет множество исходов, которые остаются возможными. Если стало известно, что некоторое событие произошло, все исходы, несовместимые с ним, исключаются из рассмотрения. Вероятности оставшихся исходов пересчитываются так, чтобы их сумма снова была равна единице.
 +
 
 +
Например, если случайно выбирается объект из совокупности, исходная вероятность принадлежности объекта к некоторому классу определяется долей этого класса во всей совокупности. После получения информации о наличии определённого признака рассматриваются только объекты с таким признаком. Доля нужного класса внутри этой подгруппы может заметно отличаться от его доли среди всех объектов.
 +
 
 +
Условие в вероятностной записи выражает имеющуюся информацию, а не обязательно причинное воздействие. Условная вероятность может измениться при наблюдении признака, даже если этот признак не является причиной изучаемого события.
== Определение ==
== Определение ==
-
Пусть задано вероятностное пространство и пусть <tex>A</tex> и <tex>B</tex> — события, причём <tex>P(B)>0</tex>. Условная вероятность <tex>P(A\mid B)</tex> определяется формулой
+
Пусть рассматриваются два события, причём вероятность события, принятого за условие, положительна. Условная вероятность определяется как
-
:<tex>P(A\mid B)=\frac{P(A\cap B)}{P(B)}</tex>
+
:<tex>P(A\mid B)=\frac{P(A\cap B)}{P(B)},\quad P(B)>0.</tex>
-
Здесь <tex>A\cap B</tex> — событие, состоящее в одновременном наступлении <tex>A</tex> и <tex>B</tex>. Деление на <tex>P(B)</tex> нормирует вероятности внутри события <tex>B</tex>: после условия <tex>B</tex> вся масса вероятности рассматривается не на исходном пространстве исходов, а на его части, где <tex>B</tex> истинно.
+
В числителе находится вероятность одновременного наступления обоих событий. Деление на вероятность условия нормирует вероятности внутри той части пространства исходов, которая совместима с полученной информацией.
-
Из определения следует правило умножения:
+
При фиксированном условии условная вероятность обладает обычными свойствами вероятностной меры. Она неотрицательна, вероятность достоверного события равна единице, а вероятности попарно несовместимых событий складываются.
-
:<tex>P(A\cap B)=P(A\mid B)P(B)</tex>
+
Определение через отношение применимо только к условиям с положительной вероятностью. В более общей [[Теория меры|теоретико-мерной]] постановке условные вероятности и условные распределения определяются с помощью условных математических ожиданий и регулярных условных мер<ref name="billingsley">{{книга |автор=Billingsley P. |заглавие=Probability and Measure |издание=3rd ed. |место=New York |издательство=Wiley |год=1995}}</ref>.
-
Смысл правила состоит в том, что вероятность совместного наступления двух событий можно разложить на вероятность условия и вероятность второго события внутри этого условия. Аналогично, если <tex>P(A)>0</tex>, то
+
== Основные свойства ==
-
:<tex>P(A\cap B)=P(B\mid A)P(A)</tex>
+
=== Правило умножения ===
-
В общем случае <tex>P(A\mid B)</tex> и <tex>P(B\mid A)</tex> различны. Это различие особенно важно в статистике и машинном обучении, где часто путают вероятность причины при наблюдаемом следствии и вероятность следствия при заданной причине.
+
Из определения условной вероятности следует правило умножения:
-
== Интуитивный смысл условия ==
+
:<tex>P(A\cap B)=P(A\mid B)P(B).</tex>
-
Условие в выражении <tex>P(A\mid B)</tex> означает не причинное воздействие <tex>B</tex> на <tex>A</tex>, а изменение доступной информации. До получения условия неопределённость описывается исходным распределением вероятностей. После того как известно, что <tex>B</tex> произошло, все исходы вне <tex>B</tex> становятся несовместимыми с наблюдением и исключаются из рассмотрения.
+
Вероятность совместного наступления двух событий равна вероятности условия, умноженной на вероятность второго события внутри этого условия.
-
Например, если из набора объектов случайно выбран один объект, событие <tex>A</tex> может означать, что объект принадлежит некоторому классу, а событие <tex>B</tex> — что у него есть определённый признак. Вероятность <tex>P(A)</tex> описывает долю объектов класса <tex>A</tex> во всей совокупности, а <tex>P(A\mid B)</tex> — долю объектов класса <tex>A</tex> только среди объектов с признаком <tex>B</tex>. Поэтому условная вероятность формализует уточнение неопределённости после добавления информации.
+
То же совместное событие можно представить в обратном порядке:
-
== Связь с формулой полной вероятности и формулой Байеса ==
+
:<tex>P(A\cap B)=P(B\mid A)P(A).</tex>
-
Пусть события <tex>B_1,\ldots,B_k</tex> образуют разбиение пространства исходов: ровно одно из них происходит, и каждое имеет положительную вероятность. Тогда для любого события <tex>A</tex> выполняется [[формула полной вероятности]]:
+
Оба выражения описывают одну и ту же вероятность, но начинают разложение с разных событий.
-
:<tex>P(A)=\sum_{i=1}^{k}P(A\mid B_i)P(B_i)</tex>
+
Для нескольких событий правило умножения обобщается в цепное правило:
-
Эта формула говорит, что общая вероятность <tex>A</tex> может быть получена как сумма вкладов по нескольким взаимоисключающим случаям. В машинном обучении такой принцип появляется, например, при маргинализации по скрытым классам, латентным переменным или компонентам смеси.
+
:<tex>P(A_1\cap\cdots\cap A_n)=P(A_1)\prod_{i=2}^{n}P(A_i\mid A_1\cap\cdots\cap A_{i-1}).</tex>
-
Из правила умножения и формулы полной вероятности следует [[формула Байеса]]:
+
Совместная вероятность последовательности событий раскладывается в произведение вероятности первого события и условных вероятностей каждого следующего события при известных предыдущих.
-
:<tex>P(B_j\mid A)=\frac{P(A\mid B_j)P(B_j)}{\sum_{i=1}^{k}P(A\mid B_i)P(B_i)}</tex>
+
Цепное правило применяется в вероятностных графических моделях, моделях последовательностей и авторегрессионных моделях.
-
Формула Байеса показывает, как вероятность гипотезы <tex>B_j</tex> обновляется после наблюдения <tex>A</tex>. Множитель <tex>P(B_j)</tex> задаёт априорную вероятность гипотезы, <tex>P(A\mid B_j)</tex> — правдоподобие наблюдения при этой гипотезе, а знаменатель нормирует вероятности всех гипотез так, чтобы их сумма была равна единице.<ref name="Feller1968">Feller W. ''An Introduction to Probability Theory and Its Applications''. Vol. 1. 3rd ed. Wiley, 1968.</ref><ref name="Billingsley1995">Billingsley P. ''Probability and Measure''. 3rd ed. Wiley, 1995.</ref>
+
=== Формула полной вероятности ===
-
В [[байесовская статистика|байесовской статистике]] эта формула используется для перехода от априорного распределения параметров к апостериорному распределению после наблюдения данных. В классическом анализе данных она также полезна как способ не путать прямую и обратную условные вероятности.
+
Пусть несколько попарно несовместимых событий образуют [[Полная группа событий|полную группу событий]]. Тогда вероятность произвольного события можно разложить по этой группе:
 +
 
 +
:<tex>P(A)=\sum_{i=1}^{k}P(A\mid B_i)P(B_i).</tex>
 +
 
 +
Каждое слагаемое описывает один возможный способ наступления изучаемого события. Общая вероятность получается сложением вкладов всех взаимоисключающих случаев.
 +
 
 +
В анализе данных такая операция называется маргинализацией. Она применяется, когда скрытая переменная, класс или компонент модели не наблюдается непосредственно и должен быть исключён суммированием или интегрированием.
 +
 
 +
=== Формула Байеса ===
 +
 
 +
Приравнивание двух вариантов правила умножения даёт [[Формула Байеса|формулу Байеса]]:
 +
 
 +
:<tex>P(B\mid A)=\frac{P(A\mid B)P(B)}{P(A)},\quad P(A)>0.</tex>
 +
 
 +
Она позволяет перейти от вероятности наблюдения при заданной гипотезе к вероятности гипотезы после получения наблюдения.
 +
 
 +
Если гипотезы образуют полную группу событий, знаменатель можно раскрыть по формуле полной вероятности:
 +
 
 +
:<tex>P(B_j\mid A)=\frac{P(A\mid B_j)P(B_j)}{\sum_{i=1}^{k}P(A\mid B_i)P(B_i)}.</tex>
 +
 
 +
В этой записи исходная вероятность гипотезы называется априорной, вероятность данных при гипотезе — правдоподобием, а результат — апостериорной вероятностью. Знаменатель учитывает все рассматриваемые объяснения наблюдения и нормирует результат.
 +
 
 +
== Пример ==
 +
 
 +
Рассмотрим стандартную колоду из 52 карт. В ней имеется 12 карт с изображением фигур: четыре валета, четыре дамы и четыре короля. Среди этих 12 карт находятся четыре короля.
 +
 
 +
Если известно, что выбранная карта является фигурой, условная вероятность получить короля равна
 +
 
 +
:<tex>P(K\mid F)=\frac{4}{12}=\frac{1}{3}.</tex>
 +
 
 +
После получения условия пространство возможных исходов сократилось со всей колоды до 12 фигурных карт. Из них четыре являются королями.
 +
 
 +
Если, напротив, известно, что выбранная карта является королём, она обязательно является фигурой:
 +
 
 +
:<tex>P(F\mid K)=\frac{4}{4}=1.</tex>
 +
 
 +
Пример показывает, что перестановка события и условия обычно изменяет вероятность. Вероятность короля среди фигурных карт и вероятность фигурной карты среди королей отвечают на разные вопросы.
== Условная независимость ==
== Условная независимость ==
-
Два события <tex>A</tex> и <tex>C</tex> называются условно независимыми при условии <tex>B</tex>, если знание <tex>C</tex> не меняет вероятность <tex>A</tex> после того, как уже известно <tex>B</tex>. При <tex>P(B)>0</tex> это можно записать как
+
Два события называются '''условно независимыми''' при известном третьем событии, если внутри заданного условия их совместная вероятность раскладывается в произведение:
-
:<tex>P(A\cap C\mid B)=P(A\mid B)P(C\mid B)</tex>
+
:<tex>P(A\cap C\mid B)=P(A\mid B)P(C\mid B).</tex>
-
Смысл этого равенства состоит в том, что внутри подпространства, заданного условием <tex>B</tex>, события <tex>A</tex> и <tex>C</tex> ведут себя как независимые. Условная независимость не совпадает с обычной независимостью: две величины могут быть зависимы без условия, но независимы при фиксированном значении третьей величины, и наоборот.
+
После учёта условия знание одного из двух событий не даёт дополнительной информации о другом.
-
Понятие [[условная независимость|условной независимости]] лежит в основе [[байесовская сеть|байесовских сетей]], графических моделей и многих приближённых вероятностных методов. Оно позволяет разложить сложное совместное распределение на произведение более простых условных распределений.<ref name="KollerFriedman2009">Koller D., Friedman N. ''Probabilistic Graphical Models: Principles and Techniques''. MIT Press, 2009.</ref><ref name="Pearl1988">Pearl J. ''Probabilistic Reasoning in Intelligent Systems: Networks of Plausible Inference''. Morgan Kaufmann, 1988.</ref> В терминах [[взаимная информация|взаимной информации]] это соответствует нулевой условной взаимной информации.<ref name="CoverThomas2006">Cover T. M., Thomas J. A. ''Elements of Information Theory''. 2nd ed. Wiley-Interscience, 2006.</ref>
+
Эквивалентное представление при положительных вероятностях соответствующих условий имеет вид
-
== От событий к случайным величинам ==
+
:<tex>P(A\mid B\cap C)=P(A\mid B).</tex>
-
В задачах анализа данных чаще работают не с отдельными событиями, а со [[случайная величина|случайными величинами]]. Если <tex>X</tex> и <tex>Y</tex> — дискретные случайные величины, то условная вероятность значения <tex>Y=y</tex> при условии <tex>X=x</tex> задаётся как
+
Добавление информации о втором событии не изменяет вероятность первого, если условие уже известно.
-
:<tex>P(Y=y\mid X=x)=\frac{P(Y=y,X=x)}{P(X=x)}</tex>
+
[[Условная независимость]] не совпадает с обычной независимостью. События могут быть зависимыми без условия и становиться независимыми после учёта третьего события. Возможна и обратная ситуация: независимые события могут стать зависимыми после обусловливания.
-
Эта формула является прямым обобщением определения для событий. Она говорит, что распределение <tex>Y</tex> пересчитывается внутри подмножества наблюдений, где <tex>X=x</tex>.
+
Например, результаты двух независимых бросков монеты становятся зависимыми, если известно, что выпавшие стороны различаются. После получения этого условия результат одного броска полностью определяет результат другого.
-
Для непрерывных случайных величин событие <tex>X=x</tex> обычно имеет вероятность ноль, поэтому простое деление на <tex>P(X=x)</tex> неприменимо. В этом случае используют условные плотности. Если существует совместная плотность <tex>f_{X,Y}(x,y)</tex> и маргинальная плотность <tex>f_X(x)>0</tex>, то
+
Условная независимость лежит в основе [[Байесовская сеть|байесовских сетей]], марковских сетей и других [[Вероятностная графическая модель|вероятностных графических моделей]]. Она позволяет представлять многомерные распределения как произведение сравнительно простых локальных распределений<ref name="koller">{{книга |автор=Koller D., Friedman N. |заглавие=Probabilistic Graphical Models: Principles and Techniques |место=Cambridge, MA |издательство=MIT Press |год=2009 |isbn=978-0-262-01319-2}}</ref>.
-
:<tex>f_{Y\mid X}(y\mid x)=\frac{f_{X,Y}(x,y)}{f_X(x)}</tex>
+
== Условные распределения случайных величин ==
-
Здесь <tex>f_{Y\mid X}(y\mid x)</tex> описывает форму распределения возможных значений <tex>Y</tex> при фиксированном значении <tex>X=x</tex>. В более общей теории меры это понятие формализуется через регулярные условные распределения, но в большинстве прикладных задач достаточно понимать условное распределение как распределение целевой величины среди объектов с заданными признаками.<ref name="Durrett2019">Durrett R. ''Probability: Theory and Examples''. 5th ed. Cambridge: Cambridge University Press, 2019.</ref>
+
В анализе данных чаще рассматриваются не отдельные события, а [[Случайная величина|случайные величины]]. Условное распределение одной величины описывает её возможные значения при известном значении другой.
 +
 
 +
=== Дискретный случай ===
 +
 
 +
Для дискретных случайных величин условная функция вероятности определяется как
 +
 
 +
:<tex>p_{Y\mid X}(y\mid x)=\frac{p_{X,Y}(x,y)}{p_X(x)},\quad p_X(x)>0.</tex>
 +
 
 +
В числителе находится совместная вероятность двух значений, а в знаменателе — маргинальная вероятность известного значения. Полученная функция нормирована по всем возможным значениям целевой величины:
 +
 
 +
:<tex>\sum_y p_{Y\mid X}(y\mid x)=1.</tex>
 +
 
 +
При каждом фиксированном условии получается отдельное распределение вероятностей.
 +
 
 +
=== Непрерывный случай ===
 +
 
 +
Для непрерывных величин вероятность отдельного точного значения обычно равна нулю. Поэтому непосредственное применение отношения вероятностей невозможно. Если существуют совместная и маргинальная плотности, условная плотность определяется формулой
 +
 
 +
:<tex>f_{Y\mid X}(y\mid x)=\frac{f_{X,Y}(x,y)}{f_X(x)},\quad f_X(x)>0.</tex>
 +
 
 +
Условная плотность показывает, как распределены возможные значения одной величины при фиксированном значении другой. Она нормирована по целевой переменной:
 +
 
 +
:<tex>\int_{-\infty}^{\infty}f_{Y\mid X}(y\mid x)\,dy=1.</tex>
 +
 
 +
В общей теории условное распределение может существовать и тогда, когда совместной плотности нет. Для этого используются регулярные условные распределения<ref name="durrett">{{книга |автор=Durrett R. |заглавие=Probability: Theory and Examples |издание=5th ed. |место=Cambridge |издательство=Cambridge University Press |год=2019}}</ref>.
 +
 
 +
=== Условное математическое ожидание ===
 +
 
 +
[[Условное математическое ожидание]] обобщает идею условной вероятности на числовые случайные величины. При наличии условной плотности оно вычисляется как
 +
 
 +
:<tex>E[g(Y)\mid X=x]=\int_{-\infty}^{\infty}g(y)f_{Y\mid X}(y\mid x)\,dy.</tex>
 +
 
 +
Условное ожидание усредняет функцию целевой величины при фиксированной информации о признаках.
 +
 
 +
Для самой целевой величины получается условное среднее:
 +
 
 +
:<tex>E[Y\mid X=x]=\int_{-\infty}^{\infty}y f_{Y\mid X}(y\mid x)\,dy.</tex>
 +
 
 +
В задачах регрессии условное среднее является оптимальным точечным прогнозом при квадратичной функции потерь.
 +
 
 +
== Оценивание по данным ==
 +
 
 +
Истинная условная вероятность является свойством распределения генеральной совокупности и обычно неизвестна. По конечной выборке её можно оценить относительной частотой:
 +
 
 +
:<tex>\widehat{P}(A\mid B)=\frac{n(A\cap B)}{n(B)},\quad n(B)>0.</tex>
 +
 
 +
В числителе находится число наблюдений, для которых произошли оба события, а в знаменателе — число наблюдений, удовлетворяющих условию.
 +
 
 +
Такая оценка естественна, но может быть нестабильной, если условие выполняется редко. При малом размере подгруппы даже одно дополнительное наблюдение способно заметно изменить результат.
 +
 
 +
В пространствах с большим числом признаков точное сочетание значений может не повторяться в выборке. Поэтому условные вероятности оценивают с помощью параметрических моделей, сглаживания, ближайших соседей, деревьев решений, ядерных методов, нейронных сетей и других методов статистического обучения.
 +
 
 +
Следует различать три объекта:
 +
 
 +
* '''истинную условную вероятность''' — свойство неизвестного распределения данных;
 +
* '''эмпирическую оценку''' — величину, вычисленную по конечной выборке;
 +
* '''модельный прогноз''' — результат, полученный обученным алгоритмом.
 +
 
 +
Даже если модель выдаёт число между нулём и единицей, оно не обязательно совпадает с истинной условной вероятностью. Его качество необходимо проверять на данных, не использованных при обучении.
== Условная вероятность в машинном обучении ==
== Условная вероятность в машинном обучении ==
-
В [[машинное обучение|машинном обучении]] условная вероятность служит языком для описания предсказания. В задаче классификации объект описывается признаками <tex>X</tex>, а ответ — меткой класса <tex>Y</tex>. Вероятностный классификатор стремится оценить
+
=== Обучение с учителем ===
-
:<tex>P(Y=y\mid X=x)</tex>
+
В [[Обучение с учителем|обучении с учителем]] модель получает признаки объекта и должна предсказать целевую переменную. Вероятностная постановка задачи состоит в оценивании условного распределения ответа при известных признаках.
-
Эта величина означает вероятность класса <tex>y</tex> среди объектов, похожих на объект <tex>x</tex> по признакам. Если модель выдаёт распределение по классам, то её прогноз можно рассматривать не только как выбор наиболее вероятного класса, но и как оценку неопределённости.
+
В классификации модель оценивает вероятности классов и может выбирать класс с наибольшей условной вероятностью:
-
В регрессии аналогичной целью является условное распределение <tex>p(y\mid x)</tex>. Точечный прогноз, например среднее или медиана, является лишь кратким описанием этого распределения. Полное условное распределение может показывать асимметрию, несколько возможных режимов и различную неопределённость для разных областей пространства признаков.
+
:<tex>\widehat{y}(x)=\mathop{\rm arg\,max}_{y}P(Y=y\mid X=x).</tex>
-
Вероятностные модели машинного обучения можно условно разделить на генеративные и дискриминативные. Генеративные модели описывают совместное распределение <tex>P(X,Y)</tex> или <tex>P(X\mid Y)P(Y)</tex>, а затем получают <tex>P(Y\mid X)</tex> через формулу Байеса. Дискриминативные модели непосредственно оценивают <tex>P(Y\mid X)</tex> или функцию, достаточную для выбора класса.<ref name="Bishop2006" /><ref name="Murphy2012" />
+
Такое правило оптимально при одинаковой стоимости всех ошибок и правильной оценке условных вероятностей.
-
Примером генеративного подхода является [[наивный байесовский классификатор]]. Он использует предположение об условной независимости признаков при заданном классе:
+
Если ошибки имеют разную стоимость, решение должно учитывать [[Функция потерь|функцию потерь]], а наиболее вероятный класс не обязательно будет оптимальным действием.
-
:<tex>P(Y\mid X_1,\ldots,X_d)\propto P(Y)\prod_{j=1}^{d}P(X_j\mid Y)</tex>
+
В регрессии точечный прогноз зависит от выбранной функции потерь. При квадратичной потере оптимальным является условное математическое ожидание:
-
Смысл этой формулы состоит в том, что вероятность класса пересчитывается по априорной частоте класса и по тому, насколько наблюдаемые признаки типичны для этого класса. Предположение независимости редко выполняется буквально, но часто даёт простую и устойчивую базовую модель.
+
:<tex>\widehat{y}(x)=E[Y\mid X=x].</tex>
-
В нейронных сетях для классификации выход слоя softmax обычно интерпретируют как модельную оценку <tex>P(Y\mid X)</tex>. Однако такая оценка не обязана быть хорошо откалиброванной. Исследование Guo et al. показало, что современные нейронные сети могут иметь высокую точность, но завышенную уверенность, а простая температурная калибровка часто улучшает соответствие между предсказанными вероятностями и фактическими частотами.<ref name="Guo2017">Guo C., Pleiss G., Sun Y., Weinberger K. Q. On Calibration of Modern Neural Networks. ''Proceedings of the 34th International Conference on Machine Learning'', PMLR 70:1321–1330, 2017.</ref>
+
При абсолютной ошибке оптимальным прогнозом является условная медиана, а при асимметричной квантильной потере — соответствующий условный квантиль. Таким образом, функция потерь определяет, какую характеристику условного распределения должна оценивать модель.
-
Условная вероятность также важна при [[сдвиг распределения|сдвиге распределения]]. Если распределение данных на обучении и применении различается, то оценка <tex>P(Y\mid X)</tex>, полученная на обучающей выборке, может перестать соответствовать реальным частотам. В работе Ovadia et al. было показано, что качество оценок неопределённости и [[калибровка вероятностей|калибровка вероятностей]] могут существенно ухудшаться при сдвиге данных.<ref name="Ovadia2019">Ovadia Y. et al. Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift. ''NeurIPS'', 32, 2019.</ref>
+
=== Генеративные и дискриминативные модели ===
-
Современные методы неопределённости, включая [[конформное предсказание]], используют условные и эмпирические идеи для построения интервалов или множеств предсказаний с контролируемым уровнем ошибки. Конформное предсказание не требует точного знания истинного условного распределения, но использует данные для получения гарантий покрытия при определённых предположениях об обменности наблюдений.<ref name="AngelopoulosBates2023">Angelopoulos A. N., Bates S. Conformal Prediction: A Gentle Introduction. ''Foundations and Trends in Machine Learning'', 16(4):494–591, 2023.</ref>
+
'''Дискриминативные модели''' непосредственно оценивают условное распределение ответа при признаках или строят границу между классами. К ним относятся логистическая регрессия и многие нейронные классификаторы.
-
== Истинная вероятность, эмпирическая оценка и модельный прогноз ==
+
'''Генеративные модели''' описывают распределение признаков внутри классов и априорные вероятности классов. После этого условные вероятности классов вычисляются по формуле Байеса:
-
В прикладной работе важно различать три уровня: истинную условную вероятность, её эмпирическую оценку и прогноз модели.
+
:<tex>P(Y=y\mid X=x)=\frac{p(x\mid y)P(Y=y)}{\sum_k p(x\mid k)P(Y=k)}.</tex>
-
Истинная условная вероятность — это свойство распределения, из которого порождаются данные. Например, <tex>P(Y=1\mid X=x)</tex> означает реальную вероятность положительного класса среди объектов с признаками <tex>x</tex>. Обычно она неизвестна: исследователь видит только конечную выборку.
+
Такой подход моделирует механизм появления признаков и позволяет использовать совместное распределение для классификации, генерации данных и работы с частично наблюдаемыми объектами<ref name="bishop" />.
-
Эмпирическая оценка строится по данным. Для событий <tex>A</tex> и <tex>B</tex> естественная частотная оценка имеет вид
+
=== Наивный байесовский классификатор ===
-
:<tex>\widehat P(A\mid B)=\frac{n(A\cap B)}{n(B)}</tex>
+
[[Наивный байесовский классификатор]] предполагает, что признаки условно независимы при известном классе:
-
Здесь <tex>n(B)</tex> — число наблюдений, где произошло <tex>B</tex>, а <tex>n(A\cap B)</tex> — число наблюдений, где произошли оба события. Такая оценка понятна, но может быть нестабильной, если <tex>n(B)</tex> мало. В пространствах с большим числом признаков точное повторение <tex>X=x</tex> может вообще почти не встречаться, поэтому требуются сглаживание, параметрические модели, непараметрические методы или регуляризация.
+
:<tex>p(x_1,\ldots,x_d\mid y)=\prod_{j=1}^{d}p(x_j\mid y).</tex>
-
Модельный прогноз — это значение, выдаваемое обученной моделью:
+
Благодаря этому многомерное распределение признаков заменяется произведением одномерных распределений. Это значительно уменьшает число оцениваемых параметров.
-
:<tex>\hat p_\theta(y\mid x)</tex>
+
Апостериорная вероятность класса пропорциональна произведению априорной вероятности и условных распределений признаков:
-
Он зависит от архитектуры модели, признаков, функции потерь, процедуры обучения и обучающей выборки. Даже если модель выдаёт число от 0 до 1, это число не автоматически является истинной вероятностью. Его нужно оценивать по качеству предсказаний, калибровке, устойчивости к сдвигу распределения и поведению на релевантных подгруппах данных.<ref name="Guo2017" /><ref name="Ovadia2019" />
+
:<tex>P(y\mid x_1,\ldots,x_d)\propto P(y)\prod_{j=1}^{d}p(x_j\mid y).</tex>
-
Функция потерь также может иметь вероятностный смысл. Например, отрицательное логарифмическое правдоподобие для одного наблюдения записывается как
+
Предположение условной независимости редко выполняется буквально, однако классификатор часто остаётся полезной базовой моделью, особенно для текстовых данных и задач с большим числом признаков.
-
:<tex>-\log \hat p_\theta(y_i\mid x_i)</tex>
+
=== Вероятностные графические модели ===
-
Эта величина штрафует модель сильнее, если она присваивает малую вероятность фактически наблюдённому ответу. Поэтому обучение по log loss стимулирует не только правильный выбор класса, но и осмысленные вероятностные оценки, хотя само по себе не гарантирует идеальной калибровки.
+
В [[Байесовская сеть|байесовской сети]] многомерное совместное распределение раскладывается в произведение локальных условных распределений:
-
== Примеры ==
+
:<tex>p(x_1,\ldots,x_d)=\prod_{j=1}^{d}p(x_j\mid {\rm pa}(x_j)).</tex>
-
=== Классификация писем ===
+
Каждая переменная зависит непосредственно только от своих родительских узлов. Структура графа кодирует условную независимость и позволяет выполнять вероятностный вывод при неполностью наблюдаемых данных<ref name="koller" />.
-
В задаче фильтрации спама событие <tex>Y=1</tex> может означать, что письмо является спамом, а <tex>X</tex> — набор признаков письма: слова, отправитель, ссылки, технические признаки заголовков. Классификатор оценивает <tex>P(Y=1\mid X=x)</tex>. Если модель выдаёт 0,9, корректная интерпретация состоит не в том, что конкретное письмо «на 90 % спам», а в том, что среди писем с похожими признаками ожидаемая доля спама близка к 90 %, если модель хорошо откалибрована.
+
=== Калибровка вероятностей ===
-
=== Оценка клика по рекомендации ===
+
Вероятностный классификатор должен не только правильно упорядочивать классы, но и выдавать числа, соответствующие наблюдаемым частотам. Если среди объектов, которым присвоена вероятность события около 80 процентов, событие действительно происходит примерно в 80 процентах случаев, модель считается [[Калибровка вероятностей|калиброванной]].
-
В рекомендательных системах часто оценивают вероятность действия пользователя при заданном контексте:
+
Высокая точность не гарантирует хорошей калибровки. Современные нейронные сети могут быть чрезмерно уверенными даже при высокой доле правильных ответов<ref name="guo">{{статья |автор=Guo C., Pleiss G., Sun Y., Weinberger K. Q. |заглавие=On Calibration of Modern Neural Networks |издание=Proceedings of the 34th International Conference on Machine Learning |год=2017 |том=70 |страницы=1321–1330}}</ref>.
-
:<tex>P(\mathrm{click}=1\mid \mathrm{user},\mathrm{item},\mathrm{context})</tex>
+
Для оценки вероятностных прогнозов применяются логарифмическая функция потерь, оценка Брайера, калибровочные диаграммы и другие методы. Калибровку следует проверять на данных, соответствующих реальным условиям применения модели.
-
Эта вероятность зависит от пользователя, объекта рекомендации, времени, устройства, позиции в выдаче и других факторов. Ошибка интерпретации возникает, если считать её неизменным свойством товара или пользователя. На самом деле это условная величина: изменение контекста может существенно изменить вероятность клика.
+
=== Сдвиг распределения ===
-
=== Диагностика качества модели по подгруппам ===
+
Условная вероятность, оценённая по историческим данным, может измениться после смены популяции, интерфейса, политики сбора данных или внешней среды. Это явление является частным проявлением [[Сдвиг распределения|сдвига распределения]].
-
Пусть <tex>A</tex> — событие ошибки модели, а <tex>B</tex> — принадлежность объекта к некоторой подгруппе. Тогда <tex>P(A\mid B)</tex> описывает частоту ошибок внутри этой подгруппы. Даже если общая ошибка модели мала, условная ошибка на отдельной группе может быть высокой. Поэтому анализ условных вероятностей важен для проверки надёжности и справедливости моделей.
+
При сдвиге данных модель может сохранять высокую численную уверенность, хотя её вероятностные оценки становятся менее надёжными. Эмпирические исследования показывают, что качество оценок неопределённости многих моделей ухудшается по мере усиления сдвига распределения<ref name="ovadia">{{статья |автор=Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. |заглавие=Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift |издание=Advances in Neural Information Processing Systems |год=2019 |том=32}}</ref>.
 +
 
 +
Поэтому после внедрения модели требуется контролировать распределение входных данных, качество предсказаний и калибровку вероятностей.
 +
 
 +
== Условная вероятность и причинность ==
 +
 
 +
Условная вероятность описывает статистическую зависимость при имеющейся информации, но сама по себе не устанавливает [[Причинность|причинную связь]]. Изменение вероятности одного события после наблюдения другого не означает, что второе событие вызывает первое.
 +
 
 +
Статистическая зависимость может возникать из-за общей причины, отбора наблюдений, обратного влияния или смешения нескольких групп. Для причинного вывода требуются дополнительные предположения, экспериментальное вмешательство или структурная причинная модель<ref name="pearl">{{книга |автор=Pearl J. |заглавие=Causality: Models, Reasoning, and Inference |издание=2nd ed. |место=Cambridge |издательство=Cambridge University Press |год=2009 |isbn=978-0-521-89560-6}}</ref>.
 +
 
 +
Условие и причинное вмешательство принципиально различаются. Условная вероятность отвечает на вопрос о распределении среди объектов, у которых признак наблюдается. Причинный вопрос относится к тому, как изменился бы результат при целенаправленном изменении этого признака.
== Типичные ошибки интерпретации ==
== Типичные ошибки интерпретации ==
-
'''Смешение <tex>P(A\mid B)</tex> и <tex>P(B\mid A)</tex>.''' Высокая вероятность признака при заданном классе не означает высокую вероятность класса при наличии признака. Для обратного вывода нужно учитывать базовые частоты через формулу Байеса.
+
=== Перестановка события и условия ===
-
'''Игнорирование базовой частоты.''' Если событие редко, то даже сильный индикатор может давать умеренную апостериорную вероятность. В анализе данных это проявляется при работе с редкими классами, мошенничеством, отказами оборудования и медицинскими тестами.
+
В общем случае условные вероятности с противоположным направлением не равны:
-
'''Причинная интерпретация условия.''' Запись <tex>P(A\mid B)</tex> сама по себе не означает, что <tex>B</tex> вызывает <tex>A</tex>. Она описывает статистическую информацию. Для причинных утверждений нужны дополнительные предположения, экспериментальный дизайн или методы [[каузальный вывод|каузального вывода]].<ref name="Pearl2009">Pearl J. ''Causality: Models, Reasoning, and Inference''. 2nd ed. Cambridge: Cambridge University Press, 2009.</ref>
+
:<tex>P(A\mid B)\ne P(B\mid A).</tex>
-
'''Оценка условной вероятности по слишком малой подвыборке.''' Если условие <tex>B</tex> выполняется редко, частотная оценка может иметь большую дисперсию. В таких случаях полезны доверительные интервалы, байесовское сглаживание, объединение похожих групп или более осторожная интерпретация.
+
Высокая вероятность признака среди объектов некоторого класса не означает столь же высокую вероятность класса среди объектов с этим признаком. Для обратного перехода требуется формула Байеса.
-
'''Отождествление выхода модели с истинной вероятностью.''' Вероятностный выход модели является оценкой, а не фактом. Он может быть смещённым, плохо откалиброванным или неприменимым вне распределения обучающих данных.
+
=== Игнорирование базовой частоты ===
-
'''Незамеченный сдвиг распределения.''' Условная вероятность, оцененная на исторических данных, может измениться после смены популяции, интерфейса, политики сбора данных или внешней среды. Поэтому модели требуют мониторинга после внедрения.
+
При оценке редкого события необходимо учитывать его исходную распространённость. Даже достаточно точный индикатор может давать умеренную апостериорную вероятность, если изучаемое событие встречается редко.
-
'''Утечка данных.''' Если признаки содержат информацию, недоступную в момент реального предсказания, модель может научиться оценивать не нужную условную вероятность <tex>P(Y\mid X)</tex>, а искусственную зависимость, созданную процедурой сбора данных. Это приводит к завышенной оценке качества на тестировании и плохой работе в эксплуатации.
+
Эта ошибка особенно существенна при медицинской диагностике, обнаружении мошенничества, прогнозировании отказов и классификации с сильным дисбалансом классов.
-
== Исторический контекст ==
+
=== Отождествление условия с причиной ===
-
Идеи условной вероятности возникли в ранней теории шансов, где исследовались азартные игры, страхование и демографические расчёты. В 1763 году была посмертно опубликована работа Томаса Байеса «An Essay towards solving a Problem in the Doctrine of Chances», подготовленная к публикации Ричардом Прайсом. Она содержала рассуждения, которые позднее стали связывать с байесовским обновлением вероятностей.<ref name="Bayes1763">Bayes T., Price R. An Essay towards solving a Problem in the Doctrine of Chances. ''Philosophical Transactions of the Royal Society of London'', 53:370–418, 1763.</ref>
+
Статистическое условие описывает полученную информацию. Оно не означает, что условное событие вызвало изучаемый результат.
-
Пьер-Симон Лаплас независимо развивал методы обратной вероятности и систематически применял вероятностные рассуждения к статистическим и астрономическим задачам. Его книга «Théorie analytique des probabilités» 1812 года стала одним из ключевых трудов классической вероятностной теории.<ref name="Laplace1812">Laplace P.-S. ''Théorie analytique des probabilités''. Paris: Courcier, 1812.</ref>
+
=== Оценивание по малой подвыборке ===
-
Современная аксиоматическая форма теории вероятностей была дана Андреем Николаевичем Колмогоровым в 1933 году. В этой теории условная вероятность событий с положительной вероятностью определяется через отношение вероятностей, а более тонкие случаи, связанные с условием на событие вероятности ноль, развиваются средствами теории меры.<ref name="Kolmogorov1933" />
+
Если условие выполняется редко, частотная оценка строится по небольшому числу наблюдений и имеет высокую случайную изменчивость. В таком случае полезны доверительные интервалы, регуляризация, байесовское сглаживание или объединение содержательно близких групп.
-
В XX и XXI веках условная вероятность стала центральным языком статистического вывода, теории информации, графических моделей и машинного обучения. В современной практике она используется не только для вывода формул, но и для постановки задач: что именно известно на момент прогноза, какое распределение нужно оценить, насколько модельная оценка соответствует реальным частотам и как она меняется при сдвиге данных.
+
=== Отождествление прогноза с истинной вероятностью ===
 +
 
 +
Вероятностный выход модели является оценкой. Он зависит от обучающей выборки, признаков, семейства моделей, функции потерь и процедуры оптимизации. Его необходимо проверять на калибровку и устойчивость.
 +
 
 +
=== Игнорирование сдвига распределения ===
 +
 
 +
Оценка, корректная на обучающих данных, может стать неверной после изменения условий. Наличие вероятностного выхода не освобождает от мониторинга модели после внедрения.
 +
 
 +
=== Утечка данных ===
 +
 
 +
Если признаки содержат информацию, недоступную в момент реального предсказания, модель оценивает искусственную условную зависимость. Это приводит к завышенному качеству при тестировании и ухудшению результатов в эксплуатации.
 +
 
 +
== Исторический контекст ==
 +
 
 +
Условные вероятностные рассуждения использовались в классической теории шансов задолго до появления современной аксиоматики. Значительную роль в развитии методов обратной вероятности сыграла посмертно опубликованная работа Томаса Байеса, представленная Королевскому обществу Ричардом Прайсом в 1763 году<ref name="bayes">{{статья |автор=Bayes T., Price R. |заглавие=An Essay towards Solving a Problem in the Doctrine of Chances |издание=Philosophical Transactions of the Royal Society of London |год=1763 |том=53 |страницы=370–418 |doi=10.1098/rstl.1763.0053}}</ref>.
 +
 
 +
Пьер-Симон Лаплас развил методы обратной вероятности и применял их в статистических, демографических и астрономических задачах. Формула, известная сегодня как формула Байеса, получила у Лапласа более общий и систематический вид.
 +
 
 +
Современная аксиоматическая теория вероятностей была изложена Андреем Николаевичем Колмогоровым в 1933 году. В ней условная вероятность события при условии события положительной вероятности определяется как отношение вероятности их пересечения к вероятности условия<ref name="kolmogorov">{{книга |автор=Kolmogorov A. N. |заглавие=Grundbegriffe der Wahrscheinlichkeitsrechnung |место=Berlin |издательство=Springer |год=1933}}</ref>.
== См. также ==
== См. также ==
-
* [[вероятность]]
+
* [[Вероятность]]
-
* [[случайное событие]]
+
* [[Случайное событие]]
-
* [[случайная величина]]
+
* [[Случайная величина]]
-
* [[формула полной вероятности]]
+
* [[Формула полной вероятности]]
-
* [[формула Байеса]]
+
* [[Формула Байеса]]
-
* [[условная независимость]]
+
* [[Условное математическое ожидание]]
-
* [[байесовская сеть]]
+
* [[Условная независимость]]
-
* [[наивный байесовский классификатор]]
+
* [[Байесовская статистика]]
-
* [[калибровка вероятностей]]
+
* [[Байесовская сеть]]
-
* [[сдвиг распределения]]
+
* [[Наивный байесовский классификатор]]
-
* [[взаимная информация]]
+
* [[Калибровка вероятностей]]
-
* [[конформное предсказание]]
+
* [[Сдвиг распределения]]
 +
* [[Причинный вывод]]
-
== Литература ==
+
== Примечания ==
-
<references />
+
{{примечания}}
 +
 
 +
== Литература ==
-
[[Категория:Теория вероятностей]]
+
* {{статья |автор=Bayes T., Price R. |заглавие=An Essay towards Solving a Problem in the Doctrine of Chances |издание=Philosophical Transactions of the Royal Society of London |год=1763 |том=53 |страницы=370–418 |doi=10.1098/rstl.1763.0053}}
-
[[Категория:Машинное обучение]]
+
* {{книга |автор=Billingsley P. |заглавие=Probability and Measure |издание=3rd ed. |место=New York |издательство=Wiley |год=1995}}
 +
* {{книга |автор=Bishop C. M. |заглавие=Pattern Recognition and Machine Learning |место=New York |издательство=Springer |год=2006 |isbn=978-0-387-31073-2}}
 +
* {{книга |автор=Durrett R. |заглавие=Probability: Theory and Examples |издание=5th ed. |место=Cambridge |издательство=Cambridge University Press |год=2019}}
 +
* {{статья |автор=Guo C., Pleiss G., Sun Y., Weinberger K. Q. |заглавие=On Calibration of Modern Neural Networks |издание=Proceedings of the 34th International Conference on Machine Learning |год=2017 |том=70 |страницы=1321–1330}}
 +
* {{книга |автор=Koller D., Friedman N. |заглавие=Probabilistic Graphical Models: Principles and Techniques |место=Cambridge, MA |издательство=MIT Press |год=2009 |isbn=978-0-262-01319-2}}
 +
* {{книга |автор=Kolmogorov A. N. |заглавие=Grundbegriffe der Wahrscheinlichkeitsrechnung |место=Berlin |издательство=Springer |год=1933}}
 +
* {{книга |автор=Murphy K. P. |заглавие=Probabilistic Machine Learning: An Introduction |место=Cambridge, MA |издательство=MIT Press |год=2022}}
 +
* {{статья |автор=Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. |заглавие=Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift |издание=Advances in Neural Information Processing Systems |год=2019 |том=32}}
 +
* {{книга |автор=Pearl J. |заглавие=Causality: Models, Reasoning, and Inference |издание=2nd ed. |место=Cambridge |издательство=Cambridge University Press |год=2009 |isbn=978-0-521-89560-6}}

Текущая версия

Содержание

Условная вероятностьвероятность одного случайного события, вычисленная при условии, что другое событие произошло или рассматривается как известное. Она формализует изменение вероятностной оценки после получения дополнительной информации.

Условная вероятность является одним из основных понятий теории вероятностей, математической статистики и машинного обучения. Многие задачи предсказания сводятся к оцениванию распределения целевой переменной при известных признаках объекта[1][1].

Основная идея

Получение новой информации изменяет множество исходов, которые остаются возможными. Если стало известно, что некоторое событие произошло, все исходы, несовместимые с ним, исключаются из рассмотрения. Вероятности оставшихся исходов пересчитываются так, чтобы их сумма снова была равна единице.

Например, если случайно выбирается объект из совокупности, исходная вероятность принадлежности объекта к некоторому классу определяется долей этого класса во всей совокупности. После получения информации о наличии определённого признака рассматриваются только объекты с таким признаком. Доля нужного класса внутри этой подгруппы может заметно отличаться от его доли среди всех объектов.

Условие в вероятностной записи выражает имеющуюся информацию, а не обязательно причинное воздействие. Условная вероятность может измениться при наблюдении признака, даже если этот признак не является причиной изучаемого события.

Определение

Пусть рассматриваются два события, причём вероятность события, принятого за условие, положительна. Условная вероятность определяется как

P(A\mid B)=\frac{P(A\cap B)}{P(B)},\quad P(B)>0.

В числителе находится вероятность одновременного наступления обоих событий. Деление на вероятность условия нормирует вероятности внутри той части пространства исходов, которая совместима с полученной информацией.

При фиксированном условии условная вероятность обладает обычными свойствами вероятностной меры. Она неотрицательна, вероятность достоверного события равна единице, а вероятности попарно несовместимых событий складываются.

Определение через отношение применимо только к условиям с положительной вероятностью. В более общей теоретико-мерной постановке условные вероятности и условные распределения определяются с помощью условных математических ожиданий и регулярных условных мер[1].

Основные свойства

Правило умножения

Из определения условной вероятности следует правило умножения:

P(A\cap B)=P(A\mid B)P(B).

Вероятность совместного наступления двух событий равна вероятности условия, умноженной на вероятность второго события внутри этого условия.

То же совместное событие можно представить в обратном порядке:

P(A\cap B)=P(B\mid A)P(A).

Оба выражения описывают одну и ту же вероятность, но начинают разложение с разных событий.

Для нескольких событий правило умножения обобщается в цепное правило:

P(A_1\cap\cdots\cap A_n)=P(A_1)\prod_{i=2}^{n}P(A_i\mid A_1\cap\cdots\cap A_{i-1}).

Совместная вероятность последовательности событий раскладывается в произведение вероятности первого события и условных вероятностей каждого следующего события при известных предыдущих.

Цепное правило применяется в вероятностных графических моделях, моделях последовательностей и авторегрессионных моделях.

Формула полной вероятности

Пусть несколько попарно несовместимых событий образуют полную группу событий. Тогда вероятность произвольного события можно разложить по этой группе:

P(A)=\sum_{i=1}^{k}P(A\mid B_i)P(B_i).

Каждое слагаемое описывает один возможный способ наступления изучаемого события. Общая вероятность получается сложением вкладов всех взаимоисключающих случаев.

В анализе данных такая операция называется маргинализацией. Она применяется, когда скрытая переменная, класс или компонент модели не наблюдается непосредственно и должен быть исключён суммированием или интегрированием.

Формула Байеса

Приравнивание двух вариантов правила умножения даёт формулу Байеса:

P(B\mid A)=\frac{P(A\mid B)P(B)}{P(A)},\quad P(A)>0.

Она позволяет перейти от вероятности наблюдения при заданной гипотезе к вероятности гипотезы после получения наблюдения.

Если гипотезы образуют полную группу событий, знаменатель можно раскрыть по формуле полной вероятности:

P(B_j\mid A)=\frac{P(A\mid B_j)P(B_j)}{\sum_{i=1}^{k}P(A\mid B_i)P(B_i)}.

В этой записи исходная вероятность гипотезы называется априорной, вероятность данных при гипотезе — правдоподобием, а результат — апостериорной вероятностью. Знаменатель учитывает все рассматриваемые объяснения наблюдения и нормирует результат.

Пример

Рассмотрим стандартную колоду из 52 карт. В ней имеется 12 карт с изображением фигур: четыре валета, четыре дамы и четыре короля. Среди этих 12 карт находятся четыре короля.

Если известно, что выбранная карта является фигурой, условная вероятность получить короля равна

P(K\mid F)=\frac{4}{12}=\frac{1}{3}.

После получения условия пространство возможных исходов сократилось со всей колоды до 12 фигурных карт. Из них четыре являются королями.

Если, напротив, известно, что выбранная карта является королём, она обязательно является фигурой:

P(F\mid K)=\frac{4}{4}=1.

Пример показывает, что перестановка события и условия обычно изменяет вероятность. Вероятность короля среди фигурных карт и вероятность фигурной карты среди королей отвечают на разные вопросы.

Условная независимость

Два события называются условно независимыми при известном третьем событии, если внутри заданного условия их совместная вероятность раскладывается в произведение:

P(A\cap C\mid B)=P(A\mid B)P(C\mid B).

После учёта условия знание одного из двух событий не даёт дополнительной информации о другом.

Эквивалентное представление при положительных вероятностях соответствующих условий имеет вид

P(A\mid B\cap C)=P(A\mid B).

Добавление информации о втором событии не изменяет вероятность первого, если условие уже известно.

Условная независимость не совпадает с обычной независимостью. События могут быть зависимыми без условия и становиться независимыми после учёта третьего события. Возможна и обратная ситуация: независимые события могут стать зависимыми после обусловливания.

Например, результаты двух независимых бросков монеты становятся зависимыми, если известно, что выпавшие стороны различаются. После получения этого условия результат одного броска полностью определяет результат другого.

Условная независимость лежит в основе байесовских сетей, марковских сетей и других вероятностных графических моделей. Она позволяет представлять многомерные распределения как произведение сравнительно простых локальных распределений[1].

Условные распределения случайных величин

В анализе данных чаще рассматриваются не отдельные события, а случайные величины. Условное распределение одной величины описывает её возможные значения при известном значении другой.

Дискретный случай

Для дискретных случайных величин условная функция вероятности определяется как

p_{Y\mid X}(y\mid x)=\frac{p_{X,Y}(x,y)}{p_X(x)},\quad p_X(x)>0.

В числителе находится совместная вероятность двух значений, а в знаменателе — маргинальная вероятность известного значения. Полученная функция нормирована по всем возможным значениям целевой величины:

\sum_y p_{Y\mid X}(y\mid x)=1.

При каждом фиксированном условии получается отдельное распределение вероятностей.

Непрерывный случай

Для непрерывных величин вероятность отдельного точного значения обычно равна нулю. Поэтому непосредственное применение отношения вероятностей невозможно. Если существуют совместная и маргинальная плотности, условная плотность определяется формулой

f_{Y\mid X}(y\mid x)=\frac{f_{X,Y}(x,y)}{f_X(x)},\quad f_X(x)>0.

Условная плотность показывает, как распределены возможные значения одной величины при фиксированном значении другой. Она нормирована по целевой переменной:

\int_{-\infty}^{\infty}f_{Y\mid X}(y\mid x)\,dy=1.

В общей теории условное распределение может существовать и тогда, когда совместной плотности нет. Для этого используются регулярные условные распределения[1].

Условное математическое ожидание

Условное математическое ожидание обобщает идею условной вероятности на числовые случайные величины. При наличии условной плотности оно вычисляется как

E[g(Y)\mid X=x]=\int_{-\infty}^{\infty}g(y)f_{Y\mid X}(y\mid x)\,dy.

Условное ожидание усредняет функцию целевой величины при фиксированной информации о признаках.

Для самой целевой величины получается условное среднее:

E[Y\mid X=x]=\int_{-\infty}^{\infty}y f_{Y\mid X}(y\mid x)\,dy.

В задачах регрессии условное среднее является оптимальным точечным прогнозом при квадратичной функции потерь.

Оценивание по данным

Истинная условная вероятность является свойством распределения генеральной совокупности и обычно неизвестна. По конечной выборке её можно оценить относительной частотой:

\widehat{P}(A\mid B)=\frac{n(A\cap B)}{n(B)},\quad n(B)>0.

В числителе находится число наблюдений, для которых произошли оба события, а в знаменателе — число наблюдений, удовлетворяющих условию.

Такая оценка естественна, но может быть нестабильной, если условие выполняется редко. При малом размере подгруппы даже одно дополнительное наблюдение способно заметно изменить результат.

В пространствах с большим числом признаков точное сочетание значений может не повторяться в выборке. Поэтому условные вероятности оценивают с помощью параметрических моделей, сглаживания, ближайших соседей, деревьев решений, ядерных методов, нейронных сетей и других методов статистического обучения.

Следует различать три объекта:

  • истинную условную вероятность — свойство неизвестного распределения данных;
  • эмпирическую оценку — величину, вычисленную по конечной выборке;
  • модельный прогноз — результат, полученный обученным алгоритмом.

Даже если модель выдаёт число между нулём и единицей, оно не обязательно совпадает с истинной условной вероятностью. Его качество необходимо проверять на данных, не использованных при обучении.

Условная вероятность в машинном обучении

Обучение с учителем

В обучении с учителем модель получает признаки объекта и должна предсказать целевую переменную. Вероятностная постановка задачи состоит в оценивании условного распределения ответа при известных признаках.

В классификации модель оценивает вероятности классов и может выбирать класс с наибольшей условной вероятностью:

\widehat{y}(x)=\mathop{\rm arg\,max}_{y}P(Y=y\mid X=x).

Такое правило оптимально при одинаковой стоимости всех ошибок и правильной оценке условных вероятностей.

Если ошибки имеют разную стоимость, решение должно учитывать функцию потерь, а наиболее вероятный класс не обязательно будет оптимальным действием.

В регрессии точечный прогноз зависит от выбранной функции потерь. При квадратичной потере оптимальным является условное математическое ожидание:

\widehat{y}(x)=E[Y\mid X=x].

При абсолютной ошибке оптимальным прогнозом является условная медиана, а при асимметричной квантильной потере — соответствующий условный квантиль. Таким образом, функция потерь определяет, какую характеристику условного распределения должна оценивать модель.

Генеративные и дискриминативные модели

Дискриминативные модели непосредственно оценивают условное распределение ответа при признаках или строят границу между классами. К ним относятся логистическая регрессия и многие нейронные классификаторы.

Генеративные модели описывают распределение признаков внутри классов и априорные вероятности классов. После этого условные вероятности классов вычисляются по формуле Байеса:

P(Y=y\mid X=x)=\frac{p(x\mid y)P(Y=y)}{\sum_k p(x\mid k)P(Y=k)}.

Такой подход моделирует механизм появления признаков и позволяет использовать совместное распределение для классификации, генерации данных и работы с частично наблюдаемыми объектами[1].

Наивный байесовский классификатор

Наивный байесовский классификатор предполагает, что признаки условно независимы при известном классе:

p(x_1,\ldots,x_d\mid y)=\prod_{j=1}^{d}p(x_j\mid y).

Благодаря этому многомерное распределение признаков заменяется произведением одномерных распределений. Это значительно уменьшает число оцениваемых параметров.

Апостериорная вероятность класса пропорциональна произведению априорной вероятности и условных распределений признаков:

P(y\mid x_1,\ldots,x_d)\propto P(y)\prod_{j=1}^{d}p(x_j\mid y).

Предположение условной независимости редко выполняется буквально, однако классификатор часто остаётся полезной базовой моделью, особенно для текстовых данных и задач с большим числом признаков.

Вероятностные графические модели

В байесовской сети многомерное совместное распределение раскладывается в произведение локальных условных распределений:

p(x_1,\ldots,x_d)=\prod_{j=1}^{d}p(x_j\mid {\rm pa}(x_j)).

Каждая переменная зависит непосредственно только от своих родительских узлов. Структура графа кодирует условную независимость и позволяет выполнять вероятностный вывод при неполностью наблюдаемых данных[1].

Калибровка вероятностей

Вероятностный классификатор должен не только правильно упорядочивать классы, но и выдавать числа, соответствующие наблюдаемым частотам. Если среди объектов, которым присвоена вероятность события около 80 процентов, событие действительно происходит примерно в 80 процентах случаев, модель считается калиброванной.

Высокая точность не гарантирует хорошей калибровки. Современные нейронные сети могут быть чрезмерно уверенными даже при высокой доле правильных ответов[1].

Для оценки вероятностных прогнозов применяются логарифмическая функция потерь, оценка Брайера, калибровочные диаграммы и другие методы. Калибровку следует проверять на данных, соответствующих реальным условиям применения модели.

Сдвиг распределения

Условная вероятность, оценённая по историческим данным, может измениться после смены популяции, интерфейса, политики сбора данных или внешней среды. Это явление является частным проявлением сдвига распределения.

При сдвиге данных модель может сохранять высокую численную уверенность, хотя её вероятностные оценки становятся менее надёжными. Эмпирические исследования показывают, что качество оценок неопределённости многих моделей ухудшается по мере усиления сдвига распределения[1].

Поэтому после внедрения модели требуется контролировать распределение входных данных, качество предсказаний и калибровку вероятностей.

Условная вероятность и причинность

Условная вероятность описывает статистическую зависимость при имеющейся информации, но сама по себе не устанавливает причинную связь. Изменение вероятности одного события после наблюдения другого не означает, что второе событие вызывает первое.

Статистическая зависимость может возникать из-за общей причины, отбора наблюдений, обратного влияния или смешения нескольких групп. Для причинного вывода требуются дополнительные предположения, экспериментальное вмешательство или структурная причинная модель[1].

Условие и причинное вмешательство принципиально различаются. Условная вероятность отвечает на вопрос о распределении среди объектов, у которых признак наблюдается. Причинный вопрос относится к тому, как изменился бы результат при целенаправленном изменении этого признака.

Типичные ошибки интерпретации

Перестановка события и условия

В общем случае условные вероятности с противоположным направлением не равны:

P(A\mid B)\ne P(B\mid A).

Высокая вероятность признака среди объектов некоторого класса не означает столь же высокую вероятность класса среди объектов с этим признаком. Для обратного перехода требуется формула Байеса.

Игнорирование базовой частоты

При оценке редкого события необходимо учитывать его исходную распространённость. Даже достаточно точный индикатор может давать умеренную апостериорную вероятность, если изучаемое событие встречается редко.

Эта ошибка особенно существенна при медицинской диагностике, обнаружении мошенничества, прогнозировании отказов и классификации с сильным дисбалансом классов.

Отождествление условия с причиной

Статистическое условие описывает полученную информацию. Оно не означает, что условное событие вызвало изучаемый результат.

Оценивание по малой подвыборке

Если условие выполняется редко, частотная оценка строится по небольшому числу наблюдений и имеет высокую случайную изменчивость. В таком случае полезны доверительные интервалы, регуляризация, байесовское сглаживание или объединение содержательно близких групп.

Отождествление прогноза с истинной вероятностью

Вероятностный выход модели является оценкой. Он зависит от обучающей выборки, признаков, семейства моделей, функции потерь и процедуры оптимизации. Его необходимо проверять на калибровку и устойчивость.

Игнорирование сдвига распределения

Оценка, корректная на обучающих данных, может стать неверной после изменения условий. Наличие вероятностного выхода не освобождает от мониторинга модели после внедрения.

Утечка данных

Если признаки содержат информацию, недоступную в момент реального предсказания, модель оценивает искусственную условную зависимость. Это приводит к завышенному качеству при тестировании и ухудшению результатов в эксплуатации.

Исторический контекст

Условные вероятностные рассуждения использовались в классической теории шансов задолго до появления современной аксиоматики. Значительную роль в развитии методов обратной вероятности сыграла посмертно опубликованная работа Томаса Байеса, представленная Королевскому обществу Ричардом Прайсом в 1763 году[1].

Пьер-Симон Лаплас развил методы обратной вероятности и применял их в статистических, демографических и астрономических задачах. Формула, известная сегодня как формула Байеса, получила у Лапласа более общий и систематический вид.

Современная аксиоматическая теория вероятностей была изложена Андреем Николаевичем Колмогоровым в 1933 году. В ней условная вероятность события при условии события положительной вероятности определяется как отношение вероятности их пересечения к вероятности условия[1].

См. также

Примечания

Литература

  • Bayes T., Price R. An Essay towards Solving a Problem in the Doctrine of Chances // Philosophical Transactions of the Royal Society of London. — 1763. — Т. 53. — С. 370–418.
  • Billingsley P. Probability and Measure. — 3rd ed.. — New York: Wiley, 1995.
  • Bishop C. M. Pattern Recognition and Machine Learning. — New York: Springer, 2006. — ISBN 978-0-387-31073-2
  • Durrett R. Probability: Theory and Examples. — 5th ed.. — Cambridge: Cambridge University Press, 2019.
  • Guo C., Pleiss G., Sun Y., Weinberger K. Q. On Calibration of Modern Neural Networks // Proceedings of the 34th International Conference on Machine Learning. — 2017. — Т. 70. — С. 1321–1330.
  • Koller D., Friedman N. Probabilistic Graphical Models: Principles and Techniques. — Cambridge, MA: MIT Press, 2009. — ISBN 978-0-262-01319-2
  • Kolmogorov A. N. Grundbegriffe der Wahrscheinlichkeitsrechnung. — Berlin: Springer, 1933.
  • Murphy K. P. Probabilistic Machine Learning: An Introduction. — Cambridge, MA: MIT Press, 2022.
  • Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift // Advances in Neural Information Processing Systems. — 2019. — Т. 32.
  • Pearl J. Causality: Models, Reasoning, and Inference. — 2nd ed.. — Cambridge: Cambridge University Press, 2009. — ISBN 978-0-521-89560-6
Личные инструменты