Условная вероятность

Материал из MachineLearning.

Версия от 01:31, 19 июля 2026; Arina Iarovenko (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск

Содержание

Условная вероятностьвероятность одного случайного события, вычисленная при условии, что другое событие произошло или рассматривается как известное. Она формализует изменение вероятностной оценки после получения дополнительной информации.

Условная вероятность является одним из основных понятий теории вероятностей, математической статистики и машинного обучения. Многие задачи предсказания сводятся к оцениванию распределения целевой переменной при известных признаках объекта[1][1].

Основная идея

Получение новой информации изменяет множество исходов, которые остаются возможными. Если стало известно, что некоторое событие произошло, все исходы, несовместимые с ним, исключаются из рассмотрения. Вероятности оставшихся исходов пересчитываются так, чтобы их сумма снова была равна единице.

Например, если случайно выбирается объект из совокупности, исходная вероятность принадлежности объекта к некоторому классу определяется долей этого класса во всей совокупности. После получения информации о наличии определённого признака рассматриваются только объекты с таким признаком. Доля нужного класса внутри этой подгруппы может заметно отличаться от его доли среди всех объектов.

Условие в вероятностной записи выражает имеющуюся информацию, а не обязательно причинное воздействие. Условная вероятность может измениться при наблюдении признака, даже если этот признак не является причиной изучаемого события.

Определение

Пусть рассматриваются два события, причём вероятность события, принятого за условие, положительна. Условная вероятность определяется как

P(A\mid B)=\frac{P(A\cap B)}{P(B)},\quad P(B)>0.

В числителе находится вероятность одновременного наступления обоих событий. Деление на вероятность условия нормирует вероятности внутри той части пространства исходов, которая совместима с полученной информацией.

При фиксированном условии условная вероятность обладает обычными свойствами вероятностной меры. Она неотрицательна, вероятность достоверного события равна единице, а вероятности попарно несовместимых событий складываются.

Определение через отношение применимо только к условиям с положительной вероятностью. В более общей теоретико-мерной постановке условные вероятности и условные распределения определяются с помощью условных математических ожиданий и регулярных условных мер[1].

Основные свойства

Правило умножения

Из определения условной вероятности следует правило умножения:

P(A\cap B)=P(A\mid B)P(B).

Вероятность совместного наступления двух событий равна вероятности условия, умноженной на вероятность второго события внутри этого условия.

То же совместное событие можно представить в обратном порядке:

P(A\cap B)=P(B\mid A)P(A).

Оба выражения описывают одну и ту же вероятность, но начинают разложение с разных событий.

Для нескольких событий правило умножения обобщается в цепное правило:

P(A_1\cap\cdots\cap A_n)=P(A_1)\prod_{i=2}^{n}P(A_i\mid A_1\cap\cdots\cap A_{i-1}).

Совместная вероятность последовательности событий раскладывается в произведение вероятности первого события и условных вероятностей каждого следующего события при известных предыдущих.

Цепное правило применяется в вероятностных графических моделях, моделях последовательностей и авторегрессионных моделях.

Формула полной вероятности

Пусть несколько попарно несовместимых событий образуют полную группу событий. Тогда вероятность произвольного события можно разложить по этой группе:

P(A)=\sum_{i=1}^{k}P(A\mid B_i)P(B_i).

Каждое слагаемое описывает один возможный способ наступления изучаемого события. Общая вероятность получается сложением вкладов всех взаимоисключающих случаев.

В анализе данных такая операция называется маргинализацией. Она применяется, когда скрытая переменная, класс или компонент модели не наблюдается непосредственно и должен быть исключён суммированием или интегрированием.

Формула Байеса

Приравнивание двух вариантов правила умножения даёт формулу Байеса:

P(B\mid A)=\frac{P(A\mid B)P(B)}{P(A)},\quad P(A)>0.

Она позволяет перейти от вероятности наблюдения при заданной гипотезе к вероятности гипотезы после получения наблюдения.

Если гипотезы образуют полную группу событий, знаменатель можно раскрыть по формуле полной вероятности:

P(B_j\mid A)=\frac{P(A\mid B_j)P(B_j)}{\sum_{i=1}^{k}P(A\mid B_i)P(B_i)}.

В этой записи исходная вероятность гипотезы называется априорной, вероятность данных при гипотезе — правдоподобием, а результат — апостериорной вероятностью. Знаменатель учитывает все рассматриваемые объяснения наблюдения и нормирует результат.

Пример

Рассмотрим стандартную колоду из 52 карт. В ней имеется 12 карт с изображением фигур: четыре валета, четыре дамы и четыре короля. Среди этих 12 карт находятся четыре короля.

Если известно, что выбранная карта является фигурой, условная вероятность получить короля равна

P(K\mid F)=\frac{4}{12}=\frac{1}{3}.

После получения условия пространство возможных исходов сократилось со всей колоды до 12 фигурных карт. Из них четыре являются королями.

Если, напротив, известно, что выбранная карта является королём, она обязательно является фигурой:

P(F\mid K)=\frac{4}{4}=1.

Пример показывает, что перестановка события и условия обычно изменяет вероятность. Вероятность короля среди фигурных карт и вероятность фигурной карты среди королей отвечают на разные вопросы.

Условная независимость

Два события называются условно независимыми при известном третьем событии, если внутри заданного условия их совместная вероятность раскладывается в произведение:

P(A\cap C\mid B)=P(A\mid B)P(C\mid B).

После учёта условия знание одного из двух событий не даёт дополнительной информации о другом.

Эквивалентное представление при положительных вероятностях соответствующих условий имеет вид

P(A\mid B\cap C)=P(A\mid B).

Добавление информации о втором событии не изменяет вероятность первого, если условие уже известно.

Условная независимость не совпадает с обычной независимостью. События могут быть зависимыми без условия и становиться независимыми после учёта третьего события. Возможна и обратная ситуация: независимые события могут стать зависимыми после обусловливания.

Например, результаты двух независимых бросков монеты становятся зависимыми, если известно, что выпавшие стороны различаются. После получения этого условия результат одного броска полностью определяет результат другого.

Условная независимость лежит в основе байесовских сетей, марковских сетей и других вероятностных графических моделей. Она позволяет представлять многомерные распределения как произведение сравнительно простых локальных распределений[1].

Условные распределения случайных величин

В анализе данных чаще рассматриваются не отдельные события, а случайные величины. Условное распределение одной величины описывает её возможные значения при известном значении другой.

Дискретный случай

Для дискретных случайных величин условная функция вероятности определяется как

p_{Y\mid X}(y\mid x)=\frac{p_{X,Y}(x,y)}{p_X(x)},\quad p_X(x)>0.

В числителе находится совместная вероятность двух значений, а в знаменателе — маргинальная вероятность известного значения. Полученная функция нормирована по всем возможным значениям целевой величины:

\sum_y p_{Y\mid X}(y\mid x)=1.

При каждом фиксированном условии получается отдельное распределение вероятностей.

Непрерывный случай

Для непрерывных величин вероятность отдельного точного значения обычно равна нулю. Поэтому непосредственное применение отношения вероятностей невозможно. Если существуют совместная и маргинальная плотности, условная плотность определяется формулой

f_{Y\mid X}(y\mid x)=\frac{f_{X,Y}(x,y)}{f_X(x)},\quad f_X(x)>0.

Условная плотность показывает, как распределены возможные значения одной величины при фиксированном значении другой. Она нормирована по целевой переменной:

\int_{-\infty}^{\infty}f_{Y\mid X}(y\mid x)\,dy=1.

В общей теории условное распределение может существовать и тогда, когда совместной плотности нет. Для этого используются регулярные условные распределения[1].

Условное математическое ожидание

Условное математическое ожидание обобщает идею условной вероятности на числовые случайные величины. При наличии условной плотности оно вычисляется как

E[g(Y)\mid X=x]=\int_{-\infty}^{\infty}g(y)f_{Y\mid X}(y\mid x)\,dy.

Условное ожидание усредняет функцию целевой величины при фиксированной информации о признаках.

Для самой целевой величины получается условное среднее:

E[Y\mid X=x]=\int_{-\infty}^{\infty}y f_{Y\mid X}(y\mid x)\,dy.

В задачах регрессии условное среднее является оптимальным точечным прогнозом при квадратичной функции потерь.

Оценивание по данным

Истинная условная вероятность является свойством распределения генеральной совокупности и обычно неизвестна. По конечной выборке её можно оценить относительной частотой:

\widehat{P}(A\mid B)=\frac{n(A\cap B)}{n(B)},\quad n(B)>0.

В числителе находится число наблюдений, для которых произошли оба события, а в знаменателе — число наблюдений, удовлетворяющих условию.

Такая оценка естественна, но может быть нестабильной, если условие выполняется редко. При малом размере подгруппы даже одно дополнительное наблюдение способно заметно изменить результат.

В пространствах с большим числом признаков точное сочетание значений может не повторяться в выборке. Поэтому условные вероятности оценивают с помощью параметрических моделей, сглаживания, ближайших соседей, деревьев решений, ядерных методов, нейронных сетей и других методов статистического обучения.

Следует различать три объекта:

  • истинную условную вероятность — свойство неизвестного распределения данных;
  • эмпирическую оценку — величину, вычисленную по конечной выборке;
  • модельный прогноз — результат, полученный обученным алгоритмом.

Даже если модель выдаёт число между нулём и единицей, оно не обязательно совпадает с истинной условной вероятностью. Его качество необходимо проверять на данных, не использованных при обучении.

Условная вероятность в машинном обучении

Обучение с учителем

В обучении с учителем модель получает признаки объекта и должна предсказать целевую переменную. Вероятностная постановка задачи состоит в оценивании условного распределения ответа при известных признаках.

В классификации модель оценивает вероятности классов и может выбирать класс с наибольшей условной вероятностью:

\widehat{y}(x)=\mathop{\rm arg\,max}_{y}P(Y=y\mid X=x).

Такое правило оптимально при одинаковой стоимости всех ошибок и правильной оценке условных вероятностей.

Если ошибки имеют разную стоимость, решение должно учитывать функцию потерь, а наиболее вероятный класс не обязательно будет оптимальным действием.

В регрессии точечный прогноз зависит от выбранной функции потерь. При квадратичной потере оптимальным является условное математическое ожидание:

\widehat{y}(x)=E[Y\mid X=x].

При абсолютной ошибке оптимальным прогнозом является условная медиана, а при асимметричной квантильной потере — соответствующий условный квантиль. Таким образом, функция потерь определяет, какую характеристику условного распределения должна оценивать модель.

Генеративные и дискриминативные модели

Дискриминативные модели непосредственно оценивают условное распределение ответа при признаках или строят границу между классами. К ним относятся логистическая регрессия и многие нейронные классификаторы.

Генеративные модели описывают распределение признаков внутри классов и априорные вероятности классов. После этого условные вероятности классов вычисляются по формуле Байеса:

P(Y=y\mid X=x)=\frac{p(x\mid y)P(Y=y)}{\sum_k p(x\mid k)P(Y=k)}.

Такой подход моделирует механизм появления признаков и позволяет использовать совместное распределение для классификации, генерации данных и работы с частично наблюдаемыми объектами[1].

Наивный байесовский классификатор

Наивный байесовский классификатор предполагает, что признаки условно независимы при известном классе:

p(x_1,\ldots,x_d\mid y)=\prod_{j=1}^{d}p(x_j\mid y).

Благодаря этому многомерное распределение признаков заменяется произведением одномерных распределений. Это значительно уменьшает число оцениваемых параметров.

Апостериорная вероятность класса пропорциональна произведению априорной вероятности и условных распределений признаков:

P(y\mid x_1,\ldots,x_d)\propto P(y)\prod_{j=1}^{d}p(x_j\mid y).

Предположение условной независимости редко выполняется буквально, однако классификатор часто остаётся полезной базовой моделью, особенно для текстовых данных и задач с большим числом признаков.

Вероятностные графические модели

В байесовской сети многомерное совместное распределение раскладывается в произведение локальных условных распределений:

p(x_1,\ldots,x_d)=\prod_{j=1}^{d}p(x_j\mid {\rm pa}(x_j)).

Каждая переменная зависит непосредственно только от своих родительских узлов. Структура графа кодирует условную независимость и позволяет выполнять вероятностный вывод при неполностью наблюдаемых данных[1].

Калибровка вероятностей

Вероятностный классификатор должен не только правильно упорядочивать классы, но и выдавать числа, соответствующие наблюдаемым частотам. Если среди объектов, которым присвоена вероятность события около 80 процентов, событие действительно происходит примерно в 80 процентах случаев, модель считается калиброванной.

Высокая точность не гарантирует хорошей калибровки. Современные нейронные сети могут быть чрезмерно уверенными даже при высокой доле правильных ответов[1].

Для оценки вероятностных прогнозов применяются логарифмическая функция потерь, оценка Брайера, калибровочные диаграммы и другие методы. Калибровку следует проверять на данных, соответствующих реальным условиям применения модели.

Сдвиг распределения

Условная вероятность, оценённая по историческим данным, может измениться после смены популяции, интерфейса, политики сбора данных или внешней среды. Это явление является частным проявлением сдвига распределения.

При сдвиге данных модель может сохранять высокую численную уверенность, хотя её вероятностные оценки становятся менее надёжными. Эмпирические исследования показывают, что качество оценок неопределённости многих моделей ухудшается по мере усиления сдвига распределения[1].

Поэтому после внедрения модели требуется контролировать распределение входных данных, качество предсказаний и калибровку вероятностей.

Условная вероятность и причинность

Условная вероятность описывает статистическую зависимость при имеющейся информации, но сама по себе не устанавливает причинную связь. Изменение вероятности одного события после наблюдения другого не означает, что второе событие вызывает первое.

Статистическая зависимость может возникать из-за общей причины, отбора наблюдений, обратного влияния или смешения нескольких групп. Для причинного вывода требуются дополнительные предположения, экспериментальное вмешательство или структурная причинная модель[1].

Условие и причинное вмешательство принципиально различаются. Условная вероятность отвечает на вопрос о распределении среди объектов, у которых признак наблюдается. Причинный вопрос относится к тому, как изменился бы результат при целенаправленном изменении этого признака.

Типичные ошибки интерпретации

Перестановка события и условия

В общем случае условные вероятности с противоположным направлением не равны:

P(A\mid B)\ne P(B\mid A).

Высокая вероятность признака среди объектов некоторого класса не означает столь же высокую вероятность класса среди объектов с этим признаком. Для обратного перехода требуется формула Байеса.

Игнорирование базовой частоты

При оценке редкого события необходимо учитывать его исходную распространённость. Даже достаточно точный индикатор может давать умеренную апостериорную вероятность, если изучаемое событие встречается редко.

Эта ошибка особенно существенна при медицинской диагностике, обнаружении мошенничества, прогнозировании отказов и классификации с сильным дисбалансом классов.

Отождествление условия с причиной

Статистическое условие описывает полученную информацию. Оно не означает, что условное событие вызвало изучаемый результат.

Оценивание по малой подвыборке

Если условие выполняется редко, частотная оценка строится по небольшому числу наблюдений и имеет высокую случайную изменчивость. В таком случае полезны доверительные интервалы, регуляризация, байесовское сглаживание или объединение содержательно близких групп.

Отождествление прогноза с истинной вероятностью

Вероятностный выход модели является оценкой. Он зависит от обучающей выборки, признаков, семейства моделей, функции потерь и процедуры оптимизации. Его необходимо проверять на калибровку и устойчивость.

Игнорирование сдвига распределения

Оценка, корректная на обучающих данных, может стать неверной после изменения условий. Наличие вероятностного выхода не освобождает от мониторинга модели после внедрения.

Утечка данных

Если признаки содержат информацию, недоступную в момент реального предсказания, модель оценивает искусственную условную зависимость. Это приводит к завышенному качеству при тестировании и ухудшению результатов в эксплуатации.

Исторический контекст

Условные вероятностные рассуждения использовались в классической теории шансов задолго до появления современной аксиоматики. Значительную роль в развитии методов обратной вероятности сыграла посмертно опубликованная работа Томаса Байеса, представленная Королевскому обществу Ричардом Прайсом в 1763 году[1].

Пьер-Симон Лаплас развил методы обратной вероятности и применял их в статистических, демографических и астрономических задачах. Формула, известная сегодня как формула Байеса, получила у Лапласа более общий и систематический вид.

Современная аксиоматическая теория вероятностей была изложена Андреем Николаевичем Колмогоровым в 1933 году. В ней условная вероятность события при условии события положительной вероятности определяется как отношение вероятности их пересечения к вероятности условия[1].

См. также

Примечания

Литература

  • Bayes T., Price R. An Essay towards Solving a Problem in the Doctrine of Chances // Philosophical Transactions of the Royal Society of London. — 1763. — Т. 53. — С. 370–418.
  • Billingsley P. Probability and Measure. — 3rd ed.. — New York: Wiley, 1995.
  • Bishop C. M. Pattern Recognition and Machine Learning. — New York: Springer, 2006. — ISBN 978-0-387-31073-2
  • Durrett R. Probability: Theory and Examples. — 5th ed.. — Cambridge: Cambridge University Press, 2019.
  • Guo C., Pleiss G., Sun Y., Weinberger K. Q. On Calibration of Modern Neural Networks // Proceedings of the 34th International Conference on Machine Learning. — 2017. — Т. 70. — С. 1321–1330.
  • Koller D., Friedman N. Probabilistic Graphical Models: Principles and Techniques. — Cambridge, MA: MIT Press, 2009. — ISBN 978-0-262-01319-2
  • Kolmogorov A. N. Grundbegriffe der Wahrscheinlichkeitsrechnung. — Berlin: Springer, 1933.
  • Murphy K. P. Probabilistic Machine Learning: An Introduction. — Cambridge, MA: MIT Press, 2022.
  • Ovadia Y., Fertig E., Ren J., Nado Z., Sculley D., Nowozin S., Dillon J. V., Lakshminarayanan B., Snoek J. Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift // Advances in Neural Information Processing Systems. — 2019. — Т. 32.
  • Pearl J. Causality: Models, Reasoning, and Inference. — 2nd ed.. — Cambridge: Cambridge University Press, 2009. — ISBN 978-0-521-89560-6
Личные инструменты