条件概率是在已知另一个事件发生或给定特定信息的情况下,赋予某个事件的概率。它记作 P(A∣B),读作“给定 B 时 A 的概率”。取条件意味着只考虑与已知信息相符的结果,并相应调整这些结果的概率。条件概率是统计学中描述依赖关系和进行不确定性推理的基本工具。(pages.stat.wisc.edu)
定义与解释
设 A 和 B 是概率空间 (Ω,F,P) 中的事件。若 P(B)>0,则
P(A∣B)=P(B)P(A∩B).
这里,A∩B 表示两个事件同时发生。分母对 B 内的概率进行重新归一化,使 B 本身的条件概率为一。换言之,此时 B 相当于新的样本空间。固定 B 后,映射 A↦P(A∣B) 满足通常的概率公理,包括非负性和可列可加性。(arxiv.org)
例如,考虑一枚均匀的六面骰子。令 A 表示“点数大于三”,B 表示“点数为偶数”。在 B={2,4,6} 中,三个等可能的结果有两个属于 A,因此 P(A∣B)=2/3,而 P(A)=1/2。这一计算体现了先限定结果范围、再进行归一化的过程。只有当相关结果等可能时,才能直接通过计数来计算概率。(live.ocw.mit.edu)
乘法公式与全概率公式
对定义式进行变形,即可得到乘法公式:
P(A∩B)=P(A∣B)P(B).
反复应用这一公式可得
P(i=1⋂nAi)=P(A1)i=2∏nP(Ai∣j=1⋂i−1Aj),
前提是作为条件的事件均具有正概率。这种分解通过一系列条件概率来表示联合概率,并不要求事件之间相互独立。(arxiv.org)
全概率公式将不同情形下的条件概率综合起来。若 B1,…,Bn 是两两互斥且并集为整个样本空间的事件,并且各自的概率均为正,则
P(A)=i=1∑nP(A∣Bi)P(Bi).
因此,无条件概率是各个情形下概率的加权平均,权重为各情形发生的概率,不一定相等。(live.ocw.mit.edu)
贝叶斯定理与条件方向的逆转
一般而言,P(A∣B) 与 P(B∣A) 并不相同。贝叶斯定理给出了两者之间的关系:
P(A∣B)=P(B)P(B∣A)P(A),
其中右侧各项须有定义。若可能的假设 Hi 构成一个划分,则
P(Hi∣E)=∑jP(E∣Hj)P(Hj)P(E∣Hi)P(Hi).
在贝叶斯推断中,先验分布表示纳入证据之前的不确定性,似然函数描述各个假设下证据出现的可能性,而后验分布表示以证据为条件之后的不确定性。(ocw.mit.edu)
举一个具体的计算例子:假设从一枚均匀硬币和一枚总是掷出正面的硬币中,以相等的概率选取一枚。观察到一次正面后,所选硬币是那枚总出正面的硬币的概率为
1⋅(1/2)+(1/2)⋅(1/2)1⋅(1/2)=32.
尽管在这一假设下必然出现正面,但出现正面后,这一假设并不必然成立。若不考虑先验概率就逆转条件方向,便会混淆两个不同的问题。(ocw.mit.edu)
独立性与条件独立
当事件满足
P(A∩B)=P(A)P(B)
时,它们具有统计独立性。在 P(B)>0 时,这等价于 P(A∣B)=P(A):得知 B 已发生并不会改变 A 的概率。独立与互斥是不同的概念。两个概率均为正的互斥事件不可能独立,因为它们交集的概率为零。(pages.stat.wisc.edu)
条件独立是指在给定信息的情况下成立的独立性。给定一个概率为正的事件 C,条件独立意味着
P(A∩B∣C)=P(A∣C)P(B∣C).
一般而言,普通独立性与条件独立性不能相互推出。因此,取条件可能揭示或消除统计依赖关系,而不只是保持原有的依赖关系。(live.ocw.mit.edu)
条件分布
对于离散随机变量 X 和 Y,其联合概率分布决定了条件概率质量函数:
pX∣Y(x∣y)=pY(y)pX,Y(x,y),pY(y)>0.
对于每个满足条件的 y,这些条件概率之和为一。按 Y 的各取值概率对它们进行加权平均,即可得到 X 的概率分布。(ocw.mit.edu)
若 X 和 Y 具有联合概率密度函数,则相应的条件密度为
fX∣Y(x∣y)=fY(y)fX,Y(x,y),fY(y)>0.
对这一密度在所关心的 X 的取值范围内积分,即可得到条件概率。当 Y 服从连续分布时,事件 Y=y 的概率为零,因此这种构造并不是直接应用初等的事件概率比值公式。条件分布还决定了条件期望 E[X∣Y=y],即给定 Y 的这一取值时,X 的期望值。(ocw.mit.edu)
测度论表述
在测度论中,信息由子σ代数 G⊆F 表示。条件概率通过条件期望定义:
P(A∣G)=E[1A∣G],
其中,1A 在 A 上等于一,在其他地方等于零。它通常是一个随机变量,而不是一个单独的数值。它是 G-可测的,并满足
∫GP(A∣G)dP=P(A∩G)对所有 G∈G.
除概率为零的集合上的取值可以不同外,它是唯一的。这一表述允许以随机变量为条件,而无须要求该随机变量的每个具体取值都有正概率;定义中的等式不能唯一确定它在零测集上的取值。(arxiv.org)