条件独立性是概率论和统计学中的一种关系,用于描述在给定信息已知后,变量之间的依赖性消失的情形。如果两个随机变量 X 和 Y 在给定 Z 时的条件联合分布可以分解为各自条件边缘分布的乘积,就称它们在给定 Z 时条件独立,记作 X⊥⊥Y∣Z。这意味着,在已知 Z 的情况下,观测 Y 不会改变 X 的条件分布,反之亦然。与通常的统计独立性不同,这种关系明确依赖于作为条件的信息。(stats.ox.ac.uk)
数学定义
对于离散变量,条件独立性要求
P(X=x,Y=y∣Z=z)=P(X=x∣Z=z)P(Y=y∣Z=z)
对所有 x,y 以及所有满足 P(Z=z)>0 的 z 都成立。等价地,只要条件事件的概率为正,就有
P(X=x∣Y=y,Z=z)=P(X=x∣Z=z).
因此,在 Z 的每个相关取值层内,条件联合概率分布都是乘积分布。对于具有适当密度的变量,相应的分解使用条件概率密度函数:
fX,Y∣Z(x,y∣z)=fX∣Z(x∣z)fY∣Z(y∣z).
这些等式只需几乎处处成立,而不必在任意选取的点上成立,因为某些点上的条件分布可能没有定义。(stats.ox.ac.uk)
使用条件期望来表述,就不必要求密度存在。对于所有有界可测函数 u,v,
E[u(X)v(Y)∣Z]=E[u(X)∣Z]E[v(Y)∣Z]几乎必然成立.
在测度论中,以 Z 为条件,意味着以 Z 生成的σ代数为条件。同一定义可以推广到以一般的信息 σ代数为条件的独立性。(stats.ox.ac.uk)
条件化可以消除或产生依赖性
边缘独立性与条件独立性之间不存在相互蕴含关系。一个共同的潜在变量可能使两个观测量在未条件化时相互依赖,即使它们在给定该变量时相互独立。反过来,以两个独立变量共同决定的信息为条件,也可能使它们变得相互依赖。这些模式分别对应图模型中的共同原因结构和共同结果结构。(cs.cmu.edu)
举一个具体例子:设 X,Y 为相互独立的二元变量,均以相等概率取值 0 或 1,并令 Z=X+Y。在给定 Z=1 时,只有 (X,Y)=(0,1) 和 (1,0) 两种可能,各自的概率为 1/2。因此,
P(X=1,Y=1∣Z=1)=0,
而两个条件边缘概率的乘积为 1/4。所以,知道两者的和会破坏它们的独立性。
条件独立性也比条件协方差为零或不存在条件线性相关关系更强。在所需的矩存在时,条件独立性蕴含
E[XY∣Z]=E[X∣Z]E[Y∣Z],
但仅凭这一个矩等式,一般无法确定完整条件分布之间的独立性。(arxiv.org)
逻辑性质
条件独立性遵循四条基本推理规则,通常称为半 graphoid 性质。这里的 X,Y,W,Z 可以表示变量集合:
- 对称性: X⊥Y∣Z 蕴含 Y⊥X∣Z。
- 分解性: X⊥(Y,W)∣Z 蕴含 X⊥Y∣Z 和 X⊥W∣Z。
- 弱联合性: X⊥(Y,W)∣Z 蕴含 X⊥Y∣(Z,W)。
- 收缩性: X⊥Y∣Z 与 X⊥W∣(Y,Z) 共同蕴含 X⊥(Y,W)∣Z。(stats.ox.ac.uk)
另一条规则是交集性,它在适当的严格正性假设下成立:
X⊥Y∣(Z,W),X⊥W∣(Z,Y)⟹X⊥(Y,W)∣Z.
没有这些假设,该规则可能不成立。弱联合性并不允许任意添加条件变量:它的前提要求与整个变量对 (Y,W) 独立。(stats.ox.ac.uk)
图表示
概率图模型通过图结构编码条件独立性。在贝叶斯网络中,有向无环图对应如下分解:
p(x1,…,xn)=i=1∏np(xi∣xpa(i)),
其中,pa(i) 表示节点 i 的父节点。在给定父节点时,每个变量都与其非后代节点所对应的变量条件独立。(cs.cmu.edu)
d分离准则可以识别这一分解所蕴含的其他独立关系。以中间节点为条件,会阻断简单链结构 X→Z→Y 或叉形结构 X←Z→Y。然而,在碰撞点结构 X→Z←Y 中,以 Z 或 Z 的某个后代节点为条件,可能打开原本被阻断的路径。(cs.cmu.edu)
对于按图结构分解的分布,d分离保证相应的独立性;但不满足 d分离,并不意味着每个具体分布中都必然存在依赖关系。特殊的参数取值可能产生额外的独立关系。图中体现的依赖关系本身也不能确立因果关系:因果推断还需要关于因果结构的额外假设。(cs.cmu.edu)
统计应用与检验
在机器学习中,朴素贝叶斯分类器假设,在给定类别变量 C 时,各个特征相互条件独立:
p(x1,…,xn∣C)=i∏p(xi∣C).
结合贝叶斯定理,便可得到一个简洁的分类模型。这一假设涉及的是各类别内部的独立性,而不是将各类别合并后的总体中的独立性。(cs.cmu.edu)
条件独立性也可以表达充分统计量的作用:在将参数 Θ 视为随机变量的适当贝叶斯推断解释下,充分性可以表述为 X⊥Θ∣T(X)。它将“统计量保留了样本中关于参数的信息”这一思想形式化。(stats.ox.ac.uk)
根据观测数据评估这种关系,是统计假设检验中的一个问题。对于分类变量,可以采用列联表方法;而当作为条件的变量连续取值时,不依赖分布假设的检验会困难得多。一般性的不可能性结果表明,要得到有用的检验,就必须对分布类别施加限制或引入其他假设;仅检验条件协方差,一般无法确认条件独立性。(stat.cmu.edu)