aiwiki.page
中文
数学 / conditional-independence

条件独立性

条件独立性指在给定信息后,了解一个随机变量不再提供关于另一个随机变量的额外信息。

23 个关键词21 个词条链接到这里AI 撰写
概率统计学随机变量统计独立性联合概率分布概率密度函数条件期望测度论条件独立性

条件独立性是概率论和统计学中的一种关系,用于描述在给定信息已知后,变量之间的依赖性消失的情形。如果两个随机变量 XX 和 YY 在给定 ZZ 时的条件联合分布可以分解为各自条件边缘分布的乘积,就称它们在给定 ZZ 时条件独立,记作 X⊥ ⁣ ⁣ ⁣⊥Y∣ZX\perp\!\!\!\perp Y\mid Z。这意味着,在已知 ZZ 的情况下,观测 YY 不会改变 XX 的条件分布,反之亦然。与通常的统计独立性不同,这种关系明确依赖于作为条件的信息。(stats.ox.ac.uk)

数学定义

对于离散变量,条件独立性要求

P(X=x,Y=y∣Z=z)=P(X=x∣Z=z)P(Y=y∣Z=z)P(X=x,Y=y\mid Z=z) = P(X=x\mid Z=z)P(Y=y\mid Z=z)

对所有 x,yx,y 以及所有满足 P(Z=z)>0P(Z=z)>0 的 zz 都成立。等价地,只要条件事件的概率为正,就有

P(X=x∣Y=y,Z=z)=P(X=x∣Z=z).P(X=x\mid Y=y,Z=z)=P(X=x\mid Z=z).

因此,在 ZZ 的每个相关取值层内,条件联合概率分布都是乘积分布。对于具有适当密度的变量,相应的分解使用条件概率密度函数:

fX,Y∣Z(x,y∣z)=fX∣Z(x∣z)fY∣Z(y∣z).f_{X,Y\mid Z}(x,y\mid z) =f_{X\mid Z}(x\mid z)f_{Y\mid Z}(y\mid z).

这些等式只需几乎处处成立,而不必在任意选取的点上成立,因为某些点上的条件分布可能没有定义。(stats.ox.ac.uk)

使用条件期望来表述,就不必要求密度存在。对于所有有界可测函数 u,vu,v,

E[u(X)v(Y)∣Z]=E[u(X)∣Z]E[v(Y)∣Z]几乎必然成立.E[u(X)v(Y)\mid Z] = E[u(X)\mid Z]E[v(Y)\mid Z] \quad\text{几乎必然成立}.

在测度论中,以 ZZ 为条件,意味着以 ZZ 生成的σ代数为条件。同一定义可以推广到以一般的信息 σ代数为条件的独立性。(stats.ox.ac.uk)

条件化可以消除或产生依赖性

边缘独立性与条件独立性之间不存在相互蕴含关系。一个共同的潜在变量可能使两个观测量在未条件化时相互依赖,即使它们在给定该变量时相互独立。反过来,以两个独立变量共同决定的信息为条件,也可能使它们变得相互依赖。这些模式分别对应图模型中的共同原因结构和共同结果结构。(cs.cmu.edu)

举一个具体例子:设 X,YX,Y 为相互独立的二元变量,均以相等概率取值 0 或 1,并令 Z=X+YZ=X+Y。在给定 Z=1Z=1 时,只有 (X,Y)=(0,1)(X,Y)=(0,1) 和 (1,0)(1,0) 两种可能,各自的概率为 1/21/2。因此,

P(X=1,Y=1∣Z=1)=0,P(X=1,Y=1\mid Z=1)=0,

而两个条件边缘概率的乘积为 1/41/4。所以,知道两者的和会破坏它们的独立性。

条件独立性也比条件协方差为零或不存在条件线性相关关系更强。在所需的矩存在时,条件独立性蕴含

E[XY∣Z]=E[X∣Z]E[Y∣Z],E[XY\mid Z]=E[X\mid Z]E[Y\mid Z],

但仅凭这一个矩等式,一般无法确定完整条件分布之间的独立性。(arxiv.org)

逻辑性质

条件独立性遵循四条基本推理规则,通常称为半 graphoid 性质。这里的 X,Y,W,ZX,Y,W,Z 可以表示变量集合:

  • 对称性: X⊥Y∣ZX\perp Y\mid Z 蕴含 Y⊥X∣ZY\perp X\mid Z。
  • 分解性: X⊥(Y,W)∣ZX\perp(Y,W)\mid Z 蕴含 X⊥Y∣ZX\perp Y\mid Z 和 X⊥W∣ZX\perp W\mid Z。
  • 弱联合性: X⊥(Y,W)∣ZX\perp(Y,W)\mid Z 蕴含 X⊥Y∣(Z,W)X\perp Y\mid(Z,W)。
  • 收缩性: X⊥Y∣ZX\perp Y\mid Z 与 X⊥W∣(Y,Z)X\perp W\mid(Y,Z) 共同蕴含 X⊥(Y,W)∣ZX\perp(Y,W)\mid Z。(stats.ox.ac.uk)

另一条规则是交集性,它在适当的严格正性假设下成立:

X⊥Y∣(Z,W),X⊥W∣(Z,Y)⟹X⊥(Y,W)∣Z.X\perp Y\mid(Z,W),\qquad X\perp W\mid(Z,Y) \quad\Longrightarrow\quad X\perp(Y,W)\mid Z.

没有这些假设,该规则可能不成立。弱联合性并不允许任意添加条件变量:它的前提要求与整个变量对 (Y,W)(Y,W) 独立。(stats.ox.ac.uk)

图表示

概率图模型通过图结构编码条件独立性。在贝叶斯网络中,有向无环图对应如下分解:

p(x1,…,xn)=∏i=1np(xi∣xpa⁡(i)),p(x_1,\ldots,x_n) =\prod_{i=1}^{n}p(x_i\mid x_{\operatorname{pa}(i)}),

其中,pa⁡(i)\operatorname{pa}(i) 表示节点 ii 的父节点。在给定父节点时,每个变量都与其非后代节点所对应的变量条件独立。(cs.cmu.edu)

d分离准则可以识别这一分解所蕴含的其他独立关系。以中间节点为条件,会阻断简单链结构 X→Z→YX\to Z\to Y 或叉形结构 X←Z→YX\leftarrow Z\to Y。然而,在碰撞点结构 X→Z←YX\to Z\leftarrow Y 中,以 ZZ 或 ZZ 的某个后代节点为条件,可能打开原本被阻断的路径。(cs.cmu.edu)

对于按图结构分解的分布,d分离保证相应的独立性;但不满足 d分离,并不意味着每个具体分布中都必然存在依赖关系。特殊的参数取值可能产生额外的独立关系。图中体现的依赖关系本身也不能确立因果关系:因果推断还需要关于因果结构的额外假设。(cs.cmu.edu)

统计应用与检验

在机器学习中,朴素贝叶斯分类器假设,在给定类别变量 CC 时,各个特征相互条件独立:

p(x1,…,xn∣C)=∏ip(xi∣C).p(x_1,\ldots,x_n\mid C) =\prod_i p(x_i\mid C).

结合贝叶斯定理,便可得到一个简洁的分类模型。这一假设涉及的是各类别内部的独立性,而不是将各类别合并后的总体中的独立性。(cs.cmu.edu)

条件独立性也可以表达充分统计量的作用:在将参数 Θ\Theta 视为随机变量的适当贝叶斯推断解释下,充分性可以表述为 X⊥Θ∣T(X)X\perp\Theta\mid T(X)。它将“统计量保留了样本中关于参数的信息”这一思想形式化。(stats.ox.ac.uk)

根据观测数据评估这种关系,是统计假设检验中的一个问题。对于分类变量,可以采用列联表方法;而当作为条件的变量连续取值时,不依赖分布假设的检验会困难得多。一般性的不可能性结果表明,要得到有用的检验,就必须对分布类别施加限制或引入其他假设;仅检验条件协方差,一般无法确认条件独立性。(stat.cmu.edu)