联合概率分布是将两个或多个随机变量作为一个整体考察时的概率分布。它为这些变量的取值组合或联合取值空间中的区域赋予概率。与分别描述各个变量的分布不同,联合概率分布描述它们的取值如何共同出现,因而能够刻画变量之间的依赖关系。联合分布是多元统计学和概率建模的基础。(online.stat.psu.edu)
定义与表示
对于实值变量 (X) 和 (Y),联合累积分布函数为
[ F_{X,Y}(x,y)=P(X\leq x,;Y\leq y). ]
逗号表示“且”,即两个不等式必须同时成立。这个函数完整刻画了联合分布,并可自然推广到任意有限个变量。例如,三个变量的分布函数为 (P(X\leq x,Y\leq y,Z\leq z))。(openlearninglibrary.mit.edu)
在测度论框架下,定义在同一概率空间上的变量构成一个随机向量。其联合分布为每个可测区域 (A) 赋予该向量落在 (A) 内的概率。这种表述不要求分布具有密度,因此适用于离散分布、连续分布及其他类型的分布。(ocw.mit.edu)
离散联合分布
当 (X) 和 (Y) 的可能取值各自构成可数集时,它们的联合概率质量函数为
[ p_{X,Y}(x,y)=P(X=x,;Y=y). ]
它满足 [ p_{X,Y}(x,y)\geq0, \qquad \sum_x\sum_y p_{X,Y}(x,y)=1. ]
将属于某个事件的所有取值对的概率相加,即可得到该事件的概率。当取值集合有限时,可以用表格展示各取值对的概率质量,表格的行和列分别对应两个变量。不可能出现的组合,其概率为零。(online.stat.psu.edu)
以两枚相互独立的公平六面骰子为例,令 (X) 和 (Y) 分别表示它们掷出的点数。36 个有序对中,每一个的概率均为 (1/36)。其中有六个取值对的两个分量相等,因此 (P(X=Y)=1/6)。沿表格的各条对角线将概率相加,就能得到点数之和 (X+Y) 的分布:能由更多取值对产生的点数和,出现的概率更大。(openlearninglibrary.mit.edu)
连续联合分布
如果联合分布相对于二维勒贝格测度具有概率密度函数 (f_{X,Y}),则
[ P((X,Y)\in A)=\iint_A f_{X,Y}(x,y),dx,dy. ]
密度非负,且在整个平面上的积分等于一。密度值本身不是概率,并且可以大于一;概率是通过在区域上积分得到的。在密度连续之处,可以对联合分布函数求偏导数,得到密度: [ f_{X,Y}(x,y) =\frac{\partial^2F_{X,Y}(x,y)}{\partial x,\partial y}. ] (online.stat.psu.edu)
各个变量都具有连续分布,并不保证它们具有联合密度。例如,如果 (X) 服从连续分布且 (Y=X),那么所有取值都落在对角线 (y=x) 上,而这条线在平面中的面积为零。因此,该联合分布不可能具有通常意义上的二维密度,但联合分布函数仍然存在。(ocw.mit.edu)
边缘分布与条件分布
边缘分布描述其中一个变量的分布,而不考虑另一个变量。对不需要的坐标求和或积分,即可得到边缘分布:
[ p_X(x)=\sum_y p_{X,Y}(x,y), \qquad f_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y),dy. ]
“边缘”一词源于将各行、各列的概率总和写在概率表边缘的做法。边缘化保留了各个变量自身的取值规律,但通常会丢失有关依赖关系的信息。(openlearninglibrary.mit.edu)
条件分布描述在已知另一个变量的某些信息时,一个变量的分布。根据条件概率,在离散情形下有
[ p_{X\mid Y}(x\mid y) =\frac{p_{X,Y}(x,y)}{p_Y(y)} ]
其中要求 (p_Y(y)>0)。对于联合分布绝对连续的变量,类似的条件密度为
[ f_{X\mid Y}(x\mid y) =\frac{f_{X,Y}(x,y)}{f_Y(y)} ]
其中分母必须为正。这个密度公式通过联合分布来定义条件分布,而不是除以零概率事件 (Y=y) 的概率。这些关系也是贝叶斯定理的基础。(online.stat.psu.edu)
独立性与依赖关系
统计独立性意味着联合分布可以分解为各个变量自身分布的乘积。对于离散变量,
[ p_{X,Y}(x,y)=p_X(x)p_Y(y); ]
对于具有联合密度的变量,相应的密度乘积分解几乎处处成立。独立性也等价于对所有 (x,y),均有 (F_{X,Y}(x,y)=F_X(x)F_Y(y))。(openlearninglibrary.mit.edu)
通常,仅凭边缘分布无法确定联合分布。例如,两个分别以相等概率取 0 和 1 的二元变量,可以彼此独立,此时四个取值对的概率均为 (1/4);也可以始终相等,此时只有 ((0,0)) 和 ((1,1)) 两个取值对具有非零概率,且均为 (1/2)。这两种构造的边缘分布完全相同,联合取值规律却不同。
当相关的矩存在时,协方差可以概括这种联合取值规律的部分特征:
[ \operatorname{Cov}(X,Y) =E[XY]-E[X]E[Y]. ]
这里的期望值根据联合分布计算。独立性意味着协方差为零,但协方差为零通常并不意味着独立;相关关系衡量的是线性关联,而非所有形式的依赖关系。(ocw.mit.edu)
高维模型与计算
对于离散变量,反复应用条件概率公式可得
[ p(x_1,\ldots,x_n) =p(x_1)\prod_{i=2}^{n} p(x_i\mid x_1,\ldots,x_{i-1}), ]
其中,条件概率只在作为条件的取值组合具有正概率时解释。这一概率链式法则不需要任何独立性假设。条件独立可以简化其中的因子。贝叶斯网络是概率图模型的一种,它利用各变量在给定其父节点变量时的条件分布来表示联合分布。(cs.cmu.edu)
显式概率表的规模增长很快:若 (n) 个变量各有 (k) 个可能取值,在考虑归一化约束之前,表中需要 (k^n) 个条目。结构化的因子分解可以减少存储需求,并支持变量消去。变量消去通过合并因子、对不需要的变量求和来回答查询,无须先构造完整的概率表。(cs.cmu.edu)