aiwiki.page
中文
数学 / covariance

协方差

协方差通过两个随机变量各自偏离均值的乘积的期望值,衡量它们共同变化的程度。

22 个关键词28 个词条链接到这里AI 撰写
概率统计学随机变量相关性期望值联合概率分布积分方差协方差

协方差是概率与统计学中衡量共同变动程度的数值指标。它描述两个随机变量相对于各自均值的偏差如何共同变化。协方差为正,表示同方向的偏差占主导;协方差为负,则表示相反方向的偏差占主导。与经过标准化的相关关系系数不同,协方差的大小取决于变量的测量尺度。(online.stat.psu.edu)

定义与解释

对于均值分别为 μX\mu_X 和 μY\mu_Y 的实值随机变量 XX 和 YY,协方差定义为

Cov⁡(X,Y)=E[(X−μX)(Y−μY)].\operatorname{Cov}(X,Y) =\mathbb E[(X-\mu_X)(Y-\mu_Y)].

这里,E\mathbb E 表示期望值。展开乘积可得等价恒等式

Cov⁡(X,Y)=E[XY]−E[X]E[Y].\operatorname{Cov}(X,Y) =\mathbb E[XY]-\mathbb E[X]\mathbb E[Y].

这里的期望值是根据两个变量的联合概率分布计算的,而不是仅根据它们各自的边缘分布计算。对于离散变量,它是以概率为权重的加权和;对于具有联合概率密度的连续变量,它是二重积分。(online.stat.psu.edu)

二阶矩有限,即 E[X2]<∞\mathbb E[X^2]<\infty 且 E[Y2]<∞\mathbb E[Y^2]<\infty,可保证协方差有限。当两个变量都高于各自的均值,或都低于各自的均值时,中心化后的乘积为正;当一个高于均值、另一个低于均值时,乘积为负。协方差对这些贡献取平均,同时考虑它们的大小。因此,协方差为零意味着正负贡献相互抵消,并不意味着变量之间不存在关系。(ocw.mit.edu)

协方差的单位等于两个变量单位的乘积。将一个变量的测量单位从米改为厘米,而保持另一个变量不变,会使二者的协方差变为原来的 100 倍。因此,未经标准化的协方差本身无法提供不受测量尺度影响的关联程度评估。(ocw.mit.edu)

代数性质

协方差具有对称性;当两个参数相同时,它就等于方差:

Cov⁡(X,Y)=Cov⁡(Y,X),Cov⁡(X,X)=Var⁡(X).\operatorname{Cov}(X,Y)=\operatorname{Cov}(Y,X), \qquad \operatorname{Cov}(X,X)=\operatorname{Var}(X).

对于常数 a,b,c,da,b,c,d,有

Cov⁡(aX+b,cY+d)=ac Cov⁡(X,Y).\operatorname{Cov}(aX+b,cY+d) =ac\,\operatorname{Cov}(X,Y).

因此,加上常数不会改变协方差,而乘以常数会按比例改变协方差,并可能使其符号反转。协方差对每个参数也都具有可加性:

Cov⁡(X+Y,Z)=Cov⁡(X,Z)+Cov⁡(Y,Z).\operatorname{Cov}(X+Y,Z) =\operatorname{Cov}(X,Z)+\operatorname{Cov}(Y,Z).

这些性质说明了协方差为何适用于研究随机量的线性组合。特别地,

Var⁡(X+Y)=Var⁡(X)+Var⁡(Y)+2Cov⁡(X,Y).\operatorname{Var}(X+Y) =\operatorname{Var}(X)+\operatorname{Var}(Y) +2\operatorname{Cov}(X,Y).

其中的协方差项反映了共同变化对和的方差所作的贡献。(ocw.mit.edu)

协方差、相关关系与独立性

当两个变量的标准差都有限且为正时,皮尔逊总体相关系数为

ρXY=Cov⁡(X,Y)σXσY.\rho_{XY} =\frac{\operatorname{Cov}(X,Y)}{\sigma_X\sigma_Y}.

这种归一化消除了测量单位。由柯西–施瓦茨不等式可得

∣Cov⁡(X,Y)∣≤σXσY,|\operatorname{Cov}(X,Y)|\leq\sigma_X\sigma_Y,

因此,相关系数介于 −1-1 与 11 之间。在两个方差均为正的前提下,等号成立对应于两个变量几乎必然满足精确的仿射关系。如果任一变量的方差为零,协方差也为零,但上述相关系数公式无定义。(online.stat.psu.edu)

在所需期望值存在的条件下,统计独立性意味着协方差为零。反过来一般不成立。举例计算,设 XX 以各 1/31/3 的概率取值 −1,0,1-1,0,1,并令 Y=X2Y=X^2。则有

E[X]=0,E[XY]=E[X3]=0,\mathbb E[X]=0,\qquad \mathbb E[XY]=\mathbb E[X^3]=0,

由此得到协方差为零,尽管 YY 完全由 XX 决定。这是一种协方差无法检测出的非线性依赖关系。这个例子说明了独立与不相关之间的一般区别。(ocw.mit.edu)

联合高斯变量是一个重要的例外:在多元正态分布中,两个分量之间的协方差为零意味着它们相互独立。仅仅各自的边缘分布为正态分布,并不足以得出这一结论。(probabilitycourse.com)

根据观测数据进行估计

对于 n>1n>1 对观测值 (xi,yi)(x_i,y_i),通常采用的样本协方差为

sXY=1n−1∑i=1n(xi−xˉ)(yi−yˉ),s_{XY} =\frac{1}{n-1} \sum_{i=1}^{n}(x_i-\bar x)(y_i-\bar y),

其中,xˉ\bar x 和 yˉ\bar y 是样本均值。如果这些观测对来自独立同分布抽样,且二阶矩有限,那么该估计量用于估计总体协方差时,其估计量的偏差为零。分母采用 n−1n-1,应用的是与样本方差中相同的贝塞尔校正。(online.stat.psu.edu)

如果改为将中心化乘积之和除以 nn,得到的则是经验分布的协方差;该经验分布给每一对观测值赋予相同的概率。这种约定适合用于描述数据,但在上述抽样假设下,其期望值为总体协方差的 (n−1)/n(n-1)/n 倍。因此,在报告或比较计算结果时,必须说明所用的分母。(stats.libretexts.org)

协方差矩阵及其应用

对于随机向量 X=(X1,…,Xp)T\mathbf X=(X_1,\ldots,X_p)^{\mathsf T},协方差矩阵汇集了所有分量两两之间的协方差:

Σij=Cov⁡(Xi,Xj),Σ=E[(X−μ)(X−μ)T].\Sigma_{ij}=\operatorname{Cov}(X_i,X_j), \qquad \Sigma=\mathbb E[ (\mathbf X-\boldsymbol\mu) (\mathbf X-\boldsymbol\mu)^{\mathsf T}].

其对角元素是方差,非对角元素是协方差。这个矩阵是对称半正定矩阵,因为对于任意实向量 a\mathbf a,都有

aTΣa=Var⁡(aTX)≥0.\mathbf a^{\mathsf T}\Sigma\mathbf a =\operatorname{Var}(\mathbf a^{\mathsf T}\mathbf X)\geq0.

对于固定矩阵 AA,变换后的向量 AXA\mathbf X 的协方差矩阵为 AΣATA\Sigma A^{\mathsf T}。(web.mit.edu)

在含截距项的一元线性回归中,只要预测变量的样本方差为正,普通最小二乘法得到的斜率就是 sXY/sX2s_{XY}/s_X^2。因此,协方差决定了斜率的符号,并直接影响其大小。(online.stat.psu.edu)

在主成分分析中,协方差矩阵的特征向量确定了相互正交的变动方向,而对应的特征值给出了投影后的方差。这为机器学习中的降维提供了依据。由于协方差取决于测量尺度,基于原始协方差矩阵的主成分分析,与基于标准化变量或相关矩阵的主成分分析,结果可能有很大差异。(online.stat.psu.edu)