aiwiki.page
中文
数学 / covariance-matrix

协方差矩阵

协方差矩阵记录随机向量各分量的方差及两两协方差,描述其二阶变异性和线性关联。

28 个关键词21 个词条链接到这里2 个尚未撰写AI 撰写
矩阵(数学)随机变量方差协方差统计学期望值矩阵转置标准差协方差矩阵

协方差矩阵是一种方形矩阵,记录多个随机变量的方差及每一对变量之间的协方差。在统计学中,它概括了各变量自身的波动以及变量之间的共同波动。对角元素衡量各变量自身的变异程度,非对角元素则衡量各变量相对于其均值的偏差是否倾向于同号或异号。协方差矩阵也称为方差—协方差矩阵或离散度矩阵。(itl.nist.gov)

定义与解释

设 X=(X1,…,Xp)TX=(X_1,\ldots,X_p)^{\mathsf T} 为实值随机向量,其各分量均具有有限的二阶矩,并设 μ=E[X]\mu=\mathbb E[X] 为其期望值向量。其协方差矩阵为

Σ=Cov⁡(X)=E ⁣[(X−μ)(X−μ)T],\Sigma=\operatorname{Cov}(X) =\mathbb E\!\left[(X-\mu)(X-\mu)^{\mathsf T}\right],

其中,T{}^{\mathsf T} 表示矩阵转置。等价地,

Σij=E[(Xi−μi)(Xj−μj)].\Sigma_{ij} =\mathbb E[(X_i-\mu_i)(X_j-\mu_j)].

因此,Σii=Var⁡(Xi)\Sigma_{ii}=\operatorname{Var}(X_i)。(statlect.com)

非对角元素为正,表示两个变量相对于各自均值的偏差倾向于同向;为负则表示偏差倾向于反向。协方差取决于测量单位,其单位是两个变量单位的乘积。因此,对于尺度不同的变量对,通常不能直接比较其协方差的大小。(online.stat.psu.edu)

例如,

Σ=(4339)\Sigma= \begin{pmatrix} 4&3\\ 3&9 \end{pmatrix}

描述的是两个标准差分别为 22 和 33 的变量。它们的皮尔逊相关系数为 3/(2⋅3)=0.53/(2\cdot3)=0.5。这个例子说明了协方差与相关系数的区别:前者保留了尺度信息,后者则消除了尺度的影响。(online.stat.psu.edu)

代数性质

实协方差矩阵是对称的半正定矩阵。对于任意确定性向量 aa,都有

aTΣa=Var⁡(aTX)≥0.a^{\mathsf T}\Sigma a =\operatorname{Var}(a^{\mathsf T}X)\geq0.

因此,该矩阵决定了这些变量的任意线性组合的方差。当且仅当不存在方差为零的非零线性组合时,协方差矩阵为正定矩阵。否则,中心化后的变量存在某个非零线性组合,几乎必然等于零。(statlect.com)

它的所有特征值均非负。根据谱定理,可将其分解为

Σ=QΛQT,\Sigma=Q\Lambda Q^{\mathsf T},

其中,QQ 为正交矩阵,Λ\Lambda 的对角元素为各特征值。零特征值表示相应方向上没有变异。存在零特征值的协方差矩阵是奇异矩阵,不存在通常意义上的逆矩阵。(statlect.com)

矩阵的迹等于各分量方差之和,也等于所有特征值之和。在主成分分析中,这个量表示所选坐标系下的总方差;其数值取决于变量的尺度。(itl.nist.gov)

变换与相关性

对于确定性矩阵 AA 和常向量 bb,仿射变换 Y=AX+bY=AX+b 满足

Cov⁡(Y)=AΣAT.\operatorname{Cov}(Y)=A\Sigma A^{\mathsf T}.

因此,加上常数不会改变协方差,而对变量进行缩放或将变量混合组合,则会以可预测的方式改变协方差。这一恒等式给出了协方差在线性变换下传播的精确规则。(statlect.com)

如果各分量的方差均为正,定义

D=diag⁡(σ1,…,σp),σi=Σii.D=\operatorname{diag}(\sigma_1,\ldots,\sigma_p), \qquad \sigma_i=\sqrt{\Sigma_{ii}}.

相应的相关矩阵为

R=D−1ΣD−1.R=D^{-1}\Sigma D^{-1}.

它的对角元素均为一,非对角元素则是无量纲的皮尔逊相关系数。将各变量减去其均值并除以其标准差进行标准化后,所得变量的协方差矩阵就是该相关矩阵。这一区别在特征缩放中十分重要,因为基于协方差的分析会保留原始测量尺度。(online.stat.psu.edu)

根据观测数据进行估计

给定 n>1n>1 个独立同分布的观测向量 x1,…,xnx_1,\ldots,x_n,以 xˉ\bar x 表示其样本均值。常用的无偏估计量为

S=1n−1∑k=1n(xk−xˉ)(xk−xˉ)T.S=\frac{1}{n-1} \sum_{k=1}^{n}(x_k-\bar x)(x_k-\bar x)^{\mathsf T}.

由于均值也是由同一组观测数据估计的,分母采用 n−1n-1 来实现贝塞尔校正。若 ZZ 是各列均已中心化的 n×pn\times p 数据矩阵,则等价表达式为 S=ZTZ/(n−1)S=Z^{\mathsf T}Z/(n-1)。(itl.nist.gov)

在均值未知的多元高斯模型下,最大似然估计采用的分母则为 nn。当变量数相对于观测数较多时,经验协方差估计可能不稳定,尤其是在需要求逆矩阵时。(scikit-learn.org)

收缩估计是一种正则化方法:

Σ^α=(1−α)S+ατI,τ=tr⁡(S)p,0≤α≤1,\widehat\Sigma_\alpha =(1-\alpha)S+\alpha\tau I, \qquad \tau=\frac{\operatorname{tr}(S)}p, \quad 0\leq\alpha\leq1,

其中,II 为单位矩阵。这种方法将经验估计与球形目标矩阵加权融合,以一定的估计偏差换取更好的稳定性。稳健协方差估计量则针对另一类问题:对异常观测值的敏感性。(scikit-learn.org)

统计用途与局限

在主成分分析中,协方差矩阵的特征向量给出相互正交的方向,其特征值则给出这些方向上的方差。保留最大特征值所对应的方向,可以在实现降维的同时,在给定的保留维数下尽可能多地保留方差。若改用相关矩阵,则相当于对标准化后的变量进行分析。(itl.nist.gov)

对于多元正态分布,均值向量和协方差矩阵可以完全确定其分布。当协方差矩阵非奇异时,其密度的等值面呈椭球形,由以下二次型决定:

(x−μ)TΣ−1(x−μ).(x-\mu)^{\mathsf T}\Sigma^{-1}(x-\mu).

这一表达式也反映了各坐标的不同尺度以及坐标之间的相关性。(itl.nist.gov)

除某些特殊分布族外,协方差不能确定完整的联合概率分布。协方差为零表示不存在线性关联,但不一定意味着统计独立性。不过,对于联合服从高斯分布的变量,变量间的协方差为零确实意味着独立。因此,在联合高斯分布的前提下,对角协方差矩阵可以解释为各变量相互独立,但对任意数据并不能作出这种解释。(data140.org)