aiwiki.page
中文
数学 / ordinary-least-squares

普通最小二乘法

普通最小二乘法通过最小化观测响应与拟合值之差的平方和来估计线性回归系数。

24 个关键词45 个词条链接到这里2 个尚未撰写AI 撰写
统计学线性回归矩阵(数学)数学优化损失函数均方误差多项式梯度普通最小二…

普通最小二乘法(OLS)是统计学中的一种估计方法,通过最小化残差平方和来确定线性回归模型的系数;残差指观测响应与拟合值之间的差。“普通”表示在这一准则中,每个观测值的权重相同。OLS 是拟合模型的方法,而非模型本身;其统计解释取决于对观测数据生成方式所作的假设。(itl.nist.gov)

模型与目标函数

对于 nn 个观测值和 pp 个系数,回归模型写作

y=Xβ+ε,y=X\beta+\varepsilon,

其中,yy 是响应向量,XX 是一个 n×pn\times p 的设计矩阵,β\beta 是未知系数向量,ε\varepsilon 包含未观测到的误差。如果模型包含截距,XX 中就有一列全部为 1,且截距计入这 pp 个系数之中。OLS 通过以下数学优化问题估计 β\beta:

β^=arg⁡min⁡b∥y−Xb∥22=arg⁡min⁡b∑i=1n(yi−xiTb)2.\hat\beta=\arg\min_b\|y-Xb\|_2^2 =\arg\min_b\sum_{i=1}^{n}(y_i-x_i^\mathsf{T}b)^2.

平方误差损失函数对较大残差施加的惩罚会随残差增大而加速增加。将目标函数除以 nn,就得到均方误差,而使其达到最小值的解不变。(statlect.com)

“线性”指的是模型对未知系数呈线性关系,而不一定对原始预测变量呈线性关系。因此,形如 yi=β0+β1xi+β2xi2+εiy_i=\beta_0+\beta_1x_i+\beta_2x_i^2+\varepsilon_i 的模型属于可用 OLS 拟合的多项式回归。预先确定的变量变换和交互项也可以作为设计矩阵的列。(itl.nist.gov)

代数解与几何解释

令目标函数的梯度为零,得到正规方程:

XTXβ^=XTy.X^\mathsf{T}X\hat\beta=X^\mathsf{T}y.

当 XX 的矩阵的秩等于其列数,即具有满列秩时,解是唯一的:

β^=(XTX)−1XTy.\hat\beta=(X^\mathsf{T}X)^{-1}X^\mathsf{T}y.

对于包含一个预测变量和一个截距的模型,上式可化为

β^1=∑i(xi−xˉ)(yi−yˉ)∑i(xi−xˉ)2,β^0=yˉ−β^1xˉ.\hat\beta_1= \frac{\sum_i(x_i-\bar x)(y_i-\bar y)} {\sum_i(x_i-\bar x)^2}, \qquad \hat\beta_0=\bar y-\hat\beta_1\bar x.

因此,拟合直线经过由样本均值确定的点。要使斜率唯一,预测变量的取值不能全部相同。(statlect.com)

在线性代数中,最小二乘法具有几何解释:拟合向量 Xβ^X\hat\beta 是 yy 在 XX 的各列所张成的线性子空间上的正交投影。残差向量 e=y−Xβ^e=y-X\hat\beta 满足 XTe=0X^\mathsf{T}e=0。因此,当模型包含截距时,残差之和为零。如果各列线性相关,系数向量可能不唯一,但拟合向量仍然唯一。通过奇异值分解可以求得范数最小的系数解。(netlib.org)

统计假设与性质

最小二乘计算本身不要求误差服从特定分布,但其统计性质的保证需要额外条件。当模型设定正确、设计矩阵具有满列秩,且满足零条件期望条件

E(ε∣X)=0,E(\varepsilon\mid X)=0,

时,OLS 具有条件无偏性:E(β^∣X)=βE(\hat\beta\mid X)=\beta。这一条件比仅要求误差的无条件均值为零更强。(qed.econ.queensu.ca)

如果还满足

Cov⁡(ε∣X)=σ2I,\operatorname{Cov}(\varepsilon\mid X)=\sigma^2I,

则各误差具有相同的条件方差,且任意两个不同误差之间的条件协方差为零。此时,高斯—马尔可夫定理表明 OLS 是最佳线性无偏估计量:在所有对 yy 呈线性、且在上述假设下无偏的估计量中,OLS 系数的每个线性组合都具有最小方差。其条件协方差矩阵为

Cov⁡(β^∣X)=σ2(XTX)−1.\operatorname{Cov}(\hat\beta\mid X) =\sigma^2(X^\mathsf{T}X)^{-1}.

该定理既不要求正态性,也不要求独立性;上述协方差条件已经足够。(qed.econ.queensu.ca)

当误差的条件分布为高斯分布时,OLS 也与回归系数的最大似然估计一致。在适当的抽样条件、矩条件和识别条件下,即使误差不服从高斯分布,OLS 仍具有一致性和渐近正态性。(qed.econ.queensu.ca)

统计推断与诊断

在经典假设下,当 n>pn>p 时,误差方差的一个无偏估计为

s2=eTen−p.s^2=\frac{e^\mathsf{T}e}{n-p}.

分母表示残差自由度。系数的估计标准误为 s2(XTX)−1s^2(X^\mathsf{T}X)^{-1} 的各个对角元素的平方根。当误差服从高斯分布时,可据此构造基于 tt 分布的精确有限样本置信区间,并对各个系数进行检验。(qed.econ.queensu.ca)

误差方差不相等或误差之间存在相关性,可能使常规标准误失效,但未必会使系数估计量有偏。适当的稳健协方差估计量可以在特定的经典协方差假设偏离情形下支持统计推断,但不能纠正条件均值的错误设定或内生性。残差图可以揭示曲线关系、变异程度的变化和异常观测值,却无法验证所有统计假设。(statlect.com)

计算与相关方法

含有矩阵求逆的公式在数学上描述了该估计量,但软件通常使用 QR 分解或奇异值分解来求解最小二乘问题。这些方法避免显式计算逆矩阵,在预测变量近乎线性相关时尤为重要。LAPACK 提供了用于求解满秩、秩亏及最小范数最小二乘问题的例程。(netlib.org)

OLS 对离群值较为敏感,在预测变量的观测范围之外进行外推时,表现也可能不佳。加权最小二乘法通过为不同观测值赋予各自的权重来修改目标函数;当误差方差不相等且误差之间不相关时,可以采用方差倒数作为权重。正则化则通过惩罚项或约束来调整估计过程。例如,岭回归对系数大小的平方施加惩罚,可能以引入偏差为代价降低估计方差。(itl.nist.gov)