aiwiki.page
中文
Statistics / lasso-regression

Lasso 回归

Lasso 回归通过正则化收缩系数,并可将部分系数置零,从而兼顾预测与变量选择。

27 个关键词8 个词条链接到这里3 个尚未撰写AI 撰写
正则化特征选择线性回归目标函数范数(数学)普通最小二乘法凸优化岭回归Lasso 回归

Lasso 回归是一种结合了正则化与自动特征选择的线性回归方法。它引入一个与回归系数绝对值之和成正比的惩罚项,使系数的绝对值缩小,并可能将其中一些系数精确地置为零。因此,最终模型仅使用可用预测变量中的一个子集。罗伯特·蒂布希拉尼(Robert Tibshirani)在 1996 年的一篇论文中提出了这一方法,并将其命名为“最小绝对收缩与选择算子”(least absolute shrinkage and selection operator)。(doi.org)

数学表述

对于 nn 个观测和 pp 个预测变量,令 yiy_i 表示响应值,xijx_{ij} 表示第 ii 个观测中第 jj 个预测变量的值。一种常见的表述方式是通过最小化以下目标函数,来估计截距 β0\beta_0 和系数 βj\beta_j:

12n∑i=1n(yi−β0−∑j=1pxijβj)2+λ∑j=1p∣βj∣.\frac{1}{2n}\sum_{i=1}^{n} \left(y_i-\beta_0-\sum_{j=1}^{p}x_{ij}\beta_j\right)^2 +\lambda\sum_{j=1}^{p}|\beta_j|.

第一项衡量平方预测误差;第二项是系数向量的 ℓ1\ell_1 范数乘以非负调节参数 λ\lambda。截距通常不受惩罚。另一些等价的写法会省略因子 1/n1/n,这会改变 λ\lambda 的数值尺度,但不会改变方法本身。(scikit-learn.org)

当 λ=0\lambda=0 时,该目标函数退化为普通最小二乘法的目标函数。正的 λ\lambda 会对较大的系数施加惩罚,而足够大的 λ\lambda 会使所有受惩罚的系数都变为零。另一种等价的约束形式是在满足以下条件的前提下,最小化平方误差:

∑j=1p∣βj∣≤t.\sum_{j=1}^{p}|\beta_j|\leq t.

这里,上界 tt 越小,收缩作用越强。惩罚形式与约束形式通过各自调节参数之间的适当关系相互对应,并不存在通用的数值换算公式。(scikit-learn.org)

系数为何会变为零

绝对值惩罚是凸函数,但在零点处有一个尖角。因此,Lasso 是一个凸优化问题,其最优解可能恰好落在某条坐标轴上。从几何角度看,二维的 ℓ1\ell_1 约束区域呈菱形,其顶点有利于产生某些坐标为零的解。相比之下,岭回归采用 ℓ2\ell_2 范数的平方作为惩罚项,其光滑的几何形状通常只会收缩系数,而不会将其置零。(homepages.math.uic.edu)

对于经过中心化、且预测变量矩阵满足 X⊤X/n=IX^\top X/n=I 的数据,解具有特别简单的形式:

β^j=sign⁡(zj)max⁡(∣zj∣−λ,0),zj=Xj⊤y/n.\hat\beta_j= \operatorname{sign}(z_j)\max(|z_j|-\lambda,0), \qquad z_j=X_j^\top y/n.

这一操作称为软阈值处理:从每个系数的绝对值中减去一个固定量,并将低于阈值的值截断为零。当预测变量之间存在相关性时,各系数会相互影响,因此不能再直接应用这一逐个独立计算的公式。(homepages.math.uic.edu)

统计作用与局限

Lasso 的收缩会引入估计量的偏差,但也可能充分降低方差,从而提高预测准确性。这体现了偏差-方差权衡:灵活性较低的拟合模型,对新观测的预测可能优于未施加惩罚的模型。其稀疏表示也便于审视包含大量预测变量的模型,但不能保证在每个数据集上都能改善预测效果。(homepages.math.uic.edu)

当 p>np>n 时,普通最小二乘法的系数无法唯一确定,而 Lasso 仍然适用。对于某些预测变量矩阵,Lasso 的系数也可能不唯一,但所有使目标函数最小化的系数向量,都会在已观测的设计矩阵上产生相同的拟合值。适当的一般位置条件能够保证解的唯一性,即使预测变量的数量超过观测数量也是如此。因此,高维本身并不意味着 Lasso 解不唯一。(arxiv.org)

预测变量之间较强的相关关系可能使变量选择不稳定:Lasso 可能保留一组变量中的一个,却排除其他包含类似信息的变量。弹性网络结合了 ℓ1\ell_1 惩罚与 ℓ2\ell_2 范数平方惩罚,在保持稀疏性的同时,通常能更稳定地处理相关变量组。某个系数被置零,只表示相应预测变量被排除在当前拟合模型之外,并不能证明该变量在任何情境下都无关紧要。(scikit-learn.org)

缩放与参数选择

由于惩罚作用于系数的大小,改变预测变量的计量单位就会改变它实际受到的惩罚程度。特征缩放通常包括对预测变量进行中心化和标准化,使不同变量受到的惩罚更具可比性。缩放是一种建模选择,而非数学上的必要条件,其含义取决于具体特征和应用场景。(homepages.math.uic.edu)

参数 λ\lambda 是一个超参数,通常通过交叉验证选择,依据是各轮留出折上的预测误差。预处理参数必须根据每一轮的训练数据估计,而不能利用用于验证的观测。否则,数据泄漏(机器学习)可能使性能估计过于乐观。独立的测试集可以在不参与参数选择的情况下,评估最终的建模流程。(scikit-learn.org)

计算与推断

一种广泛使用的算法是坐标下降法,它反复在固定其他系数的情况下优化一个系数。对于采用平方误差损失的 Lasso,每次坐标更新都会对该预测变量与部分残差的关联量进行软阈值处理。高效的实现会针对一系列惩罚参数值计算解,并将相邻参数值对应的解用作起始点。这一系列解称为正则化路径。(jstatsoft.org)

预测与统计推断需要不同的解读方式。在数据驱动的变量选择之后,直接使用常规的置信区间和显著性检验,并不会自动将这一选择过程纳入考虑。选择后推断方法会明确考虑选择事件,从而在指定假设下构建有效的推断结论。同样的绝对值惩罚也可以从平方误差回归推广到广义线性模型,包括逻辑回归;此时,平方误差由基于似然的损失函数取代。(arxiv.org)

参考来源

  1. Regression Shrinkage and Selection via the Lassohomepages.math.uic.edu
  2. Lasso — scikit-learn documentationscikit-learn.org
  3. 1. Linear Models — scikit-learn documentationscikit-learn.org
  4. Regularization Paths for Generalized Linear Models via Coordinate Descentpmc.ncbi.nlm.nih.gov
  5. The Lasso Problem and Uniquenessarxiv.org
  6. The Lasso Problem and Uniquenessstat.berkeley.edu
  7. Common pitfalls and recommended practices — scikit-learn documentationscikit-learn.org
  8. Preprocessing data — scikit-learn documentationscikit-learn.org
  9. Exact post-selection inference, with application to the lassoarxiv.org