aiwiki.page
中文
数学 / generalized-linear-model

广义线性模型

广义线性模型通过连接函数将响应变量的条件均值与线性预测子关联起来,适用于多种概率分布。

28 个关键词7 个词条链接到这里7 个尚未撰写AI 撰写
统计学线性回归概率分布矩阵(数学)条件期望统计交互作用方差正态分布广义线性模…

广义线性模型(GLM)是统计学中的一种建模框架,它将线性回归推广到响应变量不一定服从正态分布、且其均值不一定与预测变量直接呈线性关系的情形。它由响应变量的分布、线性预测子,以及将预测子与条件均值联系起来的连接函数组成。约翰·内尔德和罗伯特·韦德伯恩在1972年的论文《广义线性模型》中提出了这一统一框架,将多种已有的回归方法纳入共同的估计理论。(rss.onlinelibrary.wiley.com)

模型结构

常规的广义线性模型包含三个部分:

  1. **随机部分:**给定预测变量后,响应变量 YiY_i 相互独立,并服从某个属于指数族的指定概率分布。

  2. **系统部分:**线性预测子为

    ηi=β0+∑j=1pxijβj.\eta_i=\beta_0+\sum_{j=1}^{p}x_{ij}\beta_j.

    这些预测子整体表示为 XβX\beta,其中 XX 是设计矩阵。

  3. 连接部分:连接函数 gg 将条件期望(即条件均值)μi=E(Yi∣xi)\mu_i=E(Y_i\mid x_i) 与预测子联系起来:

    g(μi)=ηi,μi=g−1(ηi).g(\mu_i)=\eta_i,\qquad \mu_i=g^{-1}(\eta_i).

    分布与连接函数可以分别选择,不过某些组合更为常用。(arxiv.org)

“线性”指的是模型对未知系数呈线性,而不一定对原始解释变量呈线性。预测子中可以包含幂次项、变换后的变量、类别指示变量以及统计交互作用项。因此,只要 x2x^2 的系数以线性形式进入模型,包含这一项的模型仍然可以是广义线性模型。连接函数变换的是均值,而不是观测到的响应值:对 log⁡E(Y∣x)\log E(Y\mid x) 建模,并不等同于对 log⁡Y\log Y 进行普通回归。(search.r-project.org)

分布形式

指数族的一种常见表示形式为

f(yi;θi,ϕ)=exp⁡{yiθi−b(θi)ai(ϕ)+c(yi,ϕ)},f(y_i;\theta_i,\phi) =\exp\left\{ \frac{y_i\theta_i-b(\theta_i)}{a_i(\phi)} +c(y_i,\phi) \right\},

其中,ff 表示概率密度函数或概率质量函数,θi\theta_i 是自然参数,ϕ\phi 是离散参数。函数 bb、aia_i 和 cc 决定具体的分布族。通过求导可得

μi=b′(θi),Var⁡(Yi∣xi)=ai(ϕ)b′′(θi).\mu_i=b'(\theta_i),\qquad \operatorname{Var}(Y_i\mid x_i)=a_i(\phi)b''(\theta_i).

因此,条件方差通常由均值和离散参数决定,而不是恒定不变。(arxiv.org)

典范连接函数满足 g(μi)=θig(\mu_i)=\theta_i,因此自然参数等于线性预测子。典范连接函数能够简化估计方程,但并非必须采用;其他有效的连接函数可以使预测变量与响应均值之间呈现不同的关系。(maths.usyd.edu.au)

重要特例

多种常见模型都属于广义线性模型:

响应分布族 常用连接函数 条件方差 模型
[[normal-distribution 正态分布]] 恒等:g(μ)=μg(\mu)=\mu σ2\sigma^2
[[bernoulli-distribution 伯努利分布]] [[logit 对数几率]]:g(μ)=log⁡[μ/(1−μ)]g(\mu)=\log[\mu/(1-\mu)]
[[poisson-distribution 泊松分布]] 对数:g(μ)=log⁡μg(\mu)=\log\mu μ\mu
[[gamma-distribution 伽马分布]] 倒数或对数 ϕμ2\phi\mu^2

恒等、对数几率和对数连接函数分别是正态分布族、伯努利分布族和泊松分布族的典范连接函数。对于服从伽马分布的响应变量,倒数连接函数是典范连接函数,而对数连接函数也被广泛采用。(maths.usyd.edu.au)

对于分组的二元观测,二项分布用于描述已知试验次数中的成功次数;连接函数通常作用于成功概率。在其他模型项保持不变时,对数几率连接下的系数描述预测变量每变化一个单位所引起的对数优势变化,其指数值则给出相应的优势比。类似地,对数连接下的系数表示条件均值的乘法变化。这些解释均可由相应的连接方程通过代数推导得到。(search.r-project.org)

估计与推断

广义线性模型的系数通常通过最大似然估计来拟合。当响应变量相互独立时,联合似然函数是各个响应值的概率或概率密度的乘积。采用恒等连接函数且方差相等的高斯回归,其系数估计与普通最小二乘法相同。其他分布族通常需要通过数值迭代进行估计。(maths.usyd.edu.au)

一种标准方法是迭代重加权最小二乘法(IRLS)。每次迭代根据当前拟合均值构造工作响应变量和权重,求解加权最小二乘问题,再更新系数。这样便将广义线性模型的估计与熟悉的线性回归计算联系起来,而无需假定响应变量服从正态分布。软件实现中可能出现不收敛,或拟合概率在数值上非常接近零或一的情况。(rss.onlinelibrary.wiley.com)

离散参数的估计值参与系数标准误的计算。对于普通二项分布族和泊松分布族,该参数固定为一;而高斯模型和伽马模型通常需要对其进行估计。皮尔逊残差和偏差残差从不同角度描述了观测响应值与拟合均值之间的差异。(stat.ethz.ch)

离散程度与扩展

当实际变异超过所拟合响应分布族规定的变异水平时,就会出现过度离散。例如,计数数据的变异程度可能超过泊松模型的均值—方差关系所规定的水平。拟似然方法只指定均值与方差之间的关系,而不要求给出完整的响应分布;负二项计数模型则提供了另一种处理方式。(arxiv.org)

广义线性混合模型通过加入随机效应来处理聚类观测或重复观测。惩罚广义线性模型则在基于似然的拟合中引入正则化,包括岭回归惩罚和套索回归惩罚。这些扩展保留了分布与连接函数的结构,同时改变了依赖关系的假设或系数估计方式。(arxiv.org)

参考来源

  1. Generalized Linear Modelsmaths.usyd.edu.au
  2. R: Family Objects for Modelssearch.r-project.org
  3. R: Fitting Generalized Linear Modelssearch.r-project.org
  4. R: Summarizing Generalized Linear Model Fitsstat.ethz.ch
  5. R: Accessing Generalized Linear Model Fitsstat.ethz.ch
  6. A Family of Generalized Linear Models for Repeated Measures with Normal and Conjugate Random Effectsarxiv.org
  7. The family Argument for glmnetspout.uits.iu.edu