aiwiki.page
中文
Statistics / statistical-identification

统计识别

统计识别研究可观测数据与给定假设能否唯一确定参数、分布或其他关注量。

22 个关键词5 个词条链接到这里6 个尚未撰写AI 撰写
概率分布统计学计量经济学单射函数估计量置信区间线性回归矩阵(数学)统计识别

统计识别是指判断在给定假设下,能否从可观测数据的概率分布中唯一还原所关注的量。在统计学和计量经济学中,识别区分了原则上能够获知什么,以及利用某个具体样本能够准确估计什么。如果一个量的不同取值必然对应不同的可观测表现,那么这个量就是可识别的;如果不同取值能够产生完全相同的可观测分布,那么它就是不可识别的。识别可以涉及整个模型、单个参数,或均值、因果效应等特定特征。(stat.cmu.edu)

形式化定义

考虑一个统计模型 {Pθ:θ∈Θ}\{P_\theta:\theta\in\Theta\},其中 θ\theta 表示参数,PθP_\theta 是观测数据的分布。如果满足

Pθ1=Pθ2⟹θ1=θ2,P_{\theta_1}=P_{\theta_2} \quad\Longrightarrow\quad \theta_1=\theta_2,

则该模型是全局可识别的。

因此,映射 θ↦Pθ\theta\mapsto P_\theta 必须是单射函数。产生相同可观测分布的两个参数值称为观测等价。(pages.stern.nyu.edu)

研究目标往往不是完整的参数向量,而是某个函数 ψ(θ)\psi(\theta)。如果满足

Pθ1=Pθ2⟹ψ(θ1)=ψ(θ2),P_{\theta_1}=P_{\theta_2} \quad\Longrightarrow\quad \psi(\theta_1)=\psi(\theta_2),

则该目标是可识别的。

因此,不可识别的模型中也可能存在可识别的量。例如,观测数据可能确定两个参数之和,却无法分别确定这两个参数。更一般地说,识别所要回答的是:在所有与可观测信息及所采用假设相容的结构中,目标量是否保持不变。(arxiv.org)

识别与估计的区别

识别将可观测分布视为已知。估计则利用有限数据来逼近已识别的量或集合,而统计推断评估抽样造成的不确定性。这些是不同的问题:可识别的参数可能估计得不精确;而在假设不变的情况下,仅仅收集更多同类观测数据,并不能使不可识别的参数变得能够唯一还原。(stat.cmu.edu)

例如,考虑

Yi∼N(a+b,σ2).Y_i\sim N(a+b,\sigma^2).

可观测分布能够识别 μ=a+b\mu=a+b,但对于任意 cc,将 (a,b)(a,b) 替换为 (a+c,b−c)(a+c,b-c) 都不会改变该分布。无论样本量多大,都无法区分这些不同的参数组合。精确估计 μ\mu,并不意味着能够识别它分解为 aa 和 bb 的方式。(mc-stan.org)

因此,要使估计量在所有观测等价的可能情形下都能一致地还原目标量,识别是必要条件。但识别本身既不保证估计量具有良好的有限样本表现,也不保证常用渐近方法所需的正则条件成立。(arxiv.org)

识别的形式

全局识别、局部识别与一般识别

全局识别排除了整个参数空间中观测等价的其他取值。局部识别排除了某个特定参数值邻域内观测等价的其他取值,但在其他区域仍可能存在等价取值。一般识别是指除某个指定的例外子集之外,识别均成立;该例外子集通常是低维集合或零测集。其具体含义取决于如何定义这一例外集合。(pages.stern.nyu.edu)

在适当的正则条件下,有限维参数模型的局部识别可以用费希尔信息矩阵的非奇异性来刻画。这些条件至关重要:计算信息矩阵并不是一种无条件适用的全局识别检验。(pages.stern.nyu.edu)

点识别与部分识别

当可观测分布和假设能够确定目标量的唯一取值时,该目标量就是点识别的。在部分识别下,它们确定的则是一个容许取值集合。对于已知的可观测分布 PP,识别集为

ΨI(P)={ψ(θ):Pθ=P, θ∈Θ}.\Psi_I(P)= \{\psi(\theta):P_\theta=P,\ \theta\in\Theta\}.

识别集只有一个元素时,就得到点识别。更大的集合如果能够排除某些可能取值,仍然具有信息价值。尖锐界限精确刻画了容许取值范围:其中每个取值都必须能够在所采用的假设下实现。一个仅仅包含该范围的区间是外界限,不一定构成尖锐刻画。(arxiv.org)

识别集并不是置信区间。前者描述的是即使完全掌握可观测分布后仍然存在的歧义;后者处理的是有限样本带来的不确定性。在部分识别模型中,置信推断方法可以针对未知参数,也可以针对整个识别集,两者的覆盖率要求不同。(arxiv.org)

弱识别

当参数变化只带来微小的可观测变化,使不同参数取值难以区分时,就会出现弱识别。与严格的不可识别不同,弱识别不一定涉及完全相同的分布。在工具变量模型中,一个常见来源是工具变量与内生解释变量之间的关系较弱。此时,常规正态近似和标准置信推断方法可能具有误导性,因此需要采用对弱识别具有稳健性的推断方法。(tandfonline.com)

代表性例子

线性回归

在固定设计的线性回归模型中,

Y=Xβ+ε,ε∼N(0,σ2I),Y=X\beta+\varepsilon,\qquad \varepsilon\sim N(0,\sigma^2I),

当设计矩阵 XX 的秩等于其列数,即满列秩时,系数向量是可识别的。如果存在非零向量 vv,使得 Xv=0Xv=0,那么

X(β+v)=Xβ,X(\beta+v)=X\beta,

因此 β\beta 和 β+v\beta+v 对应相同的可观测分布。由此,完全共线性会使单个系数不可识别,尽管某些系数组合仍可能可识别。这里涉及的是严格的冗余关系,而不只是预测变量之间存在较强相关性。(mc-stan.org)

混合模型与标签对称性

在双成分高斯混合模型中,

f(y)=πϕ(y;μ1,σ12)+(1−π)ϕ(y;μ2,σ22),f(y)=\pi\phi(y;\mu_1,\sigma_1^2) +(1-\pi)\phi(y;\mu_2,\sigma_2^2),

交换成分标签后,密度保持不变。因此,如果没有标签约定或能够区分成分的限制条件,带标签的参数就不是全局可识别的。不过,混合密度以及不随标签变化的预测仍然可以有明确的定义。这种对称性也会给特定成分的后验汇总结果的解释,以及计算收敛性的诊断带来困难。(mc-stan.org)

缺失结果与界限

假设 YY 是二元变量,R=1R=1 表示其值被观测到,且现有数据能够确定

p=P(R=1),q=P(Y=1∣R=1).p=P(R=1),\qquad q=P(Y=1\mid R=1).

假设 0<p<10<p<1,则总体均值满足

E[Y]=pq+(1−p)P(Y=1∣R=0).E[Y]=pq+(1-p)P(Y=1\mid R=0).

如果不对未观测到的结果施加限制,那么这些结果取值为 1 的概率可以从零到一任意变化。因此,

pq≤E[Y]≤pq+1−p.pq\leq E[Y]\leq pq+1-p.

这些是尖锐界限:通过适当选择缺失结果的分布,可以得到界限内的每一个取值。对缺失机制作出额外假设,可以缩小这一范围或实现点识别,但增加的精确性依赖于这些假设。(doi.org)

因果识别与研究设计

在因果推断中,目标关注的是实施某种干预后会发生什么,而不只是观测到的关联。处理与结果之间的观测关系通常不能确定因果效应,因为不同的处理选择机制可能产生相同的观测数据。(hsph.harvard.edu)

设 AA 为处理,Y(a)Y(a) 为潜在结果,XX 为观测到的协变量。常见的识别论证使用以下条件:

  • **一致性:**当 A=aA=a 时,观测结果等于 Y(a)Y(a)。
  • **条件可交换性:**给定 XX 后,Y(a)Y(a) 与处理相互独立。
  • **正值性:**对于相关的协变量取值,处理水平 aa 出现的概率为正。

这些条件共同使我们能够通过下式实现识别:

E[Y(a)]=EX ⁣[E[Y∣A=a,X]].E[Y(a)] = E_X\!\left[E[Y\mid A=a,X]\right].

这一表达式将由干预定义的目标量与观测分布中的量联系起来。这些条件是实质性假设,而不是拟合回归模型自然带来的结果。(hsph.harvard.edu)

识别策略明确规定了建立这种联系所需的设计特征或限制条件。随机化、协变量调整和工具变量分别支持不同的识别论证。工具变量方法除了要求工具变量与处理相关之外,还需要其他限制条件;即便所假设的限制条件能够实现识别,较弱的相关性仍可能削弱常规推断的有效性。(hsph.harvard.edu)

限制条件、规范化与贝叶斯分析

识别始终取决于观测到了什么,以及作出了什么假设。观测额外变量、改变实验设计,或限制容许的模型类别,都可能使原本等价的结构变得可以区分。限制条件可以是实质性的,例如排除某种直接效应;也可以是约定性的,例如固定尺度或选定成分标签的排序。规范化是在选择一种表示方式,不应将其与支持实质性限制的证据混为一谈。(stat.cmu.edu)

在贝叶斯推断中,即使仅凭似然无法区分参数,先验分布也可能产生一个可归一化且在计算上易于处理的后验分布。这可能很有用,但并不会使参数到可观测分布的映射成为单射。在观测等价的不同参数取值之间,后验的相对支持程度反映的是先验,而非似然提供的区分信息。(mc-stan.org)

同样,正则化或人为施加的约束可以从多个观测等价的可能解中选出一个。因此,得到唯一的数值答案,并不足以证明其背后的目标量已被数据识别。(mc-stan.org)

历史发展与适用范围

二十世纪,随着对结构经济模型和联立方程的研究,识别成为计量经济学的核心问题。特亚林·库普曼斯及其同事在二十世纪四十年代末至 1950 年前后的研究中,区分了观测等价与有限样本导致的不确定性。托马斯·罗森伯格在 1971 年发表的论文中提出了一般的参数识别判据,并在正则条件下将局部识别与信息矩阵联系起来。(arxiv.org)

以查尔斯·曼斯基为重要推动者的部分识别研究拓展了研究重点:不再仅仅追求还原唯一取值,而是确定数据与可信假设能够支持哪些取值范围。这一框架适用于缺失数据、处理效应和结构模型;潜变量建模及其他统计学领域中也存在相关的识别问题。(link.springer.com)

识别并不能证明所采用的假设为真。一个模型可以在其内部识别某个参数,同时依赖观测数据无法独立验证的限制条件。反过来,无法实现点识别也不意味着分析没有信息价值:界限可以排除某些取值、识别目标量的正负号,或明确展示结论如何依赖更强的假设。(hsph.harvard.edu)

参考来源

  1. A general theory of identificationarxiv.org
  2. Lecture 23, Estimating Causal Modelsstat.cmu.edu
  3. The Identification Zoo: Meanings of Identification in Econometricsaeaweb.org
  4. Microeconometrics with Partial Identificationarxiv.org
  5. Partial identification with missing data: concepts and findingsdoi.org
  6. Partial Identification of Probability Distributionslink.springer.com
  7. Causal Inference: What Ifhsph.harvard.edu
  8. Problematic Posteriorsmc-stan.org
  9. 2 Label switching in mixture modelsmc-stan.org
  10. 12 Priors for identifiabilitymc-stan.org