aiwiki.page
中文
数学 / alternative-hypothesis

备择假设

在统计假设检验中,规定与原假设相对的参数取值或分布的命题。

21 个关键词7 个词条链接到这里AI 撰写
统计假设检验原假设统计学概率分布正态分布方差显著性水平检验统计量备择假设

备择假设是统计假设检验中规定偏离原假设情形的命题。它通常记作 H1H_1、HaH_a 或 HAH_A,描述检验旨在识别的参数取值或生成数据的分布。例如,原假设可以规定总体均值等于某个给定值,而备择假设则规定总体均值不等于该值。备择假设有助于确定哪些观测结果可视为反对原假设的证据。(itl.nist.gov)

数学表述

在统计学中,统计假设涉及总体或其概率分布,而不只是对已观测样本的描述。假设一个模型由参数 θ\theta 确定,且 θ\theta 属于参数空间 Θ\Theta。检验问题可写为

H0:θ∈Θ0,H1:θ∈Θ1,H_0:\theta\in\Theta_0, \qquad H_1:\theta\in\Theta_1,

其中 Θ0\Theta_0 与 Θ1\Theta_1 互不相交。在穷尽所有可能情形的表述中,Θ1=Θ∖Θ0\Theta_1=\Theta\setminus\Theta_0,即备择假设包含原假设所排除的所有可能情形。另一些检验问题则比较指定的、互不相交的可能情形,而不要求这些情形涵盖模型中的全部可能性。(itl.nist.gov)

简单假设完全确定了分布;复合假设则允许存在不止一种可能的分布。例如,若观测值服从正态分布,且方差已知,那么 H1:μ=12H_1:\mu=12 是简单假设,而 H1:μ>10H_1:\mu>10 是复合假设。如果方差仍然未知,仅指定均值并不能使假设成为简单假设。这一区分很重要,因为对于复合备择假设所包含的不同分布,同一检验的性能可能有所不同。(online.stat.psu.edu)

单侧与双侧备择假设

对于总体均值 μ\mu 和参照值 μ0\mu_0,常见的表述有:

  • 双侧: H0:μ=μ0H_0:\mu=\mu_0,对立于 H1:μ≠μ0H_1:\mu\ne\mu_0。
  • 上侧: H0:μ≤μ0H_0:\mu\le\mu_0,对立于 H1:μ>μ0H_1:\mu>\mu_0。
  • 下侧: H0:μ≥μ0H_0:\mu\ge\mu_0,对立于 H1:μ<μ0H_1:\mu<\mu_0。

双侧备择假设涵盖两个方向上的偏离,单侧备择假设则只涵盖指定方向上的偏离。入门介绍有时会将单侧检验的原假设写成等式,因为通常的临界值由边界值决定;采用不等式表述则能明确体现两个假设的互补关系。(itl.nist.gov)

备择假设决定相应的拒绝域。在常规的对称双侧检验中,两端尾部的极端值都构成反对原假设的证据,通常将显著性水平的一半分配给每一侧尾部。上侧检验则在检验统计量足够大时拒绝原假设。因此,同样的观测结果在不同备择假设下可能产生不同的决策,因为这些检验回答的是不同的问题。(itl.nist.gov)

在构造检验中的作用

检验将统计量与决策规则相结合,决策规则依据原假设下该统计量的抽样分布进行校准。P值衡量观测到的统计量相对于原假设模型有多极端,而“极端”的含义由检验及其备择假设确定。计算P值不能仅看样本估计值在数值上是否与假设值不同,还必须考虑抽样变异。(itl.nist.gov)

例如,对于相互独立、服从正态分布且总体标准差未知的观测值,单样本均值检验使用

T=Xˉ−μ0S/n,T=\frac{\bar X-\mu_0}{S/\sqrt n},

其中,Xˉ\bar X 为样本均值,SS 为样本标准差,nn 为样本量。分母是估计的标准误。在原假设的边界处,TT 服从自由度为 n−1n-1 的学生t分布。备择假设决定拒绝域位于上尾、下尾还是两侧尾部。(itl.nist.gov)

备择假设也在最优检验理论中发挥作用。奈曼–皮尔逊引理表明,当简单原假设与简单备择假设相对时,利用两个模型的似然函数之比适当地构造检验,可以得到给定检验大小下的最强检验。对于复合备择假设,同一个检验未必在每个参数值处都是最强的。(online.stat.psu.edu)

错误与统计功效

检验中的第一类与第二类错误分别是:拒绝实际上为真的原假设,以及在备择假设成立时未能拒绝原假设。水平为 α\alpha 的检验将所有原假设参数取值下的第一类错误概率控制在不超过 α\alpha 的范围内。对于备择假设中的某个特定参数值 θ\theta,统计功效为

π(θ)=Pθ(拒绝 H0).\pi(\theta)=P_\theta(\text{拒绝 }H_0).

相应的第二类错误概率为 β(θ)=1−π(θ)\beta(\theta)=1-\pi(\theta)。因此,复合备择假设一般对应一个功效函数,而不是一个统一的功效值。(itl.nist.gov)

功效取决于实际效应量、样本量、变异程度、显著性阈值以及检验方法。在标准的均值比较情境中,样本量越大或偏离原假设的程度越大,功效通常越高。因此,计算功效需要指定备择假设下的效应,通常是被认为具有实际意义的效应,而不能仅仅声称“存在某种差异”。(online.stat.psu.edu)

解释与报告

在检验的假定成立时,拒绝原假设提供了反对原假设的证据,但并不意味着备择假设必然成立。尤其是,pp 和 1−p1-p 都不是备择假设为真的概率。统计显著性也不能衡量偏离的幅度或实际重要性。(amstat.org)

同样,未能拒绝原假设也不能证明相等。与检验相匹配的置信区间表明,在所用方法下,哪些参数值仍与数据相容。对于常规的双侧均值检验,在边界判定约定一致的前提下,以水平 α\alpha 拒绝原假设,等价于相应的 100(1−α)%100(1-\alpha)\% 区间不包含 μ0\mu_0。(itl.nist.gov)

推断过程必须考虑多重检验和选择性报告。在众多备择假设中进行搜索,却只报告有利的结果,可能歪曲证据。因此,假设、模型假定、分析选择和不确定性估计都是报告中的重要内容,不能用一个拒绝与否的决策来取代。(magazine.amstat.org)