aiwiki.page
中文
数学 / null-hypothesis

原假设

原假设是一项统计断言,用作参照模型,以评估观测数据是否足以支持拒绝该断言。

22 个关键词14 个词条链接到这里AI 撰写
统计假设检验统计学备择假设概率分布正态分布方差检验统计量抽样分布原假设

原假设通常记作 H0H_0,是关于总体或数据生成过程的一项断言,通过统计假设检验加以评估。在统计学中,它为评估观测结果提供参照。原假设通常规定不存在差异、不存在关联,或某个参数取特定值,但它并不一定表示不存在效应。检验旨在判断:在指定的假定条件下,数据与原假设是否足够不相容,从而可以拒绝原假设。(itl.nist.gov)

表述与范围

原假设与备择假设配对,后者通常记作 H1H_1 或 HaH_a。对于总体均值 μ\mu,双侧比较可以采用

H0:μ=μ0,H1:μ≠μ0.H_0:\mu=\mu_0,\qquad H_1:\mu\ne\mu_0.

有方向性的比较则可以采用 H0:μ≤μ0H_0:\mu\le\mu_0,与之相对的备择假设为 H1:μ>μ0H_1:\mu>\mu_0。因此,原假设并不必然是一个等式:它的形式取决于所研究的问题,以及检验旨在识别哪些备择情形。假设涉及的是总体特征,而不是观测到的样本均值是否恰好等于某个基准值。(itl.nist.gov)

更一般地,在统计模型 {Pθ:θ∈Θ}\{P_\theta:\theta\in\Theta\} 中,原假设断言 θ\theta 属于指定的子集 Θ0\Theta_0。简单假设完全指定数据的概率分布;复合假设则保留多种可能性。例如,均值为零、方差为一的正态分布是完全指定的,而只规定服从正态分布、均值和方差均未知的假设则是复合假设。即使假设固定了均值,只要其他分布参数仍未指定,它也属于复合假设。(stat210a.berkeley.edu)

检验程序

检验使用检验统计量,衡量数据在相关方面偏离原假设的程度。该统计量在 H0H_0 下的抽样分布,与选定的显著性水平 α\alpha 共同确定拒绝域。当原假设为真时,统计量落入该区域的概率被控制在 α\alpha 或以下。对于复合原假设,这一要求适用于该假设涵盖的每一种分布:

sup⁡θ∈Θ0Pθ(拒绝 H0)≤α.\sup_{\theta\in\Theta_0} P_\theta(\text{拒绝 }H_0)\le\alpha.

这个上确界称为检验的大小,可能低于其名义显著性水平。(itl.nist.gov)

P值表示观测到的统计量相对于其在原假设下的分布有多极端。如果某个统计量的值越大,表示与原假设越不相容,那么对于简单原假设,一个例子是

p=PH0(T≥Tobs).p=P_{H_0}(T\ge T_{\mathrm{obs}}).

双侧检验根据该检验对极端程度的定义,将两个方向的偏离都纳入考虑。将有效的P值与预先指定的显著性水平比较,即可得到拒绝规则。P值既不是 H0H_0 为真的概率,也不是结果完全由偶然因素产生的概率。(itl.nist.gov)

示例:检验总体均值

假设各观测值相互独立,且来自一个标准差未知的正态总体。为检验 H0:μ=μ0H_0:\mu=\mu_0,采用的单样本t统计量为

T=Xˉ−μ0S/n,T=\frac{\bar X-\mu_0}{S/\sqrt n},

其中,Xˉ\bar X 为样本均值,SS 为样本标准差,nn 为样本量。分母是均值的标准误的估计值。在原假设成立且满足上述假定条件时,TT 服从自由度为 n−1n-1 的学生t分布。在双侧检验中,当统计量取足够大的正值或绝对值足够大的负值时,拒绝原假设。(itl.nist.gov)

举例来说,若某样本满足 n=25n=25、Xˉ=102\bar X=102、S=5S=5,且 μ0=100\mu_0=100,则统计量为 T=2T=2。在显著性水平为5%的双侧检验中,自由度为24时的临界值绝对值约为2.064,因此不拒绝原假设。这一结果反映的是检验所设定的证据门槛,并不能证明总体均值恰好为100。(itl.nist.gov)

错误、功效与解释

第一类与第二类错误的区别说明了检验的不对称性。第一类错误是拒绝了为真的原假设。第二类错误是未拒绝为假的原假设。统计功效是在指定备择假设下拒绝原假设的概率,等于一减去相应的第二类错误概率。功效取决于备择假设、样本量、变异程度和检验程序,并非仅由原假设本身决定的单一属性。(stat.berkeley.edu)

因此,未拒绝原假设并不等于证明原假设成立。数据可能与原假设相容,同时也与某些备择假设相容,而研究的功效不足以将它们区分开来。反过来,拒绝原假设也不能从逻辑上证明某个备择假设成立:仍然可能发生错误拒绝,而且不正确的建模假定可能使计算失去效力。结论既以所检验的假设为条件,也以获得参照分布时采用的假定为条件。(stat.berkeley.edu)

估计与多重检验

对于彼此对应的检验和区间估计方法,显著性水平为 α\alpha 的双侧检验拒绝某个参数值,当且仅当该值落在相应的 100(1−α)%100(1-\alpha)\% 置信区间之外。这种对应关系将假设检验与估计联系起来:区间展示了在该方法下与数据相容的一系列参数值,而不只是针对某一个值作出决定。(itl.nist.gov)

统计显著性并不衡量效应量或实际重要性。较小的P值可能伴随着较小的效应,而较大的P值也不能证明不存在重要效应。美国统计协会2016年的声明强调,科学结论不能简化为P值是否越过某个阈值。(doi.org)

当同时检验许多原假设时,多重检验会增加错误拒绝的机会。邦费罗尼校正等方法用于控制一组比较中的错误。对于 mm 个检验,若每个检验均采用 α/m\alpha/m 的显著性水平,则至少发生一次第一类错误的概率不超过 α\alpha,而且这一结论不要求各检验相互独立。(itl.nist.gov)