原假设通常记作 ,是关于总体或数据生成过程的一项断言,通过统计假设检验加以评估。在统计学中,它为评估观测结果提供参照。原假设通常规定不存在差异、不存在关联,或某个参数取特定值,但它并不一定表示不存在效应。检验旨在判断:在指定的假定条件下,数据与原假设是否足够不相容,从而可以拒绝原假设。(itl.nist.gov)
表述与范围
原假设与备择假设配对,后者通常记作 或 。对于总体均值 ,双侧比较可以采用
有方向性的比较则可以采用 ,与之相对的备择假设为 。因此,原假设并不必然是一个等式:它的形式取决于所研究的问题,以及检验旨在识别哪些备择情形。假设涉及的是总体特征,而不是观测到的样本均值是否恰好等于某个基准值。(itl.nist.gov)
更一般地,在统计模型 中,原假设断言 属于指定的子集 。简单假设完全指定数据的概率分布;复合假设则保留多种可能性。例如,均值为零、方差为一的正态分布是完全指定的,而只规定服从正态分布、均值和方差均未知的假设则是复合假设。即使假设固定了均值,只要其他分布参数仍未指定,它也属于复合假设。(stat210a.berkeley.edu)
检验程序
检验使用检验统计量,衡量数据在相关方面偏离原假设的程度。该统计量在 下的抽样分布,与选定的显著性水平 共同确定拒绝域。当原假设为真时,统计量落入该区域的概率被控制在 或以下。对于复合原假设,这一要求适用于该假设涵盖的每一种分布:
这个上确界称为检验的大小,可能低于其名义显著性水平。(itl.nist.gov)
P值表示观测到的统计量相对于其在原假设下的分布有多极端。如果某个统计量的值越大,表示与原假设越不相容,那么对于简单原假设,一个例子是
双侧检验根据该检验对极端程度的定义,将两个方向的偏离都纳入考虑。将有效的P值与预先指定的显著性水平比较,即可得到拒绝规则。P值既不是 为真的概率,也不是结果完全由偶然因素产生的概率。(itl.nist.gov)
示例:检验总体均值
假设各观测值相互独立,且来自一个标准差未知的正态总体。为检验 ,采用的单样本t统计量为
其中, 为样本均值, 为样本标准差, 为样本量。分母是均值的标准误的估计值。在原假设成立且满足上述假定条件时, 服从自由度为 的学生t分布。在双侧检验中,当统计量取足够大的正值或绝对值足够大的负值时,拒绝原假设。(itl.nist.gov)
举例来说,若某样本满足 、、,且 ,则统计量为 。在显著性水平为5%的双侧检验中,自由度为24时的临界值绝对值约为2.064,因此不拒绝原假设。这一结果反映的是检验所设定的证据门槛,并不能证明总体均值恰好为100。(itl.nist.gov)
错误、功效与解释
第一类与第二类错误的区别说明了检验的不对称性。第一类错误是拒绝了为真的原假设。第二类错误是未拒绝为假的原假设。统计功效是在指定备择假设下拒绝原假设的概率,等于一减去相应的第二类错误概率。功效取决于备择假设、样本量、变异程度和检验程序,并非仅由原假设本身决定的单一属性。(stat.berkeley.edu)
因此,未拒绝原假设并不等于证明原假设成立。数据可能与原假设相容,同时也与某些备择假设相容,而研究的功效不足以将它们区分开来。反过来,拒绝原假设也不能从逻辑上证明某个备择假设成立:仍然可能发生错误拒绝,而且不正确的建模假定可能使计算失去效力。结论既以所检验的假设为条件,也以获得参照分布时采用的假定为条件。(stat.berkeley.edu)
估计与多重检验
对于彼此对应的检验和区间估计方法,显著性水平为 的双侧检验拒绝某个参数值,当且仅当该值落在相应的 置信区间之外。这种对应关系将假设检验与估计联系起来:区间展示了在该方法下与数据相容的一系列参数值,而不只是针对某一个值作出决定。(itl.nist.gov)
统计显著性并不衡量效应量或实际重要性。较小的P值可能伴随着较小的效应,而较大的P值也不能证明不存在重要效应。美国统计协会2016年的声明强调,科学结论不能简化为P值是否越过某个阈值。(doi.org)
当同时检验许多原假设时,多重检验会增加错误拒绝的机会。邦费罗尼校正等方法用于控制一组比较中的错误。对于 个检验,若每个检验均采用 的显著性水平,则至少发生一次第一类错误的概率不超过 ,而且这一结论不要求各检验相互独立。(itl.nist.gov)