P 值是统计学和统计假设检验中使用的一个数值。它是在指定的原假设及其相关假定成立的条件下,获得至少与观测值同样极端的检验统计量的概率。P 值的取值范围为 0 到 1。数值越小,表明按照所选检验的衡量方式,观测结果与假设模型越不相容;它并不表示原假设为真的概率。(itl.nist.gov)
定义与计算
检验首先需要确定原假设 ,以及用于概括数据相关特征的检验统计量 。 在 成立时的抽样分布决定了哪些结果被视为不寻常。“至少同样极端”的含义取决于检验的备择假设及可能结果的排序方式,而不只是观测数据集本身出现的概率。(itl.nist.gov)
对于上尾检验,较大的统计量值与 相悖,P 值计算如下:
对于下尾检验,不等号方向相反。对于使用关于零对称的统计量的双侧检验,可以用绝对值的大小来定义极端程度:
当 服从标准正态分布时,上式可写为 ,其中 是该分布的累积分布函数。其他概率分布,尤其是离散或不对称的分布,需要明确规定双侧检验中结果的排序方式;将单侧概率乘以二,并不总能得到等价的结果。(itl.nist.gov)
示例
假设将一枚硬币抛掷十次,并假定各次抛掷具有统计独立性。在硬币公平这一原假设下,正面出现的次数 服从参数为 、成功概率为 的二项分布。精确二项检验将观测到的次数与这一分布进行比较。(stat.ethz.ch)
如果观测到九次正面,且备择假设指定硬币偏向正面,则直接计算可得:
对于允许硬币偏向任一面的双侧备择假设,同样极端的结果包括正面出现零次、一次、九次和十次。因此,计算得到的 P 值为 。这些概率包含了未实际观测到、但比实际结果更极端的结果。两种计算都不意味着硬币公平的概率为 1.07% 或 2.15%。(stat.ethz.ch)
显著性阈值与校准
在用于作出决策的检验中,P 值需要与预先指定的显著性水平 比较。按照规则,若 ,则拒绝 ;否则不拒绝。常见的阈值包括 0.05 和 0.01,但这些惯例并不是区分命题真假的数学界限。(itl.nist.gov)
有效的 P 值满足:
因此,在 时拒绝原假设,可将发生第一类错误——即拒绝实际上为真的原假设——的概率限制在不超过 的范围内。对于复合原假设,这一要求必须对该原假设允许的每一种分布都成立。在原假设成立时,基于尾部概率计算的精确连续型 P 值服从均匀分布;离散检验得到的概率通常偏保守。这种校准针对的是重复抽样,而不是某一次拒绝原假设的决定出错的概率。(stat.berkeley.edu)
解释及相关量
P 值不是由后验分布给出的假设后验概率。这类概率属于贝叶斯推断,取决于先验分布和指定的似然。P 值也不表示数据“纯粹由偶然因素”产生的概率,更不能证明某个特定备择假设为真。(amstat.org)
统计显著性并不衡量效应量或实际重要性。当测量足够精确或样本足够大时,很小的效应也可能产生很小的 P 值。反过来,即使存在相当大的效应,精度不足的研究也可能无法拒绝原假设;这涉及统计功效。未能拒绝原假设,并不等于证明两者相等或效应不存在。(stat.berkeley.edu)
置信区间提供了补充信息,指出哪些参数值与数据相容。如果区间是通过反演同一系列检验构造的,那么原假设中的参数值被排除在区间之外,就对应于在相应显著性水平下拒绝原假设。例如,与检验相匹配的双侧 95% 置信区间会在相应检验于 0.05 显著性水平下拒绝原假设时,排除原假设中的参数值。不过,分别实现的区间估计与检验并不一定采用相匹配的构造方法。(itl.nist.gov)
多重检验与分析选择
当同时检验许多假设时,使用未经调整的阈值可能提高错误拒绝原假设的概率。多重检验方法针对明确界定的一组检验进行处理。对于 次比较,邦费罗尼校正将每个 P 值与 比较,或报告调整后的值 。其他方法则控制错误发现率;这是另一种错误衡量标准,关注被拒绝的假设中错误发现所占比例的期望值。(stat.ethz.ch)
因为某些分析能产生较小的 P 值而选择它们,这种做法通常称为P 值操纵,可能使报告结果的名义解释失效。在不同结局、亚组、模型或停止规则之间进行搜索而不予披露,会掩盖分析的选择过程。因此,报告实验设计、分析选择及所检验的假设,对于评估 P 值和可复现性十分重要。美国统计学会 2016 年的声明强调透明性,反对仅依赖某个阈值作出判断;2021 年的会长特别工作组声明则重申了正确应用和解释显著性检验的价值。(stat.berkeley.edu)