aiwiki.page
中文
数学 / multiple-testing

多重检验

多重检验研究对多个假设的统计推断,以及如何控制整体决策中的假阳性错误。

23 个关键词8 个词条链接到这里8 个尚未撰写AI 撰写
统计假设检验统计学P 值原假设第一类错误与第二…显著性水平概率统计独立性多重检验

多重检验是在同一推断框架内考虑多个统计假设检验。在统计学中,按常规阈值分别检验每个假设,通常无法使整组检验维持同样的错误率。多重检验程序先定义适当的整体错误准则,再据此调整拒绝阈值、P值或同时区间。组均值之间的多重比较是一个重要特例,但这一框架也适用于多项结局、参数和科学论断。(itl.nist.gov)

为什么多重性很重要

当一个为真的原假设被拒绝时,就发生了第一类错误。在满足相应统计条件的前提下,以显著性水平 α\alpha 进行的检验会限制该项检验发生这种错误的概率。反复进行检验会增加错误拒绝的机会;单项检验的水平不会自动成为整体水平。(fda.gov)

对于 mm 个为真的原假设,如果其拒绝事件具有统计独立性,且每项检验的错误概率恰好为 α\alpha,那么至少发生一次错误拒绝的概率为

1−(1−α)m.1-(1-\alpha)^m.

例如,当 m=20m=20、α=0.05\alpha=0.05 时,该概率约为 0.6420.642。独立性是这一计算的必要条件:相互依赖的检验不一定满足该公式。不过,只要每项检验的实际第一类错误概率恰好为 α\alpha,无论检验之间是否存在依赖,错误拒绝次数的期望值都是 mαm\alpha。这两者是不同的错误度量,而不是对同一个量的两种相互矛盾的计算。(math.tau.ac.il)

假设族与错误准则

假设族是需要进行整体错误控制的一组假设。其范围取决于所评估的科学论断,而不只是哪些检验恰好使用了同一数据集。一项研究中的多个终点、治疗比较、时间点和亚组分析,都可能造成多重性。因此,对假设进行分组和排序是实验设计和分析规划的组成部分。(fda.gov)

令 VV 表示被拒绝的真原假设的数量,RR 表示被拒绝的原假设总数。两个核心准则是:

  • 族错误率(FWER):

    FWER⁡=Pr⁡(V≥1).\operatorname{FWER}=\Pr(V\geq1).
  • 错误发现率(FDR):

    FDR⁡=E ⁣[Vmax⁡(R,1)].\operatorname{FDR} =\mathbb{E}\!\left[\frac{V}{\max(R,1)}\right].

FWER 关注是否发生任何错误拒绝;FDR 关注所有拒绝中错误拒绝所占比例的期望值,并在没有拒绝发生时将该比例记为零。强 FWER 控制适用于真假假设的每一种组合;弱控制则仅适用于所有原假设均为真的情形。(stat.purdue.edu)

FDR 始终不超过 FWER;当所有原假设均为真时,两者相等。将 FDR 控制在 0.050.05,并不保证任何特定数据集中错误拒绝所占的比例最多为 5%,也不意味着每项被拒绝的假设都有 5% 的概率属于错误拒绝。它是重复抽样意义下的期望值。(stat.purdue.edu)

族错误率控制程序

邦费罗尼校正在 pi≤α/mp_i\leq\alpha/m 时拒绝假设 ii。等价地,其调整后的 P 值为 min⁡(1,mpi)\min(1,mp_i)。这一方法的理论依据是联合界,因此不要求独立性。只要每个单项 P 值在对应原假设成立时都是有效的,该程序就能实现强 FWER 控制。(stat.ethz.ch)

霍尔姆程序将 P 值排序为 p(1)≤⋯≤p(m)p_{(1)}\leq\cdots\leq p_{(m)}。从最小的 P 值开始,将 p(i)p_{(i)} 与 α/(m−i+1)\alpha/(m-i+1) 比较,依次拒绝相应假设,直到首次不满足拒绝条件为止。这种逐步下降程序在任意依赖结构下也能实现强 FWER 控制,而且会拒绝普通邦费罗尼校正所拒绝的所有假设,还可能拒绝更多假设。较宽松的阈值可以提高统计功效,即检出错误原假设的概率。(stat.ethz.ch)

一些专门的程序会利用特定比较族的结构。在方差分析之后,图基极差检验用于所有均值的两两比较,而谢费法用于所有线性对比。总体检验拒绝原假设,只能说明各均值并非全部相等,不能指出具体哪些差异导致了这一结果。这些程序各自都要求满足相应的模型假设。(itl.nist.gov)

错误发现率控制程序

1995 年提出的本杰明尼—霍赫伯格程序先对 P 值排序,再找出满足下式的最大序号 kk:

p(k)≤kqm,p_{(k)}\leq\frac{kq}{m},

其中,qq 是目标 FDR 水平。该程序拒绝与 p(1),…,p(k)p_{(1)},\ldots,p_{(k)} 对应的假设;如果没有任何序号满足条件,则不拒绝任何假设。与逐步下降程序不同,它不会在首次比较不满足条件时停止。最初的证明确立了该程序在检验统计量相互独立时对 FDR 的控制。(rss.onlinelibrary.wiley.com)

同一程序在一种特定的正依赖条件下也能控制 FDR,这一条件称为“子集上的正回归依赖”。仅仅观察到正相关关系,一般不能替代对这一条件的验证。本杰明尼—耶库铁利程序通过将 qq 替换为 q/Hmq/H_m 来适应任意依赖结构,其中 Hm=∑j=1m1/jH_m=\sum_{j=1}^{m}1/j。这种适用范围更广的保证,需要以更严格的阈值为代价。(math.tau.ac.il)

同时推断与结果解释

多重性也会影响置信区间。分别构造的 95% 置信区间,通常不能保证以 95% 的概率同时覆盖所有对应参数。如果邦费罗尼区间的单个覆盖率至少为 1−α/m1-\alpha/m,则其同时覆盖率至少为 1−α1-\alpha。这种联合保证不同于任何单个区间的覆盖率。(itl.nist.gov)

对调整后结果的解释,取决于所指定的假设族、程序、错误准则及相关假设。FWER 和 FDR 程序回答的是不同问题,因此不一定产生相同的拒绝集合。调整控制的是某个明确定义的错误率,并不能确立效应的大小或科学重要性。如果比较是在查看数据之后才选定的,选择过程也很重要:仅对选中的比较进行校正,通常无法获得针对完整搜索过程设计的程序所提供的保证。(stat.ethz.ch)