效应量是对统计学所研究的差异、关联或其他现象的大小进行量化的指标。这个术语既可以指总体中的某个量,也可以指根据样本数据计算出的估计值。效应量包括均值差、标准化差异、相关系数,以及用于比较事件概率的比值。与P值不同,效应量描述的是观察到的关系有多大,而不是数据与某个指定统计模型有多不相容。其含义取决于所用指标、结果变量及研究背景。(www2.psych.ubc.ca)
效应大小与统计显著性
效应量与统计假设检验回答的是不同的问题。假设检验评估反对原假设的证据,而效应量估计值则描述关系的大小,并在适用时描述其方向。统计显著并不意味着效应在实质上重要:当估计足够精确时,很小的效应也可能产生很小的P值。反过来,在精度不足的研究中,即使效应很重要,也可能无法在统计上得出明确结论。(amstat.org)
还必须区分总体效应及其样本估计量。估计值会随样本而变化,也可能存在估计量的偏差。在报告估计值的同时给出置信区间,可以传达其不确定性;仅给出点估计,无法说明对真实效应的估计有多精确。此外,“效应”一词本身并不意味着因果关系:要对描述性关联作出因果解释,还需要额外的研究设计条件和识别假设。(www2.psych.ubc.ca)
均值差
未标准化的均值差保留了结果变量的原始单位:
其中,每个 都是一个样本均值。因此,假设某次考试的成绩相差五分,这个差异仍可在该考试的分数尺度上直接解释。当各项研究采用相同的测量工具时,这类差异尤其有用。(cochrane.org)
标准化均值差以变异程度为参照来表示差异。对于两个独立组,Cohen的 的一种常见形式为
这里, 是样本标准差, 则通过合并两组的方差得到。假设均值相差五分,且 ,则 :两个均值相差半个合并标准差。其正负号取决于两组的排列顺序。(frontiersin.org)
Hedges的 对 的绝对大小存在的向上偏差进行校正,这在小样本中尤为重要。对于配对测量或重复测量,采用不同的标准化分母会得到不同版本的标准化效应量。除以变化分数的标准差,不等同于除以单次测量值的标准差;因此,在比较不同研究设计时,所选用的版本很重要。(frontiersin.org)
关联与解释的变异
皮尔逊相关系数 衡量两个变量之间的线性相关关系。其取值范围为 至 ;正负号表示方向,绝对值表示强度。接近零的值并不能排除很强的非线性关系。(online.stat.psu.edu)
在用普通最小二乘法拟合且包含截距的一元线性回归中,决定系数满足 。它表示拟合模型所解释的结果变量观测变异的比例,而不是由预测变量造成的变异比例。回归斜率也描述效应大小,但其单位取决于预测变量和结果变量的测量尺度。(online.stat.psu.edu)
在方差分析中,η平方为
偏η平方则以该效应的平方和除以该效应平方和与相应误差平方和之和。这些指标回答的是不同的问题,通常不能互换,尤其是在多因素设计或重复测量设计中。(frontiersin.org)
二元结果
对于二元结果,令 和 分别表示两组中事件发生的概率。常用指标为
风险差是绝对比较指标;风险比和优势比是相对比较指标。表示无差异的值,对 而言是零,对 和 而言则是一。(cochrane.org)
假设两组的事件发生概率分别为0.20和0.10,上述公式得到的风险差为10个百分点,风险比为2,优势比为2.25。因此,优势比通常并不等于风险比。绝对指标和相对指标可能给人不同的印象,因为绝对差异取决于基线事件发生概率。(cochrane.org)
解释与研究综合
惯常使用的“小”“中”“大”等标签,通常分别对应 值0.2、0.5和0.8,但它们只是粗略的参照标准,并非判断重要性的普遍界限。解释效应量时,需要考虑结果变量的含义、相关的比较对象,以及所观察到的差异会带来什么后果。标准化消除了测量单位,却没有消除不同总体之间的背景差异。(frontiersin.org)
效应量与样本量、显著性水平、变异程度及实验设计一起用于计算统计功效。研究规划中的计算可以采用预期效应,也可以采用研究者关注的最小效应。噪声较大的预试验估计值,不一定是可靠的规划依据。(doi.org)
在元分析中,可以相互比较的效应估计值会被合并,通常采用与估计精度有关的权重。标准化差异有助于综合使用不同工具测量同一构念的研究,但总体变异程度的差异可能影响这些效应量的可比性。报告所用指标、组别顺序、分母、标准误或区间,以及针对具体研究设计采用的计算方法,可以让估计值更易于解释和再次使用。解释合并效应时,也需要关注研究之间的差异和偏差,而不能将其视为不受背景影响的常数。(cochrane.org)