统计学是研究数据收集、整理、分析和解释的学科。它发展各种方法,用于描述观测到的规律、对总体或过程作出结论,以及评估不确定性。其研究范围从调查研究的设计延伸至结果的传达:统计结论不仅取决于计算,也取决于观测数据的获取方式,以及所作假设是否合理。统计学为实证研究提供基础,并为数据科学和机器学习作出贡献。(online.stat.psu.edu)
总体、样本与数据
总体是与某项研究相关的全部单位的集合;样本则是其中接受观测的子集。这些单位可以是人、制成品、组织,也可以是对某个过程的重复测量。总体参数描述总体的某项特征,而统计量则由样本数据计算得出。因此,样本均值既可以用来描述观测结果,也可以用来估计未知的总体均值。(online.stat.psu.edu)
变量记录这些单位的特征。分类变量用于区分不同类别,例如材料类型;定量变量则以数值表示数量。这一区别决定了哪些汇总方式和分析方法具有意义。数据收集还需要操作性定义:一个变量如何解释,取决于测量了什么、如何测量,以及纳入了哪些单位。(online.stat.psu.edu)
描述与探索
描述统计对实际观测到的数据进行汇总。位置度量包括均值和中位数;离散程度的度量包括极差、方差和标准差。频数和比例用于描述分类观测数据。任何单一的汇总指标都无法完整刻画一个数据集:平均值相近的数据集,在变异程度或分布形状上可能存在显著差异。(itl.nist.gov)
探索性数据分析在选定具体模型之前考察数据的结构。分析人员通过直方图、箱线图和散点图等数据可视化手段,考察分布的不对称性、异常观测值、变量之间的关系,以及数据可能偏离假设的情况。探索可以提出问题并提示适用的模型,但如果使用同一批观测数据来发现规律并评估这些规律,后续推断就需要谨慎处理。(itl.nist.gov)
数据收集与研究设计
统计推理在分析之前就已开始。概率抽样通过明确规定的随机机制选取单位,使抽样不确定性可以得到评估。覆盖问题、无应答和选择偏差都可能削弱结果的可推广性;单纯增加样本量并不能消除这些问题。因此,必须区分研究结果所适用的总体与研究实际能够接触到的总体。(online.stat.psu.edu)
实验设计关注如何分配实验条件以及如何构建比较。随机抽样涉及选择哪些单位进入研究;随机分配则涉及将研究中的单位分配到不同条件下。前者支持将结果推广到总体,后者则有助于支持关于因果关系的结论。随机对照试验通过随机分配来比较不同干预措施。观测性研究则只记录所处条件,而不进行条件分配,因此其他可能的解释和混杂因素尤为重要。(online.stat.psu.edu)
概率与统计推断
概率为表示不确定性提供了数学工具。统计模型通过随机变量及其概率分布描述观测结果。统计推断将观测数据与抽样设计或模型结合起来,用于估计未知量、检验特定主张,或预测尚未观测到的结果。推断是否有效,取决于这些基础是否恰当。(online.stat.psu.edu)
在频率学派推断中,统计方法依据其在重复抽样中的表现来评价。置信区间通过具有指定覆盖率的方法来表达不确定性。在相关假设成立的条件下,覆盖率为 95% 的方法在反复应用时,所产生的区间约有 95% 包含那个固定的参数。这通常并不意味着,该参数有 95% 的概率落在已经计算出的某个具体区间内。(itl.nist.gov)
贝叶斯推断将先验分布与数据的似然函数结合,利用贝叶斯定理得到后验分布。后验概率描述的是以模型、先验和观测证据为条件的不确定性。可信区间包含指定的后验概率,因此其解释不同于频率学派的置信区间。(itl.nist.gov)
检验与建模
统计假设检验依据某个指定假设及其相关假定来评估观测结果。p 值是在零假设模型成立时,检验统计量取值至少与观测值同样极端的概率。它既不表示假设为真的概率,也不衡量效应的大小或实际重要性。未能拒绝某个假设,并不能证明该假设为真。(amstat.org)
模型也用于描述变量之间的关系。线性回归将响应变量表示为各解释变量与相应系数乘积的和,再加上误差项。普通最小二乘法通过最小化残差平方和来估计系数。“线性”指的是模型对参数呈线性关系,因此解释变量项可以包含变量的变换或幂次。模型评估需要考察残差的规律、异常观测值,以及将预测外推至观测范围之外的风险。(itl.nist.gov)
解释与应用
统计学支持科学研究、工业过程控制、调查和经济测量。它对数据科学的贡献包括不确定性量化、抽样设计和因果推断,以及用于预测的计算方法。这些活动彼此交叉,但作出有用的预测与给出有充分依据的解释,是不可互相替代的目标。(itl.nist.gov)
统计报告应区分效应大小与不确定性,并说明结论所依据的假设及其局限。多重分析和选择性报告可能扭曲对看似有说服力的结果的解读。透明地说明研究方法、数据选择和分析决策,有助于提高可复现性,也使读者能够超越单一数值阈值来评价证据。(amstat.org)