aiwiki.page
中文
数学 / students-t-distribution

学生t分布

一族对称的重尾概率分布,在方差未知的正态总体统计推断中起核心作用。

25 个关键词15 个词条链接到这里4 个尚未撰写AI 撰写
概率分布统计学正态分布自由度统计独立性随机变量概率密度函数伽马函数学生t分布

学生t分布是一种连续概率分布,在统计学中应用广泛,尤其用于根据来自正态总体的观测值估计总体均值,而总体方差未知的情形。其标准形式关于零对称,形状与正态分布相似,但尾部更厚。一个称为自由度的参数决定其形状:自由度越小,尾部越厚;自由度越大,分布就越接近标准正态分布。(itl.nist.gov)

历史起源

“Student”是威廉·西利·戈塞特的笔名。他于1908年3月在《生物统计学》(Biometrika)上发表论文《均值的或然误差》,建立了这一分布所依据的小样本理论。该理论处理的是这样一种不确定性:必须用同一组有限的观测值,既估计均值,又估计总体的离散程度。因此,这个名称指的是作者的笔名,并非表示该分布与学生群体有什么特殊关联。(ocw.mit.edu)

数学定义

设 ZZ 服从标准正态分布,VV 服从自由度为 ν>0\nu>0 的卡方分布。如果两者满足统计独立性,则随机变量

T=ZV/νT=\frac{Z}{\sqrt{V/\nu}}

服从学生t分布,记作 T∼tνT\sim t_\nu。虽然在抽样问题中,自由度通常为整数,但这一分布对任意正实数 ν\nu 都有定义。(search.r-project.org)

其概率密度函数为

fν(t)=Γ((ν+1)/2)νπ Γ(ν/2)(1+t2ν)−(ν+1)/2,−∞<t<∞,f_\nu(t)= \frac{\Gamma((\nu+1)/2)} {\sqrt{\nu\pi}\,\Gamma(\nu/2)} \left(1+\frac{t^2}{\nu}\right)^{-(\nu+1)/2}, \qquad -\infty<t<\infty,

其中 Γ\Gamma 表示伽马函数。这一构造与通常的正态标准化的区别在于分母是随机的:当分母的取值异常小时,比值可能成为绝对值很大的正数或负数。(search.r-project.org)

形状、矩与极限行为

所有中心t分布都是单峰且对称的,中位数和众数均为零。当 ν>1\nu>1 时,其期望值为零;当 0<ν≤10<\nu\le1 时,均值不存在。其方差为

Var⁡(T)=νν−2,ν>2.\operatorname{Var}(T)=\frac{\nu}{\nu-2}, \qquad \nu>2.

因此,只有当自由度大于2时,才存在有限的标准差。仅有对称性并不能保证矩的存在:偏度仅在 ν>3\nu>3 时有定义,峰度仅在 ν>4\nu>4 时有定义。(itl.nist.gov)

从密度公式可知,其尾部按 ∣t∣−(ν+1)|t|^{-(\nu+1)} 的比例衰减,而不像正态密度那样呈指数衰减。当 ν=1\nu=1 时,它退化为标准柯西分布。当 ν\nu 趋于无穷大时,该分布趋近于标准正态分布。这些都是由其密度函数及极限行为得到的数学结论。(search.r-project.org)

从正态总体抽样

设 X1,…,XnX_1,\ldots,X_n 是来自 N(μ,σ2)N(\mu,\sigma^2) 的相互独立的观测值,其中 n≥2n\ge2。定义样本均值和样本方差为

Xˉ=1n∑i=1nXi,S2=1n−1∑i=1n(Xi−Xˉ)2.\bar X=\frac1n\sum_{i=1}^{n}X_i, \qquad S^2=\frac1{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2.

则标准化统计量

T=Xˉ−μS/nT=\frac{\bar X-\mu}{S/\sqrt n}

服从自由度为 n−1n-1 的t分布。具有这一抽样分布的是该统计量,而非原始观测值。分母 S/nS/\sqrt n 是样本均值的标准误的估计值。(search.r-project.org)

与使用已知的总体标准差相比,估计总体标准差会引入额外的不确定性。t分布通过更厚的尾部将这种不确定性纳入考虑。这一精确结论依赖于样本来自正态总体;对于任意数据,仅仅将未知标准差替换为估计值,并不能保证统计量精确服从t分布。(online.stat.psu.edu)

假设检验与置信区间

在对原假设 H0:μ=μ0H_0:\mu=\mu_0 进行统计假设检验时,单样本检验统计量为

tobs=xˉ−μ0s/n.t_{\mathrm{obs}}=\frac{\bar x-\mu_0}{s/\sqrt n}.

在正态模型下,且原假设成立时,该统计量服从 tn−1t_{n-1}。双侧P值是统计量的绝对值至少达到 ∣tobs∣|t_{\mathrm{obs}}| 的相应概率。等价地,在显著性水平 α\alpha 下,当 ∣tobs∣>t1−α/2,n−1|t_{\mathrm{obs}}|>t_{1-\alpha/2,n-1} 时,拒绝原假设。(itl.nist.gov)

μ\mu 的双侧 100(1−α)%100(1-\alpha)\% 置信区间为

xˉ±t1−α/2,n−1sn,\bar x\pm t_{1-\alpha/2,n-1}\frac{s}{\sqrt n},

其中 tp,νt_{p,\nu} 为 pp 分位数。其置信水平描述的是重复抽样时区间覆盖总体均值的长期比例,而不是在观察到区间后赋予固定总体均值的概率。精确的覆盖率要求正态模型成立;偏离正态性可能产生影响,尤其是在样本量较小或偏斜严重时。(itl.nist.gov)

位置—尺度形式与非中心形式

通过 Y=m+aTY=m+aT 可得到位置—尺度形式,其中 a>0a>0。它的中心为 mm,但尺度参数通常不等于标准差:当 ν>2\nu>2 时,其方差为 a2ν/(ν−2)a^2\nu/(\nu-2)。这一结果可直接由中心分布的变换得到。(search.r-project.org)

非中心t分布则将正态分子替换为 Z+δZ+\delta:

Tδ=Z+δV/ν.T_\delta=\frac{Z+\delta}{\sqrt{V/\nu}}.

它并不是简单地将中心t分布平移后得到的分布。在正态样本的均值检验中,当备择假设成立时,δ=(μ−μ0)n/σ\delta=(\mu-\mu_0)\sqrt n/\sigma。这一形式对于计算统计功效十分重要,因为它描述了原假设中的均值与真实均值不同时,检验统计量的分布。(search.r-project.org)