正态分布又称高斯分布,是一种连续的概率分布,其密度曲线呈对称的钟形。它通过两个参数描述随机变量:均值决定中心位置,方差决定离散程度。正态分布是统计学的基础,既用于建立观测数据的模型,也用于近似样本均值及其他统计量的分布。(itl.nist.gov)
定义与参数
若随机变量 (X) 的概率密度函数为
[ f(x)=\frac{1}{\sigma\sqrt{2\pi}} \exp\left[-\frac{(x-\mu)^2}{2\sigma^2}\right], \qquad -\infty<x<\infty, ]
则称 (X) 服从均值为 (\mu)、方差为 (\sigma^2>0) 的正态分布,记作 (X\sim N(\mu,\sigma^2))。
参数 (\mu) 可以是任意实数,而 (\sigma>0) 是标准差。有些资料使用 (N(\mu,\sigma)) 这一记法,因此必须核实第二个参数的含义。(itl.nist.gov)
其期望值为 (\mu),方差为 (\sigma^2)。均值、中位数和众数相同。增大 (\mu) 会使曲线平移,但不改变其形状;增大 (\sigma) 则会使曲线变宽、峰值降低。正态分布的偏度为零,峰度为三,因此超额峰度为零。(itl.nist.gov)
密度曲线下的总面积为一。随机变量落在某一区间内的概率,等于密度函数在该区间上的积分,而不是某个点处的密度值。因此,取某个确切值的概率为零,但落在任何长度大于零的区间内的概率都大于零。(itl.nist.gov)
标准化与概率
标准正态分布的均值为零,方差为一。若 (X\sim N(\mu,\sigma^2)),则
[ Z=\frac{X-\mu}{\sigma}\sim N(0,1). ]
观测值经标准化后得到的数值通常称为标准分数,它以标准差为单位表示该观测值与均值之间的距离。通过标准化,可以利用同一个参考分布计算任意正态分布的概率。(itl.nist.gov)
标准正态分布的累积分布函数为
[ \Phi(z)=\frac{1}{\sqrt{2\pi}} \int_{-\infty}^{z}e^{-t^2/2},dt. ]
因此,
[ P(a\le X\le b)= \Phi\left(\frac{b-\mu}{\sigma}\right) -\Phi\left(\frac{a-\mu}{\sigma}\right). ]
被积函数没有初等函数形式的原函数,积分值可通过数值方法或概率表获得。由对称性可得 (\Phi(-z)=1-\Phi(z))。(itl.nist.gov)
距均值不超过一个标准差的范围内包含约 68.27% 的概率,两个标准差以内约为 95.45%,三个标准差以内约为 99.73%。这些比例通常取近似值,称为 68–95–99.7 法则。它们描述的是理论分布,并不保证每个有限样本都具有这些比例。(itl.nist.gov)
求和与中心极限定理
独立正态随机变量的和仍服从正态分布。若 (X\sim N(\mu_X,\sigma_X^2)) 与 (Y\sim N(\mu_Y,\sigma_Y^2)) 相互独立,则
[ X+Y\sim N(\mu_X+\mu_Y,\sigma_X^2+\sigma_Y^2). ]
更一般地,独立正态随机变量的线性组合,只要方差大于零,就服从正态分布;方差为零的线性组合则为常数。(new.statlect.com)
中心极限定理解释了为什么即使总体不服从正态分布,也会出现正态近似。对于独立同分布、均值 (\mu) 有限且方差 (\sigma^2) 有限并大于零的随机变量,标准化后的样本均值依分布收敛于 (N(0,1)):
[ \frac{\sqrt n(\overline X_n-\mu)}{\sigma} \xrightarrow{d}N(0,1). ]
因此,当样本量足够大时,样本均值的分布通常可以用 (N(\mu,\sigma^2/n)) 近似。该定理讨论的是均值,而不是将原始观测值转化为服从正态分布的数据。所需的样本量取决于原始分布;不存在一个通用的样本量阈值,能够保证近似效果令人满意。(mathworks.com)
估计与统计推断
对于来自正态总体的独立观测值 (x_1,\ldots,x_n),最大似然估计给出
[ \widehat\mu=\overline x,\qquad \widehat{\sigma}^{,2}= \frac1n\sum_{i=1}^{n}(x_i-\overline x)^2. ]
这一方差估计以 (n) 为分母,存在向下偏差。将 (n) 换成 (n-1),就得到通常使用的无偏样本方差。这一区别体现了似然最大化与无偏估计并不是同一回事。(mail.statlect.com)
正态分布是许多置信区间和统计假设检验方法的基础。当独立观测值服从正态分布时,无论样本量多大,样本均值都严格服从正态分布。如果总体方差未知,对均值的推断通常使用学生 t 分布,以考虑估计标准差所带来的不确定性。(itl.nist.gov)
在线性回归中,正态性假设通常针对给定预测变量条件下的误差分布,而不是要求每个预测变量或单独考察的响应变量都服从正态分布。拟合残差的正态概率图可用于图形诊断:图上的点近似呈直线排列,支持采用正态误差模型;若存在系统性偏离,则表明模型与数据不符。(itl.nist.gov)
多元扩展与历史发展
多元正态分布将这一模型推广到随机向量。均值向量确定中心位置,协方差矩阵确定各分量的方差及其相依关系。联合正态随机向量各分量的任意线性组合,要么服从正态分布,要么为常数。不过,各分量分别服从正态分布,并不意味着它们构成的向量一定服从联合正态分布。(itl.nist.gov)
从历史上看,亚伯拉罕·德莫弗于 1733 年推导出了二项分布的正态近似。皮埃尔-西蒙·拉普拉斯进一步发展了正态分布在概率论和误差理论中的作用。“高斯分布”这一名称源于卡尔·弗里德里希·高斯对观测误差所作的影响深远的研究,尤其是他在 1809 年关于天体运动的著作中的论述。(mathshistory.st-andrews.ac.uk)