期望值是随机变量按概率加权的平均值,通常记作 (\mathbb E[X])、(E[X]) 或 (\mu)。它根据各个可能取值的概率赋予相应权重,从而描述概率分布的中心位置。期望值是由概率模型确定的理论量,不一定是能够观测到的结果,也不是对最可能结果的预测。期望是统计学和概率论中的基础概念。(statlect.com)
定义与计算
对于离散随机变量 (X),若其可能取值为 (x_i),对应概率为 (p_i=P(X=x_i)),则其有限期望值为
[ \mathbb E[X]=\sum_i x_i p_i, ]
条件是 (\sum_i |x_i|p_i<\infty)。如果可能结果只有有限个,且每个取值都是有限数,这一条件自然成立。各项权重之和为一,因此期望是一种加权算术平均值。(statlect.com)
对于概率密度为 (f_X(x)) 的绝对连续随机变量,
[ \mathbb E[X]=\int_{-\infty}^{\infty}x f_X(x),dx, ]
条件是相应的绝对值积分有限。概率密度并不是某个单独取值的概率:概率是通过在集合上对密度积分得到的。因此,连续情形的公式以概率密度而非单点概率对取值加权。(statlect.com)
在测度论中,这两个公式都是下式的具体形式:
[ \mathbb E[X]=\int_\Omega X(\omega),dP(\omega), ]
其中,(\Omega) 是样本空间,(P) 是其上的概率测度。这一定义也适用于既非离散、也非绝对连续的分布。有限期望存在的充要条件是 (\mathbb E[|X|]<\infty)。非负随机变量的期望可以为 (+\infty)。对于可取正负值的随机变量,如果其正部和负部的期望均为无穷大,则两者之差没有定义,而不是零。(ocw.mit.edu)
含义与示例
对于一枚公平的六面骰子,代入公式可得
[ \mathbb E[X]=\frac{1+2+3+4+5+6}{6}=3.5. ]
任何一次掷骰子都不会得到 3.5。这说明期望值不一定是可能出现的结果。对于以概率 (p) 取值 1、以概率 (1-p) 取值 0 的伯努利分布,其期望为 (p)。特别地,记录某事件是否发生的指示变量,其期望等于该事件的概率。(ocw.mit.edu)
大数定律为期望的长期平均含义提供了严格表述。若 (X_1,X_2,\ldots) 是独立同分布的随机变量,且绝对值的期望有限,则其样本均值
[ \overline X_n=\frac1n\sum_{i=1}^{n}X_i ]
几乎必然收敛到它们共同的期望。这一结论描述的是观测次数增加时平均值的变化,并不保证任何有限次试验中会出现某个特定结果。(ocw.mit.edu)
对于具有相同有限方差 (\sigma^2) 的独立观测值,样本均值的方差为 (\sigma^2/n)。在这些假设下,中心极限定理进一步描述了围绕期望的波动经适当缩放后的渐近分布。它补充了对期望的理解,而不是定义期望的含义。(ocw.mit.edu)
代数性质
期望在计算中最重要的性质是线性性。对于可积随机变量 (X)、(Y) 及常数 (a,b,c),
[ \mathbb E[aX+bY+c] =a\mathbb E[X]+b\mathbb E[Y]+c. ]
这一性质不要求变量相互独立。因此,即使若干个量彼此相关,也可以将它们各自的期望相加,求得总和的期望。相比之下,(\mathbb E[XY]=\mathbb E[X]\mathbb E[Y]) 对独立的可积随机变量成立,但对相依变量一般不成立。(ocw.mit.edu)
期望还具有保序性:若 (X\le Y) 几乎必然成立,且两者的期望均有限,则 (\mathbb E[X]\le\mathbb E[Y])。然而,非线性函数通常不能移到期望运算之外。对于凸函数 (g),在适当的可积性假设下,詹森不等式给出
[ g(\mathbb E[X])\le \mathbb E[g(X)]. ]
方差就是一个常见的例子:
[ \operatorname{Var}(X) =\mathbb E[X^2]-(\mathbb E[X])^2\ge0. ] (ocw.mit.edu)
条件期望
条件期望利用某个事件或另一个变量所提供的信息,对随机变量求平均。对于概率为正的事件 (A),(\mathbb E[X\mid A]) 使用给定 (A) 时的条件分布计算。在尚未指定 (Y) 的具体取值时,(\mathbb E[X\mid Y]) 本身也是一个随机变量。(ocw.mit.edu)
全期望公式指出,对于可积随机变量 (X),
[ \mathbb E[\mathbb E[X\mid Y]]=\mathbb E[X]. ]
如果将样本空间划分为有限个或可数个概率为正的事件 (A_i),则上式可写为
[ \mathbb E[X] =\sum_i P(A_i)\mathbb E[X\mid A_i]. ]
利用这一公式,可以先在不同情形下分别求平均,再对这些平均值加权,从而计算较复杂的总体平均值。(ocw.mit.edu)
统计与计算应用
在机器学习中,期望损失用于衡量预测器在数据生成分布上的表现。给定损失函数 (L),预测器 (h) 的总体风险为
[ R(h)=\mathbb E[L(h(X),Y)]. ]
经验风险最小化用训练数据上的平均值代替这一期望。这个观测平均值与总体风险之间的区别,是理解泛化(机器学习)的关键:在某个样本上表现良好,并不自动意味着在未见过的观测数据上也会表现同样出色。(cs229.stanford.edu)
在强化学习中,价值函数通常表示从指定状态出发、遵循某个策略(强化学习)所获得的折扣奖励总和的期望。贝尔曼方程将这一期望递归地表示为即时奖励与下一状态期望价值的折扣值之和。这些期望是对各种可能轨迹求平均,而不是只考虑实际发生的某一条动作与结果序列。(cs229.stanford.edu)