信息熵是衡量随机变量不确定性的数值指标。在信息论中,它表示在给定概率分布下,观察到某个结果时平均获得的信息量。克劳德·香农在其1948年的论文《通信的数学理论》中提出了信息熵的基本形式。熵关注的是结果在统计上的可预测性,而不是结果的含义、真实性或实际重要性。(cs.yale.edu)
定义与单位
对于离散随机变量 ,若其可能结果为 ,相应概率为 ,则熵为
约定 ,意味着不可能发生的结果对熵的贡献为零。对数的底数决定了熵的单位:以二为底时,单位为比特;以 为底时,单位为奈特;以十为底时,单位为哈特莱。改变底数只会使数值按比例缩放,不会改变不同分布之间的比较结果。(web.mit.edu)
某个结果的自信息,也称惊讶度,为 。因此,熵就是自信息的期望值:
观察到罕见结果时,获得的信息量比观察到常见结果时更多。但这并不意味着罕见结果会主导熵的大小:每个结果的惊讶度都要按其概率加权。熵是整个分布的属性,而惊讶度是该分布下某个具体结果的属性。(web.mit.edu)
对于服从伯努利分布的二元变量,
一枚公平硬币的熵为一比特;一枚总是出现相同结果的硬币,其熵为零。若硬币正面朝上的概率为 ,则每次抛掷的熵约为 比特。这些数值描述的是平均不确定性,而不是每次抛掷各自的信息量。(web.mit.edu)
数学性质
对于包含 个可能结果的有限符号集,
当某个结果的概率为一时,熵达到下界;当分布为均匀分布时,熵达到上界。因此,增加可能结果的数量并不一定会增加熵:各结果的概率也同样重要。可数无穷分布的熵可能为无穷大。(cs.yale.edu)
熵是概率分布的凹函数。因此,混合分布的熵不会低于各分布熵的加权平均值。对结果进行一一对应的重新标记也不会改变熵。确定性变换只能使离散熵保持不变或降低,因为合并结果会丢失结果之间的区别。这些性质使熵不同于方差等数值离散程度指标,后者取决于赋予各个结果的数值。(arxiv.org)
香农通过若干要求推导出了对数形式的公式,包括连续性、等概率选项数量增加时不确定性随之增加,以及将一次选择分解为多个连续阶段时保持一致性。在这些要求下,熵公式可以被唯一确定,仅相差一个正的乘法常数。(cs.yale.edu)
联合熵、条件熵与共享信息
联合熵 衡量一对变量的不确定性。条件熵是观察到 后, 所剩不确定性的平均值:
链式法则指出,
对于相互独立的变量,联合熵等于各变量熵的总和。更一般地,有 。(ocw.mit.edu)
互信息量化了另一个变量所带来的不确定性减少量:
互信息具有对称性和非负性,且当且仅当变量相互独立时为零。从平均意义上说,给定条件不会增加离散熵,不过,某个具体的 观测值可能对应一个熵高于原分布的条件分布。这些结论涉及的是统计依赖关系,不一定涉及因果关系。(ocw.mit.edu)
压缩与序列
熵在无损数据压缩中具有操作层面的解释。对于有限离散信源,任何二进制唯一可译码的期望码字长度都至少为 。合适的前缀码可以使期望长度 满足
将相互独立的信源符号分组编码,可以使每个符号的额外开销任意接近于零。霍夫曼编码能够为给定的有限分布构造最优前缀码。这些界限针对的是平均长度,并不保证每条消息都会变短。(people.csail.mit.edu)
对于随机过程,相继出现的符号可能存在依赖关系。当极限存在时,其熵率为
对于独立同分布的符号,熵率等于单个符号的熵。依赖关系使未来符号能够通过先前符号来预测,从而可能降低熵率。这一区别对文本和其他具有结构的序列十分重要,因为仅凭符号频率无法涵盖所有可利用的压缩空间。(people.csail.mit.edu)
统计与机器学习中的应用
交叉熵区分真实分布 与假定分布 :
其中,附加项是KL散度。它衡量分布不匹配在期望对数预测损失中造成的额外损失;当两个分布一致时,该项为零。(ocw.mit.edu)
在机器学习中,决策树学习可以用熵来衡量类别标签的不确定性。信息增益比较父节点的熵与分裂后各节点熵的加权平均值。在语言模型中,平均负对数概率提供了一种基于交叉熵的评估指标;困惑度是以相应对数底数为底、以该指标为指数的幂。交叉熵也用作概率预测的损失函数。(cs.cmu.edu)
连续变量与物理熵
对于概率密度为 的连续变量,微分熵为
与离散熵不同,微分熵可以为负,并且取决于坐标尺度:对于非零的 ,有 。因此,它不能直接替代离散熵,也不能直接等同于有限分辨率下的编码需求。(people.csail.mit.edu)
信息熵与统计力学中的熵具有相同的数学形式;在统计力学中,概率描述的是物理微观状态,玻尔兹曼常数则赋予熵相应的物理单位。应用这一联系需要建立物理模型;仅凭统计上的不可预测性,无法确定热力学熵或热量传递。(cs.yale.edu)