条件熵是信息论中的一个量,用于衡量在观测到另一个变量后,一个随机变量仍具有的平均不确定性。它记作 ,是对 的各种可能观测值所对应的 的条件分布的香农熵取平均。它描述的是给定概率模型下的不确定性,而非某个具体观测结果的不确定性。(math.mit.edu)
定义与解释
对于离散变量 和 ,用 表示它们的联合概率分布,用 表示相应的条件概率。条件熵定义为
等价地,
联合概率为零的项贡献为零。满足 的观测值不计入求和,因为它们的条件分布不影响平均值。(math.mit.edu)
对数的底决定了单位:以二为底时,单位为比特;使用自然对数时,单位为奈特。用期望值记号表示,
因此,它是 的平均条件自信息。 针对的是一个观测值,而 则对观测值的整个概率分布取平均。离散变量 也可以以连续变量 为条件,此时使用期望,而不是对 进行离散求和。(people.lids.mit.edu)
基本恒等式与不等式
熵的链式法则将联合不确定性表示为一个变量的不确定性,加上另一个变量剩余的不确定性:
对于有限序列,这一法则可推广为
其中第一项为 。这些恒等式可通过将联合概率分解为条件概率的乘积得到。当各个熵均为有限值时,第一个恒等式还给出 。当相减会产生未定义的表达式 时,直接定义仍然十分重要。(people.csail.mit.edu)
对于取值有限的变量,
右侧等号成立,当且仅当 和 具有统计独立性。左侧等号成立,当且仅当除概率为零的事件外, 是 的确定性函数。条件熵通常不具有对称性:知道 可能足以确定 ,但知道 未必能确定 。(ocw.mit.edu)
增加条件不会使平均离散熵增大:
两者之差是条件互信息 ,它是非负的。对于取值有限的变量,等号成立,当且仅当给定 时, 和 条件独立。类似地,互信息满足
它量化了观测 平均而言能使 的不确定性减少多少。(ocw.mit.edu)
示例与取平均的作用
考虑一个两个取值等概率的二元变量 。令 以概率 等于 ,否则取相反的值;是否翻转与 独立。根据定义可得
当 时,观测值可以确定 。当 时,观测值不提供任何信息,仍留有一比特的不确定性。当 时,观测值又能确定 ,因为观测值总是与 相反。这些结论都直接来自相应的条件分布。(math.mit.edu)
“给定条件会降低熵”说的是平均意义上的结果,并不保证对每个观测值都成立。例如,令 和 为相互独立、各自两个取值等概率的二元变量,并令 。此时 ,约为 比特。观测到 时,有 ,不确定性上升到一比特;观测到 时,则可以确定 。然而,取平均后仍有 比特,低于无条件熵。(ocw.mit.edu)
编码与统计学习
在具有边信息的无损数据压缩中,条件熵决定了渐近编码阈值。对于独立同分布、取值于有限字母表的变量对 ,当解码器知道相应的 数据块时,高于 的码率可以使 数据块的重构错误概率趋于零。斯莱皮安–沃尔夫定理表明,即使编码器不知道这些观测值,这一阈值仍然可以达到。(people.lids.mit.edu)
条件熵也可描述具有依赖关系的序列中的不确定性。对于取值于有限字母表的平稳随机过程,随着作为条件的历史序列越来越长,下一个符号的不确定性收敛于熵率。对于平稳的一阶马尔可夫链,该熵率为 。(stanforddatacompressionclass.github.io)
在机器学习中, 衡量给定特征 时标签 的不确定性。它不同于模型 的条件交叉熵。模型的条件交叉熵减去条件熵,等于真实条件分布与模型之间的KL散度的期望。因此,在预测不受限制的情况下,条件熵是总体层面上可达到的最小对数损失,而不一定是训练后的模型实际达到的损失。(s3-us-west-2.amazonaws.com)
连续变量
当相关量均为有限值时,。与离散条件熵不同,它可以为负,并且会随着 的尺度变化而改变。因此,不能直接将其解释为精确表示一个连续观测值所需的非负比特数。互信息仍然是非负的,并且在差值有明确定义时,等于 。(s3-us-west-2.amazonaws.com)
参考来源
- 600: Lecture 33 — Entropymath.mit.edu
- Information Theory — Polyanskiy and Wupeople.lids.mit.edu
- 441S16: Course Notesocw.mit.edu
- ST06 — Lecture 3people.csail.mit.edu
- Non IID Sources and Entropy Ratestanforddatacompressionclass.github.io
- 11. Information Theory — Dive into Deep Learnings3-us-west-2.amazonaws.com