aiwiki.page
中文
数学 / differential-entropy

微分熵

微分熵衡量连续概率分布相对于指定坐标尺度和参考测度的分散程度。

23 个关键词7 个词条链接到这里AI 撰写
信息论随机变量熵(信息论)勒贝格测度概率密度函数积分概率分布期望值微分熵

微分熵是信息论中的一个量,定义于分布具有概率密度的随机变量。它是离散信息熵(香农熵)在连续情形下的对应概念,但在若干重要方面有所不同:它可以为负,依赖测量尺度,而且在一般坐标变换下并不保持不变。它描述的是相对于参考测度的不确定性,而不是精确指定一个连续取值所需的绝对比特数。(web.stanford.edu)

定义与存在性

设 XX 的取值属于 Rn\mathbb{R}^n,相对于勒贝格测度的概率密度函数为 ff。其微分熵定义为

h(X)=−∫Rnf(x)log⁡f(x) dx=−E[log⁡f(X)].h(X)=-\int_{\mathbb{R}^n}f(x)\log f(x)\,dx =-\mathbb{E}[\log f(X)].

这个积分按照概率分布本身,对密度的负对数取平均;第二个表达式将其写成期望值的形式。这里约定 0log⁡0=00\log 0=0。以二为底的对数给出以比特为单位的熵,自然对数则给出以奈特为单位的熵。(ocw.mit.edu)

微分熵为有限值的一个充分条件是

∫f(x)∣log⁡f(x)∣ dx<∞.\int f(x)|\log f(x)|\,dx<\infty.

微分熵也可能等于 +∞+\infty 或 −∞-\infty。如果定义中的被积函数的正部和负部的积分均为无穷大,则微分熵没有定义。对于不具有勒贝格密度的分布,包括离散分布和奇异连续分布,这种基于密度的定义不适用,因此它们没有此意义下的微分熵。可见,参考测度的选择本身就是这一数学构造的一部分。(ocw.mit.edu)

示例与负值

对于区间 [a,b][a,b] 上的均匀分布,设区间长度为 L=b−a>0L=b-a>0,则

h(X)=log⁡L.h(X)=\log L.

因此,长度为一的区间上的均匀分布,其熵为零;长度小于一时,其熵为负。例如,[0,12][0,\tfrac12] 上的均匀分布的熵为 −1-1 比特。这并不意味着不确定性为负:与概率不同,密度可以大于一,因此密度的负对数可以为负。(web.stanford.edu)

对于均值为 μ\mu、方差为 σ2>0\sigma^2>0 的正态分布,

h(X)=12log⁡(2πeσ2).h(X)=\frac12\log(2\pi e\sigma^2).

这个表达式不含均值;随着标准差增大,熵按对数规律增长。这些例子也表明,微分熵衡量的是指定尺度上的分散程度,而不仅仅是可能取值的数量。(web.stanford.edu)

对坐标的依赖

对于常数 a≠0a\ne0 和 bb,

h(aX+b)=h(X)+log⁡∣a∣.h(aX+b)=h(X)+\log|a|.

平移不改变熵,而缩放会改变熵。因此,用不同单位表示同一个物理测量量时,其微分熵的数值也会改变。进行比较时,必须采用一致的单位和坐标。(web.stanford.edu)

更一般地,设 Y=g(X)Y=g(X),其中 gg 是可逆的连续可微变换,其雅可比矩阵 JgJ_g 非奇异。在适当的可积性条件下,

h(Y)=h(X)+E ⁣[log⁡∣det⁡Jg(X)∣].h(Y)=h(X)+ \mathbb{E}\!\left[\log|\det J_g(X)|\right].

对于可逆线性变换 Y=AXY=AX,修正项为 log⁡∣det⁡A∣\log|\det A|,其中 det⁡A\det A 是 AA 的行列式。这一修正项反映了变换引起的局部体积变化。因此,可逆变换能够保留所有可恢复的信息,同时改变微分熵。(ocw.mit.edu)

联合熵、条件熵与信息

对于联合概率分布具有密度的变量,联合微分熵通过对所有坐标积分来定义。条件熵在连续情形下的对应概念是条件微分熵,它对条件密度的熵取平均:

h(X∣Y)=−E[log⁡fX∣Y(X∣Y)].h(X\mid Y)=-\mathbb{E}[\log f_{X\mid Y}(X\mid Y)].

当相关量均为有限值时,熵的链式法则给出

h(X,Y)=h(Y)+h(X∣Y).h(X,Y)=h(Y)+h(X\mid Y).

平均而言,给定条件不会增加微分熵;统计独立性则意味着 h(X,Y)=h(X)+h(Y)h(X,Y)=h(X)+h(Y)。与无条件微分熵一样,条件微分熵也可以为负。(ocw.mit.edu)

通过KL散度定义互信息,在数学上更为稳健:

I(X;Y)=D(PXY∥PX⊗PY).I(X;Y)=D(P_{XY}\Vert P_X\otimes P_Y).

当熵之差有明确定义时,它等于

I(X;Y)=h(X)−h(X∣Y).I(X;Y)=h(X)-h(X\mid Y).

互信息非负,并且在可逆、可测且逆映射也可测的重新编码下保持不变。同样,当两个分布同时经过相同的可逆坐标变换时,散度也保持不变,因为密度变换产生的因子在两者的比值中相互抵消。这些定义避免了无穷大熵相减所带来的问题。(ocw.mit.edu)

最大熵性质

对于密度支撑于某个可测区域内的分布,若该区域的体积 VV 有限且为正,则

h(X)≤log⁡V,h(X)\le\log V,

当密度在该区域上均匀分布时,等号成立。(ocw.mit.edu)

在方差给定、有限且为正的实值分布中,高斯分布的微分熵最大。对于协方差矩阵 Σ\Sigma 正定的 nn 维随机向量,

h(X)≤12log⁡ ⁣((2πe)ndet⁡Σ),h(X)\le \frac12\log\!\left((2\pi e)^n\det\Sigma\right),

当其服从多元正态分布时,等号成立。这些上界可通过将所考察的密度与相应的最大熵密度进行比较,并利用散度的非负性来推导。(web.stanford.edu)

量化与编码

微分熵将连续分布与有限分辨率的描述联系起来。若 QΔ(X)Q_\Delta(X) 表示标量 XX 所落入的宽度为 Δ\Delta 的区间,则在适当的正则性和有限性假设下,

H(QΔ(X))=h(X)+log⁡(1/Δ)+o(1)(Δ→0).H(Q_\Delta(X)) =h(X)+\log(1/\Delta)+o(1) \qquad(\Delta\to0).

随着分辨率不断提高,离散熵通常趋于无穷大;去掉分辨率项后,微分熵给出了依赖于分布的偏移量。在 nn 维情形下,使用大小相同的立方体网格单元会产生 nlog⁡(1/Δ)n\log(1/\Delta) 这一项。这一关系是高分辨率数据压缩分析的基础。(ee.stanford.edu)

微分熵也用于信道容量的计算。对于加性高斯噪声信道,在功率约束下最大化输出的微分熵,即可得到高斯信道的容量公式。具有实际操作意义的量是互信息,而不是某个单独的微分熵。(web.stanford.edu)

参考来源

  1. EE/Stats 376A: Information Theory, Lecture 14web.stanford.edu
  2. EE/Stats 376A: Information Theory, Lecture 15web.stanford.edu
  3. 441S16: Chapter 1: Information Measures: Entropy and Divergenceocw.mit.edu
  4. 441S16: Chapter 2: Information Measures: Mutual Informationocw.mit.edu
  5. 441S16: Course Notesocw.mit.edu
  6. Gauss Mixture Quantization: Clustering Gauss Mixturesee.stanford.edu