1. 熵的概念起源与核心定义
熵这个概念最早由克劳修斯在热力学中提出,用来描述系统的无序程度。后来香农在1948年发表的《通信的数学理论》中,将其引入信息论领域,成为信息论最基础也最重要的概念之一。
在信息论中,熵(Entropy)被定义为随机变量不确定性的度量。具体来说,对于一个离散随机变量X,其熵H(X)的计算公式为:
H(X) = -Σ p(x) log p(x)
其中p(x)表示随机变量X取值为x的概率。对数底数通常取2,这时熵的单位是比特(bit);如果取自然对数e,单位就是纳特(nat)。
注意:熵的计算依赖于概率分布,而与随机变量的具体取值无关。这意味着两个完全不同的随机变量,只要它们的概率分布相同,就会有相同的熵值。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 熵的直观理解与性质解析
2.1 熵的三种理解视角
-
不确定性角度:熵衡量的是在得知随机变量实际取值之前,对其取值的不确定程度。熵越大,不确定性越高。
-
信息量角度:熵表示为了消除这个不确定性所需要的信息量。这也是为什么熵的单位是比特——它反映了需要用多少位二进制数来描述这个随机变量。
-
编码长度角度:熵给出了在最优编码方案下,表示该随机变量所需的最小平均编码长度。
2.2 熵的关键性质
-
非负性:H(X) ≥ 0,当且仅当X是确定性变量(即某个取值概率为1)时,熵为0。
-
极值性:对于具有n个可能取值的随机变量,当所有取值等概率(p=1/n)时,熵达到最大值log n。
-
可加性:对于两个独立的随机变量X和Y,有H(X,Y)=H(X)+H(Y)。
-
凹性:熵函数是概率分布的凹函数,这意味着混合两个分布会使得熵增加。
3. 熵的计算实例与应用场景
3.1 典型分布下的熵计算
让我们通过几个具体例子来理解熵的计算:
-
二值熵函数:
对于伯努利分布(即只有两个可能结果的情况),设p(1)=p,p(0)=1-p,则:
H(X) = -p log p - (1-p) log (1-p)当p=0.5时,熵达到最大值1比特;当p接近0或1时,熵趋近于0。
-
均匀分布的熵:
对于n个结果的均匀分布,每个结果的概率都是1/n
