1. 熵的概念起源与核心意义
1948年,克劳德·香农在《通信的数学理论》中首次提出信息熵的概念,这成为信息论奠基性工作的重要里程碑。熵的本质是描述信息源不确定性的度量工具,就像温度计测量物体冷热程度一样,熵值大小直接反映了系统的不确定性水平。
在实际通信系统中,当我们说某个信号源的熵值较高时,意味着这个信号源输出的消息具有更大的不可预测性。例如英语字母表中,字母"e"的出现概率约为12.7%,而"z"仅有0.074%。如果所有字母出现概率相同,英语的熵值会显著提高——这正是熵与概率分布关系的直观体现。
关键理解:熵不是信息的量,而是信息不确定性的量。就像摇骰子比猜硬币需要更多信息来描述结果,因为其可能状态更多。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 离散随机变量的熵定义
2.1 数学表达式解析
对于离散随机变量X,其熵H(X)的经典定义为:
code复制H(X) = -Σ p(x) log p(x)
其中对数底数通常取2(比特单位),自然对数底e(奈特单位)或10(哈特利单位)。在通信工程中最常用的是以2为底的计算方式。
这个公式的构造蕴含深刻智慧:
- 概率p(x)决定了各事件对整体不确定性的贡献权重
- 对数运算确保独立事件的熵具有可加性
- 负号保证最终结果为非负值
2.2 计算实例演示
假设一个二元信源,产生符号0和1的概率分别为:
- p(0)=0.25
- p(1)=0.75
计算过程:
code复制H(X) = -[0.25*log₂0.25 + 0.75*log₂0.75]
≈ -[0.25*(-2) + 0.75*(-0.415)]
= 0.5 + 0.311 = 0.811比特/符号
对比等概率情况(p(0)=p(1)=0.5):
code复制H(X) = -2*(0.5*log₂0.5) = 1比特/符号
可见等概率分布时熵达到最大值,这与直觉完全一致。
3. 熵的物理意义深度解读
3.1 信息量与不确定性的关系
熵值直接决定了描述信息所需的最少比特数。在数据压缩领域,香农熵给出了无损压缩的极限值。例如:
- 一个熵为0.8比特/符号的信源,理论最佳压缩率为80%
- ASCII编码固定8比特/字符,实际英语文本熵约4-5比特,因此存在压缩空间
