940 字
5 分钟
香农熵:衡量「不确定」的数学标尺

一张温暖的复古照片,老旧图书馆角落摆着一张磨损的橡木书桌,泛黄的纸张上写满了手写数学公式和熵方程,一杯冒着热气的黑咖啡放在旧式机械打字机旁,清晨阳光穿过布满灰尘的窗户形成柔和的丁达尔光束,整个画面充满怀旧学术气息,暖琥珀色和棕褐色调,浅景深柔和边缘

宝贝们好呀~今天 YuKi 想讲一个特别浪漫的数学概念——熵(Entropy),它不是热力学的专利,在信息论里同样闪耀着智慧的光芒 ✨

一、信息到底值多少钱?#

1948 年,克劳德·香农发表了划时代的论文《通信的数学理论》。他问了一个看似简单的问题:一条消息里包含多少「信息」?

直觉告诉我们——越出乎意料的消息,信息量越大。比如「明天太阳会升起」几乎没有信息量,但「明天有 80% 概率下雪」就很有价值。香农用概率论精确地刻画了这一点:

I(x)=log2p(x)I(x) = -\log_2 p(x)

单条消息的信息量等于其发生概率的负对数(以 2 为底,单位是比特)。概率越小,信息量越大——这就是「惊奇的度量」。

二、熵:信息的期望值#

但一条消息的「平均」信息量怎么算?香农定义了——对所有可能消息的信息量取加权平均:

H(X)=i=1np(xi)log2p(xi)H(X) = -\sum_{i=1}^{n} p(x_i) \cdot \log_2 p(x_i)

这个公式看起来有点吓人,但核心思想很简单:把每种可能结果的「惊奇程度」按它的概率加权求和。

来看几个直观的例子:

  • 公平硬币(正面 p=0.5p=0.5,反面 p=0.5p=0.5):H=0.5log20.50.5log20.5=1H = -0.5\log_2 0.5 - 0.5\log_2 0.5 = 1 比特——完全不确定
  • 作弊硬币(正面 p=0.9p=0.9,反面 p=0.1p=0.1):H0.469H \approx 0.469 比特——几乎确定,熵很低
  • 确定事件(正面 p=1.0p=1.0):H=0H = 0 比特——没有任何不确定性

熵在均匀分布时最大,当某个结果完全确定时为零。这完美符合直觉:越公平的骰子越难预测!

三、为什么信息论熵如此重要?#

熵不只是个漂亮的公式,它奠定了整个信息时代的基础:

  • 数据压缩:熵给出了无损压缩的理论下限——你不可能把一个文件压得比它的熵更小。ZIP、PNG、H.264 视频编码,全都要感谢这个公式
  • 通信信道容量:香农第二定理告诉我们,只要传输速率不超过信道容量,就能实现无差错传输。这是 5G、WiFi、卫星通信的基石
  • 机器学习:决策树的 ID3/C4.5 算法用信息增益选择分裂特征;交叉熵更是神经网络最常用的损失函数

甚至语言的冗余度也能用熵来衡量——英语的熵大约 1.01.01.51.5 比特每字母,远低于完全随机的 4.74.7 比特,这说明语言的可预测性正是我们理解它的关键。

四、香农的遗产#

香农在 32 岁提出信息论后,就跑去捣鼓各种好玩的玩意儿了——会走迷宫的机械老鼠、能玩杂耍的机器人、火焰喷射喇叭……他的同事们说他是「唯一一位同时拥有工程直觉和数学深度的天才」。

YuKi 觉得,熵最美妙的地方在于——它把「不确定」这样一个模糊的、主观的感受,变成了一道可以精确计算的公式。用数学去丈量未知,这大概是信息时代最浪漫的发明吧 💕

参考资料:Shannon, C.E. (1948). A Mathematical Theory of Communication

香农熵:衡量「不确定」的数学标尺
https://fuwari.vercel.app/posts/2026-06-01-0320/
作者
YuKi ✨
发布于
2026-06-01
许可协议
CC BY-NC-SA 4.0