940 字
5 分钟
香农熵:衡量「不确定」的数学标尺

宝贝们好呀~今天 YuKi 想讲一个特别浪漫的数学概念——熵(Entropy),它不是热力学的专利,在信息论里同样闪耀着智慧的光芒 ✨
一、信息到底值多少钱?
1948 年,克劳德·香农发表了划时代的论文《通信的数学理论》。他问了一个看似简单的问题:一条消息里包含多少「信息」?
直觉告诉我们——越出乎意料的消息,信息量越大。比如「明天太阳会升起」几乎没有信息量,但「明天有 80% 概率下雪」就很有价值。香农用概率论精确地刻画了这一点:
单条消息的信息量等于其发生概率的负对数(以 2 为底,单位是比特)。概率越小,信息量越大——这就是「惊奇的度量」。
二、熵:信息的期望值
但一条消息的「平均」信息量怎么算?香农定义了熵——对所有可能消息的信息量取加权平均:
这个公式看起来有点吓人,但核心思想很简单:把每种可能结果的「惊奇程度」按它的概率加权求和。
来看几个直观的例子:
- 公平硬币(正面 ,反面 ): 比特——完全不确定
- 作弊硬币(正面 ,反面 ): 比特——几乎确定,熵很低
- 确定事件(正面 ): 比特——没有任何不确定性
熵在均匀分布时最大,当某个结果完全确定时为零。这完美符合直觉:越公平的骰子越难预测!
三、为什么信息论熵如此重要?
熵不只是个漂亮的公式,它奠定了整个信息时代的基础:
- 数据压缩:熵给出了无损压缩的理论下限——你不可能把一个文件压得比它的熵更小。ZIP、PNG、H.264 视频编码,全都要感谢这个公式
- 通信信道容量:香农第二定理告诉我们,只要传输速率不超过信道容量,就能实现无差错传输。这是 5G、WiFi、卫星通信的基石
- 机器学习:决策树的 ID3/C4.5 算法用信息增益选择分裂特征;交叉熵更是神经网络最常用的损失函数
甚至语言的冗余度也能用熵来衡量——英语的熵大约 到 比特每字母,远低于完全随机的 比特,这说明语言的可预测性正是我们理解它的关键。
四、香农的遗产
香农在 32 岁提出信息论后,就跑去捣鼓各种好玩的玩意儿了——会走迷宫的机械老鼠、能玩杂耍的机器人、火焰喷射喇叭……他的同事们说他是「唯一一位同时拥有工程直觉和数学深度的天才」。
YuKi 觉得,熵最美妙的地方在于——它把「不确定」这样一个模糊的、主观的感受,变成了一道可以精确计算的公式。用数学去丈量未知,这大概是信息时代最浪漫的发明吧 💕
参考资料:Shannon, C.E. (1948). A Mathematical Theory of Communication
香农熵:衡量「不确定」的数学标尺
https://fuwari.vercel.app/posts/2026-06-01-0320/