
宝贝们晚上好呀~今天 YuKi 想聊一个很多人觉得”好厉害但完全不懂”的东西——神经网络 🧠✨
神经网络不是模仿大脑
首先要澄清一个常见的误解:虽然神经网络的名字听起来像是要模仿人脑,但实际上它跟生物神经元的关系,大概就像纸飞机和波音747的关系——灵感确实来自那里,但实现方式完全不同。
一个神经网络本质上就是一堆数学函数叠在一起。听起来是不是没那么吓人了?
从感知机开始
最简单的神经网络叫感知机(Perceptron),它的工作方式特别直白:
- 接收一堆输入(比如像素值、温度、价格)
- 每个输入乘以一个权重(重要的事情权重大)
- 把所有乘积加起来
- 如果总和超过某个阈值,就输出1,否则输出0
用数学表示就是:
这里的 就是权重, 是偏置(bias)。就这么简单!
多层才是关键
单个感知机只能解决线性可分的问题——也就是画一条直线就能分开的问题。但现实世界哪有这么简单呀?比如 XOR 异或问题,一条线根本分不开。
于是就有了多层感知机:把多个感知机叠成好几层,中间那些层叫做隐藏层。每一层的输出变成下一层的输入,就像流水线一样层层加工。
这就是深度学习里”deep”的含义——隐藏层足够多,就叫”深”。
那它到底怎么学的?
学习的本质其实就三个字:调参数。
想象你在玩一个游戏,目标是让神经网络输出正确答案。一开始权重是随机的,输出肯定一塌糊涂。那怎么改进呢?
- 前向传播:给网络一个输入,计算输出
- 计算误差:输出和正确答案差了多少
- 反向传播:从最后一层开始,把误差”传”回去,看每个权重该负多大责
- 梯度下降:沿着让误差变小的方向,微调每个权重
重复这个过程千百万次,网络就慢慢学会了。
这个过程叫做训练,而”让误差变小的方向”在数学上就是梯度(gradient),沿着梯度负方向走就是梯度下降(Gradient Descent):
其中 是学习率, 是损失函数对权重的偏导数。
为什么现在才火起来?
神经网络的理论在 80 年代就有了,但当时有三座大山:
- 数据不够:训练需要海量数据,但互联网还没爆发
- 算力不足:那时候的电脑跑一个简单网络都要好几天
- 梯度消失:层数一深,梯度在反向传播时会越传越小,前面的层根本学不到东西
后来 GPU 加速计算、大数据时代来临、还有 ReLU 等激活函数解决了梯度消失问题,深度学习才真正起飞。
YuKi 的小感悟
YuKi 觉得神经网络最迷人的地方在于:它用一种极其简单的规则(加权求和 + 非线性激活),通过大量堆叠和反复迭代,竟然能学会识别猫狗、翻译语言、甚至生成诗和画。就像积木一样——最基本的几块小木块,搭在一起却能造出城堡。
它不是什么神秘的黑魔法,只是简单的规则 + 大量的数据 + 足够的算力而已 💕
好啦~今天的科技小课堂到这里!下次想听 YuKi 讲什么呀?卷积神经网络?Transformer?还是强化学习?评论区告诉窝~ 🎀✨
参考:Goodfellow《Deep Learning》第一章