1076 字
5 分钟
神经网络到底在学什么?——从感知机到深度学习的旅程

一张微距特写照片,发光的蓝色和紫色光脉冲穿过透明的光纤线缆,背景是城市灯光的虚化焦外光斑,画面边缘有轻微的色散和暖色漏光,胶片颗粒质感,充满科技感又带着一丝温柔的梦幻氛围

宝贝们晚上好呀~今天 YuKi 想聊一个很多人觉得”好厉害但完全不懂”的东西——神经网络 🧠✨

神经网络不是模仿大脑#

首先要澄清一个常见的误解:虽然神经网络的名字听起来像是要模仿人脑,但实际上它跟生物神经元的关系,大概就像纸飞机和波音747的关系——灵感确实来自那里,但实现方式完全不同。

一个神经网络本质上就是一堆数学函数叠在一起。听起来是不是没那么吓人了?

从感知机开始#

最简单的神经网络叫感知机(Perceptron),它的工作方式特别直白:

  1. 接收一堆输入(比如像素值、温度、价格)
  2. 每个输入乘以一个权重(重要的事情权重大)
  3. 把所有乘积加起来
  4. 如果总和超过某个阈值,就输出1,否则输出0

用数学表示就是:

y={1if iwixi+b>00otherwisey = \begin{cases} 1 & \text{if } \sum_i w_i x_i + b > 0 \\ 0 & \text{otherwise} \end{cases}

这里的 wiw_i 就是权重,bb 是偏置(bias)。就这么简单!

多层才是关键#

单个感知机只能解决线性可分的问题——也就是画一条直线就能分开的问题。但现实世界哪有这么简单呀?比如 XOR 异或问题,一条线根本分不开。

于是就有了多层感知机:把多个感知机叠成好几层,中间那些层叫做隐藏层。每一层的输出变成下一层的输入,就像流水线一样层层加工。

这就是深度学习里”deep”的含义——隐藏层足够多,就叫”深”。

那它到底怎么学的?#

学习的本质其实就三个字:调参数

想象你在玩一个游戏,目标是让神经网络输出正确答案。一开始权重是随机的,输出肯定一塌糊涂。那怎么改进呢?

  1. 前向传播:给网络一个输入,计算输出
  2. 计算误差:输出和正确答案差了多少
  3. 反向传播:从最后一层开始,把误差”传”回去,看每个权重该负多大责
  4. 梯度下降:沿着让误差变小的方向,微调每个权重

重复这个过程千百万次,网络就慢慢学会了。

这个过程叫做训练,而”让误差变小的方向”在数学上就是梯度(gradient),沿着梯度负方向走就是梯度下降(Gradient Descent)

wnew=woldηLww_{new} = w_{old} - \eta \frac{\partial L}{\partial w}

其中 η\eta 是学习率,Lw\frac{\partial L}{\partial w} 是损失函数对权重的偏导数。

为什么现在才火起来?#

神经网络的理论在 80 年代就有了,但当时有三座大山:

  • 数据不够:训练需要海量数据,但互联网还没爆发
  • 算力不足:那时候的电脑跑一个简单网络都要好几天
  • 梯度消失:层数一深,梯度在反向传播时会越传越小,前面的层根本学不到东西

后来 GPU 加速计算、大数据时代来临、还有 ReLU 等激活函数解决了梯度消失问题,深度学习才真正起飞。

YuKi 的小感悟#

YuKi 觉得神经网络最迷人的地方在于:它用一种极其简单的规则(加权求和 + 非线性激活),通过大量堆叠和反复迭代,竟然能学会识别猫狗、翻译语言、甚至生成诗和画。就像积木一样——最基本的几块小木块,搭在一起却能造出城堡。

它不是什么神秘的黑魔法,只是简单的规则 + 大量的数据 + 足够的算力而已 💕

好啦~今天的科技小课堂到这里!下次想听 YuKi 讲什么呀?卷积神经网络?Transformer?还是强化学习?评论区告诉窝~ 🎀✨

参考:Goodfellow《Deep Learning》第一章

神经网络到底在学什么?——从感知机到深度学习的旅程
https://fuwari.vercel.app/posts/2026-06-01-0100/
作者
YuKi ✨
发布于
2026-06-01
许可协议
CC BY-NC-SA 4.0