知识点深化 · 神经网络基础
神经网络基础:一个「加权打分器」是怎么学会的
你手机里的人脸识别、语音助手,底层都是神经网络。别被名字唬住——它最基本的零件就是一个加权打分的神经元:把输入乘上权重加起来,再过一个激活函数。这一页从 M-P 感知机讲起,搞懂激活函数为什么必须存在、前向传播怎么算答案、反向传播怎么用链式法则纠错,这是看懂后面 CNN、RNN、Transformer 的地基。
① 小白第一课怎么学(4 步走,约 60 分钟)
别被"神经网络"四个字吓到,它本质就是一套"加权打分 + 纠错"的机器:
1看结构(10 分钟)
读第②③部分:看一张神经元图,搞懂"输入→加权求和→激活→输出"这条流水线。
2记公式(15 分钟)
背第④部分:感知机公式、常见激活函数、损失函数、链式法则。
3算例题(15 分钟)
精读第⑤部分,手算一次前向传播和一次反向传播的小例子。
4刷题纠错(20 分钟)
做第⑦⑩部分,错题回到第⑥部分高频错误里找原因。
本课小目标学完你要能:① 画出一个 M-P 神经元并写出它的公式;② 说出 Sigmoid/Tanh/ReLU 各自长什么样、什么时候用;③ 讲清"前向传播算误差、反向传播调权重"这个闭环。
② 一图看懂:神经网络是怎么搭起来的
读法:中心是"神经网络",主干是"感知机→激活→前向传播→反向传播"这条流水线;下方是两个引擎——损失函数(算错多少)和梯度下降(怎么改权重)。
③ 先认识它:神经元就是一个"加权打分器"
把一个神经元想象成一个收简历的面试官:
· 简历上有好几项经历(输入 x₁, x₂, x₃),每项经历重要程度不同(权重 w₁, w₂, w₃)。
· 面试官先把每项经历乘上它的重要度,再加起来,最后加上一个"基础印象分" b(偏置)。
· 算出来一个总分 z = w₁x₁ + w₂x₂ + w₃x₃ + b。
· 总分过了阈值就发 offer(输出 1),否则拒绝(输出 0)——这就是阶跃激活。
一层叠一层:很多个这样的面试官排成一排(隐藏层),前一个的输出是后一个的输入,就堆成了"神经网络"。
为什么需要"激活函数"如果只有加权求和,无论叠多少层,整体还是一个线性函数(直线/平面),只能解决"一刀切"的问题。激活函数给网络注入非线性,让它能弯出曲线,拟合复杂规律。ReLU 就是最简单的"负数归零、正数照留"。
④ 完整体系与公式表
M-P 感知机公式
单个神经元:先加权求和,再过激活
z = w₁x₁ + w₂x₂ + … + wₙxₙ + b = 𝐰ᵀ𝐱 + b
a = f(z) (f 是激活函数,a 是该神经元输出)
常见激活函数对照表
| 函数 | 公式 | 输出范围 | 特点 / 用途 |
| 阶跃 Step | z≥0 取 1,否则 0 | {0,1} | 原始感知机,不可导,无法训练 |
| Sigmoid | 1/(1+e⁻ᶻ) | (0,1) | 平滑、可导;易梯度消失,常用于二分类输出层 |
| Tanh | (eᶻ−e⁻ᶻ)/(eᶻ+e⁻ᶻ) | (−1,1) | 零中心化,比 Sigmoid 收敛快;仍有梯度消失 |
| ReLU | max(0, z) | [0,+∞) | 计算极快、缓解梯度消失;隐藏层默认首选 |
| Leaky ReLU | z>0 取 z,否则 αz | (−∞,+∞) | 解决 ReLU "负数死掉"问题 |
损失函数(衡量错多少)
均方误差 MSE(回归)/ 交叉熵(分类)
MSE = (1/n) Σ (yᵢ − ŷᵢ)²
交叉熵 L = −[y·log ŷ + (1−y)·log(1−ŷ)] (二分类)
反向传播 = 链式法则
反向传播的核心就是高数里的链式求导:误差从输出层往回传,每一层把"对权重的梯度"乘上"上游传来的梯度",再用梯度下降更新:
梯度下降更新权重
w ← w − η · ∂L/∂w (η 是学习率,控制每步走多大)
前向 vs 反向一句话分清前向传播:输入从左往右算,得到预测 ŷ;反向传播:误差从右往左传,算出每个权重该往哪调。一个"算答案",一个"找错因"。
⑤ 应用场景与典型例题
例1(基础·手算感知机)x₁=1, x₂=0,w₁=0.5, w₂=−1, b=0.5,阶跃激活阈值 0,求输出。
先算加权和,再判断过没过阈值。
① z = 0.5×1 + (−1)×0 + 0.5 = 1.0。
② z=1.0 ≥ 0,阶跃输出 y=1。
答案:y=1。
例2(激活函数)某神经元 z=−2,分别经过 Sigmoid 和 ReLU,输出大约是多少?
Sigmoid 把任意数压到 (0,1);ReLU 负数归零。
① Sigmoid(−2) = 1/(1+e²) ≈ 1/(1+7.39) ≈ 0.119。
② ReLU(−2) = max(0, −2) = 0。
答案:Sigmoid≈0.12,ReLU=0。
例3(梯度下降直觉)损失 L=(y−ŷ)²,y=1 固定,当前 ŷ=0.6,学习率 η=0.1,问 w 怎么调一步(假设 ŷ 随 w 增大而增大)?
误差 0.4,预测偏低,应让 ŷ 增大。
① ∂L/∂ŷ = 2(ŷ−y) = 2(0.6−1) = −0.8。
② ŷ 偏低(0.6<1),梯度为负,沿负梯度走就是增大 w,让 ŷ 往 1 靠近。
③ 直观:每次更新后 ŷ 离 y 更近一点,重复上万次就收敛。
答案:w 应增大,使 ŷ 上升趋近 1。
学习率 η 怎么选太大→一步跨过最低点来回震荡,甚至发散;太小→走得极慢,训练半天不动。实际中常用 0.01、0.001,或先用大后小。
⑥ 高频错误诊断(4 条)
错误 1:以为激活函数可有可无堆叠 100 层不加激活,整体仍是一个线性变换(矩阵乘法叠加还是矩阵乘法),再深也只能画直线。没有非线性激活 = 白叠层。
错误 2:隐藏层也用 SigmoidSigmoid 在 |z| 很大时导数趋近 0,层数一多梯度越传越小(梯度消失),前面的层学不动。隐藏层优先 ReLU。
错误 3:学习率设成 1 或更大η 太大,权重每步乱跳,损失不降反升。默认从 0.001~0.01 试起。
错误 4:把偏置 b 当成可有可无b 决定了决策边界的"截距",没有 b,分界线只能过原点,很多数据分不开。权重调形状,偏置调位置。
⑦ 考点与真题演练(4 题)
考点分布
| 考法 | 出题形式 | 应对 |
| 感知机计算 | 给 x、w、b 求 z 和输出 | 先加权和再过激活 |
| 激活函数选择 | 问隐藏层/输出层用哪个 | 隐藏层 ReLU,二分类输出 Sigmoid |
| 反向传播理解 | 梯度消失、链式法则方向 | 误差从右往左传 |
真题1. 下列哪个激活函数最常用在深度网络的隐藏层?
真题2. ReLU(z) 在 z=−3 时的输出是?
真题3. 反向传播中,梯度(误差信号)是按什么方向传播的?
真题4. 学习率 η 设置过大,最可能导致?
⑧ 必背公式卡
神经元:z = Σwᵢxᵢ + b,a = f(z) 加权求和再过激活
Sigmoid:σ(z)=1/(1+e⁻ᶻ) ∈ (0,1) 二分类输出
ReLU:f(z)=max(0,z) 隐藏层默认
MSE:L=(1/n)Σ(y−ŷ)² 回归损失
梯度下降:w ← w − η·∂L/∂w 沿负梯度走一步
前向:从输入算到输出 ŷ 算答案
反向:误差从输出传回,链式法则求 ∂L/∂w 找错因
⑨ 应用输出:用神经网络思维建模
建模场景:判断一封邮件是不是垃圾邮件
输入特征 x:① 是否含"中奖";② 是否含陌生链接;③ 发件人是否在通讯录。
设 w=(0.6, 0.5, −0.4),b=−0.5。一封邮件三个特征都是 1(含中奖、含链接、陌生发件人)。
· z = 0.6×1 + 0.5×1 + (−0.4)×1 + (−0.5) = 0.2。
· Sigmoid(0.2) ≈ 0.55,垃圾概率略高于 50%,判为可疑垃圾邮件。
· 如果标注是正常邮件(预测错了),反向传播会自动调低"中奖"这个特征的权重,下次更准。
口述训练合上书说三句:"神经元就是加权打分再过激活;前向算答案、反向找错因;隐藏层用 ReLU、输出二分类用 Sigmoid、学习率先取 0.01。"
⑩ 分层练习 18 题(基础 6 + 中档 6 + 拔高 6)
▍基础 6 题
基础1写出单个神经元加权求和公式。
z = w₁x₁ + w₂x₂ + … + wₙxₙ + b。
基础2x=(2,1),w=(3,−1),b=1,求 z。
z=3×2+(−1)×1+1=6。
基础3ReLU(5) 等于多少?
max(0,5)=5。
基础4ReLU(−4) 等于多少?
max(0,−4)=0。
基础5Sigmoid 输出范围是?
(0, 1),常表示概率。
基础6神经网络为什么需要激活函数?
为引入非线性,否则多层叠加仍是线性模型,只能拟合直线。
▍中档 6 题
中档7z=0,Sigmoid(0)=?
1/(1+e⁰)=1/2=0.5。
中档8前向传播的作用是什么?
从输入逐层计算到输出,得到预测值 ŷ。
中档9反向传播靠什么数学法则?
链式法则(复合函数求导)。
中档10梯度下降更新公式 w←w−η∂L/∂w 中 η 叫什么?
学习率,控制每步更新幅度。
中档11二分类输出层一般用什么激活?
Sigmoid(输出概率)。
中档12MSE 损失 L=(y−ŷ)²,y=2,ŷ=1,L=?
(2−1)²=1。
▍拔高 6 题
拔高13为什么深层网络用 Sigmoid 会梯度消失?
Sigmoid 导数最大仅 0.25,反向传播时梯度连乘多层后趋近 0,前面层学不动。
拔高14偏置 b 的几何意义?
决定决策边界的截距/位置,使分界线不必过原点。
拔高15Tanh 相比 Sigmoid 的优势?
输出零中心化(范围 −1~1),收敛更快。
拔高16Leaky ReLU 解决 ReLU 什么问题?
ReLU 负区间导数恒 0,神经元可能"死掉";Leaky 给负数一个小斜率 αz。
拔高17多分类输出层用什么激活?
Softmax,把多个输出变成和为 1 的概率分布。
拔高18损失不下降,可能原因有哪些(说两条)?
① 学习率太大震荡;② 学习率太小走不动;③ 梯度消失/爆炸;④ 特征未归一化。
⑪ 记忆口诀 + 7 天复习计划
三句口诀
① 神经元:加权求和 z=Σwx+b,再过激活 f(z)。
② 前向算答案,反向找错因,链式法则调权重。
③ 隐藏 ReLU、输出 Sigmoid、学习率先取 0.01。
| 天 | 任务 | 自检 |
| 第 1 天 | 读②③④,画神经元图 | 能默写 z=Σwx+b |
| 第 2 天 | 背激活函数表 + 基础 1-6 | ReLU/Sigmoid 脱口而出 |
| 第 3 天 | 做中档 7-12 | 讲清前向/反向区别 |
| 第 4 天 | 做拔高 13-18 | 能解释梯度消失 |
| 第 5 天 | 做⑦真题 4 题 | 限时每题 2 分钟 |
| 第 6-7 天 | 合上书口述三句口诀 | 不看资料全说对 |
← 返回算法与AI总览