知识点深化 · 正则化
正则化:给模型"踩刹车",治过拟合的六味药
模型在训练集上考 99 分、测试集上只有 70 分——这就是过拟合:它把训练数据里的噪声、巧合全背下来了,没学会真正的规律。正则化就是给模型踩刹车:别让它太"聪明"、权重别太大。这一页讲清过拟合的根源,以及 L1(Lasso)、L2(Ridge)、Elastic Net、早停、Dropout、数据增强这几招分别怎么踩刹车。
① 小白第一课怎么学(4 步走,约 55 分钟)
先理解"过拟合=死记硬背",再看正则化怎么让人"理解着学":
1看图建立直觉(12 分钟)
读第②③部分:看欠拟合/正好/过拟合三条曲线,搞懂偏差与方差。
2记六种手段(15 分钟)
背第④部分:L1 稀疏、L2 权重衰减、Dropout 等对照表。
3做例题(15 分钟)
精读第⑤部分,判断场景该用哪种正则化。
4刷题+纠错(13 分钟)
做第⑦⑩部分,错题回第⑥部分找原因。
本课小目标学完你要能:① 说清过拟合 vs 欠拟合;② 区分 L1(产生稀疏/特征选择)与 L2(权重衰减);③ 解释 Dropout 为什么能抗过拟合;④ 知道早停、数据增强在干嘛。
② 一图看懂:正则化全地图
读法:中心是正则化,四大手段——L1、L2、Dropout、早停/数据增强;共同目标是治过拟合;底层原理是偏差-方差权衡。
③ 先认识它:模型就像学生,正则化就是别让它死记硬背
想象一个学生准备考试:
欠拟合:书都没看完,例题都不会,模拟考和真考都差——学得不到位(高偏差)。
正好:理解了方法,模拟考不错,真考也稳。
过拟合:把历年题答案全背下来了,模拟考满分;可真题一换数字就不会——背了噪声没学会规律(高方差)。
正则化就是劝他:"别死记,别迷信某一道偏题的细节,抓主要规律。"数学上就是给大权重加惩罚——权重越大罚得越狠,逼模型用简单、平滑的方式拟合,而不是东一下西一下地死记每个点。
偏差-方差权衡正则化是"主动加点偏差,换方差大降":模型稍微欠拟合一点点(偏差↑),但换来在新数据上稳得多(方差↓),总误差反而更小。这就是为什么测试误差曲线会"先降后升"——升的那段就是过拟合,正则化就是把它按下去。
④ 完整体系与方法对照表
正则化给损失函数加了什么
总损失 = 原始损失 + 正则项
J = Loss(数据) + λ·R(w)
λ 越大,惩罚越狠,模型越"简单"(越偏向欠拟合)
L1 vs L2 核心对照(必考!)
| L1(Lasso) | L2(Ridge) |
| 正则项 R(w) | λ·Σ|wᵢ|(权重绝对值) | λ·Σwᵢ²(权重平方) |
| 效果 | 把不重要权重直接压成 0 | 把权重往小压缩但不为 0 |
| 产物 | 稀疏解,自带特征选择 | 权重整体变小(权重衰减) |
| 适合 | 特征多、想自动挑重要特征 | 特征都有用、缓解共线/过拟合 |
Elastic Net(弹性网)= L1 + L2 合体
R(w) = λ₁·Σ|wᵢ| + λ₂·Σwᵢ² 兼顾稀疏与稳定,解决 L1 在特征高度相关时摇摆的问题
其他抗过拟合手段
| 手段 | 怎么做 | 直觉 |
| 早停 Early Stopping | 监控验证集误差,一回升就停 | 学到刚好就刹车,别背过头 |
| Dropout | 训练时随机"关掉"一部分神经元 | 不能依赖任何一个神经元,逼它学鲁棒特征 |
| 数据增强 | 图像翻转/裁剪/加噪扩充数据 | 见更多样本,没噪声可背 |
Dropout 为什么管用每次训练随机让一部分神经元"罢工",网络就不能把答案寄托在某几个特定神经元上(否则一被关掉就崩)。于是它被迫学出冗余、鲁棒的表示——这等价于训练了大量共享参数的小网络做集成。测试时不 dropout,用全部神经元。
⑤ 用法场景与典型例题
例1(L1 vs L2)做房价预测,有 100 个候选特征,想自动筛掉没用的、只留几个关键的,用哪个?
要稀疏解(不重要权重变 0)。
① L1(Lasso)会把无用特征的权重压到 0,等于自动做特征选择。
② L2 只会把它们压小,不会变 0,特征还留着。
答案:选 L1 正则(Lasso)。
例2(过拟合判断)训练集准确率 99%,验证集 75%。下面哪个动作不合适?
这是典型过拟合。
① 合适的:增大 λ(加正则)、加 Dropout、早停、数据增强、减模型复杂度。
② 不合适的:继续增加层数/训练更久——会让过拟合更严重。
答案:不该再加复杂度,应收紧正则、提前停。
例3(λ 的方向)正则系数 λ 从 0 慢慢调大,训练误差和测试误差分别怎么变?
λ 越大惩罚越狠,模型越简单。
① λ=0:模型随意拟合,训练误差最低但测试误差高(过拟合)。
② λ 增大:模型变简单,训练误差上升(开始欠拟合),但测试误差先降后在过强时升。
③ 中间有个甜点,测试误差最低。
答案:训练误差单调上升;测试误差先降后升,找甜点。
正则化全家桶怎么配深度学习里常一起上:L2(权重衰减)+ Dropout + 数据增强 + 早停;线性模型里看要不要特征选择选 L1/L2/Elastic Net。它们都是"给模型踩刹车",但踩的地方不同。
⑥ 中国学生高频错误诊断(4 条)
错误 1:把过拟合当成"训练不够"去加训练过拟合时训练误差已经很低了,再训只会更糟。正确方向是加正则、减复杂度、早停,而不是接着训。
错误 2:以为 L1 和 L2 差不多L1 产生稀疏(权重变 0)、做特征选择;L2 只是把权重整体缩小。要筛特征用 L1,要稳用 L2。
错误 3:Dropout 在测试时也开着Dropout 只在训练时随机关神经元,测试时全用(训练时要按保留概率缩放权重)。测试时还 dropout 等于故意丢信息。
错误 4:λ 调太大λ 太大惩罚过重,权重全被压成接近 0,模型退化成常数——欠拟合。正则不是越狠越好,要交叉验证找甜点。
⑦ 考点与真题演练(4 题)
考点分布
| 考法 | 出题形式 | 应对 |
| L1/L2 区别 | 问谁产生稀疏解 | L1 稀疏做特征选择 |
| 过拟合对策 | 给现象选手段 | 加正则/早停/Dropout |
| Dropout | 为什么抗过拟合 | 训练随机关神经元 |
| λ 方向 | λ 增大的影响 | 训练误差升、防过拟合 |
基础真题1. 训练集准确率很高、测试集准确率明显低,这是?
中档真题2. 哪种正则化会把不重要特征的权重直接压成 0,实现特征选择?
中档真题3. Dropout 在神经网络中抗过拟合的原理是?
拔高真题4. 增大正则系数 λ,通常会使?
⑧ 必背公式卡
总损失:J = Loss + λ·R(w) λ 越大越简单
L1:λ·Σ|wᵢ| 稀疏、特征选择
L2:λ·Σwᵢ² 权重衰减、平滑稳定
Elastic Net:L1 + L2 合体 稀疏又稳
过拟合:训练低、测试高 背了噪声没学规律
Dropout:训练随机关神经元,测试全开 学鲁棒表示
早停:验证误差一回升就停 数据增强:加样本多样性
⑨ 应用输出:给一个过拟合的网络开药方
建模场景:图像分类网络过拟合(训练 98% / 验证 70%)
现象:训练集越练越准,验证集先升后降——典型过拟合。
· 第一道:加 Dropout(如 0.5),让网络别依赖个别神经元。
· 第二道:优化器里加 权重衰减(L2),约束权重别太大。
· 第三道:做数据增强(翻转、裁剪、颜色抖动),让训练集更多样。
· 第四道:设早停,验证误差不再下降就停,别继续背。
口述解题思路训练合上书说:"过拟合就是训练考得好、真考砸;正则化给损失加惩罚项踩刹车;L1 让权重变 0 做特征选择,L2 让权重变小做衰减;Dropout 训练随机关神经元,早停验证一回升就停,数据增强让它没噪声可背;λ 要交叉验证找甜点。"能顺下来就真懂了。
⑩ 分层练习 18 题(基础 6 + 中档 6 + 拔高 6)
▍基础 6 题
基础1过拟合的典型表现是什么?
训练误差很低,测试/验证误差明显高。
基础2L1 正则项是权重的几次方?
绝对值的一次方:Σ|wᵢ|。
基础3L2 正则项是权重的几次方?
平方:Σwᵢ²(权重衰减)。
基础4Dropout 在训练还是测试时随机关神经元?
只在训练时;测试时使用全部神经元。
基础5早停根据什么决定何时停止训练?
监控验证集误差,一回升就停。
基础6判断:正则化系数 λ 越大越好。
错。λ 太大模型被压得太简单会欠拟合,要找甜点。
▍中档 6 题
中档7想自动从 200 个特征里挑出重要的,用 L1 还是 L2?
L1(Lasso):它把无用权重压成 0,自带特征选择。
中档8数据增强为什么能抗过拟合?
通过翻转/裁剪等制造更多样训练样本,模型没机会死记固定噪声。
中档9Elastic Net 是哪两个正则的结合?
L1 + L2,兼顾稀疏性与稳定性。
中档10过拟合时,"增加网络层数"是对的对策吗?
不对。更复杂只会更过拟合;应加正则/早停/数据增强或减复杂度。
中档11权重衰减(weight decay)对应哪种正则?
对应 L2(Ridge),让权重在更新时整体往小缩。
中档12欠拟合时该增大还是减小 λ?
欠拟合说明太简单,应减小 λ(放松正则)或增大模型容量。
▍拔高 6 题
拔高13为什么 L1 能产生稀疏解而 L2 不能?
L1 的约束区域是带棱角的菱形,最优解常落在角点(某维=0);L2 是圆,不会正好压到 0。
拔高14Dropout 为什么相当于集成很多网络?
每次随机关掉不同神经元,相当于采样了一个不同的"子网络",无数子网络共享权重做平均,降低方差。
拔高15偏差-方差分解里,正则化主要降低哪一项?
主要降低方差(换一点偏差),从而减小总误差。
拔高16特征高度共线时,L1 会在相关特征间随机挑一个,怎么办?
用 Elastic Net(加一点 L2 项),结果更稳定,不摇摆。
拔高17训练误差和验证误差都很高,该正则化吗?
不该。这是欠拟合,加正则会更差;应增大模型容量、减少正则。
拔高18为什么测试时 Dropout 要缩放权重(inverted dropout)?
训练时按保留概率 p 期望输出缩放,保证训练/测试期望一致,否则测试激活会偏大。
⑪ 记忆口诀 + 7 天复习计划
三句口诀
① 训练高、测试低,过拟合在背噪声题。
② L1 压零做筛选,L2 缩小权重衰减。
③ Dropout 训练关神经元,早停增强一起上。
| 天 | 任务 | 自检 |
| 第 1 天 | 读②③,画欠拟合/正好/过拟合曲线 | 能讲偏差方差 |
| 第 2 天 | 背公式卡 + 做基础 1-6 | L1/L2 不出错 |
| 第 3 天 | 做中档 7-12 + 重做错题 | 能开处方 |
| 第 4 天 | 做拔高 13-18 | 理解稀疏几何 |
| 第 5 天 | 做⑦真题 4 题 | 限时每题 2 分钟 |
| 第 6-7 天 | 合上书口述三句口诀,默写六种手段 | 不看资料全默对 |
← 返回算法与AI总览