← 返回算法与AI总览 算法与AI · 知识点深化
知识点深化 · 正则化

正则化:给模型"踩刹车",治过拟合的六味药

模型在训练集上考 99 分、测试集上只有 70 分——这就是过拟合:它把训练数据里的噪声、巧合全背下来了,没学会真正的规律。正则化就是给模型踩刹车:别让它太"聪明"、权重别太大。这一页讲清过拟合的根源,以及 L1(Lasso)、L2(Ridge)、Elastic Net、早停、Dropout、数据增强这几招分别怎么踩刹车。

① 小白第一课怎么学(4 步走,约 55 分钟)

先理解"过拟合=死记硬背",再看正则化怎么让人"理解着学":

1看图建立直觉(12 分钟)
读第②③部分:看欠拟合/正好/过拟合三条曲线,搞懂偏差与方差。
2记六种手段(15 分钟)
背第④部分:L1 稀疏、L2 权重衰减、Dropout 等对照表。
3做例题(15 分钟)
精读第⑤部分,判断场景该用哪种正则化。
4刷题+纠错(13 分钟)
做第⑦⑩部分,错题回第⑥部分找原因。
本课小目标学完你要能:① 说清过拟合 vs 欠拟合;② 区分 L1(产生稀疏/特征选择)与 L2(权重衰减);③ 解释 Dropout 为什么能抗过拟合;④ 知道早停、数据增强在干嘛。

② 一图看懂:正则化全地图

正则化 L1 (Lasso) 权重绝对值→稀疏 L2 (Ridge) 权重平方→衰减 Dropout 训练随机关神经元 其他手段 早停+数据增强 目标:治过拟合 降低方差,提泛化 偏差-方差权衡 正则=加偏差换低方差
读法:中心是正则化,四大手段——L1、L2、Dropout、早停/数据增强;共同目标是治过拟合;底层原理是偏差-方差权衡。

③ 先认识它:模型就像学生,正则化就是别让它死记硬背

想象一个学生准备考试:

欠拟合:书都没看完,例题都不会,模拟考和真考都差——学得不到位(高偏差)。

正好:理解了方法,模拟考不错,真考也稳。

过拟合:把历年题答案全背下来了,模拟考满分;可真题一换数字就不会——背了噪声没学会规律(高方差)。

正则化就是劝他:"别死记,别迷信某一道偏题的细节,抓主要规律。"数学上就是给大权重加惩罚——权重越大罚得越狠,逼模型用简单、平滑的方式拟合,而不是东一下西一下地死记每个点。

欠拟合 正好 过拟合 训练误差 vs 测试误差 绿=训练误差一直降 红=测试误差先降后升=过拟合
偏差-方差权衡正则化是"主动加点偏差,换方差大降":模型稍微欠拟合一点点(偏差↑),但换来在新数据上稳得多(方差↓),总误差反而更小。这就是为什么测试误差曲线会"先降后升"——升的那段就是过拟合,正则化就是把它按下去。

④ 完整体系与方法对照表

正则化给损失函数加了什么

总损失 = 原始损失 + 正则项 J = Loss(数据) + λ·R(w)
λ 越大,惩罚越狠,模型越"简单"(越偏向欠拟合)

L1 vs L2 核心对照(必考!)

L1(Lasso)L2(Ridge)
正则项 R(w)λ·Σ|wᵢ|(权重绝对值)λ·Σwᵢ²(权重平方)
效果把不重要权重直接压成 0把权重往小压缩但不为 0
产物稀疏解,自带特征选择权重整体变小(权重衰减)
适合特征多、想自动挑重要特征特征都有用、缓解共线/过拟合
Elastic Net(弹性网)= L1 + L2 合体 R(w) = λ₁·Σ|wᵢ| + λ₂·Σwᵢ²  兼顾稀疏与稳定,解决 L1 在特征高度相关时摇摆的问题

其他抗过拟合手段

手段怎么做直觉
早停 Early Stopping监控验证集误差,一回升就停学到刚好就刹车,别背过头
Dropout训练时随机"关掉"一部分神经元不能依赖任何一个神经元,逼它学鲁棒特征
数据增强图像翻转/裁剪/加噪扩充数据见更多样本,没噪声可背
Dropout 为什么管用每次训练随机让一部分神经元"罢工",网络就不能把答案寄托在某几个特定神经元上(否则一被关掉就崩)。于是它被迫学出冗余、鲁棒的表示——这等价于训练了大量共享参数的小网络做集成。测试时不 dropout,用全部神经元。

⑤ 用法场景与典型例题

例1(L1 vs L2)做房价预测,有 100 个候选特征,想自动筛掉没用的、只留几个关键的,用哪个?
要稀疏解(不重要权重变 0)。
① L1(Lasso)会把无用特征的权重压到 0,等于自动做特征选择。
② L2 只会把它们压小,不会变 0,特征还留着。
答案:选 L1 正则(Lasso)。
例2(过拟合判断)训练集准确率 99%,验证集 75%。下面哪个动作不合适?
这是典型过拟合。
① 合适的:增大 λ(加正则)、加 Dropout、早停、数据增强、减模型复杂度。
② 不合适的:继续增加层数/训练更久——会让过拟合更严重。
答案:不该再加复杂度,应收紧正则、提前停。
例3(λ 的方向)正则系数 λ 从 0 慢慢调大,训练误差和测试误差分别怎么变?
λ 越大惩罚越狠,模型越简单。
① λ=0:模型随意拟合,训练误差最低但测试误差高(过拟合)。
② λ 增大:模型变简单,训练误差上升(开始欠拟合),但测试误差先降后在过强时升。
③ 中间有个甜点,测试误差最低。
答案:训练误差单调上升;测试误差先降后升,找甜点。
正则化全家桶怎么配深度学习里常一起上:L2(权重衰减)+ Dropout + 数据增强 + 早停;线性模型里看要不要特征选择选 L1/L2/Elastic Net。它们都是"给模型踩刹车",但踩的地方不同。

⑥ 中国学生高频错误诊断(4 条)

错误 1:把过拟合当成"训练不够"去加训练过拟合时训练误差已经很低了,再训只会更糟。正确方向是加正则、减复杂度、早停,而不是接着训。
错误 2:以为 L1 和 L2 差不多L1 产生稀疏(权重变 0)、做特征选择;L2 只是把权重整体缩小。要筛特征用 L1,要稳用 L2。
错误 3:Dropout 在测试时也开着Dropout 只在训练时随机关神经元,测试时全用(训练时要按保留概率缩放权重)。测试时还 dropout 等于故意丢信息。
错误 4:λ 调太大λ 太大惩罚过重,权重全被压成接近 0,模型退化成常数——欠拟合。正则不是越狠越好,要交叉验证找甜点。

⑦ 考点与真题演练(4 题)

考点分布

考法出题形式应对
L1/L2 区别问谁产生稀疏解L1 稀疏做特征选择
过拟合对策给现象选手段加正则/早停/Dropout
Dropout为什么抗过拟合训练随机关神经元
λ 方向λ 增大的影响训练误差升、防过拟合

基础真题1. 训练集准确率很高、测试集准确率明显低,这是?

中档真题2. 哪种正则化会把不重要特征的权重直接压成 0,实现特征选择?

中档真题3. Dropout 在神经网络中抗过拟合的原理是?

拔高真题4. 增大正则系数 λ,通常会使?

⑧ 必背公式卡

总损失:J = Loss + λ·R(w) λ 越大越简单
L1:λ·Σ|wᵢ| 稀疏、特征选择
L2:λ·Σwᵢ² 权重衰减、平滑稳定
Elastic Net:L1 + L2 合体 稀疏又稳
过拟合:训练低、测试高 背了噪声没学规律
Dropout:训练随机关神经元,测试全开 学鲁棒表示
早停:验证误差一回升就停 数据增强:加样本多样性

⑨ 应用输出:给一个过拟合的网络开药方

建模场景:图像分类网络过拟合(训练 98% / 验证 70%)
现象:训练集越练越准,验证集先升后降——典型过拟合。
· 第一道:加 Dropout(如 0.5),让网络别依赖个别神经元。
· 第二道:优化器里加 权重衰减(L2),约束权重别太大。
· 第三道:做数据增强(翻转、裁剪、颜色抖动),让训练集更多样。
· 第四道:设早停,验证误差不再下降就停,别继续背。
口述解题思路训练合上书说:"过拟合就是训练考得好、真考砸;正则化给损失加惩罚项踩刹车;L1 让权重变 0 做特征选择,L2 让权重变小做衰减;Dropout 训练随机关神经元,早停验证一回升就停,数据增强让它没噪声可背;λ 要交叉验证找甜点。"能顺下来就真懂了。

⑩ 分层练习 18 题(基础 6 + 中档 6 + 拔高 6)

▍基础 6 题

基础1过拟合的典型表现是什么?
训练误差很低,测试/验证误差明显高。
基础2L1 正则项是权重的几次方?
绝对值的一次方:Σ|wᵢ|。
基础3L2 正则项是权重的几次方?
平方:Σwᵢ²(权重衰减)。
基础4Dropout 在训练还是测试时随机关神经元?
只在训练时;测试时使用全部神经元。
基础5早停根据什么决定何时停止训练?
监控验证集误差,一回升就停。
基础6判断:正则化系数 λ 越大越好。
错。λ 太大模型被压得太简单会欠拟合,要找甜点。

▍中档 6 题

中档7想自动从 200 个特征里挑出重要的,用 L1 还是 L2?
L1(Lasso):它把无用权重压成 0,自带特征选择。
中档8数据增强为什么能抗过拟合?
通过翻转/裁剪等制造更多样训练样本,模型没机会死记固定噪声。
中档9Elastic Net 是哪两个正则的结合?
L1 + L2,兼顾稀疏性与稳定性。
中档10过拟合时,"增加网络层数"是对的对策吗?
不对。更复杂只会更过拟合;应加正则/早停/数据增强或减复杂度。
中档11权重衰减(weight decay)对应哪种正则?
对应 L2(Ridge),让权重在更新时整体往小缩。
中档12欠拟合时该增大还是减小 λ?
欠拟合说明太简单,应减小 λ(放松正则)或增大模型容量。

▍拔高 6 题

拔高13为什么 L1 能产生稀疏解而 L2 不能?
L1 的约束区域是带棱角的菱形,最优解常落在角点(某维=0);L2 是圆,不会正好压到 0。
拔高14Dropout 为什么相当于集成很多网络?
每次随机关掉不同神经元,相当于采样了一个不同的"子网络",无数子网络共享权重做平均,降低方差。
拔高15偏差-方差分解里,正则化主要降低哪一项?
主要降低方差(换一点偏差),从而减小总误差。
拔高16特征高度共线时,L1 会在相关特征间随机挑一个,怎么办?
用 Elastic Net(加一点 L2 项),结果更稳定,不摇摆。
拔高17训练误差和验证误差都很高,该正则化吗?
不该。这是欠拟合,加正则会更差;应增大模型容量、减少正则。
拔高18为什么测试时 Dropout 要缩放权重(inverted dropout)?
训练时按保留概率 p 期望输出缩放,保证训练/测试期望一致,否则测试激活会偏大。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① 训练高、测试低,过拟合在背噪声题。
② L1 压零做筛选,L2 缩小权重衰减。
③ Dropout 训练关神经元,早停增强一起上。
天任务自检
第 1 天读②③,画欠拟合/正好/过拟合曲线能讲偏差方差
第 2 天背公式卡 + 做基础 1-6L1/L2 不出错
第 3 天做中档 7-12 + 重做错题能开处方
第 4 天做拔高 13-18理解稀疏几何
第 5 天做⑦真题 4 题限时每题 2 分钟
第 6-7 天合上书口述三句口诀,默写六种手段不看资料全默对

← 返回算法与AI总览