知识点深化 · 微调与 LoRA
大模型微调与 LoRA:全参微调与参数高效微调
预训练模型是「通才」,微调是把它训练成「专才」。这一页讲透全参微调 vs LoRA/QLoRA:为什么 LoRA 冻结原权重、只训小矩阵就能省显存,以及数据怎么备、什么场景该微调、什么场景用 RAG 就够。
① 小白第一课怎么学(4 步走,约 65 分钟)
预训练模型是"通才",微调是把它训练成"专才":
1建立直觉(10 分钟)
读②③:微调=在已学会的基础上,用你的数据再"补补课"。
2记方法(15 分钟)
读④:全参微调 vs LoRA/QLoRA,数据怎么备。
3跟例题(20 分钟)
精读⑤,判断什么场景该用哪种微调。
4刷题纠错(20 分钟)
做⑦⑩,错题回⑥。
本课小目标学完你要能:① 区分预训练/微调/RAG;② 说清 LoRA 为什么省显存;③ 判断什么情况该微调、什么情况用 Prompt/RAG 就够。
② 一图看懂:微调家族
读法:微调分全参(贵但彻底)和参数高效(LoRA/QLoRA,省显存);效果好坏七分靠数据质量。
③ 本质直觉:给"通才"补专业课
预训练阶段模型读了海量通用文本,学会了语言和常识,但它不懂你公司的话术、不适应你的任务格式。
微调(Fine-tuning)就是在预训练权重基础上,用一批"指令→理想回答"的样本继续训练,让模型学会你的风格和任务。
为什么不全参微调?一个 7B 模型全参数就要 70 亿,全参训练要装下参数+梯度+优化器状态,显存常要上百 GB,太贵。
LoRA 的巧思:冻结原模型权重不动,只在旁边挂两个小小的"低秩矩阵" A、B,只训这两个小矩阵。参数量从几十亿降到几百万,显存大降,效果接近全参。
QLoRA 再省一步QLoRA 把冻结的原权重量化成 4bit 存储,再配合 LoRA,让单张消费级显卡也能微调几十亿参数的模型。
④ 完整体系:三种微调路线对照
| 对比 | 全参微调 SFT | LoRA | QLoRA |
| 训练参数量 | 全部 | 低秩小矩阵(~1%) | 同 LoRA,原权重4bit |
| 显存需求 | 很高 | 中 | 低(单卡可跑) |
| 效果 | 最好 | 接近全参 | 略损但实用 |
| 适用 | 数据多、预算足 | 大多数垂直场景 | 显存有限的个人/小团队 |
微调 vs Prompt vs RAG 怎么选
| 手段 | 改不改权重 | 适合解决 |
| Prompt | 不改 | 格式、简单任务、即改即用 |
| RAG | 不改 | 注入会变的知识/资料 |
| 微调 | 改 | 固定风格、特定能力、格式固化 |
指令数据格式
{"instruction": "把这句翻译成英文", "input": "今天天气真好", "output": "The weather is nice today."}
数据质量 > 数量几百条高质量、风格统一的样本,往往比几万条杂乱数据效果好。脏数据会让模型学坏。
⑤ 用法场景与典型例题
例1(选型)只是想让模型回答都用"客服小妹"语气,该微调还是改 Prompt?
风格类先试 Prompt。
① 简单风格用角色 Prompt 即可。
② 若要全场景稳定、且有大量优质对话样本,再微调固化。
答案:先 Prompt,不够再微调。
例2(LoRA)为什么 LoRA 能省显存还不掉太多效果?
冻结原权重,只训小矩阵。
① 原权重冻结,不需要为它存梯度和优化器状态。
② 低秩矩阵参数量小,更新量小。
③ 经验证明低秩更新足以学到任务需要的方向。
答案:冻结大矩阵+只训小低秩矩阵。
例3(数据)微调医疗问答喂了一堆闲聊数据会怎样?
数据污染。
① 模型会学到闲聊风格,医疗回答变水。
② 必须用高质量、领域相关、格式统一的指令对。
答案:垃圾进垃圾出,数据要干净对口。
别过度微调数据太少就微调会过拟合,模型变得死板、丧失通用能力。小问题先用 Prompt/RAG。
⑥ 高频错误诊断(4 条)
错误 1:明明该用 RAG 却去微调知识会更新、要引用来源,微调把知识焊死在权重里,改都改不动。该外挂资料。
错误 2:用脏数据/少量数据硬训数据杂乱或太少,模型学坏或过拟合。先保证质量和对口。
错误 3:以为微调万能微调主要改风格和能力,不能可靠注入新知识,也不能替代安全对齐。
错误 4:全参微调不评估就上线要在测试集对比微调前后,防止通用能力退化(灾难性遗忘)。
⑦ 考点真题演练(4 题)
考点分布
| 考法 | 出题形式 | 应对 |
| LoRA 原理 | 问为何省显存 | 冻结原权重,只训低秩小矩阵 |
| 选型 | 问该微调/RAG/Prompt | 知识用 RAG,风格用微调 |
| 数据 | 问数据质量重要性 | 高质量 > 数量 |
真题基础1. LoRA 训练时,对原模型权重的处理是?
真题中档2. 企业制度经常更新、且要可溯源,最合适的方式是?
真题中档3. QLoRA 相比 LoRA 进一步省显存靠的是?
真题拔高4. 关于微调数据,正确的是?
⑧ 必背知识点卡
本质:在预训练权重上用指令样本再训练,变垂直专才 补专业课
全参 SFT:所有参数都改,效果好但贵 预算足
LoRA:冻结原权重,只训低秩小矩阵 省显存
QLoRA:4bit 量化原权重 + LoRA 单卡可跑
选型:改风格/能力用微调,注入知识用 RAG,简单用 Prompt 别用错
数据:指令问答对,高质量 > 数量 垃圾进垃圾出
风险:过拟合、灾难性遗忘,上线前必评估 对比前后
⑨ 应用输出:把通用模型微调成法律合同助手
实战场景:让模型按律所风格审查合同
① 判断:要固定专业风格和输出格式,且有历史优质审查报告,适合 LoRA 微调。
② 备数据:整理 500 条"合同片段→审查意见"指令对,统一格式:风险等级+条款+建议。
③ 训练:用 QLoRA 在单卡上跑几轮,只保存几十 MB 的 LoRA 适配器。
④ 组合:具体法条引用仍走 RAG 检索,微调负责风格和审查流程。
⑤ 评估:在测试集对比微调前后,确认没退化、风格到位才上线。
口述选型"要知识外挂、会变、要溯源就用 RAG;要固定风格和能力、有优质样本就用 LoRA 微调;小问题先调 Prompt。"
⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)
▍基础 6 题
基础1微调在什么基础上继续训练?
预训练好的模型权重。
基础2LoRA 冻结的是哪部分?
原模型权重,只训旁挂低秩矩阵。
基础3QLoRA 多了什么关键操作?
把冻结原权重4bit 量化。
基础4微调数据通常是什么格式?
指令→回答的问答对。
基础5会更新的企业知识该用微调还是 RAG?
RAG,外挂好更新。
▍中档 5 题
中档7为什么 LoRA 省显存?
原权重冻结不用存梯度/优化器状态,只训极小的低秩矩阵。
中档8灾难性遗忘指什么?
微调后模型学会新任务,却忘了原来的通用能力。
中档9数据质量和数量哪个更关键?
质量,干净对口比堆量重要。
中档10LoRA 适配器文件一般多大?
通常几十到几百 MB,远小于整个模型。
中档11什么时候先别微调?
样本少、需求简单、知识会变时,先用 Prompt/RAG。
▍拔高 5 题
拔高12LoRA 的低秩体现在哪?
用两个瘦长矩阵 A×B 近似权重更新 ΔW,秩 r 很小(如 8/16),参数少。
拔高13为什么微调后要在测试集评估?
防止过拟合和能力退化,确认收益大于损失。
拔高14微调适合改"知识"吗?
不擅长。知识易过时且不可靠,知识注入优先 RAG。
拔高15LoRA 可以像插件一样切换吗?
可以,换不同任务的 LoRA 适配器即切换能力,基座共用。
拔高16学习率选太大会怎样?
训练不稳定、破坏预训练知识,应从小学习率起步。
⑪ 记忆口诀 + 7 天复习计划
三句口诀
① 微调是给通才补专业课,用指令样本再训练。
② LoRA 冻结原权重只训小矩阵,QLoRA 再 4bit 量化更省。
③ 风格用微调、知识用 RAG、简单用 Prompt;数据质量大于数量。
| 天 | 任务 | 自检 |
| 第 1 天 | 读②③④,画 LoRA 示意图 | 说清冻结谁 |
| 第 2 天 | 背知识点卡 + 基础 1-6 | 基础全对 |
| 第 3 天 | 做中档 7-11 | 会选型 |
| 第 4 天 | 做拔高 12-16 | 懂低秩原理 |
| 第 5 天 | 做⑦真题 4 题 | 限时每题 2 分钟 |
| 第 6-7 天 | 合上书口述选型三原则 | 不看资料全说对 |
← 返回算法与AI总览