← 返回算法与AI总览 算法与AI · 知识点深化 · 大模型微调与 LoRA:全参微调与参数高效微调
知识点深化 · 微调与 LoRA

大模型微调与 LoRA:全参微调与参数高效微调

预训练模型是「通才」,微调是把它训练成「专才」。这一页讲透全参微调 vs LoRA/QLoRA:为什么 LoRA 冻结原权重、只训小矩阵就能省显存,以及数据怎么备、什么场景该微调、什么场景用 RAG 就够。

① 小白第一课怎么学(4 步走,约 65 分钟)

预训练模型是"通才",微调是把它训练成"专才":

1建立直觉(10 分钟)
读②③:微调=在已学会的基础上,用你的数据再"补补课"。
2记方法(15 分钟)
读④:全参微调 vs LoRA/QLoRA,数据怎么备。
3跟例题(20 分钟)
精读⑤,判断什么场景该用哪种微调。
4刷题纠错(20 分钟)
做⑦⑩,错题回⑥。
本课小目标学完你要能:① 区分预训练/微调/RAG;② 说清 LoRA 为什么省显存;③ 判断什么情况该微调、什么情况用 Prompt/RAG 就够。

② 一图看懂:微调家族

模型微调 全参微调 SFT 所有参数都改,贵 LoRA 只训低秩小矩阵 QLoRA 4bit 量化+LoRA 数据准备 指令问答对,高质量 应用:垂直领域问答 法律/医疗/客服风格 易错:数据差/过拟合 喂错数据越训越笨
读法:微调分全参(贵但彻底)和参数高效(LoRA/QLoRA,省显存);效果好坏七分靠数据质量。

③ 本质直觉:给"通才"补专业课

预训练阶段模型读了海量通用文本,学会了语言和常识,但它不懂你公司的话术、不适应你的任务格式。

微调(Fine-tuning)就是在预训练权重基础上,用一批"指令→理想回答"的样本继续训练,让模型学会你的风格和任务。

为什么不全参微调?一个 7B 模型全参数就要 70 亿,全参训练要装下参数+梯度+优化器状态,显存常要上百 GB,太贵。

LoRA 的巧思:冻结原模型权重不动,只在旁边挂两个小小的"低秩矩阵" A、B,只训这两个小矩阵。参数量从几十亿降到几百万,显存大降,效果接近全参。

原权重 W(冻结) A B 只训 A、B,W 不动 ΔW ≈ B·A,参数量骤减
QLoRA 再省一步QLoRA 把冻结的原权重量化成 4bit 存储,再配合 LoRA,让单张消费级显卡也能微调几十亿参数的模型。

④ 完整体系:三种微调路线对照

对比全参微调 SFTLoRAQLoRA
训练参数量全部低秩小矩阵(~1%)同 LoRA,原权重4bit
显存需求很高中低(单卡可跑)
效果最好接近全参略损但实用
适用数据多、预算足大多数垂直场景显存有限的个人/小团队

微调 vs Prompt vs RAG 怎么选

手段改不改权重适合解决
Prompt不改格式、简单任务、即改即用
RAG不改注入会变的知识/资料
微调改固定风格、特定能力、格式固化
指令数据格式 {"instruction": "把这句翻译成英文", "input": "今天天气真好", "output": "The weather is nice today."}
数据质量 > 数量几百条高质量、风格统一的样本,往往比几万条杂乱数据效果好。脏数据会让模型学坏。

⑤ 用法场景与典型例题

例1(选型)只是想让模型回答都用"客服小妹"语气,该微调还是改 Prompt?
风格类先试 Prompt。
① 简单风格用角色 Prompt 即可。
② 若要全场景稳定、且有大量优质对话样本,再微调固化。
答案:先 Prompt,不够再微调。
例2(LoRA)为什么 LoRA 能省显存还不掉太多效果?
冻结原权重,只训小矩阵。
① 原权重冻结,不需要为它存梯度和优化器状态。
② 低秩矩阵参数量小,更新量小。
③ 经验证明低秩更新足以学到任务需要的方向。
答案:冻结大矩阵+只训小低秩矩阵。
例3(数据)微调医疗问答喂了一堆闲聊数据会怎样?
数据污染。
① 模型会学到闲聊风格,医疗回答变水。
② 必须用高质量、领域相关、格式统一的指令对。
答案:垃圾进垃圾出,数据要干净对口。
别过度微调数据太少就微调会过拟合,模型变得死板、丧失通用能力。小问题先用 Prompt/RAG。

⑥ 高频错误诊断(4 条)

错误 1:明明该用 RAG 却去微调知识会更新、要引用来源,微调把知识焊死在权重里,改都改不动。该外挂资料。
错误 2:用脏数据/少量数据硬训数据杂乱或太少,模型学坏或过拟合。先保证质量和对口。
错误 3:以为微调万能微调主要改风格和能力,不能可靠注入新知识,也不能替代安全对齐。
错误 4:全参微调不评估就上线要在测试集对比微调前后,防止通用能力退化(灾难性遗忘)。

⑦ 考点真题演练(4 题)

考点分布

考法出题形式应对
LoRA 原理问为何省显存冻结原权重,只训低秩小矩阵
选型问该微调/RAG/Prompt知识用 RAG,风格用微调
数据问数据质量重要性高质量 > 数量

真题基础1. LoRA 训练时,对原模型权重的处理是?

真题中档2. 企业制度经常更新、且要可溯源,最合适的方式是?

真题中档3. QLoRA 相比 LoRA 进一步省显存靠的是?

真题拔高4. 关于微调数据,正确的是?

⑧ 必背知识点卡

本质:在预训练权重上用指令样本再训练,变垂直专才 补专业课
全参 SFT:所有参数都改,效果好但贵 预算足
LoRA:冻结原权重,只训低秩小矩阵 省显存
QLoRA:4bit 量化原权重 + LoRA 单卡可跑
选型:改风格/能力用微调,注入知识用 RAG,简单用 Prompt 别用错
数据:指令问答对,高质量 > 数量 垃圾进垃圾出
风险:过拟合、灾难性遗忘,上线前必评估 对比前后

⑨ 应用输出:把通用模型微调成法律合同助手

实战场景:让模型按律所风格审查合同
① 判断:要固定专业风格和输出格式,且有历史优质审查报告,适合 LoRA 微调。
② 备数据:整理 500 条"合同片段→审查意见"指令对,统一格式:风险等级+条款+建议。
③ 训练:用 QLoRA 在单卡上跑几轮,只保存几十 MB 的 LoRA 适配器。
④ 组合:具体法条引用仍走 RAG 检索,微调负责风格和审查流程。
⑤ 评估:在测试集对比微调前后,确认没退化、风格到位才上线。
口述选型"要知识外挂、会变、要溯源就用 RAG;要固定风格和能力、有优质样本就用 LoRA 微调;小问题先调 Prompt。"

⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)

▍基础 6 题

基础1微调在什么基础上继续训练?
预训练好的模型权重。
基础2LoRA 冻结的是哪部分?
原模型权重,只训旁挂低秩矩阵。
基础3QLoRA 多了什么关键操作?
把冻结原权重4bit 量化。
基础4微调数据通常是什么格式?
指令→回答的问答对。
基础5会更新的企业知识该用微调还是 RAG?
RAG,外挂好更新。
基础6全参微调的主要缺点?
显存/算力昂贵。

▍中档 5 题

中档7为什么 LoRA 省显存?
原权重冻结不用存梯度/优化器状态,只训极小的低秩矩阵。
中档8灾难性遗忘指什么?
微调后模型学会新任务,却忘了原来的通用能力。
中档9数据质量和数量哪个更关键?
质量,干净对口比堆量重要。
中档10LoRA 适配器文件一般多大?
通常几十到几百 MB,远小于整个模型。
中档11什么时候先别微调?
样本少、需求简单、知识会变时,先用 Prompt/RAG。

▍拔高 5 题

拔高12LoRA 的低秩体现在哪?
用两个瘦长矩阵 A×B 近似权重更新 ΔW,秩 r 很小(如 8/16),参数少。
拔高13为什么微调后要在测试集评估?
防止过拟合和能力退化,确认收益大于损失。
拔高14微调适合改"知识"吗?
不擅长。知识易过时且不可靠,知识注入优先 RAG。
拔高15LoRA 可以像插件一样切换吗?
可以,换不同任务的 LoRA 适配器即切换能力,基座共用。
拔高16学习率选太大会怎样?
训练不稳定、破坏预训练知识,应从小学习率起步。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① 微调是给通才补专业课,用指令样本再训练。
② LoRA 冻结原权重只训小矩阵,QLoRA 再 4bit 量化更省。
③ 风格用微调、知识用 RAG、简单用 Prompt;数据质量大于数量。
天任务自检
第 1 天读②③④,画 LoRA 示意图说清冻结谁
第 2 天背知识点卡 + 基础 1-6基础全对
第 3 天做中档 7-11会选型
第 4 天做拔高 12-16懂低秩原理
第 5 天做⑦真题 4 题限时每题 2 分钟
第 6-7 天合上书口述选型三原则不看资料全说对

← 返回算法与AI总览