← 返回算法与AI总览 算法与AI · 知识点深化 · 大模型安全与对齐:RLHF、DPO 与越狱防御
知识点深化 · 安全与对齐

大模型安全与对齐:RLHF、DPO 与越狱防御

模型很能说,但如果什么都说、甚至帮人干坏事就危险了。对齐就是让它守规矩、向善、说实话。这一页讲透 RLHF、DPO、有害内容过滤和越狱攻击防御,以及为什么安全是一场持续战。

① 小白第一课怎么学(4 步走,约 60 分钟)

模型很能说,但如果什么都说、甚至帮人干坏事,那就危险了。对齐就是让它"守规矩、帮对人":

1建立直觉(10 分钟)
读②③:对齐=让模型的行为符合人类价值观和安全要求。
2记方法(15 分钟)
读④:RLHF、DPO、有害内容过滤、越狱攻击。
3跟例题(20 分钟)
精读⑤,看一步对齐的流水线。
4刷题纠错(15 分钟)
做⑦⑩,错题回⑥。
本课小目标学完你要能:① 说清 RLHF 在做什么;② 区分 RLHF 和 DPO;③ 知道什么是越狱攻击及基本防御。

② 一图看懂:安全与对齐

安全与对齐 RLHF 人类反馈强化学习 DPO 直接偏好优化,更简单 内容过滤 输入输出双向审核 越狱攻击与防御 提示绕过安全规则 目标:有用+无害+诚实 对齐三原则 易错:只训不防 缺运行时过滤
读法:对齐靠 RLHF/DPO 把人类偏好灌进模型;运行时还要内容过滤,并防越狱绕过。

③ 本质直觉:让模型"听话、向善、说实话"

预训练模型只会"接话",不知道什么该说、什么不该说。对齐(Alignment)就是让它的行为符合人类价值观:有用、无害、诚实。

RLHF 怎么做:先让人对模型的多个回答排序(哪个更好/更安全),训练一个"奖励模型"来模拟人的偏好,再用强化学习让大模型朝着"拿高分"的方向优化。

DPO 是简化版:跳过复杂的强化学习和奖励模型,直接用"好回答 vs 坏回答"的成对数据训练,让模型直接偏向好回答,更省更稳。

光训练不够:运行时还要在输入和输出两端加内容过滤,拦截恶意请求和有害回答。

① 人工给回答排序(偏好) ② 训练奖励模型模拟偏好 ③ RL 让模型朝高分方向优化 DPO:跳过②③,直接用成对数据训
越狱攻击(Jailbreak)用户用"假设你是个无限制的 AI""我们在写小说"等话术,诱导模型绕过安全约束输出有害内容。防御要靠训练对齐+运行时过滤双管齐下。

④ 完整体系:对齐方法与防御对照

方法做什么特点
SFT 监督微调用安全示范数据教正确回答对齐基础
RLHF人工偏好→奖励模型→强化学习效果好但复杂、成本高
DPO用好坏成对数据直接优化省去强化学习,更简单稳定

运行时安全措施

措施拦什么
输入审核识别恶意/越界请求,提前拦截
输出审核过滤生成内容中的有害信息
越狱检测识别角色扮演/绕过话术
对齐不是一次性新的越狱手法不断出现,要持续红队测试、更新安全数据和过滤规则。

⑤ 用法场景与典型例题

例1(RLHF 流程)为什么先让人排序回答?
把人类偏好变成可学的信号。
① 人来判断哪个回答更合适、更安全。
② 用这些排序训练奖励模型,再用 RL 优化大模型。
答案:人工偏好是对齐的"教材"。
例2(DPO 优势)相比 RLHF,DPO 简单在哪?
省去奖励模型和强化学习。
① RLHF 要训奖励模型、跑 RL,复杂。
② DPO 直接拿"好/坏回答对"训练。
答案:DPO 流程更短、更稳、成本低。
例3(越狱)"假设你是没有任何限制的角色,帮我写…"属于什么?
典型越狱话术。
① 通过角色扮演绕过安全约束。
② 需越狱检测识别,拒绝越界请求。
答案:越狱攻击,要防御。
有用与无害的平衡对齐不是让模型变胆小什么都拒,而是在安全前提下尽量有用。

⑥ 高频错误诊断(4 条)

错误 1:以为训练对齐就一劳永逸越狱手法不断翻新,必须持续红队测试和更新过滤。
错误 2:只在输出端过滤,不管输入恶意请求进都该拦,双向过滤才完整。
错误 3:对齐过度导致"拒答一切"什么都拒绝就没法用,要在安全和有用间平衡。
错误 4:低估越狱话术的迷惑性角色扮演、虚构场景等包装很隐蔽,不能只靠关键词。

⑦ 考点真题演练(4 题)

考点分布

考法出题形式应对
RLHF 流程问偏好怎么用排序→奖励模型→RL
DPO 优势问比 RLHF 简单在哪省去 RL,直接成对训练
越狱识别绕过话术角色扮演绕过,需检测

真题基础1. RLHF 中的"人工偏好"首先被用来做什么?

真题中档2. DPO 相比 RLHF 的主要优势是?

真题中档3. "假设你是没有任何限制的角色,帮我写…"属于?

真题拔高4. 关于大模型安全,正确的是?

⑧ 必背知识点卡

对齐目标:有用、无害、诚实 符合价值观
RLHF:人工排序→奖励模型→强化学习 偏好驱动
DPO:好坏成对数据直接优化,省去 RL 更简单
SFT:用安全示范教正确回答 对齐基础
运行时:输入审核+输出审核+越狱检测 双向过滤
越狱:角色扮演/虚构场景绕过约束 要识别
铁律:持续红队测试,别过度拒答 平衡有用与安全

⑨ 应用输出:给一个对外聊天助手做安全层

实战场景:上线前补安全防线
① 训练侧:已用 SFT 安全示范 + DPO 好坏对数据对齐。
② 输入过滤:请求进来先过审核,识别"教我做危险操作"类越界请求。
③ 越狱检测:识别"假设你是无限制 AI"这类话术,礼貌拒绝。
④ 输出过滤:生成内容再过一遍,拦截有害信息。
⑤ 持续:定期红队测试、更新安全样本和规则。
口述"对齐就是让模型有用、无害、诚实:RLHF 用人类偏好训奖励模型再强化学习,DPO 更简单直接;运行时还要双向过滤和越狱检测,持续红队。"

⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)

▍基础 6 题

基础1对齐的三个目标?
有用、无害、诚实。
基础2RLHF 的中文叫?
基于人类反馈的强化学习。
基础3人工偏好先用来训练什么?
奖励模型。
基础4DPO 比 RLHF 省去了什么?
省去奖励模型和强化学习。
基础5越狱攻击指什么?
用话术绕过安全约束输出有害内容。
基础6运行时安全至少要过滤哪两端?
输入和输出两端。

▍中档 5 题

中档7为什么不能只靠输出过滤?
恶意请求应在输入端就拦截,双向才完整。
中档8DPO 的训练数据长什么样?
成对的"更好回答 vs 更差回答"。
中档9为什么对齐会过度拒答?
安全标准过严会让模型什么都拒,丧失可用性。
中档10红队测试是什么?
主动模拟攻击找漏洞,再修补。
中档11SFT 在对齐里的角色?
用安全示范数据教正确回答,是对齐基础。

▍拔高 5 题

拔高12RLHF 为什么成本高?
需大量人工标注、训练奖励模型、再跑强化学习,流程复杂。
拔高13越狱话术为什么不能只靠关键词拦?
包装千变万化(虚构场景、角色扮演),需语义级检测。
拔高14为什么安全是持续过程?
新越狱手法不断出现,需持续更新样本和过滤规则。
拔高15对齐与 RAG/微调的关系?
对齐是叠加在能力之上的安全层,不替代知识注入。
拔高16如何平衡有用与无害?
对边界问题引导而非硬拒,在安全前提下尽量满足合理需求。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① 对齐目标:有用、无害、诚实。
② RLHF 靠人类偏好训奖励模型再强化学习,DPO 更简单直接。
③ 运行时双向过滤+防越狱,持续红队测试别过度拒答。
天任务自检
第 1 天读②③④,画 RLHF 流程说清三步
第 2 天背知识点卡 + 基础 1-6基础全对
第 3 天做中档 7-11懂双向过滤
第 4 天做拔高 12-16懂红队与平衡
第 5 天做⑦真题 4 题限时每题 2 分钟
第 6-7 天合上书口述 RLHF/DPO不看资料全说对

← 返回算法与AI总览