知识点深化 · 大模型评估
大模型评估:人工、自动指标与 LLM-as-Judge
大模型都说自己很强,怎么客观判断它到底行不行?这一页讲透人工评估、自动指标、LLM-as-Judge、公开基准 MMLU/CMMLU 四条路,以及为什么榜单分高不等于你的业务效果好。
① 小白第一课怎么学(4 步走,约 60 分钟)
大模型都说自己"很强",怎么客观判断它到底行不行?
1建立直觉(10 分钟)
读②③:评估就是"考试"——用一批标准题给模型打分。
2记方法(15 分钟)
读④:人工评、自动指标、LLM-as-Judge、基准榜 MMLU/CMMLU。
3跟例题(20 分钟)
精读⑤,看不同方法各评什么。
4刷题纠错(15 分钟)
做⑦⑩,错题回⑥。
本课小目标学完你要能:① 区分人工评估和自动评估;② 说清 LLM-as-Judge 的优缺点;③ 知道 MMLU/CMMLU 考什么。
② 一图看懂:大模型评估方法
读法:评估四条路——人评(准但贵)、自动指标(有标准答案)、LLM 当裁判、公开基准榜。
③ 本质直觉:给模型"出考卷、打分"
评估的本质就是考试:准备一批有标准答案/评分标准的题,让模型作答,再打分。
有标准答案的题(选择题、数学题)好办——自动比对对错即可,准确率自动算。
开放题就麻烦了(写文案、回答客服)没有唯一答案。这时要么人工打分(准但慢且贵),要么让一个更强的模型当裁判(LLM-as-Judge)来打分。
基准榜(如 MMLU)是覆盖上百学科的标准题库,跑完出一个分数,方便横向对比不同模型。但要注意:榜单分高 ≠ 你的业务效果好。
LLM-as-Judge 的甜头与坑便宜、可批量、可复现,但它有偏好:偏好更长的回答、偏好自己风格的输出,也可能被错误选项带偏。需抽样人工校准。
④ 完整体系:评估方法与基准对照
| 方法 | 评什么 | 优点 | 缺点 |
| 人工评估 | 开放回答质量 | 最贴近真实 | 贵、慢、主观 |
| 自动指标 | 有标准答案的题 | 快、客观 | 覆盖不了开放题 |
| LLM-as-Judge | 开放回答/排序 | 批量、便宜 | 有偏好偏差,需校准 |
常见基准
| 基准 | 考什么 |
| MMLU | 英文多学科常识(含 STEM、人文等) |
| CMMLU | 中文多学科理解,测中文能力 |
| GSM8K / MATH | 数学推理 |
| MT-Bench | 多轮对话,常配 LLM-as-Judge |
别迷信单一分数要看你的业务场景:客服看重一致与安全,写作看重风格,代码看重可运行。做一份"业务自测集"比看榜更实在。
⑤ 用法场景与典型例题
例1(选方法)让模型写产品文案,怎么评?
开放题没有标准答案。
① 没有唯一答案,自动比对不行。
② 先用 LLM-as-Judge 批量初筛,再抽样人工精评。
答案:人评+LLM 裁判结合。
例2(基准用途)MMLU 分数高代表什么?
综合常识能力强。
① MMLU 覆盖多学科选择题。
② 分数高说明通用知识与推理较强。
答案:通用能力强,但不等于你的业务效果好。
例3(Judge 偏差)为什么 LLM-as-Judge 偏爱长回答?
它觉得长=信息多。
① 裁判模型倾向给更长的回答高分。
② 解决:加"简洁"要求、做成对比较、抽样人工核对。
答案:裁判有偏好,需校准。
自动化回归每次改 Prompt/换模型,都跑同一套自测集,防止改一处坏一处。
⑥ 高频错误诊断(4 条)
错误 1:只看公开榜单就选模型榜单考通用能力,你的垂直业务可能完全另一回事。必须建业务自测集。
错误 2:直接信 LLM-as-Judge 不做人工校准裁判有偏好偏差,不校准会被误导。
错误 3:开放题硬套自动准确率没有标准答案,自动指标评不了开放回答。
错误 4:只看平均分不看分布平均分可能掩盖大量失败案例,要看错例分布。
⑦ 考点真题演练(4 题)
考点分布
| 考法 | 出题形式 | 应对 |
| 方法选择 | 开放题怎么评 | 人评+LLM 裁判 |
| Judge 偏差 | 问裁判缺点 | 偏好长回答/自身风格 |
| 基准 | MMLU/CMMLU 考什么 | 多学科常识 |
真题基础1. LLM-as-Judge 指的是?
真题中档2. 评估模型写的开放文案,最合适的做法是?
真题中档3. MMLU/CMMLU 这类基准主要测的是?
真题拔高4. 关于 LLM-as-Judge,正确的是?
⑧ 必背知识点卡
本质:出标准题、让模型答、对照打分 考试
人工评估:准但贵慢、主观 金标准
自动指标:有标准答案才能用,快而客观 选择题/数学
LLM-as-Judge:强模型当裁判,批量便宜但有偏好 需校准
MMLU:英文多学科常识 通用能力
CMMLU:中文多学科理解 测中文
铁律:榜单分≠业务效果,要建业务自测集 别迷信榜
⑨ 应用输出:给客服模型做一轮上线评估
实战场景:换了新模型,上线前评估
① 建自测集:整理 200 条真实客服问题,标注期望处理方式。
② 客观题:可判定对错的(如是否正确退款规则)自动打分。
③ 开放题:语气、共情类用 LLM-as-Judge 初评。
④ 人工校准:抽样 20% 人工复核裁判结果,纠偏。
⑤ 看分布:不只看平均分,重点看安全/违规类失败案例,修复后再上线。
口述"评估就是出考卷:有标准答案自动打分,开放题用 LLM 裁判加人工校准;公开榜只作参考,业务自测集才是真标准。"
⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)
▍基础 6 题
基础1评估大模型本质是在做什么?
出题作答并打分。
基础4LLM-as-Judge 用什么打分?
一个更强的大模型当裁判。
基础5MMLU 主要测什么?
多学科常识/通用能力。
基础6CMMLU 和 MMLU 区别?
CMMLU 侧重中文多学科理解。
▍中档 5 题
中档7开放文案为什么不能自动打分?
没有唯一标准答案,无法自动比对对错。
中档8LLM-as-Judge 常见偏差?
偏好更长回答、偏好自身风格、可能被误导。
中档9为什么要人工校准裁判?
裁判有偏差,抽样人工核对才能保证可信度。
中档10为什么榜单分高不一定业务好?
公开榜考通用题,不覆盖你的垂直场景与要求。
中档11每次改 Prompt/模型该做什么?
跑同一套业务自测集做回归,防改一处坏一处。
▍拔高 5 题
拔高12成对比较(pairwise)评估为什么常用?
让裁判在两个回答里选更好的,比直接打分更稳定、更一致。
拔高13平均分掩盖了什么?
少数严重失败(安全/违规)可能被平均分稀释,要看错例。
拔高14GSM8K 考什么?
小学数学应用题推理能力。
拔高15好的业务自测集应具备什么?
来自真实分布、覆盖关键场景、有明确评分标准、可重复跑。
拔高16为什么不能只依赖一个基准?
单一基准偏科,多基准+业务自测才能全面反映能力。
⑪ 记忆口诀 + 7 天复习计划
三句口诀
① 评估就是出考卷:标准题、让模型答、对照打分。
② 有标准答案自动评,开放题用 LLM 裁判加人工校准。
③ MMLU/CMMLU 只看通用,业务自测集才是真标准。
| 天 | 任务 | 自检 |
| 第 1 天 | 读②③④,列四种评估方法 | 说清优缺点 |
| 第 2 天 | 背知识点卡 + 基础 1-6 | 基础全对 |
| 第 3 天 | 做中档 7-11 | 会选评估方法 |
| 第 4 天 | 做拔高 12-16 | 懂成对比较 |
| 第 5 天 | 做⑦真题 4 题 | 限时每题 2 分钟 |
| 第 6-7 天 | 合上书口述评估四法 | 不看资料全说对 |
← 返回算法与AI总览