AI 基础入门 · 第3课
评分系统:怎么知道一个模型到底好不好
模型 A 跑分 85,模型 B 跑分 82,是不是 A 一定比 B 好用?不一定。 这一课讲清楚大模型世界的"考试体系":从最底层的困惑度 ,到中考级别的MMLU/GSM8K/HumanEval ,再到高考级别的Chatbot Arena 真人盲测 ,以及应用层的 RAGAS 。最后泼一盆冷水——跑分高不等于好用 ,刷榜、过拟合、和真实体验脱节,这些坑你必须认识。
① 小白第一课怎么学(4 步走,约 55 分钟)
这一课要记住的是"考什么试",不是公式推导。把每个评测当成一门学科就好。
1 建立直觉(10 分钟) 读③:模型评估=考试,不同考试考不同能力。
2 理清四层考试体系(20 分钟) 读④⑤:困惑度→学科基准→真人盲测→应用层。
3 认识跑分陷阱(10 分钟) 读⑥⑦:别被榜单忽悠。
4 刷题自测(15 分钟) 做⑦⑩,错题回⑥。
本课小目标 学完你要能:① 说清困惑度怎么读(越低越好);② 说出 MMLU/GSM8K/HumanEval/MMMU 各自考什么;③ 解释为什么 Chatbot Arena 的真人投票比纯跑分更可信;④ 列出至少 3 个跑分陷阱。
② 一图看懂:模型评估的四层金字塔
第4层 真人盲测
第3层 学科基准 Benchmark
MMLU · GSM8K · HumanEval · MMMU
第2层 应用层评估 RAGAS
忠实度 · 相关性 · 上下文召回
第1层 内部指标:困惑度 Perplexity
越低越好,训练时盯着它
越往上
越接近真实
用户体验
越贵越慢
老前辈:BLEU(翻译)、ROUGE(摘要)——现在用得少了,被 LLM-as-judge 和真人盲测取代
读法:从下往上读。底层困惑度是训练时的"体温",告诉你模型学没学会语言;中间基准是分科考试,看模型各科成绩;顶上真人盲测是"用户满意度调查",最接近真实体验。越往上越接近"好不好用",但也越贵越慢。
③ 本质直觉:评估就是"给模型安排一场考试"
先想一个比喻: 你要招一个翻译,怎么知道他水平?
你会先测他母语读得顺不顺 (困惑度:对语言有多熟),再让他做各科卷子 (基准:MMLU 考常识、GSM8K 考数学),再让他跟老外真实聊半小时 (真人盲测),最后把他扔进真实项目里试用 (应用层 RAGAS)。
困惑度(Perplexity, PPL) 是最底层的指标。它的直觉是:给模型一句话,它预测下一个词有多"意外"。 如果模型看到"今天天气真___",它觉得"好"概率 80%、"热"概率 15%,它就很不意外,PPL 低;如果它一脸懵、把概率均匀撒给一万个词,PPL 就飙高。PPL 越低,说明模型对语言越熟练。
但 PPL 低不代表好用。 一个把训练集背得滚瓜烂熟的模型 PPL 极低,可它啥新东西也不会。所以必须往上走,用"没见过的题"考它——这就是 Benchmark。
PPL = 模型对下一个词的意外度
"今天天气真___"
"好" 80%
"热" 15%
其他 5%
→ 很确定,PPL 低(好)
如果概率均匀撒给 1 万个词
→ 一脸懵,PPL 高(差)
记住一个反直觉的事实 困惑度是在测试集上 算的,不是训练集。如果模型在训练集上 PPL 很低、在测试集上 PPL 飙升,说明它背答案去了——这就是过拟合,后面讲。
④ 完整体系:四大基准 + 竞技场 + 应用层
四大"学科考试"基准
基准 考什么 一句话理解 满分/读法
MMLU 57 个学科的综合知识(从初中数学到大学法律) 模型的"全科高考",测知识面广度 百分比,越高越好
GSM8K 8000 道小学数学应用题 测模型能不能一步步推理算算术 百分比,越高越好
HumanEval 手写函数题,让模型补全代码并跑通测试 测模型"写代码能不能一次过" pass@1,越高越好
MMMU 多学科多模态题,要同时看懂图和文字 测多模态模型"看图+读题"联合推理 百分比,越高越好
Chatbot Arena:真人盲测的 Elo 排行榜
光做卷子不够,因为卷子会被"刷"。于是 LMSYS 搞了个 Chatbot Arena :让真人在不知道模型名字的情况下,把两个模型对同一问题的回答放在一起,投票选哪个更好。每赢一次,模型的 Elo 分 (跟国际象棋一个算法)就涨一点,输了就跌。最后排出总榜。
为什么 Elo 排名比跑分更可信 ① 题目没公开,没法刷题;② 真人主观判断覆盖了"回答像不像人话""有没有废话"这些试卷测不出来的维度;③ 两两比较比打分更稳——人打分容易飘,但"二选一"很准。
RAGAS:RAG 系统的应用层体检
当你用 RAG(检索增强生成,后面第6课讲)搭了一个"公司知识问答机器人",光问它 MMLU 多少分没用——你关心的是它有没有瞎编 、有没有答非所问 。RAGAS 就是干这个的:
指标 测什么
Faithfulness 忠实度 模型说的话,是不是都能在检索到的资料里找到依据?有没有瞎编?
Answer Relevancy 回答相关性 模型答的题,是不是真的在回答用户问的?有没有跑题?
Context Recall 上下文召回 该找的资料都找来了吗?有没有漏掉关键文档?
Context Precision 上下文精度 找来的资料里,混进来多少没用的垃圾?
老前辈:BLEU 和 ROUGE
在大模型之前,机器翻译用 BLEU ,文本摘要用 ROUGE 。它们的思路很笨:把模型输出跟"标准答案"做 n-gram 重叠计数,重叠越多分越高。问题是:意思对了但用词不一样,分就低 。比如标准答案是"我喜欢猫",模型说"猫咪很讨我喜欢",BLEU 会给低分,但人觉得翻译得很好。所以现在这些老指标主要在工业界小任务里还在用,前沿评测已经基本换成真人盲测和 LLM-as-judge 了。
⑤ 跑分的三大陷阱(重点)
陷阱 1:刷榜(Benchmark Overfitting)
厂商把测试题混进训练集,模型"做过这套卷子"。
比如某模型 MMLU 90 分,但你问它一个 MMLU 里没见过的冷门知识,它立刻露馅。对策: 看 LiveBench、Arena 这种题目持续更新、不公开的榜单。
陷阱 2:公开测试集被污染
GSM8K、HumanEval 这些题已经被互联网爬了几百万遍,训练数据里大概率有原题。
模型不是"会做数学题",是"见过这道题"。对策: 看厂商用新出的、没公开过的测试集的成绩,比如最新版 MMMU-Pro。
陷阱 3:跑分和真实体验脱节
某模型 MMLU 比另一个高 3 分,但你用起来觉得它更啰嗦、更爱幻觉、写代码更容易崩。
基准只测"会不会做",不测"做得舒不舒服"。长文本稳定性、指令遵循、风格控制、拒答策略——这些都要靠真人试用才知道。对策: 小流量灰度试用一周,比看任何榜单都准。
一句话总结 跑分是入门门槛 (连门都没进的不要),不是录用通知 。真正选型时,永远拿自己的真实业务数据跑一遍。
⑥ 高频错误诊断(5 条)
错误 1:以为 PPL 越低越好,越低越强 PPL 低只说明模型对语言熟练,不代表它会推理、会写代码、会看图。一个把维基百科全背下来的模型 PPL 极低,但它可能完全不会做数学。
错误 2:把 MMLU 90 分等同于"什么都懂" MMLU 是选择题,四选一有 25% 蒙对概率。而且它测的是"知识面宽度",不是"深度推理"。o1/o3 这类推理模型 MMLU 不一定最高,但做难题强得多。
错误 3:拿 BLEU 分评价今天的大模型翻译 BLEU 对意译极其不友好,今天的 GPT/Claude 翻译在 BLEU 上可能不如十年前的系统,但人用起来好太多。
错误 4:以为 Elo 分高就一定适合自己 Arena 是"通用闲聊"排名,你要是专门做法律文书或医疗问答,可能排名靠后的模型反而更合适——领域微调过。
错误 5:忽略"推理成本"这个维度 跑分高的模型往往推理慢、贵。一个 MMLU 85 但每千 token 0.001 美元的开源模型,可能比 MMLU 90 但贵 100 倍的闭源模型更适合你的业务。
⑦ 考点真题演练(4 题)
考点分布
考法 出题形式 应对
PPL 方向 问越高越好还是越低越好 越低越好
基准用途 给任务选基准 数学→GSM8K,代码→HumanEval
Arena 机制 问 Elo 怎么来的 真人两两盲测投票
跑分陷阱 问哪个是过拟合 测试题进训练集
真题 基础 1. 关于困惑度 Perplexity(PPL),下面哪个说法对?
A. PPL 越高,模型越厉害
B. PPL 越低,模型对下一个词越不意外
C. PPL 是真人投票投出来的
D. PPL 只跟模型大小有关
真题 中档 2. 你想知道一个模型"数学推理能力"如何,应该看哪个基准?
A. HumanEval
B. GSM8K
C. BLEU
D. ROUGE
真题 中档 3. Chatbot Arena 的 Elo 分数是怎么算出来的?
A. 厂商自己报的
B. 机器自动评的
C. 真人在不知道模型名字的情况下两两盲测投票
D. 按模型参数规模加权
真题 拔高 4. 某模型 MMLU 分数极高,但在实际业务中表现很差,最不可能的原因是?
A. 测试题被混进了训练集(刷榜)
B. 业务场景需要长文本稳定性,MMLU 测不出来
C. 模型在业务领域的方言/术语上没见过
D. 模型参数太多了,所以跑分高
⑧ 必背知识点卡
PPL: 困惑度,越低越好 = 对下一个词越不意外 训练时盯着它
MMLU: 57 学科综合知识高考 考知识面广度
GSM8K: 小学数学应用题 考数学推理
HumanEval: 写代码跑测试 考代码能力
MMMU: 多模态多学科 考图文联合推理
Arena Elo: 真人盲测两两投票 最接近真实体验
RAGAS: RAG 专用,忠实度/相关性/召回 应用层体检
BLEU/ROUGE: 老前辈,重叠计数 现在用得少
跑分三坑: 刷榜、测试集污染、和真实体验脱节 永远用自己数据复测
⑨ 应用输出:帮老板解读模型榜单
实战场景:老板甩来一张榜单说"咱们换第1名这个模型吧"
① 先看榜单是什么: 是 MMLU 这种学科考试,还是 Arena 真人盲测?前者可能刷榜,后者相对干净。
② 再看跟业务对不对口: 咱们是做客服问答,不是做数学奥赛,GSM8K 高 5 分对我们没意义。
③ 算总成本: 新模型贵 3 倍、慢 2 倍,但我们的问答量一天十万次,一个月多花几十万值不值?
④ 给建议: 别光看榜,拿过去 1000 条真实客服对话,让两个模型都答一遍,人工评 A/B,两周后再决定。
口述全链路 "模型评估分四层:底层困惑度看语言熟不熟,中层基准看各科成绩,上层 Arena 真人盲测最接近体验,应用层 RAGAS 看 RAG 系统有没有瞎编。跑分是门槛不是答案,永远要拿自己业务数据复测。"
⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)
▍基础 6 题
基础1 困惑度 PPL 是越高越好还是越低越好?
解析 越低越好 ,说明模型对下一个词越不意外、语言越熟练。
基础2 MMLU 考的是什么?
解析 57 个学科的综合知识 ,相当于模型的"全科高考",测知识面广度。
基础3 GSM8K 主要考什么能力?
解析 数学推理 ,8000 道小学数学应用题,看模型能不能一步步算对。
基础4 HumanEval 是测什么的?
解析 代码能力 ,让模型写函数补全,跑通单元测试就算过。
基础5 Chatbot Arena 的 Elo 分怎么来的?
解析 真人盲测两两投票 ,不知道模型名字,选哪个回答好,赢了涨 Elo、输了跌。
基础6 RAGAS 是测哪类系统的?
解析 RAG(检索增强生成)系统 ,重点看有没有瞎编(忠实度)和有没有答非所问(相关性)。
▍中档 5 题
中档7 为什么 BLEU/ROUGE 在大模型时代用得少了?
解析 它们靠 n-gram 重叠计分,意思对了但换了说法就被打低分 ,没法反映意译、改写质量。被 LLM-as-judge 和真人盲测取代。
中档8 什么叫"刷榜"?
解析 把测试集题目混进训练数据,模型"做过这套卷子",跑分高但没真本事。对策是用持续更新、题目不公开的榜单。
中档9 MMMU 和 MMLU 的关键区别?
解析 MMLU 纯文字选择题;MMMU 要同时看懂图片和文字 联合推理,是多模态模型的考试。
中档10 为什么说"跑分高不等于好用"?
解析 基准只测"会不会做",不测"做得舒不舒服"——长文本稳定性、指令遵循、风格、拒答策略、幻觉率都不在卷子里。
中档11 RAGAS 的"忠实度"(Faithfulness)测的是什么?
解析 模型给出的答案,是不是每句话都能在检索到的资料里找到依据 。忠实度低就是在瞎编。
▍拔高 5 题
拔高12 困惑度在训练集上很低、测试集上很高,说明什么?
解析 过拟合 :模型背下了训练数据,但没学会语言的通用规律,换没见过的句子就一脸懵。需要加正则、扩数据、减模型规模。
拔高13 为什么 LiveBench、Arena 这种"题目持续更新"的榜单更可信?
解析 一旦题目公开就可能被爬进训练集。持续换新题、不公开题库,让厂商没法提前见过,分数才反映真实泛化能力。
拔高14 o1/o3 这类推理模型为什么在传统基准上不一定最高?
解析 它们优化的是"花更多思考时间做难题",在简单选择题上反而可能因为过度思考出错。真正拉开差距的是竞赛数学、代码调试这类硬推理题。
拔高15 选型时为什么要把"推理成本"和"跑分"放一起看?
解析 跑分高的模型往往更慢更贵。如果业务是高频低难度场景(比如意图分类),用便宜 100 倍的小模型性价比高得多。选型 = 能力 × 成本 × 延迟的综合权衡。
拔高16 什么是"LLM-as-judge"?它和真人评测比有什么优缺点?
解析 用一个强模型(如 GPT-4)当裁判给其他模型的输出打分。优点:便宜、快、可批量;缺点:裁判模型有自己的偏好和盲区,会偏袒跟自己风格像的输出,不能完全替代真人。
⑪ 记忆口诀 + 7 天复习计划
三句口诀
① PPL 越低越熟练,基准分科看本事,Arena 真人最实在。
② MMLU 考面广,GSM8K 考数学,HumanEval 考代码,MMMU 考多模态。
③ 跑分是门槛不是答案,永远拿自己业务数据复测。
天 任务 自检
第 1 天 读②③,画四层评估金字塔 说清四层各考什么
第 2 天 读④,背四大基准用途 四个基准不串
第 3 天 读⑤⑥,记跑分三陷阱 能讲刷榜原理
第 4 天 背知识点卡 + 基础 1-6 基础全对
第 5 天 做中档 7-11 + 真题 4 题 限时每题 2 分钟
第 6-7 天 做拔高 12-16,合上书口述评估体系 不看资料全说对
📌 知识链路
本节位置
学会用 MMLU/GSM8K/Elo 这些尺子衡量 模型,而不是凭感觉说"这个聪明"。