← 第2课 · 模型类型 首页 / 算法与AI / AI 基础入门 / 第3课 · 评分系统
AI 基础入门 · 第3课

评分系统:怎么知道一个模型到底好不好

模型 A 跑分 85,模型 B 跑分 82,是不是 A 一定比 B 好用?不一定。这一课讲清楚大模型世界的"考试体系":从最底层的困惑度,到中考级别的MMLU/GSM8K/HumanEval,再到高考级别的Chatbot Arena 真人盲测,以及应用层的 RAGAS。最后泼一盆冷水——跑分高不等于好用,刷榜、过拟合、和真实体验脱节,这些坑你必须认识。

① 小白第一课怎么学(4 步走,约 55 分钟)

这一课要记住的是"考什么试",不是公式推导。把每个评测当成一门学科就好。

1建立直觉(10 分钟)
读③:模型评估=考试,不同考试考不同能力。
2理清四层考试体系(20 分钟)
读④⑤:困惑度→学科基准→真人盲测→应用层。
3认识跑分陷阱(10 分钟)
读⑥⑦:别被榜单忽悠。
4刷题自测(15 分钟)
做⑦⑩,错题回⑥。
本课小目标学完你要能:① 说清困惑度怎么读(越低越好);② 说出 MMLU/GSM8K/HumanEval/MMMU 各自考什么;③ 解释为什么 Chatbot Arena 的真人投票比纯跑分更可信;④ 列出至少 3 个跑分陷阱。

② 一图看懂:模型评估的四层金字塔

第4层 真人盲测 第3层 学科基准 Benchmark MMLU · GSM8K · HumanEval · MMMU 第2层 应用层评估 RAGAS 忠实度 · 相关性 · 上下文召回 第1层 内部指标:困惑度 Perplexity 越低越好,训练时盯着它 越往上 越接近真实 用户体验 越贵越慢 老前辈:BLEU(翻译)、ROUGE(摘要)——现在用得少了,被 LLM-as-judge 和真人盲测取代
读法:从下往上读。底层困惑度是训练时的"体温",告诉你模型学没学会语言;中间基准是分科考试,看模型各科成绩;顶上真人盲测是"用户满意度调查",最接近真实体验。越往上越接近"好不好用",但也越贵越慢。

③ 本质直觉:评估就是"给模型安排一场考试"

先想一个比喻:你要招一个翻译,怎么知道他水平?

你会先测他母语读得顺不顺(困惑度:对语言有多熟),再让他做各科卷子(基准:MMLU 考常识、GSM8K 考数学),再让他跟老外真实聊半小时(真人盲测),最后把他扔进真实项目里试用(应用层 RAGAS)。

困惑度(Perplexity, PPL)是最底层的指标。它的直觉是:给模型一句话,它预测下一个词有多"意外"。如果模型看到"今天天气真___",它觉得"好"概率 80%、"热"概率 15%,它就很不意外,PPL 低;如果它一脸懵、把概率均匀撒给一万个词,PPL 就飙高。PPL 越低,说明模型对语言越熟练。

但 PPL 低不代表好用。一个把训练集背得滚瓜烂熟的模型 PPL 极低,可它啥新东西也不会。所以必须往上走,用"没见过的题"考它——这就是 Benchmark。

PPL = 模型对下一个词的意外度 "今天天气真___" "好" 80% "热" 15% 其他 5% → 很确定,PPL 低(好) 如果概率均匀撒给 1 万个词 → 一脸懵,PPL 高(差)
记住一个反直觉的事实困惑度是在测试集上算的,不是训练集。如果模型在训练集上 PPL 很低、在测试集上 PPL 飙升,说明它背答案去了——这就是过拟合,后面讲。

④ 完整体系:四大基准 + 竞技场 + 应用层

四大"学科考试"基准

基准考什么一句话理解满分/读法
MMLU57 个学科的综合知识(从初中数学到大学法律)模型的"全科高考",测知识面广度百分比,越高越好
GSM8K8000 道小学数学应用题测模型能不能一步步推理算算术百分比,越高越好
HumanEval手写函数题,让模型补全代码并跑通测试测模型"写代码能不能一次过"pass@1,越高越好
MMMU多学科多模态题,要同时看懂图和文字测多模态模型"看图+读题"联合推理百分比,越高越好

Chatbot Arena:真人盲测的 Elo 排行榜

光做卷子不够,因为卷子会被"刷"。于是 LMSYS 搞了个 Chatbot Arena:让真人在不知道模型名字的情况下,把两个模型对同一问题的回答放在一起,投票选哪个更好。每赢一次,模型的 Elo 分(跟国际象棋一个算法)就涨一点,输了就跌。最后排出总榜。

为什么 Elo 排名比跑分更可信① 题目没公开,没法刷题;② 真人主观判断覆盖了"回答像不像人话""有没有废话"这些试卷测不出来的维度;③ 两两比较比打分更稳——人打分容易飘,但"二选一"很准。

RAGAS:RAG 系统的应用层体检

当你用 RAG(检索增强生成,后面第6课讲)搭了一个"公司知识问答机器人",光问它 MMLU 多少分没用——你关心的是它有没有瞎编、有没有答非所问。RAGAS 就是干这个的:

指标测什么
Faithfulness 忠实度模型说的话,是不是都能在检索到的资料里找到依据?有没有瞎编?
Answer Relevancy 回答相关性模型答的题,是不是真的在回答用户问的?有没有跑题?
Context Recall 上下文召回该找的资料都找来了吗?有没有漏掉关键文档?
Context Precision 上下文精度找来的资料里,混进来多少没用的垃圾?

老前辈:BLEU 和 ROUGE

在大模型之前,机器翻译用 BLEU,文本摘要用 ROUGE。它们的思路很笨:把模型输出跟"标准答案"做 n-gram 重叠计数,重叠越多分越高。问题是:意思对了但用词不一样,分就低。比如标准答案是"我喜欢猫",模型说"猫咪很讨我喜欢",BLEU 会给低分,但人觉得翻译得很好。所以现在这些老指标主要在工业界小任务里还在用,前沿评测已经基本换成真人盲测和 LLM-as-judge 了。

⑤ 跑分的三大陷阱(重点)

陷阱 1:刷榜(Benchmark Overfitting)
厂商把测试题混进训练集,模型"做过这套卷子"。
比如某模型 MMLU 90 分,但你问它一个 MMLU 里没见过的冷门知识,它立刻露馅。对策:看 LiveBench、Arena 这种题目持续更新、不公开的榜单。
陷阱 2:公开测试集被污染
GSM8K、HumanEval 这些题已经被互联网爬了几百万遍,训练数据里大概率有原题。
模型不是"会做数学题",是"见过这道题"。对策:看厂商用新出的、没公开过的测试集的成绩,比如最新版 MMMU-Pro。
陷阱 3:跑分和真实体验脱节
某模型 MMLU 比另一个高 3 分,但你用起来觉得它更啰嗦、更爱幻觉、写代码更容易崩。
基准只测"会不会做",不测"做得舒不舒服"。长文本稳定性、指令遵循、风格控制、拒答策略——这些都要靠真人试用才知道。对策:小流量灰度试用一周,比看任何榜单都准。
一句话总结跑分是入门门槛(连门都没进的不要),不是录用通知。真正选型时,永远拿自己的真实业务数据跑一遍。

⑥ 高频错误诊断(5 条)

错误 1:以为 PPL 越低越好,越低越强PPL 低只说明模型对语言熟练,不代表它会推理、会写代码、会看图。一个把维基百科全背下来的模型 PPL 极低,但它可能完全不会做数学。
错误 2:把 MMLU 90 分等同于"什么都懂"MMLU 是选择题,四选一有 25% 蒙对概率。而且它测的是"知识面宽度",不是"深度推理"。o1/o3 这类推理模型 MMLU 不一定最高,但做难题强得多。
错误 3:拿 BLEU 分评价今天的大模型翻译BLEU 对意译极其不友好,今天的 GPT/Claude 翻译在 BLEU 上可能不如十年前的系统,但人用起来好太多。
错误 4:以为 Elo 分高就一定适合自己Arena 是"通用闲聊"排名,你要是专门做法律文书或医疗问答,可能排名靠后的模型反而更合适——领域微调过。
错误 5:忽略"推理成本"这个维度跑分高的模型往往推理慢、贵。一个 MMLU 85 但每千 token 0.001 美元的开源模型,可能比 MMLU 90 但贵 100 倍的闭源模型更适合你的业务。

⑦ 考点真题演练(4 题)

考点分布

考法出题形式应对
PPL 方向问越高越好还是越低越好越低越好
基准用途给任务选基准数学→GSM8K,代码→HumanEval
Arena 机制问 Elo 怎么来的真人两两盲测投票
跑分陷阱问哪个是过拟合测试题进训练集

真题基础1. 关于困惑度 Perplexity(PPL),下面哪个说法对?

真题中档2. 你想知道一个模型"数学推理能力"如何,应该看哪个基准?

真题中档3. Chatbot Arena 的 Elo 分数是怎么算出来的?

真题拔高4. 某模型 MMLU 分数极高,但在实际业务中表现很差,最不可能的原因是?

⑧ 必背知识点卡

PPL:困惑度,越低越好 = 对下一个词越不意外 训练时盯着它
MMLU:57 学科综合知识高考 考知识面广度
GSM8K:小学数学应用题 考数学推理
HumanEval:写代码跑测试 考代码能力
MMMU:多模态多学科 考图文联合推理
Arena Elo:真人盲测两两投票 最接近真实体验
RAGAS:RAG 专用,忠实度/相关性/召回 应用层体检
BLEU/ROUGE:老前辈,重叠计数 现在用得少
跑分三坑:刷榜、测试集污染、和真实体验脱节 永远用自己数据复测

⑨ 应用输出:帮老板解读模型榜单

实战场景:老板甩来一张榜单说"咱们换第1名这个模型吧"
① 先看榜单是什么:是 MMLU 这种学科考试,还是 Arena 真人盲测?前者可能刷榜,后者相对干净。
② 再看跟业务对不对口:咱们是做客服问答,不是做数学奥赛,GSM8K 高 5 分对我们没意义。
③ 算总成本:新模型贵 3 倍、慢 2 倍,但我们的问答量一天十万次,一个月多花几十万值不值?
④ 给建议:别光看榜,拿过去 1000 条真实客服对话,让两个模型都答一遍,人工评 A/B,两周后再决定。
口述全链路"模型评估分四层:底层困惑度看语言熟不熟,中层基准看各科成绩,上层 Arena 真人盲测最接近体验,应用层 RAGAS 看 RAG 系统有没有瞎编。跑分是门槛不是答案,永远要拿自己业务数据复测。"

⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)

▍基础 6 题

基础1困惑度 PPL 是越高越好还是越低越好?
越低越好,说明模型对下一个词越不意外、语言越熟练。
基础2MMLU 考的是什么?
57 个学科的综合知识,相当于模型的"全科高考",测知识面广度。
基础3GSM8K 主要考什么能力?
数学推理,8000 道小学数学应用题,看模型能不能一步步算对。
基础4HumanEval 是测什么的?
代码能力,让模型写函数补全,跑通单元测试就算过。
基础5Chatbot Arena 的 Elo 分怎么来的?
真人盲测两两投票,不知道模型名字,选哪个回答好,赢了涨 Elo、输了跌。
基础6RAGAS 是测哪类系统的?
RAG(检索增强生成)系统,重点看有没有瞎编(忠实度)和有没有答非所问(相关性)。

▍中档 5 题

中档7为什么 BLEU/ROUGE 在大模型时代用得少了?
它们靠 n-gram 重叠计分,意思对了但换了说法就被打低分,没法反映意译、改写质量。被 LLM-as-judge 和真人盲测取代。
中档8什么叫"刷榜"?
把测试集题目混进训练数据,模型"做过这套卷子",跑分高但没真本事。对策是用持续更新、题目不公开的榜单。
中档9MMMU 和 MMLU 的关键区别?
MMLU 纯文字选择题;MMMU 要同时看懂图片和文字联合推理,是多模态模型的考试。
中档10为什么说"跑分高不等于好用"?
基准只测"会不会做",不测"做得舒不舒服"——长文本稳定性、指令遵循、风格、拒答策略、幻觉率都不在卷子里。
中档11RAGAS 的"忠实度"(Faithfulness)测的是什么?
模型给出的答案,是不是每句话都能在检索到的资料里找到依据。忠实度低就是在瞎编。

▍拔高 5 题

拔高12困惑度在训练集上很低、测试集上很高,说明什么?
过拟合:模型背下了训练数据,但没学会语言的通用规律,换没见过的句子就一脸懵。需要加正则、扩数据、减模型规模。
拔高13为什么 LiveBench、Arena 这种"题目持续更新"的榜单更可信?
一旦题目公开就可能被爬进训练集。持续换新题、不公开题库,让厂商没法提前见过,分数才反映真实泛化能力。
拔高14o1/o3 这类推理模型为什么在传统基准上不一定最高?
它们优化的是"花更多思考时间做难题",在简单选择题上反而可能因为过度思考出错。真正拉开差距的是竞赛数学、代码调试这类硬推理题。
拔高15选型时为什么要把"推理成本"和"跑分"放一起看?
跑分高的模型往往更慢更贵。如果业务是高频低难度场景(比如意图分类),用便宜 100 倍的小模型性价比高得多。选型 = 能力 × 成本 × 延迟的综合权衡。
拔高16什么是"LLM-as-judge"?它和真人评测比有什么优缺点?
用一个强模型(如 GPT-4)当裁判给其他模型的输出打分。优点:便宜、快、可批量;缺点:裁判模型有自己的偏好和盲区,会偏袒跟自己风格像的输出,不能完全替代真人。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① PPL 越低越熟练,基准分科看本事,Arena 真人最实在。
② MMLU 考面广,GSM8K 考数学,HumanEval 考代码,MMMU 考多模态。
③ 跑分是门槛不是答案,永远拿自己业务数据复测。
天任务自检
第 1 天读②③,画四层评估金字塔说清四层各考什么
第 2 天读④,背四大基准用途四个基准不串
第 3 天读⑤⑥,记跑分三陷阱能讲刷榜原理
第 4 天背知识点卡 + 基础 1-6基础全对
第 5 天做中档 7-11 + 真题 4 题限时每题 2 分钟
第 6-7 天做拔高 12-16,合上书口述评估体系不看资料全说对

📌 知识链路

前置知识(先学) · 第2课 · 模型类型:先知道在评的是哪一类模型。
本节位置 学会用 MMLU/GSM8K/Elo 这些尺子衡量模型,而不是凭感觉说"这个聪明"。
下一步(学完去) · 第4课 · 主流模型:拿着榜单去看真实的明星选手。
← 第2课 · 模型类型 算法与AI总览