AI 新技术 · 第 8 章
模型评测:MMLU-Pro、Arena Hard,以及"分数高就一定强吗"
厂商都说自己的模型"世界第一",到底谁说了算?模型评测(Eval)就是给 AI 考试:出一套标准题,看谁分高。但这行水很深——会刷题的模型不等于会干活,榜单能刷、能过拟合。这一课教你怎么看评测、怎么不被营销话术带偏。
⓪ 本章怎么学(约 40 分钟)
1为什么评测(8 分钟)
读①:跑分 ≠ 好用。
2概念表(10 分钟)
读②:榜单、LLM-as-judge。
3看例子+防坑(12 分钟)
读③④,记过拟合榜单。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清 MMLU-Pro 和 Arena Hard 考什么、LLM-as-judge 为什么要人工抽检、什么是过拟合榜单、以及怎么交叉验证厂商宣传。
① 一句话搞懂:为什么要评测
买手机看跑分,选模型也看"跑分"。但跑分只代表它在那类题上强,不代表它在你的真实业务里好用。
| 评测类型 | 考什么 | 代表榜单 |
| 知识/推理 | 各学科选择题、推理题 | MMLU、MMLU-Pro |
| 综合对话 | 让人和模型盲测、两两PK | LMSYS Chatbot Arena、Arena Hard |
| 编程 | 真实修 bug、写代码 | SWE-bench、HumanEval |
| 长上下文 | 超长文档里找针 | LongBench、大海捞针测试 |
核心直觉没有单一"总分"能概括一个模型。要按你要用的能力选对应榜单:做编程看 SWE-bench,写文案看人类偏好榜。
② 关键概念表
| 名词 | 大白话 |
| MMLU-Pro | 升级版学科知识考,题更难、更像多选,防死记硬背 |
| Arena Hard | 精选难题,两模型匿名 PK,真人投票谁更好 |
| Human Eval | 让人实际试用、按体验打分 |
| LLM-as-judge | 用一个强模型当裁判,给另一个模型的回答打分 |
| 过拟合榜单 | 模型专门"背"考题,分数虚高,换题就露馅 |
为什么 LLM-as-judge 又快又要小心
让人一道道打分太贵太慢,于是用 GPT-4 这类强模型当裁判自动打分。它便宜快,但它自己也有偏好(爱长篇、爱自己风格),所以重要结论仍要抽一部分真人核对。
③ 三个例子
例 1 · MMLU-Pro 考的是什么
一道多选专业题,涵盖大学数理化生、法律、医学。
它测的是知识面和推理深度,不是闲聊能力。分高说明"读的书多、想得清楚",不代表客服话术好。
例 2 · Arena 盲测怎么比
用户拿到两个匿名回答,不知道来自哪个模型。
选"哪个更好"。成千上万次投票汇总出人类偏好排名,这比冷冰冰的选择题更接近真实体验。
例 3 · 过拟合榜单翻车
某模型在某公开题库刷到 90 分。
换成一套没见过的新题,立刻掉到 60 分——它是背答案,不是真懂。所以新题榜、私有测试集才靠谱。
④ 防坑提醒
坑 1:只看一个总榜就下单总榜是平均,可能偏科严重。做编程要看 SWE-bench,做中文写作要看中文榜,别拿知识榜当万能指标。
坑 2:迷信"我们模型排第一"榜单可能被污染(训练数据里包含考题),也可能挑对自己有利的榜宣传。多榜交叉 + 自己的真实任务测一遍最稳。
坑 3:把 LLM-as-judge 当绝对真理自动打分快但有偏差,关键场景要人工抽检。它是"初筛工具",不是"终审法官"。
⑤ 折叠自测(点开即答)
基础1MMLU-Pro 和 Arena Hard 分别考什么?
MMLU-Pro 考各学科知识与推理(标准化选择题);Arena Hard 考人类偏好下的综合对话质量(两模型匿名 PK、真人投票)。
中档2LLM-as-judge 是什么?为什么还要人抽检?
用强模型当自动裁判给回答打分,便宜快;但它有自己的偏好(爱长篇、爱特定风格),所以重要结论要抽一部分真人复核。
拔高3"过拟合榜单"是什么意思,怎么防?
模型在公开考题上背答案,分数虚高、换新题就露馅。防法:用新题/私有测试集、多榜交叉、并在你自己的真实任务上跑一遍。
⑥ 费曼三问(合上讲,自己讲给自己听)
用大白话回答,讲不顺就是没懂
问 1:为什么不能只看一个"总分榜"就选模型?
问 2:Arena 盲测比客观选择题更接近真实体验,为什么?
问 3:厂商说"我们排第一",你该怎么交叉验证?
MMLU-Pro:学科知识与推理的硬考 升级版选择题
Arena Hard:匿名 PK + 真人偏好投票 更像真实体验
SWE-bench:真实修 bug 的编程考 别只看总分
LLM-as-judge:强模型当裁判,便宜但有偏 要人抽检
过拟合榜单:背题分数虚高 新题/私有集验证
🛠 实战场景:怎么挑模型不被忽悠
| 情况 | 做法 | 原因 |
| 主要做编程 | 看 SWE-bench 类榜 | 别用知识榜评判 |
| 主要做中文文案 | 看中文偏好榜 | 英文高分不代表中文好 |
| 只看官方宣传的一个榜 | 警惕 | 可能挑对自己有利的 |
| 要上生产 | 自己真实任务测 | 榜单≠你的场景 |
| 用 LLM-as-judge 打分 | 抽人复核 | 自动裁判有偏差 |
经验法则:按用途选榜、多榜交叉、最后用自己的真实任务跑一遍,再付钱。
🧪 生活联想
1高考
榜单像高考分数,能筛人但不等于工作能力。
2押题
过拟合榜单像考前押中原题,分高但不是真本事。
3试用期
你自己的真实任务测试,就是给它"试用期"。
对照自己选型时别只看官方宣传的那个榜,多找几个独立榜,并在你自己的真实任务上跑一遍再决定。
📖 名词速查
| 名词 | 大白话 |
| MMLU-Pro | 升级版学科知识与推理考 |
| Arena Hard | 匿名 PK + 真人偏好投票 |
| SWE-bench | 真实修 bug 的编程考 |
| HumanEval | 基础函数生成题 |
| LLM-as-judge | 用强模型当裁判自动打分 |
| 过拟合榜单 | 背题刷分,换新题就露馅 |
⚡ 高频 FAQ
问:榜单第一就一定最好吗?不一定。它可能只在那个榜强,或污染了训练数据。多榜交叉 + 自己测最稳。
问:LLM-as-judge 能完全替代人吗?不能。它便宜快但有偏好,关键场景要人工抽检。
问:怎么判断厂商在挑榜宣传?看它是不是只拿对自己有利的那一个榜说事;要求看同条件下多个独立榜的对比。
🔁 5 天复习计划
| 天 | 任务 | 自检 |
| 第 1 天 | 读①②,理清评测类型 | 说清 MMLU vs Arena |
| 第 2 天 | 读③④,跟一遍三个例子 | 讲清过拟合榜单 |
| 第 3 天 | 做⑤折叠自测 | 三题全对 |
| 第 4 天 | 读⑥费曼三问,不看资料讲 | 能举例 |
| 第 5 天 | 名词速查 + 口诀默写 | 脱稿说清怎么交叉验证 |
三句口诀① 没有万能总分榜,按能力选;② Arena 比选择更像真实体验;③ 过拟合榜单靠新题和自测拆穿。
📌 知识链路
前置知识先懂前面各章模型都有什么能力,再看怎么客观衡量它们。
本节位置AI 新技术线的收尾:学会不被营销带偏,理性选型。
下一步回到 AI 基础总览,按自己的方向深入下一个板块。