← 返回 AI 基础 首页 / 算法与AI / AI 新技术 · 模型评测
AI 新技术 · 第 8 章

模型评测:MMLU-Pro、Arena Hard,以及"分数高就一定强吗"

厂商都说自己的模型"世界第一",到底谁说了算?模型评测(Eval)就是给 AI 考试:出一套标准题,看谁分高。但这行水很深——会刷题的模型不等于会干活,榜单能刷、能过拟合。这一课教你怎么看评测、怎么不被营销话术带偏。

⓪ 本章怎么学(约 40 分钟)

1为什么评测(8 分钟)
读①:跑分 ≠ 好用。
2概念表(10 分钟)
读②:榜单、LLM-as-judge。
3看例子+防坑(12 分钟)
读③④,记过拟合榜单。
4自测+复述(10 分钟)
做⑤⑥,费曼三问讲一遍。
本章小目标学完你要能:说清 MMLU-Pro 和 Arena Hard 考什么、LLM-as-judge 为什么要人工抽检、什么是过拟合榜单、以及怎么交叉验证厂商宣传。

① 一句话搞懂:为什么要评测

买手机看跑分,选模型也看"跑分"。但跑分只代表它在那类题上强,不代表它在你的真实业务里好用。

评测类型考什么代表榜单
知识/推理各学科选择题、推理题MMLU、MMLU-Pro
综合对话让人和模型盲测、两两PKLMSYS Chatbot Arena、Arena Hard
编程真实修 bug、写代码SWE-bench、HumanEval
长上下文超长文档里找针LongBench、大海捞针测试
核心直觉没有单一"总分"能概括一个模型。要按你要用的能力选对应榜单:做编程看 SWE-bench,写文案看人类偏好榜。

② 关键概念表

名词大白话
MMLU-Pro升级版学科知识考,题更难、更像多选,防死记硬背
Arena Hard精选难题,两模型匿名 PK,真人投票谁更好
Human Eval让人实际试用、按体验打分
LLM-as-judge用一个强模型当裁判,给另一个模型的回答打分
过拟合榜单模型专门"背"考题,分数虚高,换题就露馅

为什么 LLM-as-judge 又快又要小心

让人一道道打分太贵太慢,于是用 GPT-4 这类强模型当裁判自动打分。它便宜快,但它自己也有偏好(爱长篇、爱自己风格),所以重要结论仍要抽一部分真人核对。

③ 三个例子

例 1 · MMLU-Pro 考的是什么
一道多选专业题,涵盖大学数理化生、法律、医学。
它测的是知识面和推理深度,不是闲聊能力。分高说明"读的书多、想得清楚",不代表客服话术好。
例 2 · Arena 盲测怎么比
用户拿到两个匿名回答,不知道来自哪个模型。
选"哪个更好"。成千上万次投票汇总出人类偏好排名,这比冷冰冰的选择题更接近真实体验。
例 3 · 过拟合榜单翻车
某模型在某公开题库刷到 90 分。
换成一套没见过的新题,立刻掉到 60 分——它是背答案,不是真懂。所以新题榜、私有测试集才靠谱。

④ 防坑提醒

坑 1:只看一个总榜就下单总榜是平均,可能偏科严重。做编程要看 SWE-bench,做中文写作要看中文榜,别拿知识榜当万能指标。
坑 2:迷信"我们模型排第一"榜单可能被污染(训练数据里包含考题),也可能挑对自己有利的榜宣传。多榜交叉 + 自己的真实任务测一遍最稳。
坑 3:把 LLM-as-judge 当绝对真理自动打分快但有偏差,关键场景要人工抽检。它是"初筛工具",不是"终审法官"。

⑤ 折叠自测(点开即答)

基础1MMLU-Pro 和 Arena Hard 分别考什么?
MMLU-Pro 考各学科知识与推理(标准化选择题);Arena Hard 考人类偏好下的综合对话质量(两模型匿名 PK、真人投票)。
中档2LLM-as-judge 是什么?为什么还要人抽检?
用强模型当自动裁判给回答打分,便宜快;但它有自己的偏好(爱长篇、爱特定风格),所以重要结论要抽一部分真人复核。
拔高3"过拟合榜单"是什么意思,怎么防?
模型在公开考题上背答案,分数虚高、换新题就露馅。防法:用新题/私有测试集、多榜交叉、并在你自己的真实任务上跑一遍。

⑥ 费曼三问(合上讲,自己讲给自己听)

用大白话回答,讲不顺就是没懂
问 1:为什么不能只看一个"总分榜"就选模型?
问 2:Arena 盲测比客观选择题更接近真实体验,为什么?
问 3:厂商说"我们排第一",你该怎么交叉验证?
MMLU-Pro:学科知识与推理的硬考 升级版选择题
Arena Hard:匿名 PK + 真人偏好投票 更像真实体验
SWE-bench:真实修 bug 的编程考 别只看总分
LLM-as-judge:强模型当裁判,便宜但有偏 要人抽检
过拟合榜单:背题分数虚高 新题/私有集验证

🛠 实战场景:怎么挑模型不被忽悠

情况做法原因
主要做编程看 SWE-bench 类榜别用知识榜评判
主要做中文文案看中文偏好榜英文高分不代表中文好
只看官方宣传的一个榜警惕可能挑对自己有利的
要上生产自己真实任务测榜单≠你的场景
用 LLM-as-judge 打分抽人复核自动裁判有偏差

经验法则:按用途选榜、多榜交叉、最后用自己的真实任务跑一遍,再付钱。

🧪 生活联想

1高考
榜单像高考分数,能筛人但不等于工作能力。
2押题
过拟合榜单像考前押中原题,分高但不是真本事。
3试用期
你自己的真实任务测试,就是给它"试用期"。
对照自己选型时别只看官方宣传的那个榜,多找几个独立榜,并在你自己的真实任务上跑一遍再决定。

📖 名词速查

名词大白话
MMLU-Pro升级版学科知识与推理考
Arena Hard匿名 PK + 真人偏好投票
SWE-bench真实修 bug 的编程考
HumanEval基础函数生成题
LLM-as-judge用强模型当裁判自动打分
过拟合榜单背题刷分,换新题就露馅

⚡ 高频 FAQ

问:榜单第一就一定最好吗?不一定。它可能只在那个榜强,或污染了训练数据。多榜交叉 + 自己测最稳。
问:LLM-as-judge 能完全替代人吗?不能。它便宜快但有偏好,关键场景要人工抽检。
问:怎么判断厂商在挑榜宣传?看它是不是只拿对自己有利的那一个榜说事;要求看同条件下多个独立榜的对比。

🔁 5 天复习计划

天任务自检
第 1 天读①②,理清评测类型说清 MMLU vs Arena
第 2 天读③④,跟一遍三个例子讲清过拟合榜单
第 3 天做⑤折叠自测三题全对
第 4 天读⑥费曼三问,不看资料讲能举例
第 5 天名词速查 + 口诀默写脱稿说清怎么交叉验证
三句口诀① 没有万能总分榜,按能力选;② Arena 比选择更像真实体验;③ 过拟合榜单靠新题和自测拆穿。

📌 知识链路

前置知识先懂前面各章模型都有什么能力,再看怎么客观衡量它们。
本节位置AI 新技术线的收尾:学会不被营销带偏,理性选型。
下一步回到 AI 基础总览,按自己的方向深入下一个板块。
← 上一章 · 端侧小模型 返回 AI 基础总览