Home
avatar

.Sam

【LLM测评-02】MMLU:当一场考试被考到“饱和”

这是“LLM测评”系列的第 2 篇。上一篇我们学会了怎么读跑分表,这一篇解剖一个最有名的基准 MMLU,以及一个所有基准都逃不过的宿命:饱和。

摘要

本文回答三个问题:MMLU 到底在考什么、为什么它曾是“通用能力”的代名词、以及“饱和”是什么意思、对读榜有什么影响。

核心论点:一个基准的区分度会随时间衰减。 MMLU 从 2021 年的新基准,到 2026 年头部模型普遍 90%+,已经从“考场”变成了“地板检查”——它还能确认模型没退步,但再也测不出谁更强。

什么是 MMLU

MMLU(Massive Multitask Language Understanding,大规模多任务语言理解)是 2021 年提出的基准,一度是大模型评测的“默认开场白”。

它像一场覆盖超广的“文综考试”:57 个学科、约 1.4 万道四选一题目,从物理化学到法律历史,从会计到医学伦理,横跨 STEM、人文社科和专业领域三大板块。

图1:MMLU 在考什么——57 个学科分三大板块:STEM 理工约 21 个学科、人文社科约 21 个学科、专业领域约 15 个学科;四选一,答对比例即分数,蒙也有 25% 底分。

为什么它曾经很重要? 因为在大模型能力普遍较弱的年代,“四选一”是一个足够标准化、可自动评分的测量方式:不需要人工评判,跑起来便宜,结果可复现。它第一次让“这个模型知识面更广”这件事有了可比较的数字。

从考场到“地板检查”

但任何考试都逃不过一个命运:题目和答案一旦公开,就会慢慢失去区分能力。

模型不是变聪明了才考高分——训练数据里可能就包含了题目本身。更普遍的原因是:当所有头部模型都掌握了这些知识,分数就全部挤在 90% 上方。

这就是“饱和”(saturation):一个基准的分数分布越来越挤向顶部,头部模型之间差的那 2-3 分,已经小于测量噪声本身。

图2:MMLU 饱和示意——2021 到 2026 年头部模型分数从约 65% 爬升到 90% 以上并趋平,进入“饱和区”:头部集中在上方,差 2-3 分可能只是噪声。趋势为示意,非精确年度数据。

2026 年的现实是:头部模型在 MMLU 上普遍超过 90%,这个基准已经很难再告诉你“谁更强”。它还保有的用途是“地板检查”——如果一个模型连 MMLU 都考不到 80%,说明它的知识基础有明显问题;但考到 92% 还是 94%,对选型几乎没有意义。

饱和了怎么办:两个方向

基准社区应对饱和有两条路:

  1. 加难:把题目做得更难、更反“背诵”。MMLU 的继任者 MMLU-Pro 把选项从 4 个加到 10 个、去掉琐碎题、更侧重推理,分数天然比原版低 16-33 个百分点——重新拉开差距。
  2. 换赛道:转去测选择题测不到的东西——推理过程、多步操作、真实任务。这就是后面几篇的主角们(GPQA、SWE-bench、τ²-bench 等)。

对读榜人的启示:看到一个基准名字,先问一句“这个考试现在还活着吗?” 一个 2021 年的基准上 95% 和 96% 的差别,不值得作为选型依据。

一个实际的读榜例子

假设两份选型报告:

  • 报告 A:“模型 X 在 MMLU 上 95.2%,比模型 Y 高 1.8 个百分点。”
  • 报告 B:“模型 X 在 MMLU-Pro 上 78.4%,比模型 Y 高 6.2 个百分点;在 SWE-bench Verified 上 62%,比 Y 高 9 个百分点。”

报告 A 的数字“正确”但基本无用——95% 附近 1.8 分可能在噪声范围内。报告 B 更接近有用的选型信息:它用更难的基准拉开了差距,并且覆盖了不止一个能力维度。

实战:GPT-6 Astra 的跑分表里,已经没有 MMLU 了

2026 年 9 月 GPT-6 Astra 发布,官方跑分表是观察“基准饱和与更替”最鲜活的一手样本:

  • MMLU 完全缺席。官方这次主推的是 MMMU-Pro(多模态)、GPQA Diamond(科学推理)、FrontierMath Tier 4(研究级数学)——饱和基准从“卖点”变成了“不提也罢”。
  • MMMU-Pro 87%:Artificial Analysis 独立评测中 Astra 拿下的最高分。注意这已不是 57 学科四选一的原版 MMLU,而是选项更多、更侧重多模态推理的继任者。
  • GPQA Diamond 96.0%FrontierMath Tier 4 97.6%:官方口径下双双接近饱和线——新一代模型正在把“继任者”也迅速考饱和。

图3:饱和的实锤——GPT-6 Astra 官方跑分表已不列 MMLU,主推 MMMU-Pro 87%、GPQA Diamond 96.0%、FrontierMath Tier 4 97.6%。(MMMU-Pro 为 Artificial Analysis 口径,其余为 OpenAI 官方口径)

这张图说明“饱和”不是一个理论概念,而是正在发生的市场行为:

  1. 厂商最清楚哪个基准还活着。 一个基准如果测不出差距,就不会出现在发布会跑分表上——因为它没有宣传价值。MMLU 从 2021 年的“默认开场白”到 2026 年官方跑分表绝迹,只用了五年。
  2. 饱和会传染。 Astra 在 GPQA Diamond 拿 96%、FrontierMath Tier 4 拿 97.6%,说明这两个“继任者”也已进入饱和前夜——它们的存续期可能更短。基准社区必须不断“加难”,或者转向选择题测不到的真实任务赛道(这正是本系列 04-06 篇的主角)。
  3. 读榜要跟着“官方焦点”走,但不能只跟。 官方把 MMMU-Pro 放进来,说明这是当前有区分度的测量;但正如第 1 篇讲的,官方口径也要用五项配置核对。饱和是一场接力赛:老卷子作废,新卷子上场,然后新卷子再作废。

对读榜人的即时行动:如果一份选型报告还在用“MMLU 92% vs 94%”当核心论据,这份报告的可信度要打个问号;真正有信息量的是“MMMU-Pro / GPQA / FrontierMath / SWE-bench 这类仍在区分期的基准上的差距”。

小结

  • MMLU 是 57 学科的四选一知识考试,曾是最通用的能力标尺。
  • 饱和是基准的必然宿命:分数挤向顶部,区分度消失。
  • 2026 年的 MMLU 只适合做“地板检查”,读榜要转向更难、更抗污染的基准。

下一篇,我们进入推理赛道:GPQA 为什么敢说自己是“考不倒的博士题”?AI 的高分到底是会推理,还是背得多?

一个考试考到人人满分,就该换一张卷子了。

LLM测评 Benchmark MMLU 科普 饱和