Home
avatar

.Sam

【LLM测评-07】榜单会腐烂:污染、刷分与退役

这是“LLM测评”系列的第 7 篇。前几篇在讲“怎么读分”,这一篇讲“为什么很多分根本不值得读”——基准会腐烂,而且腐烂得比你想象中快。

摘要

本文回答三个问题:一个基准为什么会失效、失效有哪几种机制、以及读榜时怎么判断一个基准“还活着吗”。

核心论点:benchmark 是软件系统,不是数据集。 它会腐化、会被攻破、会过期。用一个已退役的榜做决策,比不看榜更危险。

黄金标准也会过期

2021 年,SWE-bench 刚发布时,被称作“代码评测的黄金标准”:真实仓库、真实 issue、客观测试判定。

2026 年 2 月,它的 Verified 子集(500 个 Python 任务)正式退役。

发生了什么?不是题出错了,而是题被“背下来了”:这些任务和答案在开源社区流传太久,被反复指出泄漏进训练集的嫌疑。当模型可能“见过答案”时,分数就不再是能力的证据。

两年,一个黄金标准就完成了它的生命周期。这就是基准的宿命。

基准的生命周期

几乎所有有影响力的基准都会走完五步:发布 → 被采纳 → 被污染 → 被 exploit → 退役。

图1:基准生命周期五阶段——发布(可信度最高)、被采纳(成为行业惯例)、被污染(答案进入训练集,分数虚高)、被 exploit(评分缺陷被利用)、退役(被新版本替代或作废)。实例:SWE-bench Verified 2026 年 2 月退役。

关键认知:“退役”不是失败,是健康治理。 一个基准能承认自己过时并退出,说明维护它的机构有公信力。真正危险的反而是那些没人维护、悄悄过时、却还在被引用的老榜。

四种失效机制

基准失效不是单一原因,至少有四种机制在起作用:

图2:基准失效的四种机制——数据污染(答案进训练集,案例 SWE-bench Verified 泄漏退役)、评分缺陷(测试用例本身是错的,案例某基准最难档约六成失败任务用例有缺陷)、环境腐化(依赖漂移指令脱节,案例 Terminal-Bench 2.0→2.1 修正 89 个任务中的 28 个)、主动 exploit(弱验证器被绕过,自动化流水线数轮内找出可 hack 任务)。

机制一句话真实案例
数据污染答案进训练集,测的是记忆SWE-bench Verified 泄漏嫌疑,2026 退役
评分缺陷测试用例本身就是错的某基准最难档约六成失败任务用例有缺陷
环境腐化依赖漂移、指令与测试脱节Terminal-Bench 2.0→2.1 修正 28/89 个任务
主动 exploit弱验证器被绕过自动化流水线数轮内找出可 hack 的任务

饱和:另一种“腐烂”

别忘了第 2 篇讲的饱和也是一种失效:分数挤向顶部,区分度消失。

饱和和污染的区别:

  • 污染:模型背了答案,分数虚高,测的是记忆。
  • 饱和:模型真的学会了,但所有人都会,分数不再有意义。

两者都会让基准“退役”,但一个是“作弊”,一个是“毕业”。识别方法也简单:污染会让分数突然跳升,饱和是渐进趋平。

怎么判断一个榜还活着

读任何基准之前,过一遍自查清单:

  • 这个榜最近一次版本更新是什么时候?(超过一年没动过的榜,小心)
  • 有没有污染审计报告?(公开审计过 = 可信度加分)
  • 评分代码开源吗?(不开源 = 无法复现,无法审计)
  • 有没有独立机构维护,还是受益方自管?(中立维护才有动力排查)
  • 头部模型是否已接近满分?(接近满分 = 该退役了)
  • 数据集公开吗?第三方能独立复测吗?(连数据都拿不到 = 分数无法验证)

数据集的公开程度:能不能被独立复测

自查清单最后一条,值得单独展开:一个分数能不能被第三方验证,第一道门槛是数据本身公不公开。

很多人以为”公开基准”都长一个样,其实差别很大。按公开程度,评测数据集大致分五档:

图4:数据集公开程度光谱——完全公开(MMLU、GPQA、SWE-bench、HumanEval,任何人可复测)→ 需申请(OSWorld 2.0 任务公开但环境镜像 gated、GPQA 答案需密码)→ 防污染保密(FrontierMath 338 题仅公开 10 题样例、ARC-AGI-3 竞赛集保密)→ 安全敏感(ExploitBench 开源但内容是真实漏洞利用链)→ 公开性存疑(SRE-Bench GPT-6 版未见官方说明)。结论:可复测性 = 可信度。

档位数据集(官方地址)第三方能否复测
① 完全公开MMLUGPQA DiamondSWE-benchHumanEval✅ 能,谁都能下载重跑
② 需申请/认证OSWorld 2.0(任务在 HF,环境镜像 gated)、GPQA 答案需密码🟡 部分能,走审批
③ 防污染保密FrontierMath(仅 10 题样例)、ARC-AGI-3(竞赛集保密)🔴 基本不能,只有官方口径
④ 安全敏感ExploitBench(真实漏洞利用链)🟣 能,但需安全审查
⑤ 公开性存疑SRE-Bench(GPT-6 报告版,OpenAI 发布页⚪ 未见说明,需查原始报告

这里有一个反直觉的点:保密不是”不透明”,而是一种防污染设计。 FrontierMath 只公开 10 题样例、ARC-AGI-3 把竞赛集设成 semi/fully-private,恰恰是为了防止题目流进训练集——这与第 2 篇讲 MMLU 饱和、本篇开头讲 SWE-bench 退役是同一个问题的两面:题目一旦全公开,就有被背下来的风险;题目一保密,外界就无法独立验证。 基准设计者必须在这两难之间取舍。

读榜时怎么用这个光谱?记住一句话:

越难独立复测的分数,越要打折看待。 全公开的数据集(MMLU、GPQA)谁都能复核,分数可信度高;只能信官方口径的分数(FrontierMath 97.6%),无论数字多漂亮,都要等独立复测出来再下结论——这也是为什么前文案例三里,Epoch AI 接受 OpenAI 资助这件事值得单独标出来。

实战:GPT-6 Astra 发布,三处“分数会腐烂”的现场

2026 年 9 月的 GPT-6 Astra 发布,是观察基准污染与治理的完美样本。一场发布里,三个“分数会腐烂”的机制同时上演:

案例一:ARC-AGI-3,同一模型两个分数。 官方口径 99.9%(自家 Provider Adapter harness),ARC Prize 标准 harness 复测只有 62.7%——差 37.2 分。这属于“环境腐化”的变种:测量环境由被测方控制,分数就不再是公平的。模型没变,变的只是“考场的监考员是谁”。

案例二:ExploitBench,换题就露馅。 官方口径 Astra 100%(满分),但抗污染版本(只含 2026 年 6-8 月的新漏洞)只有 39.0%——差 61 分。这正是“数据污染”的教科书演示:旧漏洞的利用方法可能已经进入训练数据,测的是记忆;换上新漏洞,分数立刻现出原形。 上一代 Sol 在抗污染版上只有 5.5%,说明 Astra 是真实进步——但“100%”这个数字本身,是污染口径的产物。

案例三:FrontierMath,利益关联。 Astra 的 97.6% 出自 Epoch AI 开发的 FrontierMath Tier 4,而 Epoch AI 已披露接受 OpenAI 资助。这不是说分数造假,而是“谁出钱,谁就间接影响尺子”——当开发基准的机构与被测方有资金关系时,即使数字诚实,也需要更多独立复测来背书。

图3:一场发布三个现场——ARC-AGI-3 官方 99.9% vs 独立 62.7%(harness 分歧);ExploitBench 官方 100% vs 抗污染版 39.0%(换题差 61 分);FrontierMath 97.6% 的出处 Epoch AI 已披露接受 OpenAI 资助(利益关联)。

三个案例对应三种读法:

  1. harness 分歧 → 回到第 1 篇:先问分数是谁的。被测方控制的测量环境,数字再漂亮也要按“环境差异”打折。
  2. 污染口径 → 回到本篇文章机制表:“100%”如果建立在旧题上,价值约等于它没发过。 抗污染版本(新题)才是真实能力的证据。
  3. 利益关联 → 回到自查清单第 4 项:受益方自管的尺子,必须等独立复测出来再信。

一个“满分”可能只是旧题背得好;真正能信的,是换了新题、换了监考员之后依然站得住的分数。

小结

  • 基准会走完“发布 → 被采纳 → 被污染 → 被 exploit → 退役”的生命周期。
  • 失效有四种机制:污染、评分缺陷、环境腐化、主动 exploit;饱和是另一种“毕业式”失效。
  • 读榜前先自查基准的健康度,用退役的尺子量新模型,比不量更危险。

下一篇,本系列的最后一篇实战篇:公开榜单终归是别人的考试——怎么给自家 LLM 出题、建自己的评测体系?

一把两年没校准过的尺子,读数越精确越危险。

LLM测评 Benchmark 数据污染 科普 评测治理