【LLM测评-07】榜单会腐烂:污染、刷分与退役
这是“LLM测评”系列的第 7 篇。前几篇在讲“怎么读分”,这一篇讲“为什么很多分根本不值得读”——基准会腐烂,而且腐烂得比你想象中快。
摘要
本文回答三个问题:一个基准为什么会失效、失效有哪几种机制、以及读榜时怎么判断一个基准“还活着吗”。
核心论点:benchmark 是软件系统,不是数据集。 它会腐化、会被攻破、会过期。用一个已退役的榜做决策,比不看榜更危险。
黄金标准也会过期
2021 年,SWE-bench 刚发布时,被称作“代码评测的黄金标准”:真实仓库、真实 issue、客观测试判定。
2026 年 2 月,它的 Verified 子集(500 个 Python 任务)正式退役。
发生了什么?不是题出错了,而是题被“背下来了”:这些任务和答案在开源社区流传太久,被反复指出泄漏进训练集的嫌疑。当模型可能“见过答案”时,分数就不再是能力的证据。
两年,一个黄金标准就完成了它的生命周期。这就是基准的宿命。
基准的生命周期
几乎所有有影响力的基准都会走完五步:发布 → 被采纳 → 被污染 → 被 exploit → 退役。

关键认知:“退役”不是失败,是健康治理。 一个基准能承认自己过时并退出,说明维护它的机构有公信力。真正危险的反而是那些没人维护、悄悄过时、却还在被引用的老榜。
四种失效机制
基准失效不是单一原因,至少有四种机制在起作用:

| 机制 | 一句话 | 真实案例 |
|---|---|---|
| 数据污染 | 答案进训练集,测的是记忆 | SWE-bench Verified 泄漏嫌疑,2026 退役 |
| 评分缺陷 | 测试用例本身就是错的 | 某基准最难档约六成失败任务用例有缺陷 |
| 环境腐化 | 依赖漂移、指令与测试脱节 | Terminal-Bench 2.0→2.1 修正 28/89 个任务 |
| 主动 exploit | 弱验证器被绕过 | 自动化流水线数轮内找出可 hack 的任务 |
饱和:另一种“腐烂”
别忘了第 2 篇讲的饱和也是一种失效:分数挤向顶部,区分度消失。
饱和和污染的区别:
- 污染:模型背了答案,分数虚高,测的是记忆。
- 饱和:模型真的学会了,但所有人都会,分数不再有意义。
两者都会让基准“退役”,但一个是“作弊”,一个是“毕业”。识别方法也简单:污染会让分数突然跳升,饱和是渐进趋平。
怎么判断一个榜还活着
读任何基准之前,过一遍自查清单:
- 这个榜最近一次版本更新是什么时候?(超过一年没动过的榜,小心)
- 有没有污染审计报告?(公开审计过 = 可信度加分)
- 评分代码开源吗?(不开源 = 无法复现,无法审计)
- 有没有独立机构维护,还是受益方自管?(中立维护才有动力排查)
- 头部模型是否已接近满分?(接近满分 = 该退役了)
- 数据集公开吗?第三方能独立复测吗?(连数据都拿不到 = 分数无法验证)
数据集的公开程度:能不能被独立复测
自查清单最后一条,值得单独展开:一个分数能不能被第三方验证,第一道门槛是数据本身公不公开。
很多人以为”公开基准”都长一个样,其实差别很大。按公开程度,评测数据集大致分五档:

| 档位 | 数据集(官方地址) | 第三方能否复测 |
|---|---|---|
| ① 完全公开 | MMLU、GPQA Diamond、SWE-bench、HumanEval | ✅ 能,谁都能下载重跑 |
| ② 需申请/认证 | OSWorld 2.0(任务在 HF,环境镜像 gated)、GPQA 答案需密码 | 🟡 部分能,走审批 |
| ③ 防污染保密 | FrontierMath(仅 10 题样例)、ARC-AGI-3(竞赛集保密) | 🔴 基本不能,只有官方口径 |
| ④ 安全敏感 | ExploitBench(真实漏洞利用链) | 🟣 能,但需安全审查 |
| ⑤ 公开性存疑 | SRE-Bench(GPT-6 报告版,OpenAI 发布页) | ⚪ 未见说明,需查原始报告 |
这里有一个反直觉的点:保密不是”不透明”,而是一种防污染设计。 FrontierMath 只公开 10 题样例、ARC-AGI-3 把竞赛集设成 semi/fully-private,恰恰是为了防止题目流进训练集——这与第 2 篇讲 MMLU 饱和、本篇开头讲 SWE-bench 退役是同一个问题的两面:题目一旦全公开,就有被背下来的风险;题目一保密,外界就无法独立验证。 基准设计者必须在这两难之间取舍。
读榜时怎么用这个光谱?记住一句话:
越难独立复测的分数,越要打折看待。 全公开的数据集(MMLU、GPQA)谁都能复核,分数可信度高;只能信官方口径的分数(FrontierMath 97.6%),无论数字多漂亮,都要等独立复测出来再下结论——这也是为什么前文案例三里,Epoch AI 接受 OpenAI 资助这件事值得单独标出来。
实战:GPT-6 Astra 发布,三处“分数会腐烂”的现场
2026 年 9 月的 GPT-6 Astra 发布,是观察基准污染与治理的完美样本。一场发布里,三个“分数会腐烂”的机制同时上演:
案例一:ARC-AGI-3,同一模型两个分数。 官方口径 99.9%(自家 Provider Adapter harness),ARC Prize 标准 harness 复测只有 62.7%——差 37.2 分。这属于“环境腐化”的变种:测量环境由被测方控制,分数就不再是公平的。模型没变,变的只是“考场的监考员是谁”。
案例二:ExploitBench,换题就露馅。 官方口径 Astra 100%(满分),但抗污染版本(只含 2026 年 6-8 月的新漏洞)只有 39.0%——差 61 分。这正是“数据污染”的教科书演示:旧漏洞的利用方法可能已经进入训练数据,测的是记忆;换上新漏洞,分数立刻现出原形。 上一代 Sol 在抗污染版上只有 5.5%,说明 Astra 是真实进步——但“100%”这个数字本身,是污染口径的产物。
案例三:FrontierMath,利益关联。 Astra 的 97.6% 出自 Epoch AI 开发的 FrontierMath Tier 4,而 Epoch AI 已披露接受 OpenAI 资助。这不是说分数造假,而是“谁出钱,谁就间接影响尺子”——当开发基准的机构与被测方有资金关系时,即使数字诚实,也需要更多独立复测来背书。

三个案例对应三种读法:
- harness 分歧 → 回到第 1 篇:先问分数是谁的。被测方控制的测量环境,数字再漂亮也要按“环境差异”打折。
- 污染口径 → 回到本篇文章机制表:“100%”如果建立在旧题上,价值约等于它没发过。 抗污染版本(新题)才是真实能力的证据。
- 利益关联 → 回到自查清单第 4 项:受益方自管的尺子,必须等独立复测出来再信。
一个“满分”可能只是旧题背得好;真正能信的,是换了新题、换了监考员之后依然站得住的分数。
小结
- 基准会走完“发布 → 被采纳 → 被污染 → 被 exploit → 退役”的生命周期。
- 失效有四种机制:污染、评分缺陷、环境腐化、主动 exploit;饱和是另一种“毕业式”失效。
- 读榜前先自查基准的健康度,用退役的尺子量新模型,比不量更危险。
下一篇,本系列的最后一篇实战篇:公开榜单终归是别人的考试——怎么给自家 LLM 出题、建自己的评测体系?
一把两年没校准过的尺子,读数越精确越危险。