【LLM测评-01】一份跑分表,到底该怎么读?
这是“LLM测评”系列的第 1 篇。上一篇我们建立了基准测试的直觉,这一篇拿一份真实的跑分表来解剖:分数旁边,还藏着哪些必须读懂的细节?
摘要
本文回答三个问题:一个 benchmark 分数由哪些配置决定、为什么同一个模型会有多个不同的分数、以及拿到任何跑分时应该核对的五项配置。
核心论点:一个分数不是模型的属性,是“模型 + 测试装置 + 运行次数 + 预算 + 数据版本”这一整套配置的属性。 不披露配置的分数,不具备比较意义。
从一张发布会截图说起
每个模型发布会的固定节目,是放一张跑分表:我们模型在 XX 基准上 92%,超越所有竞品。
如果你是第一次认真看这张表,可能会问:这个 92% 到底是怎么来的?是不是只要题目够简单、提示词够友好、允许试很多次,谁都能考高分?
答案是:很大程度上,是的。
2026 年的 benchmark 评测里,同一模型在不同评测条件下差出 20-30 个百分点,是常态而不是意外。这些差距不是谁在作弊,而是测量口径不同。就像用卷尺和用激光测距仪量同一面墙,仪器不同,读数不同,不代表墙变了。
决定分数的五项配置
拿到任何一个跑分,先在心里过一遍这五个问题:
- 谁在跑? 厂商用自己评测流程报的分,还是第三方独立机构用统一流程跑的分?前者难免带上自家的提示词和容错设计。
- 用什么测试装置(harness)? 模型是裸跑,还是套上了统一的评测装置(数据加载、提示构造、判分流程)?在 Agent 类基准里还要再问一层:模型自带的增强结构(scaffold,脚手架)是什么?这套外壳对分数的影响,常常大于模型本身。
- 跑了几次? 报的是单次最好成绩,还是多次运行的统计量?一个随机系统跑一次就报分,信息量接近于零。
- 花了多少成本? 不限预算地堆测试时算力换来的高分,和生产环境能用得起的分,不是一回事。
- 数据是哪个版本? 用的题目集有没有更新过、有没有被污染、是不是已经退役的旧版本?

为什么“换壳”能差出几十分
这里引入本系列最重要的一个概念:scaffold(脚手架)——并且先和 harness 划清界限:harness(测试装置)是评测方搭建的统一测量设备(数据加载、提示构造、答案解析、判分),管“怎么考”;scaffold(脚手架)是模型 / Agent 开发者自己搭建的增强结构(提示模板、可用工具、重试策略、上下文管理、步骤预算),管“怎么干”。同样的模型,套上不同的脚手架,成绩天差地别。在 Agent 类基准里两者会重叠:评测时你既需要 harness 来测量,也要把各家 scaffold 一起测。
举一个真实的观察:在 GAIA 这类需要多步推理加工具使用的基准上,模型裸跑和套上完整脚手架,分数差距可以超过 30 个百分点——这个差距大于头部模型之间的差距。
所以业内有一句流传的话:“the scaffold is the score”(脚手架就是分数)。 当脚手架带来的增量大于模型本身的能力差距时,榜单排的其实是工程能力,不是模型能力。

三种分数,三种决策
把上面的例子翻译成决策语言:
| 分数类型 | 回答的问题 | 对应决策 |
|---|---|---|
| 厂商自报(完整产品) | 产品整体能交付什么 | 选产品、选 API |
| 统一测试装置(独立评测) | 公平条件下谁的方法更好 | 横向对比、方法研究 |
| 裸模型 | 模型底子本身多强 | 复现实验、学术比较 |
三者都有意义,但不能混在一张榜上比。厂商自报分数天然包含产品工程优势,而那份工程优势是真实的商业价值——但把它当成“模型能力”来读,就错了。
读分自查清单
以后看到任何 AI 跑分,按这份清单核对:
- 分数是独立机构测的,还是厂商自报的?
- 模型跑的时候用了哪些工具和提示?(有没有披露 harness)
- 报的是单次最好成绩,还是多次运行的均值/通过率?
- 有没有披露 token 成本和计算预算?
- 用的是哪个数据版本?这个版本还“活着”吗?
三项里一项都不公开的分数,只能当作宣传口径来听。
实战:Astra 的 99.9% 是怎么来的
2026 年 9 月,GPT-6 Astra 发布,官方给出的 ARC-AGI-3 分数是 99.9%——上一代只有 7.8%,看起来是“神迹”。但 ARC Prize 基金会用标准 harness 复测同一模型,得到的是 62.7%。
两个分数都是真的,差在五项配置里的第 2 项:测试装置(harness)。
- 官方用的是自家的 Provider Adapter:请求之间保留推理状态、对长对话做压缩,模型可以“记住”自己之前的探索过程,复用结果。跑分成本约 1.88 万美元,速度快 3.66 倍。
- 独立复测用的是 Standard harness:每次从头开始推理,只允许带模型自己选择保留的笔记。成本约 2.61 万美元。

这个案例把本篇文章的论点钉死了:
- “the scaffold is the score” 不是比喻,是字面事实。 37.2 分的差距全部来自 harness,模型本身一行参数没动。
- 两个分数回答两个问题。 62.7% 回答“裸 Astra 的抽象推理有多强”;99.9% 回答“带 OpenAI 自家测试装置(含记忆复用这类增强结构)的 Astra 能多强”。后者有商业价值,但写进论文当模型分数,就是口径偷换。
- 成本是最容易被忽略的配置项。 便宜了 0.73 万美元的官方 harness 反而分高——不是因为省钱,是因为“记忆”特性把探索成本摊薄了。读分时看到成本差异,就该警觉口径不同。
对照清单复核官方 99.9% 这个数字:独立机构复测 ✔(但分数不同)、harness 有披露 ✔(自家 adapter)、跑多次 ✔、成本有披露 ✔、数据版本 ARC-AGI-3 Semi-Private ✔。五项全有,但这个分数依然只属于“带 adapter 的 Astra”——这就是读完五项配置之后,你还需要知道的:披露配置只是起点,能不能横向比较,取决于别人能不能用同一套配置复现你的分数。
小结
- 分数属于“模型 + 测试装置 + 次数 + 预算 + 版本”这套配置,不是模型单独所有。
- 测试装置与增强结构对分数的影响常常大于模型本身——“the scaffold is the score”在 Agent 类基准上尤其成立。
- 三种分数对应三种决策,混在一起比较没有意义。
下一篇,我们看一个最经典也最“接近饱和”的基准——MMLU。当几乎所有模型都考到 85 分以上的时候,这个考试还测得出差距吗?
不披露 harness 的分数,不是不精确,是没有定义。