【LLM测评-08】怎么给自家 LLM 出题:从读榜到自建评测
这是“LLM测评”系列的第 8 篇,也是收尾篇。前 7 篇教你怎么读别人的榜,这一篇告诉你:公开榜终归是别人的考试,真正决定你产品能不能发版的,是你自己的评测集。
摘要
本文回答三个问题:公开基准和自建评测集各该承担什么职责、自建评测的五步流程是什么、以及为什么门槛要卡在“每次都能成功”而不是“碰巧成功”。
核心论点:公开基准告诉你“业界在哪”,只有自己的评测集能告诉你“能不能发版”。 读榜是输入,自建评测才是决策。
先分清两件事
很多团队犯的错误是:拿公开榜单的分数当验收标准。“模型在 SWE-bench 上 70 分,所以可以上线”——这是把别人的考试当成自己的面试。
正确分工是这样:

| 职责 | 公开基准 | 私有评测集 |
|---|---|---|
| 收窄候选 | ✅ 先筛出 3-5 个候选 | ❌ |
| 校准方法 | ✅ 学任务采样、判定设计 | ❌ |
| 发现盲区 | ✅ 暴露你没想过的失败 | ❌ |
| 决定上线 | ❌ 领域不匹配 | ✅ 唯一裁决者 |
自建评测的五步流程
① 选场景
从你的真实业务里收集任务:客服场景就把历史工单拿出来,代码场景就把真实 bug 修复记录拿出来。用例必须来自真实使用,而不是自己编的理想题。
② 定判定
每个任务怎么算“对”?
- 能客观判定的(答案固定、测试能跑)优先客观判定;
- 不能客观判定的(开放式回答)才考虑 LLM-as-Judge,并做好裁判偏见的校验(第 6 篇提过的可靠性问题)。
- 涉及外部副作用的任务(发消息、退款、删数据),必须加“违规即零分”规则——这是 τ²-bench 教给我们的。
③ 固定 harness(测试装置)
第 1 篇的教训在这里落地:评测的测试装置(harness)必须固定,不允许“换壳跑分”。 工具集、提示模板、重试策略、预算上限,写进评测配置,一视同仁地跑所有候选模型。
④ 多次运行,报帕累托点
单次运行报分等于抛硬币。正确做法:
- 每个候选跑多次,报统计量(均值、通过率);
- 同时记录成本(token、时间);
- 画“准确率-成本”散点,看帕累托前沿而不是榜首——一个便宜 20 倍、准确率只低 3 个点的模型,可能比榜首更适合你。
⑤ 定期轮换
第 7 篇的教训也要用在自己身上:你的黄金集也会污染和饱和。 用过的题会“漏”给自己家的模型,需要像治理公开基准一样定期更新、轮换、退役旧题。

门槛卡在哪个指标
最后一个关键决策:CI 门槛用什么指标?
- pass@1:单次成功率。衡量“有没有可能做到”。
- pass@k:k 次里至少一次成功。乐观指标,衡量“运气好时能不能成”。
- pass^k:k 次全部成功。悲观指标,衡量“能不能每次都做到”。
生产环境看 pass^k。 一个 pass@1 = 0.85 的客服 Agent 听起来不错,但如果四次里有一次会违规操作,它就不能上线——用户不会替你重试,外部副作用不能重来。
可回滚的内部任务可以接受 pass@k 语义;有外部副作用的操作只能看 pass^k。这个区分,就是“读榜方法论”落到自己评测集时最值钱的一条。
实战:为什么“独立评测打平”比“官方刷新纪录”更值得信
写这一篇时(2026 年 9 月),GPT-6 Astra 刚发布,正是一个绝佳的教学案例:官方口径和独立口径,同一模型给出两种叙事。
- 官方叙事:“FrontierMath 97.6%、ARC-AGI-3 99.9%、ExploitBench 100%,欢迎来到 AGI 时代。”
- 独立叙事:Artificial Analysis 的综合智能指数里,Astra 得 61 分,与上一代 GPT-5.6 Sol 的 61 分完全打平;编程能力指数 67 分,还低于 Claude Fable 5.1 的 70 分。

这不是谁在撒谎,而是测量口径不同:官方口径强调“最难任务的上限突破”(部分还带自家 harness 与利益关联),独立指数强调“综合能力的均衡水平”。两个数字都真实,但做决策时,独立口径往往更可靠:
- 独立机构与被测方无利益关联——没有动机美化数字(这正是第 7 篇“谁出钱谁影响尺子”的反向应用)。
- 独立指数是多次运行、统一 harness 的统计量——符合第 1 篇“跑几次、什么测试装置”的纪律。
- 它逼你看清“真实差距”:如果 Astra 和 Sol 综合指数打平,那“代际飞跃”主要发生在少数极限任务上,而不是全面能力——这个判断直接决定选型预算怎么花。
还有一个技术前提值得记住(第 7 篇讲过):独立评测能成立,靠的是数据集公开。 AA 能复测 ARC-AGI-3,是因为 ARC 的 public 集对外开放;FrontierMath 只有官方口径,是因为 338 题只公开 10 题样例、主体保密防污染。所以”独立口径 vs 官方口径”的分歧天然偏向那些全公开的基准——做决策时,优先采信能独立复测的那几个分数。
把它翻译成自建评测的行动:你的评测体系里,至少要有一个“独立第三方口径”作为校准锚点——要么用 Artificial Analysis 这类公开独立指数,要么自建一套“只有内部知道、无利益掺杂”的黄金集。官方跑分负责激动人心,独立口径负责做决策。
系列收尾
回到第 0 篇的问题:AI 的能力到底怎么量?
8 篇下来,答案已经完整:没有测量就没有进步,但没有正确口径的测量更危险。 读任何分数,先问四个问题:分数属于谁、跑了几次、花了多少、数据还活着吗?
把这份怀疑能力用在公开榜上,把这份纪律用在自建评测里——你就能从“看热闹”变成“做决策”。
公开基准告诉你“业界在哪”,只有自己的评测集能告诉你“能不能发版”。