Home
avatar

.Sam

【LLM测评-08】怎么给自家 LLM 出题:从读榜到自建评测

这是“LLM测评”系列的第 8 篇,也是收尾篇。前 7 篇教你怎么读别人的榜,这一篇告诉你:公开榜终归是别人的考试,真正决定你产品能不能发版的,是你自己的评测集。

摘要

本文回答三个问题:公开基准和自建评测集各该承担什么职责、自建评测的五步流程是什么、以及为什么门槛要卡在“每次都能成功”而不是“碰巧成功”。

核心论点:公开基准告诉你“业界在哪”,只有自己的评测集能告诉你“能不能发版”。 读榜是输入,自建评测才是决策。

先分清两件事

很多团队犯的错误是:拿公开榜单的分数当验收标准。“模型在 SWE-bench 上 70 分,所以可以上线”——这是把别人的考试当成自己的面试。

正确分工是这样:

图1:公开基准 vs 私有评测集分工——公开基准负责收窄候选范围、校准评测方法、发现失败维度;私有评测集(黄金集)用你自己的业务场景出题,决定能不能上线。从公开基准可以偷四样东西:任务采样策略、判定器设计、多次运行报分纪律、成本约束;不能偷的是任务本身和绝对分数。

职责公开基准私有评测集
收窄候选✅ 先筛出 3-5 个候选
校准方法✅ 学任务采样、判定设计
发现盲区✅ 暴露你没想过的失败
决定上线❌ 领域不匹配✅ 唯一裁决者

自建评测的五步流程

① 选场景

从你的真实业务里收集任务:客服场景就把历史工单拿出来,代码场景就把真实 bug 修复记录拿出来。用例必须来自真实使用,而不是自己编的理想题。

② 定判定

每个任务怎么算“对”?

  • 能客观判定的(答案固定、测试能跑)优先客观判定;
  • 不能客观判定的(开放式回答)才考虑 LLM-as-Judge,并做好裁判偏见的校验(第 6 篇提过的可靠性问题)。
  • 涉及外部副作用的任务(发消息、退款、删数据),必须加“违规即零分”规则——这是 τ²-bench 教给我们的。

③ 固定 harness(测试装置)

第 1 篇的教训在这里落地:评测的测试装置(harness)必须固定,不允许“换壳跑分”。 工具集、提示模板、重试策略、预算上限,写进评测配置,一视同仁地跑所有候选模型。

④ 多次运行,报帕累托点

单次运行报分等于抛硬币。正确做法:

  • 每个候选跑多次,报统计量(均值、通过率);
  • 同时记录成本(token、时间);
  • 画“准确率-成本”散点,看帕累托前沿而不是榜首——一个便宜 20 倍、准确率只低 3 个点的模型,可能比榜首更适合你。

⑤ 定期轮换

第 7 篇的教训也要用在自己身上:你的黄金集也会污染和饱和。 用过的题会“漏”给自己家的模型,需要像治理公开基准一样定期更新、轮换、退役旧题。

图2:自建评测五步流程——选场景(真实用例)→ 定判定(客观优先,违规零分)→ 固定 harness(不许换壳)→ 多次运行报帕累托点 → 定期轮换黄金集。门槛卡哪个指标?生产问题看 pass^k(每次都成功),而不是 pass@1(碰巧成功)。

门槛卡在哪个指标

最后一个关键决策:CI 门槛用什么指标?

  • pass@1:单次成功率。衡量“有没有可能做到”。
  • pass@k:k 次里至少一次成功。乐观指标,衡量“运气好时能不能成”。
  • pass^k:k 次全部成功。悲观指标,衡量“能不能每次都做到”。

生产环境看 pass^k。 一个 pass@1 = 0.85 的客服 Agent 听起来不错,但如果四次里有一次会违规操作,它就不能上线——用户不会替你重试,外部副作用不能重来。

可回滚的内部任务可以接受 pass@k 语义;有外部副作用的操作只能看 pass^k。这个区分,就是“读榜方法论”落到自己评测集时最值钱的一条。

实战:为什么“独立评测打平”比“官方刷新纪录”更值得信

写这一篇时(2026 年 9 月),GPT-6 Astra 刚发布,正是一个绝佳的教学案例:官方口径和独立口径,同一模型给出两种叙事。

  • 官方叙事:“FrontierMath 97.6%、ARC-AGI-3 99.9%、ExploitBench 100%,欢迎来到 AGI 时代。”
  • 独立叙事:Artificial Analysis 的综合智能指数里,Astra 得 61 分,与上一代 GPT-5.6 Sol 的 61 分完全打平;编程能力指数 67 分,还低于 Claude Fable 5.1 的 70 分。

图3:独立评测视角——AA 综合指数 Astra 61 vs Sol 61 打平,Fable 5.1 66、Opus 5 63 反超;编程指数 Astra 67 vs Fable 5.1 70。官方宣传“代际飞跃”,独立指数“打平”。

这不是谁在撒谎,而是测量口径不同:官方口径强调“最难任务的上限突破”(部分还带自家 harness 与利益关联),独立指数强调“综合能力的均衡水平”。两个数字都真实,但做决策时,独立口径往往更可靠

  1. 独立机构与被测方无利益关联——没有动机美化数字(这正是第 7 篇“谁出钱谁影响尺子”的反向应用)。
  2. 独立指数是多次运行、统一 harness 的统计量——符合第 1 篇“跑几次、什么测试装置”的纪律。
  3. 它逼你看清“真实差距”:如果 Astra 和 Sol 综合指数打平,那“代际飞跃”主要发生在少数极限任务上,而不是全面能力——这个判断直接决定选型预算怎么花。

还有一个技术前提值得记住(第 7 篇讲过):独立评测能成立,靠的是数据集公开。 AA 能复测 ARC-AGI-3,是因为 ARC 的 public 集对外开放;FrontierMath 只有官方口径,是因为 338 题只公开 10 题样例、主体保密防污染。所以”独立口径 vs 官方口径”的分歧天然偏向那些全公开的基准——做决策时,优先采信能独立复测的那几个分数。

把它翻译成自建评测的行动:你的评测体系里,至少要有一个“独立第三方口径”作为校准锚点——要么用 Artificial Analysis 这类公开独立指数,要么自建一套“只有内部知道、无利益掺杂”的黄金集。官方跑分负责激动人心,独立口径负责做决策。

系列收尾

回到第 0 篇的问题:AI 的能力到底怎么量?

8 篇下来,答案已经完整:没有测量就没有进步,但没有正确口径的测量更危险。 读任何分数,先问四个问题:分数属于谁、跑了几次、花了多少、数据还活着吗?

把这份怀疑能力用在公开榜上,把这份纪律用在自建评测里——你就能从“看热闹”变成“做决策”。

公开基准告诉你“业界在哪”,只有自己的评测集能告诉你“能不能发版”。

LLM测评 Benchmark 自建评测 科普 工程实践