【LLM测评-06】从“答题”到“干活”:Agent 测评到底在测什么
这是“LLM测评”系列的第 6 篇。前几篇讲的都是“答题型”基准,这一篇进入 2026 年最热也最复杂的赛道——Agent 测评:当 AI 不再只回答,而是去操作,分数还怎么打?
摘要
本文回答三个问题:Agent 测评和模型测评有什么本质区别、GAIA 与 τ²-bench 各自在测什么、以及为什么“完成任务”不等于“成功”。
核心论点:Agent 基准测的不是“答得对不对”,而是“一段过程能不能走通”。 过程有环境、有工具、有重试、有成本,评分也从“对错”变成“结果 + 合规”。
两种完全不同的测量对象
先想一个区别:
- 答题型基准(MMLU、GSM8K):输入一道题,输出一个答案,评分看对错。一次输入、一次输出。
- 干活型基准(GAIA、τ²-bench):给一个目标,模型要调工具、看反馈、再行动、再反馈……最后验收结果。一段过程。

这个区别决定了所有读法上的差异:模型基准的分数属于“模型本身”,Agent 基准的分数属于“模型 + 脚手架(scaffold)+ 环境”整个系统——这正是第 1 篇“分数属于谁”问题的最强版本。
GAIA:考“工具链编排”
GAIA(2023 年提出)是 Agent 测评的代表作。它的题目长这样:
“列出 2023 年某天文发现中提到的超新星名称,并给出其所在星座。”
对人来说,概念不难;但答案是唯一的精确值,且必须靠多步推理 + 网页搜索 + 文件处理 + 多模态能力组合才能得出。工具链编排是它的核心考点。
GAIA 上有个著名现象:同一模型,裸跑和套上完整脚手架,分数能差 30 个百分点以上。它因此成了观察“脚手架效应”的最佳样本——也成了“the scaffold is the score”这句话的实证来源。
GAIA2 走得更远:转向动态、异步的环境。它的作者公开承认“静态 GAIA 分数不能迁移到新环境”——基准团队自己否定前代,这个信号值得重视:Agent 能力的环境依赖性,已经被写进基准设计里了。
τ²-bench:考“守规矩”
如果说 GAIA 考“能不能干成”,τ²-bench 考的是“能不能干成还不违规”。
它模拟企业客服场景:一个 Agent 面对用户模拟器,操作零售 / 航空 / 电信等领域 API,处理查订单、改票、退款等任务。最特别的是双控制设计(dual-control):用户侧也持有工具,Agent 必须和用户协调,不能单方面执行。

它的核心判定哲学:企业场景里,“完成任务”不是首要,“不破坏政策”才是。 一个把退款办成了但违规给了不该给的折扣的 Agent,不是 80 分,是 0 分——没有部分得分。
这正是它和“准确率”思维最大的分叉:在真实业务里,违规是不可逆的外部副作用,不能靠“多试几次”来补救。
为什么 Agent 分数更难读
读 Agent 基准的分数,比读模型基准难得多:
- 环境依赖:换一个环境(工具集、API 版本、提示方式),分数大变。
- 成本巨大:跑一次完整 Agent 评测的算力和时间成本,远高于跑选择题,多次运行统计很难做。
- 可靠性是独立维度:一个 pass@1 为 0.85 的 Agent,如果失败不可回滚,四连试全成功的概率可能不到 50%——“能不能做到”和“能不能每次都做到”是两件事。
最后一点催生了 τ-bench 带来的重要指标 pass^k:k 次独立尝试全部成功才算通过。它和 pass@k(至少一次成功)一字之差,含义相反——网上大量资料把两者搞混,后面我们会专门讲。
实战:GPT-6 Astra——追平人类基线,但离上岗还远
2026 年 9 月 GPT-6 Astra 发布,把“Agent 测评到底在测什么”从抽象问题变成了具体数字:
OSWorld 2.0 离线集(真实桌面操作系统里完成任务):
| 模型 | OSWorld 2.0 离线 |
|---|---|
| GPT-6 Astra | 72.6% |
| Claude Opus 5 | 70.2% |
| GPT-5.6 Sol | 65.7% |
| 人类基线 | 约 72% |
AutomationBench(专业电脑任务): Astra 41.4%、Claude Fable 5.1 31.4%、GPT-5.6 Sol 18%。

这套数据是“答题 vs 干活”的最好注脚:
第一,“追平人类基线”要打引号。 Astra 72.6% 与人类 72% 打平,是 Agent 史上的标志性时刻——但注意口径:OSWorld 2.0 是离线子集 + 部分计分,不是完整 OSWorld。也就是说,这个分数回答的是“在给定离线环境里,任务完成得怎么样”,而不是“它能像人一样用电脑”。
第二,难度一加,分数就露底。 同样一个 Astra,在 OSWorld 上 72.6%,在更专业的 AutomationBench 上只有 41.4%。“追平人类”只发生在特定任务族上;一旦任务更专业、更长程,Agent 离上岗还有一大段距离。 这也印证了 Agent 分数必须“连着环境读”:换一套任务,分数就换一个世界。
第三,效率本身成了新指标。 Astra 把 OSWorld 单任务平均耗时从约 75 分钟压到约 40 分钟——效率进步近一半。这提醒我们:Agent 测评里“花多少成本干成”和“干成没有”同样重要,读分时别只盯着完成率。
第四,72.6% ≠ 可以上岗。 生产部署还要看违规率(τ²-bench 的教训)、失败可回滚性(pass^k 的教训)、以及长尾任务的表现。追平人类基线,只是从“实验室玩具”走向“受控试点”的门槛,不是终点。
在特定任务上追平人类,和在专业任务里稳定上岗,中间隔着整个生产环境。
小结
- Agent 基准测的是“一段过程”,分数属于“模型 + 脚手架(scaffold)+ 环境”整个系统。
- GAIA 考工具链编排,τ²-bench 考“完成任务且不违规”。
- Agent 分数难读:环境依赖强、成本高、可靠性必须单独测。
下一篇,我们聊聊所有基准共同的敌人——污染与刷分:为什么一个曾经的“黄金标准”,会变成不能用的尺子?
任务完成了但违反了政策,不是扣分,是零分。