Home
avatar

.Sam

【LLM测评-06】从“答题”到“干活”:Agent 测评到底在测什么

这是“LLM测评”系列的第 6 篇。前几篇讲的都是“答题型”基准,这一篇进入 2026 年最热也最复杂的赛道——Agent 测评:当 AI 不再只回答,而是去操作,分数还怎么打?

摘要

本文回答三个问题:Agent 测评和模型测评有什么本质区别、GAIA 与 τ²-bench 各自在测什么、以及为什么“完成任务”不等于“成功”。

核心论点:Agent 基准测的不是“答得对不对”,而是“一段过程能不能走通”。 过程有环境、有工具、有重试、有成本,评分也从“对错”变成“结果 + 合规”。

两种完全不同的测量对象

先想一个区别:

  • 答题型基准(MMLU、GSM8K):输入一道题,输出一个答案,评分看对错。一次输入、一次输出。
  • 干活型基准(GAIA、τ²-bench):给一个目标,模型要调工具、看反馈、再行动、再反馈……最后验收结果。一段过程。

图1:答题型 vs 干活型——答题型是一次输入一次输出,评分看对错,便宜可批量;干活型是模型与工具、环境多轮交互,有环境、有成本、有重试,评分看结果与是否违规。

这个区别决定了所有读法上的差异:模型基准的分数属于“模型本身”,Agent 基准的分数属于“模型 + 脚手架(scaffold)+ 环境”整个系统——这正是第 1 篇“分数属于谁”问题的最强版本。

GAIA:考“工具链编排”

GAIA(2023 年提出)是 Agent 测评的代表作。它的题目长这样:

“列出 2023 年某天文发现中提到的超新星名称,并给出其所在星座。”

对人来说,概念不难;但答案是唯一的精确值,且必须靠多步推理 + 网页搜索 + 文件处理 + 多模态能力组合才能得出。工具链编排是它的核心考点。

GAIA 上有个著名现象:同一模型,裸跑和套上完整脚手架,分数能差 30 个百分点以上。它因此成了观察“脚手架效应”的最佳样本——也成了“the scaffold is the score”这句话的实证来源。

GAIA2 走得更远:转向动态、异步的环境。它的作者公开承认“静态 GAIA 分数不能迁移到新环境”——基准团队自己否定前代,这个信号值得重视:Agent 能力的环境依赖性,已经被写进基准设计里了。

τ²-bench:考“守规矩”

如果说 GAIA 考“能不能干成”,τ²-bench 考的是“能不能干成还不违规”。

它模拟企业客服场景:一个 Agent 面对用户模拟器,操作零售 / 航空 / 电信等领域 API,处理查订单、改票、退款等任务。最特别的是双控制设计(dual-control):用户侧也持有工具,Agent 必须和用户协调,不能单方面执行。

图2:τ²-bench 的双控制设计——Agent 在用户模拟器与领域 API 之间协调,最终由数据库状态比对验收;判定规则是“任务完成但违反政策 → 零分,没有部分得分”。这是 pass^k 指标的发源地。

它的核心判定哲学:企业场景里,“完成任务”不是首要,“不破坏政策”才是。 一个把退款办成了但违规给了不该给的折扣的 Agent,不是 80 分,是 0 分——没有部分得分。

这正是它和“准确率”思维最大的分叉:在真实业务里,违规是不可逆的外部副作用,不能靠“多试几次”来补救。

为什么 Agent 分数更难读

读 Agent 基准的分数,比读模型基准难得多:

  1. 环境依赖:换一个环境(工具集、API 版本、提示方式),分数大变。
  2. 成本巨大:跑一次完整 Agent 评测的算力和时间成本,远高于跑选择题,多次运行统计很难做。
  3. 可靠性是独立维度:一个 pass@1 为 0.85 的 Agent,如果失败不可回滚,四连试全成功的概率可能不到 50%——“能不能做到”和“能不能每次都做到”是两件事。

最后一点催生了 τ-bench 带来的重要指标 pass^k:k 次独立尝试全部成功才算通过。它和 pass@k(至少一次成功)一字之差,含义相反——网上大量资料把两者搞混,后面我们会专门讲。

实战:GPT-6 Astra——追平人类基线,但离上岗还远

2026 年 9 月 GPT-6 Astra 发布,把“Agent 测评到底在测什么”从抽象问题变成了具体数字:

OSWorld 2.0 离线集(真实桌面操作系统里完成任务):

模型OSWorld 2.0 离线
GPT-6 Astra72.6%
Claude Opus 570.2%
GPT-5.6 Sol65.7%
人类基线约 72%

AutomationBench(专业电脑任务): Astra 41.4%、Claude Fable 5.1 31.4%、GPT-5.6 Sol 18%。

图3:Agent 真实跑分——OSWorld 2.0 离线集 Astra 72.6% 首次追平人类基线(约 72%),单任务平均耗时从约 75 分钟降到约 40 分钟;AutomationBench 全部低于 50%(Astra 41.4%、Fable 5.1 31.4%、Sol 18%)。

这套数据是“答题 vs 干活”的最好注脚:

第一,“追平人类基线”要打引号。 Astra 72.6% 与人类 72% 打平,是 Agent 史上的标志性时刻——但注意口径:OSWorld 2.0 是离线子集 + 部分计分,不是完整 OSWorld。也就是说,这个分数回答的是“在给定离线环境里,任务完成得怎么样”,而不是“它能像人一样用电脑”。

第二,难度一加,分数就露底。 同样一个 Astra,在 OSWorld 上 72.6%,在更专业的 AutomationBench 上只有 41.4%。“追平人类”只发生在特定任务族上;一旦任务更专业、更长程,Agent 离上岗还有一大段距离。 这也印证了 Agent 分数必须“连着环境读”:换一套任务,分数就换一个世界。

第三,效率本身成了新指标。 Astra 把 OSWorld 单任务平均耗时从约 75 分钟压到约 40 分钟——效率进步近一半。这提醒我们:Agent 测评里“花多少成本干成”和“干成没有”同样重要,读分时别只盯着完成率。

第四,72.6% ≠ 可以上岗。 生产部署还要看违规率(τ²-bench 的教训)、失败可回滚性(pass^k 的教训)、以及长尾任务的表现。追平人类基线,只是从“实验室玩具”走向“受控试点”的门槛,不是终点。

在特定任务上追平人类,和在专业任务里稳定上岗,中间隔着整个生产环境。

小结

  • Agent 基准测的是“一段过程”,分数属于“模型 + 脚手架(scaffold)+ 环境”整个系统。
  • GAIA 考工具链编排,τ²-bench 考“完成任务且不违规”。
  • Agent 分数难读:环境依赖强、成本高、可靠性必须单独测。

下一篇,我们聊聊所有基准共同的敌人——污染与刷分:为什么一个曾经的“黄金标准”,会变成不能用的尺子?

任务完成了但违反了政策,不是扣分,是零分。

LLM测评 Benchmark Agent GAIA τ-bench 科普