Home
avatar

.Sam

【LLM测评-03】GPQA:AI 是真会推理,还是背得多?

这是“LLM测评”系列的第 3 篇。前两篇讲了 benchmark 的基本框架和“饱和”概念,这一篇进入最难测的能力之一——推理,以 GPQA 为例。

摘要

本文回答三个问题:为什么选择题考不出“推理”、GPQA 是怎么设计出“考不倒、背不着”的题目的、以及 AI 的高分到底算不算会推理。

核心论点:“答对”不等于“会推理”。 GPQA 这类博士级、抗搜索的题目,把“背得多”和“推得动”区分开来,是目前评估推理能力的重要样本。

一个反直觉的事实

先说一个让很多人惊讶的数据:GPQA 的题目,普通成年人平均只能答对约 34%,博士级专家大约 65%。这不是因为它出的是偏题怪题——恰恰相反,它出的是物理、化学、生物领域里“专家觉得值得考”的正经题。

问题在于:这些题设计成在网上搜不到标准答案。你可以开卷、可以搜索、可以查资料,但题目本身就要求你“现场推出来”。

这就是 GPQA 全称的含义:Google-Proof Q&A——谷歌都救不了你的问答。

图1:GPQA 为“考不倒、背不着”而生——题目由博士级专家撰写,设计成搜不到答案;非专家人类约 34%,博士约 65%。2026 年头部模型约 65-80%,已超过人类博士基线但远未满分。

记忆和推理,是两种不同的能力

为什么我们要专门区分“记忆”和“推理”?

想象两道题:

  • 记忆型:珠穆朗玛峰有多高?见过就答对,训练语料里出现越多越容易对。
  • 推理型:某个化合物在特定条件下为什么表现反常?需要排除干扰、多步推导,网上没有现成答案。

同一个模型,在这两类题上可能表现完全不同。一个“背书机器”在记忆型题上可以拿高分,遇到推理型题就露馅。

MMLU 的题目里混着大量记忆型题目,所以它高分不能证明推理强;而 GPQA 从设计上就偏向推理型——它能区分“背得多”和“推得动”。

图2:记忆型 vs 推理型的区别——记忆型关键是“见过没有”,推理型关键是“能不能推”。靠记忆的高分换个新领域就打回原形,靠推理的高分才能迁移到没见过的问题。

AI 在 GPQA 上的表现意味着什么

2026 年的现状:头部推理模型在 GPQA Diamond(198 题的精选子集)上大约能到 65-80%,已经超过了人类博士专家的平均水平(约 65%),但离满分还很远。

这个结果该怎么读?

  • 正面:模型确实掌握了一部分“现场推导”能力,不是单纯靠背诵——因为题目本身就防背诵。
  • 谨慎:GPQA 只有 198 题,样本很小;超过人类博士基线不代表在所有领域都超过专家;单点高分也不代表稳定的推理能力。
  • 关键提醒:GPQA 是“研究生水平”的硬核推理,它测的是上限能力。一个在生产环境里日常犯错的模型,也可以在 GPQA 上拿高分——上限测试和日常可靠性是两回事

推理类基准家族

GPQA 不是唯一一个。了解几个同类:

基准测什么特点
GPQA Diamond博士级科学推理抗搜索,198 题精选集
HLE(Humanity’s Last Exam)人类最难问题合集极难、极新,防污染
ARC-AGI-2抽象图形推理测“从未见过的任务”,反记忆
BIG-Bench Hard23 个困难任务覆盖广,测多步推理

它们的共同思路:题目越难、越新、越搜不到,就越能测出真正的推理,而不是记忆。

实战:GPT-6 Astra 在 GPQA 上 96%,但所有人都挤在一起

2026 年 9 月 GPT-6 Astra 发布,官方对比数据让“饱和”在 GPQA 上变成现实:

模型GPQA Diamond相对领先
GPT-6 Astra96.0%新一代
GPT-5.6 Sol94.6%上一代
Claude Fable 5.193.7%竞品
Claude Opus 593.7%竞品
Gemini 3.8 Flash95.3%竞品

图3:GPQA Diamond 真实跑分——五款头部模型挤在 93.7%~96.0% 之间,人类博士基线约 65%,领先差距只有 1-2 分。Astra 96.0% 刷新纪录,但全体已进入饱和区。

这张图值得反复看,因为它同时演示了本篇的两个论点:

第一,“背不着”的设计确实有效。 Astra 在 GPQA 上拿到 96.0%,是在“搜不到答案、只能现场推”的前提下——说明新一代模型的推理能力是真实提升,不是背诵。2022 年最强的模型在 GPQA 上几乎全军覆没,四年时间从个位数走到 96%,这是 GPQA 这类抗搜索基准存在的意义:它真的测到了“推得动”。

第二,96% 已经是饱和信号。 五款头部模型全部挤在 93.7%-96.0% 的区间里,新一代对上一代的领先只有 1-2 分——这个差距已经接近测量噪声。GPQA 只有 198 题,随机误差让 1-2 分的“领先”不再可信。按照第 2 篇的逻辑:GPQA Diamond 正在从“考场”变成“地板检查”——如果模型在 GPQA 上低于 90%,说明推理有明显短板;但 95.3% 和 96.0% 谁更强,这个基准已经回答不了。

第三,Astra 的高分不代表日常可靠。 96% 是“极限推理”的上限成绩;生产环境里一个模型每天处理海量普通任务,可靠性与这个单点高分不是一回事。这也是为什么 GPQA 之后,评测社区把注意力转向更“不可背诵”的新卷子(ARC-AGI-3)和真实任务(SWE-bench、Terminal-Bench)——后面几篇的主角。

当五款模型在“博士题”上全部考到 94% 上下,该换一张更难、更不可背的卷子了——这就是评测社区正在做的事。

小结

  • “答对”不等于“会推理”,记忆型高分和推理型高分是两回事。
  • GPQA 用博士级、抗搜索的题目,是目前测推理的重要样本。
  • 头部模型已超过人类博士基线,但 GPQA 测的是上限,不等于日常可靠性。

下一篇,我们看另一个能力维度——数学。从“小学应用题”到“数学竞赛题”,AI 的数学能力是怎么一步步被测出来的?

能背下整本习题册,和能解出一道没见过的题,不是一回事。

LLM测评 Benchmark GPQA 推理 科普