【LLM测评-03】GPQA:AI 是真会推理,还是背得多?
这是“LLM测评”系列的第 3 篇。前两篇讲了 benchmark 的基本框架和“饱和”概念,这一篇进入最难测的能力之一——推理,以 GPQA 为例。
摘要
本文回答三个问题:为什么选择题考不出“推理”、GPQA 是怎么设计出“考不倒、背不着”的题目的、以及 AI 的高分到底算不算会推理。
核心论点:“答对”不等于“会推理”。 GPQA 这类博士级、抗搜索的题目,把“背得多”和“推得动”区分开来,是目前评估推理能力的重要样本。
一个反直觉的事实
先说一个让很多人惊讶的数据:GPQA 的题目,普通成年人平均只能答对约 34%,博士级专家大约 65%。这不是因为它出的是偏题怪题——恰恰相反,它出的是物理、化学、生物领域里“专家觉得值得考”的正经题。
问题在于:这些题设计成在网上搜不到标准答案。你可以开卷、可以搜索、可以查资料,但题目本身就要求你“现场推出来”。
这就是 GPQA 全称的含义:Google-Proof Q&A——谷歌都救不了你的问答。

记忆和推理,是两种不同的能力
为什么我们要专门区分“记忆”和“推理”?
想象两道题:
- 记忆型:珠穆朗玛峰有多高?见过就答对,训练语料里出现越多越容易对。
- 推理型:某个化合物在特定条件下为什么表现反常?需要排除干扰、多步推导,网上没有现成答案。
同一个模型,在这两类题上可能表现完全不同。一个“背书机器”在记忆型题上可以拿高分,遇到推理型题就露馅。
MMLU 的题目里混着大量记忆型题目,所以它高分不能证明推理强;而 GPQA 从设计上就偏向推理型——它能区分“背得多”和“推得动”。

AI 在 GPQA 上的表现意味着什么
2026 年的现状:头部推理模型在 GPQA Diamond(198 题的精选子集)上大约能到 65-80%,已经超过了人类博士专家的平均水平(约 65%),但离满分还很远。
这个结果该怎么读?
- 正面:模型确实掌握了一部分“现场推导”能力,不是单纯靠背诵——因为题目本身就防背诵。
- 谨慎:GPQA 只有 198 题,样本很小;超过人类博士基线不代表在所有领域都超过专家;单点高分也不代表稳定的推理能力。
- 关键提醒:GPQA 是“研究生水平”的硬核推理,它测的是上限能力。一个在生产环境里日常犯错的模型,也可以在 GPQA 上拿高分——上限测试和日常可靠性是两回事。
推理类基准家族
GPQA 不是唯一一个。了解几个同类:
| 基准 | 测什么 | 特点 |
|---|---|---|
| GPQA Diamond | 博士级科学推理 | 抗搜索,198 题精选集 |
| HLE(Humanity’s Last Exam) | 人类最难问题合集 | 极难、极新,防污染 |
| ARC-AGI-2 | 抽象图形推理 | 测“从未见过的任务”,反记忆 |
| BIG-Bench Hard | 23 个困难任务 | 覆盖广,测多步推理 |
它们的共同思路:题目越难、越新、越搜不到,就越能测出真正的推理,而不是记忆。
实战:GPT-6 Astra 在 GPQA 上 96%,但所有人都挤在一起
2026 年 9 月 GPT-6 Astra 发布,官方对比数据让“饱和”在 GPQA 上变成现实:
| 模型 | GPQA Diamond | 相对领先 |
|---|---|---|
| GPT-6 Astra | 96.0% | 新一代 |
| GPT-5.6 Sol | 94.6% | 上一代 |
| Claude Fable 5.1 | 93.7% | 竞品 |
| Claude Opus 5 | 93.7% | 竞品 |
| Gemini 3.8 Flash | 95.3% | 竞品 |

这张图值得反复看,因为它同时演示了本篇的两个论点:
第一,“背不着”的设计确实有效。 Astra 在 GPQA 上拿到 96.0%,是在“搜不到答案、只能现场推”的前提下——说明新一代模型的推理能力是真实提升,不是背诵。2022 年最强的模型在 GPQA 上几乎全军覆没,四年时间从个位数走到 96%,这是 GPQA 这类抗搜索基准存在的意义:它真的测到了“推得动”。
第二,96% 已经是饱和信号。 五款头部模型全部挤在 93.7%-96.0% 的区间里,新一代对上一代的领先只有 1-2 分——这个差距已经接近测量噪声。GPQA 只有 198 题,随机误差让 1-2 分的“领先”不再可信。按照第 2 篇的逻辑:GPQA Diamond 正在从“考场”变成“地板检查”——如果模型在 GPQA 上低于 90%,说明推理有明显短板;但 95.3% 和 96.0% 谁更强,这个基准已经回答不了。
第三,Astra 的高分不代表日常可靠。 96% 是“极限推理”的上限成绩;生产环境里一个模型每天处理海量普通任务,可靠性与这个单点高分不是一回事。这也是为什么 GPQA 之后,评测社区把注意力转向更“不可背诵”的新卷子(ARC-AGI-3)和真实任务(SWE-bench、Terminal-Bench)——后面几篇的主角。
当五款模型在“博士题”上全部考到 94% 上下,该换一张更难、更不可背的卷子了——这就是评测社区正在做的事。
小结
- “答对”不等于“会推理”,记忆型高分和推理型高分是两回事。
- GPQA 用博士级、抗搜索的题目,是目前测推理的重要样本。
- 头部模型已超过人类博士基线,但 GPQA 测的是上限,不等于日常可靠性。
下一篇,我们看另一个能力维度——数学。从“小学应用题”到“数学竞赛题”,AI 的数学能力是怎么一步步被测出来的?
能背下整本习题册,和能解出一道没见过的题,不是一回事。