【LLM测评-04】AI 的数学能力:从小学应用题到研究级难题
这是“LLM测评”系列的第 4 篇。上一篇我们讲了推理基准 GPQA,这一篇沿着能力维度继续:数学。为什么“会做小学数学题”和“会做竞赛题”是两个时代的声明?
摘要
本文回答三个问题:数学基准为什么分了好几个档、每档各测什么、以及怎么判断一个“数学 95%”的声明值多少钱。
核心论点:数学是推理能力最干净的试验场——答案客观、可自动判定、几乎不存在“感觉对了”。但不同档位的数学题测的能力完全不同,读分必须先看档位。
从“小学应用题”说起
GSM8K 是 LLM 评测史上最有名的数学基准之一:8000 多道小学数学应用题。
“小明有 5 个苹果,给了小红 2 个,又买了 3 个,现在有几个?”——这类题。当年模型们挣扎其中,GSM8K 曾是好用的分水岭。
但 2026 年的现实是:头部模型在 GSM8K 上已经接近满分。 小学数学题不再能区分任何头部模型。这不是模型突然都会算数了——是这类题被学透了。
数学基准的难度阶梯
数学评测从不只有一档,它是一道从小学到研究级的阶梯:

| 基准 | 难度档位 | 2026 状态 |
|---|---|---|
| GSM8K | 小学数学应用题 | 已饱和,头部接近满分 |
| MATH | 竞赛数学(AMC 级别) | 接近饱和,区分度下降 |
| AIME | 高级数学竞赛 | 仍是主战场,推理模型在此拉开差距 |
| FrontierMath | 前沿研究级新题 | 最难最新,几乎无人高分 |
读榜第一课:看到“数学 95%”,先问是哪一档。 小学数学 95% 和竞赛数学 95%,是完全不同的两种能力声明。
同一批模型,换一档题分数暴跌
把同一批头部模型放到四个档位上,分数分布是这样的(示意量级):

这个“断崖式”分布说明了三件事:
- 档位决定分数:离开档位谈“数学 X%”没有意义。
- 饱和是渐进过程:最低档先饱和,然后一档档往上“攻陷”——GSM8K → MATH → AIME,这个过程本身就是能力进步的度量。
- 最难档是当前前沿:FrontierMath 这类新题,因为太新、太难,还没有被训练数据污染,是当前区分顶尖模型的重要标尺。
为什么数学是“干净的”评测
数学基准有个其他领域没有的优势:答案客观,自动判定几乎零争议。
一道题,答案是 42,模型答 42 就是对,答 41 就是错。不需要人工评委、不需要 LLM-as-Judge、不存在“文采好不好”的争议。
这听起来简单,但在 AI 评测里极其宝贵——它意味着数学分数可复现、可审计、可信。当你想验证一个“推理能力很强”的声明时,数学基准是第一块试金石。
局限:数学好 ≠ 什么都好
也要说清楚数学测不到什么:
- 不测真实场景的“建模”:把现实问题翻译成数学问题的能力,和解题能力不是一回事。
- 不测创造力和判断力:数学答案唯一,但很多真实任务没有唯一答案。
- 过度训练风险:公开的竞赛题库也可能进入训练数据,所以新题(如 FrontierMath)才更值钱。
实战:FrontierMath Tier 4 被考到 97.6%——“最难”也快被攻陷了
2026 年 9 月 GPT-6 Astra 发布,给数学档位理论提供了最新鲜的真实数据。最难的 FrontierMath Tier 4(研究级数学,官方口径):
| 模型 | FrontierMath Tier 4 v2 |
|---|---|
| GPT-6 Astra | 97.6% |
| Claude Fable 5.1 | 87.8% |
| GPT-5.6 Sol | 83.0% |
| Claude Opus 5 | 73.2% |

这个案例把“难度阶梯”和“饱和”两个概念都演活了:
第一,“最难的卷子”也在被攻陷。 两年多前 FrontierMath Tier 4 被视为“人类顶尖数学家的难题高地”,几乎无人能高分;Astra 直接考到 97.6%,逼近 98% 饱和线。上一代 Sol 83%、Claude 87.8%——档位在前进,饱和也在前进:GSM8K 饱和 → MATH 饱和 → AIME 拉锯 → 现在连 FrontierMath 也进入尾声。
第二,差距在收敛。 Astra 对 Sol 领先 14.6 分、对 Fable 5.1 领先 9.8 分——这个差距比 GPQA 上大得多,说明 FrontierMath 仍是当前区分度最好的数学卷子。但它的区分度也在快速消耗,因为这是“新一代 vs 旧一代”的差距,而新一代已经把卷子考穿了。
第三,读档位,也要读数据来源。 一个关键提醒:FrontierMath 由 Epoch AI 开发,而 Epoch AI 已被披露与 OpenAI 存在资助关联(详见本系列第 7 篇)。这不代表分数造假,但意味着“官方口径”这里要更谨慎——这正是“先问分数是谁的”的又一次实践。
小结
- 数学基准分多档,从 GSM8K 到 FrontierMath,档位决定分数含义。
- 低档已饱和,当前区分点在高档竞赛题和前沿新题。
- 数学分数客观可审计,是验证“推理能力”声明的最佳起点,但只是能力地图的一个维度。
下一篇,我们看最贴近程序员日常的赛道——代码:从“写个函数”到“修好一个真实 bug”,AI 程序员是怎么被考试的?
小学数学 95% 和竞赛数学 95%,是两个时代的声明。