Home
avatar

.Sam

【LLM测评-04】AI 的数学能力:从小学应用题到研究级难题

这是“LLM测评”系列的第 4 篇。上一篇我们讲了推理基准 GPQA,这一篇沿着能力维度继续:数学。为什么“会做小学数学题”和“会做竞赛题”是两个时代的声明?

摘要

本文回答三个问题:数学基准为什么分了好几个档、每档各测什么、以及怎么判断一个“数学 95%”的声明值多少钱。

核心论点:数学是推理能力最干净的试验场——答案客观、可自动判定、几乎不存在“感觉对了”。但不同档位的数学题测的能力完全不同,读分必须先看档位。

从“小学应用题”说起

GSM8K 是 LLM 评测史上最有名的数学基准之一:8000 多道小学数学应用题。

“小明有 5 个苹果,给了小红 2 个,又买了 3 个,现在有几个?”——这类题。当年模型们挣扎其中,GSM8K 曾是好用的分水岭。

但 2026 年的现实是:头部模型在 GSM8K 上已经接近满分。 小学数学题不再能区分任何头部模型。这不是模型突然都会算数了——是这类题被学透了。

数学基准的难度阶梯

数学评测从不只有一档,它是一道从小学到研究级的阶梯:

图1:数学基准难度阶梯——GSM8K(小学数学,已饱和)、MATH(竞赛数学 AMC 级别,接近饱和)、AIME(高级竞赛,仍是主战场)、FrontierMath(前沿研究级新题,最难最新)。越往右越难,越难被刷。

基准难度档位2026 状态
GSM8K小学数学应用题已饱和,头部接近满分
MATH竞赛数学(AMC 级别)接近饱和,区分度下降
AIME高级数学竞赛仍是主战场,推理模型在此拉开差距
FrontierMath前沿研究级新题最难最新,几乎无人高分

读榜第一课:看到“数学 95%”,先问是哪一档。 小学数学 95% 和竞赛数学 95%,是完全不同的两种能力声明。

同一批模型,换一档题分数暴跌

把同一批头部模型放到四个档位上,分数分布是这样的(示意量级):

图2:同一批模型换档位分数的示意——GSM8K 约 97%、MATH 约 90%、AIME 约 80%、FrontierMath 不到 10%。难度越高分数越低、区分度越好。数值为示意量级,真实榜单以官方 leaderboard 为准。

这个“断崖式”分布说明了三件事:

  1. 档位决定分数:离开档位谈“数学 X%”没有意义。
  2. 饱和是渐进过程:最低档先饱和,然后一档档往上“攻陷”——GSM8K → MATH → AIME,这个过程本身就是能力进步的度量。
  3. 最难档是当前前沿:FrontierMath 这类新题,因为太新、太难,还没有被训练数据污染,是当前区分顶尖模型的重要标尺。

为什么数学是“干净的”评测

数学基准有个其他领域没有的优势:答案客观,自动判定几乎零争议。

一道题,答案是 42,模型答 42 就是对,答 41 就是错。不需要人工评委、不需要 LLM-as-Judge、不存在“文采好不好”的争议。

这听起来简单,但在 AI 评测里极其宝贵——它意味着数学分数可复现、可审计、可信。当你想验证一个“推理能力很强”的声明时,数学基准是第一块试金石。

局限:数学好 ≠ 什么都好

也要说清楚数学测不到什么:

  • 不测真实场景的“建模”:把现实问题翻译成数学问题的能力,和解题能力不是一回事。
  • 不测创造力和判断力:数学答案唯一,但很多真实任务没有唯一答案。
  • 过度训练风险:公开的竞赛题库也可能进入训练数据,所以新题(如 FrontierMath)才更值钱。

实战:FrontierMath Tier 4 被考到 97.6%——“最难”也快被攻陷了

2026 年 9 月 GPT-6 Astra 发布,给数学档位理论提供了最新鲜的真实数据。最难的 FrontierMath Tier 4(研究级数学,官方口径):

模型FrontierMath Tier 4 v2
GPT-6 Astra97.6%
Claude Fable 5.187.8%
GPT-5.6 Sol83.0%
Claude Opus 573.2%

图3:FrontierMath Tier 4 真实跑分——Astra 97.6% 逼近 98% 饱和线,上一代 Sol 83.0%,Claude Fable 5.1 87.8%,Opus 5 73.2%。研究级新题也在被快速攻陷。

这个案例把“难度阶梯”和“饱和”两个概念都演活了:

第一,“最难的卷子”也在被攻陷。 两年多前 FrontierMath Tier 4 被视为“人类顶尖数学家的难题高地”,几乎无人能高分;Astra 直接考到 97.6%,逼近 98% 饱和线。上一代 Sol 83%、Claude 87.8%——档位在前进,饱和也在前进:GSM8K 饱和 → MATH 饱和 → AIME 拉锯 → 现在连 FrontierMath 也进入尾声。

第二,差距在收敛。 Astra 对 Sol 领先 14.6 分、对 Fable 5.1 领先 9.8 分——这个差距比 GPQA 上大得多,说明 FrontierMath 仍是当前区分度最好的数学卷子。但它的区分度也在快速消耗,因为这是“新一代 vs 旧一代”的差距,而新一代已经把卷子考穿了。

第三,读档位,也要读数据来源。 一个关键提醒:FrontierMath 由 Epoch AI 开发,而 Epoch AI 已被披露与 OpenAI 存在资助关联(详见本系列第 7 篇)。这不代表分数造假,但意味着“官方口径”这里要更谨慎——这正是“先问分数是谁的”的又一次实践

小结

  • 数学基准分多档,从 GSM8K 到 FrontierMath,档位决定分数含义。
  • 低档已饱和,当前区分点在高档竞赛题和前沿新题。
  • 数学分数客观可审计,是验证“推理能力”声明的最佳起点,但只是能力地图的一个维度。

下一篇,我们看最贴近程序员日常的赛道——代码:从“写个函数”到“修好一个真实 bug”,AI 程序员是怎么被考试的?

小学数学 95% 和竞赛数学 95%,是两个时代的声明。

LLM测评 Benchmark 数学 AIME 科普