【LLM测评-00】AI 为什么也要“考试”?
这是“LLM测评”系列的第 0 篇。这个系列回答一个问题:AI 模型的能力到底怎么量? 从为什么需要考试讲起,一路拆到主流基准各自在测什么、榜单怎么读、以及怎么给自家模型出题。
摘要
本文回答三个问题:为什么 AI 也需要“考试”、一场 AI 考试由什么组成、以及“一个分数”和“一份榜单”之间差了什么。
核心论点:没有测量的进步只是宣传。 当一个模型的能力只能靠厂商发布会上的形容词来证明时,它就还停留在“感觉好用”的阶段;benchmark 就是把这套感觉变成可比较、可复现、可追溯数字的测量办法。
一个真实的困惑
先看一个普通用户每天都会遇到的场景。
你打开两个 AI 产品的评测页:A 产品说“我们拿下了某某榜单第一,准确率 92%”,B 产品说“我们的推理能力超过 GPT,在某某测试上领先 10 个百分点”。两个都拿数字说话,但你不知道该信谁——因为它们的数字不是同一把尺子量出来的。
这就像两个学校都宣传“升学率 95%”,但一个只统计重点班,一个统计全体学生。数字本身没有说谎,是测量口径在说谎。
AI 模型也一样。同一个模型,换个题目集、换个提示方式、换个评分规则,分数能差出几十个百分点。所以我们需要一套标准化的测量办法——这就是 benchmark(基准测试)。
Benchmark 的三块积木
一场 AI 的“考试”和人类的考试没有本质区别,都由三部分组成:
- 任务与数据:考什么。是一组多选题、一段代码题、还是一个需要操作工具的真实任务。
- 运行规则:怎么考。模型能调用哪些工具、提示词是什么、允许试几次、预算多少。
- 评分办法:怎么打分。答案是精确匹配还是人工评判,多次尝试算哪一次的成绩。

三个例子帮你快速建立直觉:
- MMLU:57 个学科的多选题(物理、历史、法律……),规则是“四选一”,评分是“答对比例”。它考的是知识面。
- GSM8K:小学数学应用题,考的是基础数学推理。
- SWE-bench:从真实开源仓库里挑出 issue,让模型自己改代码、跑测试。考的是“能不能干活”。
看出来了吗?这三场“考试”测的完全是不同的能力。没有一个大而全的分数能代表一个模型——这就是为什么会有那么多榜单,而不是一个“总榜”。
能力不是一个数,是一张地图
如果把 LLM 的能力画成地图,至少能看到八个维度:通用知识、复杂推理、数学、代码、Agent 与工具使用、多模态、对话偏好、安全与事实性。

一个模型可能在通用知识上考 90 分,在代码上只有 50 分;可能聊天体验极好,但一算数学就露馅。所以读任何 AI 榜单之前,第一件事是确认:这个榜测的是哪个维度?
跑分 vs 榜单
搞清楚两个容易混的词:
- 跑分(score):某一次测量的结果。比如“在 MMLU 上得了 85 分”。
- 榜单(leaderboard):把多份跑分按某种规则排在一起。榜单本身不产生分数,它只是把分数摆出来。
问题在于:摆出来的分数必须是同一把尺子量的,榜单才有意义。如果 A 模型是厂商自己用自家提示词跑的,B 模型是第三方用统一工具跑的,两者放在同一张榜上,比的其实是“谁的工具链更强”,而不是“谁更强”。
这正是本系列后面几篇要反复强调的主线:看分数之前,先问这个分数是谁的。
实战:GPT-6 Astra 的跑分,到底该怎么看
写这篇时(2026 年 9 月),OpenAI 刚刚发布 GPT-6 Astra,官方跑分一时刷屏。把它的真实数据摆出来,正好是上面所有概念的活教材:
- FrontierMath Tier 4(数学):官方口径 97.6%,接近这条测试的 98% 饱和线;
- GPQA Diamond(科学推理):96.0%,比上一代 GPT-5.6 Sol 的 94.6% 高出 1.4 个百分点;
- ARC-AGI-3(抽象推理):官方口径 99.9%,上一代只有 7.8%,看起来是“代际飞跃”;
- OSWorld 2.0 离线集(计算机操作):72.6%,人类基线约 72%,模型首次追平人类;
- Terminal-Bench 4.0(终端任务):57.9%,上一代 37.3%;
- Artificial Analysis 综合指数:61 分,与 GPT-5.6 Sol 的 61 分完全打平。

这张表值得逐行读三遍,因为每一行都在讲本篇的主线:
第一,同一个模型,数字可以差出 37 分。 ARC-AGI-3 的 99.9% 是 OpenAI 用自家 Responses API harness(允许长对话压缩、保留推理状态)跑出来的;ARC Prize 用标准 harness 复测,同一个模型只有 62.7%。模型没变,变的只是“怎么考”——这就是我们说的“测量口径在说谎”。
第二,分数要放在该测的能力维度上看。 在“纯推理”和“科学知识”上 Astra 接近饱和(96%~97.6%),但在“终端真实操作”上只有 57.9%。它不是一个“什么都 99 分”的模型,而是“在部分维度打爆、在其他维度仍有大量空间”的模型。只报最高分,就是误导。
第三,官方口径和第三方口径可以打架。 Artificial Analysis 独立评测给出 61 分,与上一代打平;官方宣传却说“代际飞跃”。不是有人撒谎,而是两边测的东西和权重不同。看懂这一点,你才不会被任何一张榜单牵着走。
同一个模型、同一天发布,分数从 57.9% 到 99.9% 都有——分数属于谁,决定了它值多少钱。
小结
- Benchmark 是 AI 的标准化考试,由任务、规则、评分三部分组成。
- 能力是多维的,没有“一个分数代表一切”的榜单。
- 跑分是一次测量,榜单是把测量结果放在一起;口径不一致的榜单没有比较意义。
下一篇,我们拿一份真实的跑分表解剖:一张榜单上除了分数,还藏着哪些必须读懂的细节?
先别问哪个模型分数高。先问这个分数是谁的。