MATH-500 测试集档案
MATH-500 测试集中文档案:经典 MATH 题库的 500 题精选子集 由 原始 MATH 为 Hendrycks et al. 2021;500 题采样由 OpenAI(prm800k math-splits) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- MATH-500
- 原始 MATH 为 Hendrycks et al. 2021;500 题采样由 OpenAI(prm800k math-splits)
已发布事实
- 题量
- 500 题,采样自 MATH 测试集(原始题库 1.25 万题)
- 主题
- 预代数/代数/几何/数论/计数与概率/中级代数/预备微积分 7 类
- 难度
- Level 1–5 五档
- 答案形式
- LaTeX \boxed{} 最终答案,符号等价判分
- 出处
- OpenAI PRM800K 项目的 math-splits;社区版为 HuggingFaceH4/MATH-500
它测什么
原始 MATH 是 Hendrycks 等人 2021 年发布的 1.25 万道高中竞赛数学题;MATH-500 是 OpenAI 在 PRM800K 项目中从 MATH 测试集抽出的 500 题子集(math-splits),因为体量适中、判分方便,成了社区默认的快速数学评测集。题目覆盖预代数、代数、几何、数论、计数与概率、中级代数、预备微积分 7 个主题,难度分 1–5 级,每题都要求给出 LaTeX 格式的最终答案。
怎么测
模型看到题目后输出完整解答,把最终答案写在 \boxed{} 里;判分用符号等价(比如 1/2 和 0.5、3√13 的等价写法都算对)而非简单字符串匹配。报整体准确率,也常按难度级别拆开看。HuggingFaceH4/MATH-500 是最常用的数据版本。
分数怎么看
它曾是衡量数学能力的主力指标,但 2024 年后快速饱和:DeepSeek-R1 已达 97.3%,头部模型基本都在 95% 上下。如今它主要用作中小模型的回归测试和训练过程监控——前沿模型之间的差距在这个集上已经看不出来了。
局限
题目和解答在网上流传多年,污染风险高,高分不能证明模型没见过题;接近饱和导致对前沿模型丧失区分度;500 题全部来自同一个原始题库,覆盖面窄。看前沿模型的数学能力请转去 AIME 新年份、HMMT 或 MathArena Apex。
典型任务
简单的如 Level 3 数论题「196 有多少个正整数因子?」——先分解 196=2²·7²,答案 9。难的如 Level 5 中级代数题「求不超过 (√7+√5)⁶ 的最大整数,不许用计算器」——标准技巧是配上共轭项 (√7−√5)⁶ 凑出整数,答案 13535。还有绕两层的「284 的真因子之和的真因子之和是多少」(答案恰好回到 284)。可以看出 5 级题已经需要真正的技巧,不是套公式能解决的。
沿革
- 2021-03:Hendrycks 等人发布 MATH 数据集(arXiv:2103.03874),1.25 万道高中竞赛题
- 2023-05:OpenAI 发布 PRM800K(arXiv:2305.20050),其中 math-splits 划定 500 题测试子集
- 2024:HuggingFaceH4/MATH-500 上线,成为社区默认的快速数学评测集
- 2025-01:DeepSeek-R1 达 97.3%,宣告对前沿模型近饱和,退居回归测试用途