AIME 测试集档案
AIME 测试集中文档案:美国奥数邀请赛真题,答案都是 0–999 整数 由 美国数学协会(MAA);基准数据集常用 HuggingFaceH4/aime_2024、math-ai/aime25 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- AIME
- AIME 2024/2025/2026
- AIME25(Thinking/Thinking-2507)
- AIME 2025 · Speciale
- AIME 2025(无工具/家族基准 R1-0528)
- 美国数学协会(MAA);基准数据集常用 HuggingFaceH4/aime_2024、math-ai/aime25
已发布事实
- 题量
- 每年 30 题(AIME I + II 各 15 题)
- 答案形式
- 0–999 的整数,精确匹配判分
- 真实赛制
- 3 小时、禁用计算器,AMC 高分者才有资格参加
- 常用数据集
- HuggingFaceH4/aime_2024、math-ai/aime25
- 通行报法
- 每题采样几十次取平均(avg@k),抑制小样本抖动
它测什么
AIME(美国数学邀请赛)是 MAA 主办的赛事,夹在 AMC 和 USAMO 之间——AMC 考得足够好才有资格参加,全国高中生里大约前 5% 能走到这一步。每年两场(AIME I/II)各 15 题共 30 题,覆盖代数、几何、数论、组合与概率,所有答案都是 0 到 999 的整数。这个「整数答案」设计让它天然适合自动判分,社区于是把历年真题整理成数据集测模型,最常用的是 2024、2025 年份。它针对的是竞赛级多步数学推理。
怎么测
模型拿到题目原文,自由输出推理过程,最后给出一个整数,与官方答案精确匹配判对错。真实考试给选手 3 小时、不许用计算器。因为一年只有 30 题、随机波动大,通行做法是每题采样几十次(常见 32 或 64 次)再取平均,报 avg@k 而不是单次正确率——看分数时一定要留意采样次数。
分数怎么看
2024 年初 GPT-4 类模型基本做不动,推理模型时代分数暴涨:头部模型在 AIME 2024 上普遍超过 90%,在更新的 AIME 2025 上最好成绩也在九成上下(MathArena 2025 年 8 月称 GPT-5 在其所有最终答案型赛事上都约 90%)。低于 50% 在今天只能算二线水平。
局限
一年只有 30 题,差一两题分数就抖动 3–7 个百分点,单次跑分参考价值有限;早年份真题在训练语料里泛滥,AIME 2024 的分数普遍被认为有污染,看最新年份才可靠;只判最终整数,推理过程错了但数字蒙对也算对——USAMO/IMO 类证明题正是为补这个洞而生。
典型任务
比如 2024 AIME II 第 1 题:Aimeville 镇 900 名居民中,195 人有钻戒、367 人有高尔夫球杆、562 人有园铲,且人人都有一袋心形糖果;已知 437 人恰好拥有其中两样、234 人恰好拥有三样,求四样全有的人数——用容斥原理列方程,答案是 73。中等难度的如 2024 AIME I 第 13 题:找最小的素数 p 使存在整数 n 满足 p² 整除 n⁴+1(p=17),再求最小的正整数 m 使 p² 整除 m⁴+1,答案 110。题目往往一句话就能读懂,但要做对得绕好几个弯。
沿革
- 1983:MAA 创办首届 AIME,作为 AMC 与 USAMO 之间的选拔环节
- 2024-02:AIME 2024 举办,随后被整理为最常用的评测数据集之一
- 2024-09:o1 发布后推理模型分数暴涨,AIME 成为衡量「数学推理进步」的默认标尺
- 2025-02:AIME 2025 举办;math-ai/aime25 等数据集跟进,社区转向新年份以规避污染
- 2025-08:MathArena 指出头部模型在 2025 年最终答案型赛事整体约 90%,AIME 开始「不够考」