HMMT 测试集档案
HMMT 测试集中文档案:哈佛-MIT 数学赛真题,赛后立刻开测防背题 由 哈佛/MIT 学生组织;基准化由 MathArena(ETH SRI)赛后数天内完成 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- HMMT
- HMMT25
- HMMT(Thinking)
- 哈佛/MIT 学生组织;基准化由 MathArena(ETH SRI)赛后数天内完成
已发布事实
- 赛事方
- 哈佛/MIT 学生组织,每年 2 月、11 月各一场
- 基准规模
- 每场取 30 题(如 HMMT February 2025)
- 题型
- 最终答案型(数值或表达式),精确匹配判分
- 评测方
- MathArena(ETH SRI),赛后数天内上线评测
- 核心卖点
- 题目在模型训练数据截止后才公开,机制上防污染
它测什么
HMMT 是哈佛和 MIT 学生组织合办的高水平数学竞赛,每年 2 月、11 月各一场,个人赛按代数、组合、几何、数论分轮次,题目一律要求给出最终答案(数值或表达式)。作为 AI 基准,它由 MathArena(苏黎世联邦理工 SRI 实验室)在赛后数天内把新题整理上线评测,最常用的是 HMMT February 2025 的 30 题。它的核心价值是「新鲜」:题目在模型训练数据截止之后才公开,从机制上排除背题的可能,难度又普遍高于 AIME。
怎么测
按 MathArena 协议评测:模型逐题独立作答,输出完整推理和最终答案,与官方答案精确匹配判分;每题采样多次(通常 4 次起)报平均正确率。评测紧跟比赛日程——HMMT 2025 年 2 月 15 日举办,数天内模型分数就已上线,抢在任何厂商把新题喂进训练数据之前完成。
分数怎么看
在 MathArena 榜单上,HMMT February 2025 长期比同年 AIME 更难,同一模型在 HMMT 上的得分通常明显低于 AIME 2025。分数随模型迭代变化很快,以 matharena.ai 实时榜单为准;2025 年下半年头部模型(如 GPT-5)在最终答案型赛事整体上已到约 90%。
局限
题量小(每场 30 题),方差大;赛事本身是学生组织办的,基准化是第三方(MathArena)行为,不同平台或厂商自报可能用不同子集、不同采样次数,横向对比要看清协议;只判最终答案,证明类能力测不到。
典型任务
以 HMMT 2025 年 2 月几何轮第 1 题为例:矩形 ABCD 中 BC=24,内部一点 X 满足 ∠AXB=90°,已知 △AXD 和 △BXC 都是锐角三角形且外接圆半径分别为 13 和 15,求 AB 的长度——官方答案 14+4√37,需要作对称点加圆幂定理才能解出。组合轮第 1 题则要求计算把 1 到 7 这七个数排成一圈、满足特定相邻条件的排法数。题面都很短,但多数题需要竞赛技巧而非直接套公式。
沿革
- 1998:HMMT 由哈佛与 MIT 学生创办,此后每年两届
- 2025-02-15:HMMT February 2025 举办,数天内 MathArena 上线 30 题评测
- 2025-05:MathArena 论文 arXiv:2505.23281 发布,HMMT 成为其常驻赛事之一
- 2025-08:GPT-5 等头部模型在最终答案型赛事约 90%,MathArena 转而推出 Apex 难题集