IMO 2025 测试集档案
IMO 2025 测试集中文档案:2025 国际奥数赛场,两大 AI 同达金牌线 由 国际数学奥林匹克(第 66 届,2025-07);AI 评测方为 Google DeepMind 与 OpenAI 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- IMO 2025
- IMO 2025 · Speciale
- 国际数学奥林匹克(第 66 届,2025-07);AI 评测方为 Google DeepMind 与 OpenAI
已发布事实
- 届次
- 第 66 届 IMO(2025-07,澳大利亚阳光海岸)
- 题量与计分
- 6 道证明题,每题 0–7 分,满分 42,金牌线 35
- AI 成绩
- Gemini Deep Think 与 OpenAI 实验模型均为 35/42
- 认证差异
- Google 由 IMO 官方协调员按学生答卷标准认证;OpenAI 自行组织评分
- 赛制约束
- 与人类选手同样的 4.5 小时时限,自然语言作答,不用形式化证明工具
它测什么
国际数学奥林匹克(IMO)是全球最高水平的中学生数学竞赛,两天做 6 道证明题,每题 0–7 分、满分 42,通常只有约 8% 的选手能过金牌线。2025 年 7 月的第 66 届意外成为 AI 的「世纪考场」:Google DeepMind 的 Gemini Deep Think 高级版和 OpenAI 的实验性推理模型先后宣布拿到 35/42——正好压在金牌线上。这是 AI 首次在 IMO 正式规则下达到金牌水平。
怎么测
两边都让模型在与人类选手相同的 4.5 小时时限内,直接读自然语言题面、输出自然语言完整证明,不借助形式化证明工具。Google 的答卷由 IMO 官方协调员按学生答卷同一标准认证;OpenAI 未走官方渠道,而是自行组织前 IMO 奖牌得主评分,其独立性当时引发了争议。
分数怎么看
35/42 是里程碑:它证明顶级推理系统已能在最严的人类数学赛制下与金牌选手同台。但注意这是一次性事件而非持续榜单——每年题目不同,分数无法跨年比较,2025 年的 35 分和 2026 年的成绩没有可比性。
局限
OpenAI 的成绩未获 IMO 官方认证,其评分独立性和抢在官方日程前官宣的做法均有争议;两套系统都是未公开的实验版本,外界无法复现;单次六题的结果不应外推为「AI 数学能力全面超越人类」——同年 USAMO 式的人工评阅早就揭示过模型证明里的水分。
典型任务
第 1 题定义「阳光线」:不平行于 x 轴、y 轴和直线 x+y=0 的直线;要求确定所有非负整数 k,使得存在 n 条直线覆盖所有满足 a+b≤n+1 的格点 (a,b)、且其中恰好 k 条是阳光线。第 6 题「Matilda 铺砖」是全场最难题:在 2025×2025 方格里放矩形瓷砖,使每行每列恰好留出一个空格,求最少要多少块(答案 2112)——MathArena 后来把它改成最终答案题测试,81% 的模型答 4048 并附上一段假证明。Gemini 六题中五题拿了满分。
沿革
- 1959:首届 IMO 在罗马尼亚举办,此后每年一届
- 2025-07-17:MathArena 发布针对 IMO 2025 题目的独立评测博文,为随后的金牌官宣提供了第三方对照
- 2025-07-19:OpenAI 宣布其实验模型 35/42 达金牌线,因自评且抢在官方日程前官宣引发争议
- 2025-07-21:Google DeepMind 宣布 Gemini Deep Think 35/42(六题中五题满分),获 IMO 官方协调员认证