SuperGPQA 测试集档案
SuperGPQA 测试集中文档案:285 个研究生学科、2.6 万题的广度大考 由 字节豆包团队 × M-A-P(2077.AI),arXiv:2502.14739(2025-02) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- SuperGPQA
- 字节豆包团队 × M-A-P(2077.AI),arXiv:2502.14739(2025-02)
已发布事实
- 题量
- 26,529 题,覆盖 13 门类 / 72 领域 / 285 个研究生二级学科
- 题型
- 最多 10 个选项(A–J,平均 9.67 个)的单选题
- 构造方式
- 80+ 专家标注员结合多轮 LLM 答题反馈的人机协作过滤
- 难度结构
- 约 42% 题目需要计算;约 77% 属 STEM(工程学 7892 题、理学 9838 题)
- 覆盖保证
- 每个二级学科至少 50 题
它测什么
SuperGPQA 把 GPQA「博士级难题」的思路从理化生三科扩展到 285 个研究生二级学科:13 大学科门类、72 个一级学科、26,529 道题,每个学科至少 50 题。它专门覆盖农学、军事学、教育学这类传统 benchmark 几乎不碰的长尾学科(约 77% 仍是 STEM,其中工程学 7892 题、理学 9838 题),约 42% 的题需要计算。出题采用「人机协作过滤」:80 多位专家标注员结合多轮 LLM 答题反馈,反复剔除太简单或有歧义的题,只留下能卡住模型的。
怎么测
每题是最多 10 个选项(A–J,平均 9.67 个)的单选题,模型选出唯一正确项,按准确率计分。官方评测支持 zero-shot 和 five-shot 两种模式,并提供按学科门类、按难度(易/中/难)拆分的细分准确率,方便看模型的短板到底在哪个领域。报分时最常见的是 overall 准确率。
分数怎么看
发布时(2025 年 2 月)最强推理模型 DeepSeek-R1 也只有 61.82%,o1 为 60.24%,普通对话模型普遍在 40–55%——60% 上下曾是前沿水平线。官方榜单持续更新,新一代模型已到 70% 以上(如 Gemini 3 Pro 约 73.8%)。分数低不代表模型差,而是长尾学科知识本来就难。
局限
体量大但摊到单学科题量小,细分学科层面的分数噪声大;部分题目源自公开数据集改造,存在污染可能;十个选项把蒙对率压到约 10%,但选择题终究测不了完整推导;作为 GPQA 的「广度互补版」,它测知识覆盖多于测深度推理。
典型任务
题目形式很统一:题干平均约 58 个 token、选项平均约 13 个 token,比如一道军事学或农学题给出一段专业情境,随后列出 A 到 J 十个候选,模型必须从中挑出唯一正确项;理工类则有相当比例要先推导计算、再从十个数值选项里挑答案。题目主体是新写的,但官方 README 注明有一小部分由既有数据集改造而来(包括 MMLU-Pro、MedQA、LawBench、AIME-AOPS 等),使用时需遵守原数据集协议。
沿革
- 2025-02:arXiv:2502.14739 发布,官方榜单 DeepSeek-R1 61.82% 居首,普通对话模型普遍 40–55%
- 2025-09:被 NeurIPS 2025 接收(Datasets & Benchmarks 方向 poster)
- 2025-11:Gemini 3 Pro Preview 上线官方榜单,以 73.75% 把榜首大幅推高