GPQA Diamond 测试集档案
GPQA Diamond 测试集中文档案:博士级理化生选择题,谷歌也搜不到答案 由 NYU / Cohere / Anthropic 研究者(David Rein 等),arXiv:2311.12022,COLM 2024 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- GPQA Diamond
- GPQA
- GPQA Diamond(3.1 Pro 参考/Epoch 复现)
- NYU / Cohere / Anthropic 研究者(David Rein 等),arXiv:2311.12022,COLM 2024
已发布事实
- 题量
- Diamond 子集 198 题(全集 448 题,生物/化学/物理)
- 题型
- 四选一单选,评测时选项顺序随机打乱
- 出题人
- 对应领域博士级专家亲手编写,并由其他专家交叉验证
- 人类基线
- 领域专家约 65%(剔除自认笔误后 74%),非专家开卷用谷歌约 34%
- 防污染设计
- 作者明确要求不得在网上明文传播原题
它测什么
GPQA 全称 Graduate-Level Google-Proof Q&A,由 NYU 等机构的研究生发布,包含 448 道生物、化学、物理三个领域的博士级四选一题,全部由对应领域的博士级专家亲自编写。设计目标是「谷歌也救不了你」:让非本领域的高水平验证者开卷用搜索引擎查 30 分钟以上,正确率也只有约 34%,而本领域专家约 65%(剔除自认的笔误后 74%)。Diamond 是从中再筛出的 198 题——专家答得对、非专家大多答错的那批,是公认最难的子集,也是今天厂商报分默认用的版本。它针对的是「模型是否具备专家级科学推理」这一能力,而不是事实检索。
怎么测
模型拿到题干和四个选项,输出选项字母,按准确率计分。主流评测脚本(如 OpenAI simple-evals)会把选项顺序随机打乱,并且每题重复采样 4 次取平均,以降低选项位置带来的噪声。人类基线就是前面那组数字:专家约 65–74%,非专家约 34%,瞎蒙下限 25%。
分数怎么看
GPT-4 时代最强基线只有 39%,远低于专家;推理模型出现后分数快速攀升,如今前沿模型普遍超过专家基线,80% 以上算头部水平。它是判断「模型科学推理是否逼近博士专家」最常用的试金石之一,厂商发布新模型几乎必报。
局限
只有 198 题,统计噪声不小,一两个点的分差意义有限;题目虽有保密要求,但答案片段难免在网上流传,污染风险长期存在;Epoch AI 等第三方复现的分数与厂商自报常有出入,横向对比要认准同一评测口径。选择题形式也决定了它测不了完整的推导过程。
典型任务
论文给出的样题以一段具体科研情境开头(例如一道分子生物学题描述一位科学家的实验设置),随后给出四个都貌似合理的选项——三个干扰项同样按「能骗过聪明外行」的标准设计,必须真正懂该领域的机制和计算才能排除。值得注意的是,数据集作者明确要求不要在网上明文贴出原题,以防泄进训练语料,所以公开渠道几乎看不到完整题目,只能看到学科分布、评测脚本和各家分数。
沿革
- 2023-11:论文 arXiv:2311.12022 发布,448 题,当时最强 GPT-4 基线仅 39%
- 2024-09:OpenAI o1 发布,GPQA Diamond 成绩首次越过人类专家基线,成为推理模型时代的标志性时刻
- 2024:被 COLM 2024 录用;此后成为厂商发布新模型几乎必报的试金石
- 2025–2026:头部模型普遍 80%+,Epoch AI、Kaggle、OpenRouter 等第三方榜单开始独立复现以对冲厂商自报