BrowseComp 测试集档案
BrowseComp 测试集中文档案:考 AI 大海捞针:翻遍全网找一条冷门事实 由 OpenAI,2025-04 随 Deep Research 发布(arXiv:2504.12516) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- BrowseComp
- BrowseComp 浏览理解
- MCP Atlas / BrowseComp
- OpenAI,2025-04 随 Deep Research 发布(arXiv:2504.12516)
已发布事实
- 题量
- 1,266 道(初版 1,287 道,复核后删 21 道)
- 出题方法
- 倒装出题:先锁定冷门答案,再用其属性编谜面
- 话题分布
- 影视 16.2%、科技 13.7%,艺术/历史/体育/音乐等各约 10%
- 判分方式
- AI grader 语义比对短答案(与 HLE 同一判分 prompt)
- 难度门槛
- 当时 GPT-4o/o1/早期 Deep Research 均做不出 + 五次谷歌首页无果 + 人类十分钟做不出
- 人类参照
- 出题的训练师自己做(禁 AI、两小时上限)仅解出 29.2%
它测什么
测浏览 agent「找藏得深但好验证的信息」的能力,1,266 道题。出题方式是「倒装」:出题人先锁定一个冷门事实(一个人、一场比赛、一篇论文),再挑出它的一组属性反过来说成谜面,让答案在理论上唯一、但几乎搜不到。这样的设计故意避开了日常搜索——答案是那种「Google 第一页绝对没有、但找到了一眼能确认」的东西,专测检索的毅力和策略,而不是知识储备。
怎么测
agent 带着问题自主上网,可以反复搜索、翻页、换关键词,最后交一个简短答案。参考答案都是短字符串,判分用一个 AI grader(与 Humanity's Last Exam 同一套判分 prompt)判断模型答案与参考答案是否语义等价,报准确率。出题时有三道难关把关:当时的 GPT-4o、o1 和早期 Deep Research 都答不出;简单搜五次首页没有;另一个人十分钟内也做不出。
分数怎么看
发布时的数字很有冲击力:GPT-4o 不开浏览只有 0.6%,开了浏览也才 1.9%,OpenAI Deep Research 约 51.5%——是当时唯一能做这个榜的系统,也成了各家 deep research 产品的必争之地。连出题的人类训练师自己做(不许用 AI、两小时上限)也只解出 29.2%。
局限
它只测「找到一条难找的信息」,不测写长报告、处理模糊需求等真实搜索场景。倒装出题有固有缺陷:能保证参考答案对,但不能百分百保证没有第二个答案。题目和参考答案公开后污染风险上升(官方加了 canary 字符串过滤训练语料),且网页内容随时间变化会影响可解性;衍生版(BrowseComp-ZH、MM-BrowseComp 等)成绩与原始版不可混用。
典型任务
论文给的例子很有画面感:「1990 到 1994 年间,哪两支球队的足球比赛由巴西裁判执法、全场四张黄牌双方各两张、其中三张不出现在上半场、四次换人且一次是前 25 分钟因伤换人?」(答案:Ireland v Romania)。另一题:「找出这位虚构角色——偶尔打破第四面墙、背景故事里有无私的苦行僧相助、以幽默著称、主演的电视剧在 60 到 80 年代播出且不到 50 集」(答案:Plastic Man)。解题得把条件拆开、设计搜索路径、交叉验证, brute force 要翻成千上万个候选。
沿革
- 2025-04-10:随 OpenAI Deep Research 一同发布;GPT-4o 带浏览仅 1.9%,Deep Research 约 51.5%
- 2025:数据修订:复核 Deep Research 零通过率的 118 题,删除答案有误或歧义的 21 题,定格为 1,266 题
- 2025 起:衍生版陆续出现:BrowseComp-ZH(中文信息生态)、MM-BrowseComp(多模态)、BrowseComp-Plus 等