DSBench 测试集档案
DSBench 测试集中文档案:拿真实数据竞赛题考 AI 当数据分析师和建模工程师 由 UT Dallas、USC、Tencent AI Lab Seattle(Liqiang Jing 等,ICLR 2025),arXiv:2409.07703 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- DSBench
- DSBench(WebDev 代理)
- UT Dallas、USC、Tencent AI Lab Seattle(Liqiang Jing 等,ICLR 2025),arXiv:2409.07703
已发布事实
- 发布方
- UT Dallas、USC、Tencent AI Lab Seattle(Liqiang Jing 等)
- 发表
- ICLR 2025(arXiv:2409.07703)
- 任务规模
- 466 道数据分析题(ModelOff)+ 74 道数据建模题(Kaggle)
- 分析题形态
- 选择题/填空题,背景材料平均约 749 词,多模态(Excel、表格、图片)
- 建模题形态
- 端到端机器学习竞赛:预处理、建模、调优、产出提交文件
- 计分
- 分析题按准确率(数值给容差);建模题按任务指标与相对表现差距 RPG
它测什么
测的是 agent 干数据科学这行的真本事,题目全部来自真实数据竞赛。分两大类:466 道数据分析题取自 ModelOff 竞赛的迷你案例,要求读懂长背景材料和多份数据文件后回答分析问题;74 道数据建模题取自 Kaggle,要求端到端完成整个机器学习竞赛流程。刻意保留真实世界的复杂度:长上下文、多模态背景(Excel、表格、图片)、大体积数据文件、多表关联。
怎么测
分析题以选择题或填空题形式给出,背景材料平均约 749 词,答案按准确率判分(数值答案给容差)。建模题则给训练集和测试集,agent 要自己写代码完成预处理、建模、调优,最后产出符合竞赛提交格式的预测文件,按任务指标和相对表现差距(RPG)计分。模型需要在能执行代码的 agent 环境里跑完整个流程,不是一次性问答。
分数怎么看
论文评测的当时最强 agent 也只解决了 34.12% 的数据分析任务,建模任务的相对表现差距(RPG)为 34.74%——离「数据科学专家」还差得远。这个榜的意义在于揭示:模型在编程榜上分数再高,面对真实数据工作的脏活(长材料、脏数据、多表关联)依然会翻车。
局限
题目源自公开的 ModelOff 和 Kaggle 竞赛,这些材料在模型预训练语料中很可能出现过,存在污染风险。另外注意撞名:DeepSeek 后来发布过内部的「DSBench-FullStack / DSBench-Hard」编程基准,与本条目完全是两回事,引用时需分清。
典型任务
一道典型分析题:给你某公司业务背景的近千词描述、几张 Excel 表和图表,问「上个季度哪个产品线的毛利率下滑最多」式的经营分析问题,agent 得自己读懂表结构、跨表计算才能填出答案。建模题则直接复刻 Kaggle 竞赛:给你多 GB 的训练 CSV 和赛题说明,要求你提交一份对测试集的预测文件,像真人选手一样被排行榜指标评判。
沿革
- 2024-09-12:arXiv v1 发布,提出从真实竞赛取材的数据科学 agent 评测
- 2025-01:被 ICLR 2025 接收
- 2025-02-22:arXiv v2 修订
- 2026:DeepSeek 发布内部编程基准「DSBench-FullStack / DSBench-Hard」,与本条目撞名,第三方榜单开始出现混淆记录