Codeforces Rating 测试集档案
Codeforces Rating 测试集中文档案:直接拿竞赛平台的 Elo 分给 AI 排名 由 Codeforces 平台;标准化评测代表作 CodeElo(阿里 Qwen 团队,arXiv:2501.01257) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- Codeforces Rating
- Codeforces
- CFEval / CodeForces
- Codeforces 平台;标准化评测代表作 CodeElo(阿里 Qwen 团队,arXiv:2501.01257)
已发布事实
- 题型
- 真实竞赛题,题目难度 rating 800–2400+
- 平台
- Codeforces,2010 年上线(Mike Mirzayanov)
- 标准化评测
- 代表作 CodeElo(阿里 Qwen 团队,2025-01):54 场比赛、387 题
- 计分方式
- 与人类选手同体系的 Elo/rating
- 判题方式
- 机器人直交官方平台,隐藏测试 + special judge,零误判
- 提交预算
- CodeElo 每题最多 8 次提交,失败按平台规则罚分
它测什么
这不是一个独立题库,而是「用人类竞赛平台的尺子量 AI」:让模型做 Codeforces 上的真实竞赛题(题目难度 rating 从 800 到 2400+),再折算成与人类选手同体系的 Elo rating。题目难度本身有精确定义:一道 rating 为 x 的题,表示 rating 为 x 的人类选手第一次见它有 50% 概率做出。代表作是 Qwen 团队的 CodeElo(2025-01),收录 2024 年 5–11 月的 54 场比赛、387 题,首次做到与人类完全可比的评分。
怎么测
CodeElo 的做法最「硬核」:用机器人把模型生成的代码直接提交到 Codeforces 官方平台,跑平台的隐藏测试和 special judge(约三成题答案不唯一、需要专门判题器),全过才算 Accept,实现零误判。每题最多提交 8 次,失败罚分照平台规则算。Elo 换算把每场比赛当独立事件:将模型的成绩插入该场人类选手名次表,用二分搜索反解出「打出这个名次所对应的期望 rating」,方差比平台官方的逐场更新法更低。
分数怎么看
rating 直接对照人类段位,是少数「人机同尺」的编程指标。CodeElo 实测(2025 初):o1-mini 拿到 1578,约超过近 90% 的人类参赛者;QwQ-32B-Preview 1261 约在 60 百分位;其余模型大多连最简题都吃力,落在人类最低的 10–25 百分位。此后各厂商发布推理模型时常自报 Codeforces 分数,头部数字已远超于此。
局限
「CFEval」只是厂商自报 Codeforces 分数时的非正式标签,不是独立基准,本站统一归到本条。各家自报口径差异很大(选题范围、是否允许重复提交、是否真在平台判题、是否对齐训练截止后的新题),横向对比前务必确认方法是否对齐 CodeElo 这类标准化做法。
典型任务
一场典型评测就是一场真实比赛:模型拿到题面(保留原始 HTML 格式,含输入输出约定、数据范围和时限),要写出完整可提交的 C++ 程序——论文发现强制用 C++ 时几乎所有模型分数更高,因为竞赛题卡运行时间,而模型默认爱写 Python。题目的算法标签(贪心、DP、图论等 35 种,平均每题 3.9 个)对模型不可见,事后用于分析:模型普遍擅长数学和模拟类题,栽在动态规划和树上。
沿革
- 2010:Codeforces 平台上线,逐渐成为全球竞赛编程主战场
- 2023:OpenAI 报 GPT-4 的 Codeforces rating 约 392,处于人类底部 5%
- 2024-12 前后:o1、o3、DeepSeek-R1 发布均以 Codeforces 分数作卖点,但各家自报口径不一
- 2025-01:Qwen 团队发布 CodeElo(arXiv:2501.01257):机器人直交平台、人机可比 Elo,o1-mini 1578 居首