ExploitBench 测试集档案
ExploitBench 测试集中文档案:把漏洞利用拆成 16 级台阶,看 AI 爬到第几级 由 Seunghyun Lee、David Brumley(CMU),arXiv:2605.14153(2026-05) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- ExploitBench
- CTF 安全
- Semgrep 安全评测帖
- Seunghyun Lee、David Brumley(CMU),arXiv:2605.14153(2026-05)
已发布事实
- 任务集
- 41 个 V8(Chrome JS 引擎)真实漏洞
- 能力阶梯
- 16 级 flag:代码覆盖 → crash → 沙箱原语 → 任意读写 → 控制流劫持 → 任意代码执行
- 判分
- 确定性 oracle:随机挑战-应答 + 差分执行 + 信号处理器证明
- 报分
- 达成 flag 数 / 成功利用比例,能看出模型「卡在第几级」
- 发布
- arXiv:2605.14153,2026-05,作者 Seunghyun Lee 与 David Brumley(CMU)
它测什么
测安全 agent 真实攻击能力的「能力阶梯」基准。以往的漏洞利用评测把「让程序崩溃」就算成功,但从触发 bug 到真正控制目标之间隔着十万八千里。ExploitBench 把完整的利用过程拆成 16 个可量化 flag:从代码覆盖、触发 crash,到构造沙箱原语、任意地址读写、劫持控制流,直至任意代码执行(ACE)。实例化在 41 个 V8(Chrome JavaScript 引擎)真实漏洞上——选 V8 是因为它部署极广、利用链条最成熟,能代表攻击天花板。
怎么测
agent 拿到漏洞环境后自主尝试利用,每达成一级能力就被一个确定性 oracle 验证并记一个 flag:原语类能力用每轮随机化的挑战-应答验证(防止碰运气蒙对),进展用与 ground-truth 二进制的差分执行度量,代码执行用信号处理器证明。报分口径是达成的 flag 数和成功利用比例,因此能看出模型「卡在哪一级」,而不是只有一个过/不过。
分数怎么看
论文核心发现:公开模型大多止步于「能崩溃」这一级,走不到可利用的原语;而据 Anthropic 2026-05 的评测报告,其内部模型 Mythos Preview 在 41 个任务中有 21 个达到了任意代码执行,其他受测公开模型为 0。flag 数越深代表攻击能力越强,这个榜同时也是双刃剑能力的官方测量尺。
局限
只覆盖 V8 一个目标,分数不能直接外推到其他软件栈;部分高段位成绩来自厂商内部模型、外部无法复现。注意同类基准很多——Cybench、CVE-Bench、CyberGym 都是不同团队的独立作品,别混着比;站内「Semgrep 安全评测帖」标签归在此条,但那是厂商自测内容,与 ExploitBench 本身无关,引用时注意区分。
典型任务
一个任务的典型流程:agent 面对一个有已知 CVE 的 V8 构建,先要写出能执行到漏洞代码的输入(覆盖 flag),再触发崩溃(crash flag);接下来才是硬活——把崩溃加工成可复用的读写原语,比如实现「往任意内存地址写一个指定值」,oracle 会现场随机出题(写哪个地址、写什么值每轮都变)来验证这个原语是真的而不是凑巧;最终目标是在 V8 沙箱里拿到任意代码执行。
沿革
- 2026-05-13:arXiv v1 上线(2605.14153),提出 16 级能力阶梯与确定性验证 oracle
- 2026-05-22:Anthropic 发布《Measuring LLMs' ability to develop exploits》,用 ExploitBench 等三个基准测 Mythos Preview,公布 21/41 ACE 成绩
- 2026-05 同期:ExploitGym(Berkeley RDI,898 个漏洞)与 SCONE-bench 刷新版同月问世,漏洞利用评测从「有没有打穿」整体转向「打穿到哪一级」