AA Intelligence Index 测试集档案
AA Intelligence Index 测试集中文档案:第三方机构统一跑题,把 9 个硬基准揉成智能指数 由 Artificial Analysis(独立第三方评测机构) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- AA Intelligence Index
- AA 智能指数
- AA 智能指数 v4.1.1
- AA 综合评测
- AA 综合榜
- Artificial Analysis v4.1
- Artificial Analysis 智能指数
- Intelligence Index
- AA Intelligence Index(Thinking)
- AAII 推理榜
- AA Agentic
- AA Coding Agent Index
已发布事实
- 主办方
- Artificial Analysis,独立第三方评测机构
- 现行版本
- Intelligence Index v4.1.1,由 9 个评测合成
- 权重
- Agents 34% / Coding 24% / 科学推理 24% / 综合 18%
- 协议
- zero-shot、统一温度(推理模型 0.6)、pass@1 为主、部分评测重复 3-10 次
- 精度
- 官方估计指数 95% 置信区间小于 ±1%
- 配套
- 与价格、速度并列展示;另有 Agentic/Coding 等细分指数
它测什么
独立评测机构 Artificial Analysis 出品的综合智能分。与厂商自报分数不同,AA 用统一协议自己跑所有模型(zero-shot 指令提示、统一温度、pass@1 为主),再按固定权重合成指数。当前 v4.1.1 由 9 个评测按四大类加权:Agents 34%(GDPval-AA v2、τ³-Banking)、Coding 24%(Terminal-Bench v2.1、SciCode)、科学推理 24%(HLE、GPQA Diamond、CritPt)、综合 18%(AA-LCR 长文推理、AA-Omniscience 知识幻觉)。权重明显向 Agent 能力倾斜,是该指数的鲜明立场。榜单常与价格、速度并列展示,方便算「性价比」。
怎么测
所有模型在相同条件下跑题:非推理模型 temperature 0、推理模型 0.6;部分评测重复 3-10 次取平均;官方估计指数的 95% 置信区间小于 ±1%。每个模型页公开各子项分数,指数外还有一批单独报告的评测(LiveCodeBench、IFBench、MMLU-Pro、AA-Briefcase 等)不计入总分。评测仅限英文文本,多模态和多语言另有独立指数。
分数怎么看
头部模型在指数上通常只差几个点,官方 ±1% 的置信区间意味着 2-3 分以上的差距才比较有把握。注意 2026-01 的 v4.0 大改版把 MMLU-Pro 等一批趋于饱和的老基准踢出指数、换成 Agentic 和真实工作类评测(VentureBeat 有报道),所以新旧版本的分数不能直接比。
局限
指数的构成和权重由 AA 单方决定且会换版(v4.0 起构成大改),跨版本排名不可比;Agents 占 34% 是价值判断而非行业共识,想看纯推理或纯编程应看分项。别名里的 AA Agentic、AA Coding Agent Index、AA-Briefcase 是它家的细分指数,口径各自独立。
典型任务
指数里最重的一项 GDPval-AA v2:模型被丢进 E2B 沙箱,带着联网搜索和代码执行工具,最多 250 个回合,交出一份真实职业交付物(报告、PPT、表格),再由三家前沿模型组成的评审团盲评两份交付物谁更好,拟合成锚定「人类专家 = 1000」的 Elo。另一项 AA-LCR 则给模型塞约 10 万 token 的公司年报、法律文件,问 100 道硬问题,考长文推理。
沿革
- 2025 年中:v3 时代:MMLU-Pro、GPQA、HLE、SciCode、AIME 等难度型基准合成,被多篇学术论文采用
- 2026-01-06:v4.0 大改版:踢出 MMLU-Pro 等趋于饱和的老基准,纳入 Agentic 与真实工作类评测(VentureBeat 报道)
- 2026-02-25:方法论页更新至 v4.1.1:9 个评测,GDPval-AA v2 与 τ³-Banking 入列,Agents 权重升至 34%
- 2026-08:Claude Opus 5 以 63.0 领跑榜单