Agent Arena 测试集档案
Agent Arena 测试集中文档案:让两个 AI agent 同题对战,用户投票定排名 由 UC Berkeley Gorilla 团队,2024-10 上线(agent-arena.com) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- Agent Arena
- Agent Arena 智能体
- Agentic 三榜(Coding / Browser-Use / Tool-Use)
- UC Berkeley Gorilla 团队,2024-10 上线(agent-arena.com)
已发布事实
- 机制
- 两两对战 + 用户投票,用扩展 Bradley-Terry 模型评分
- 特色
- 把胜负归因到模型 / 框架 / 工具子组件,除总榜外还有三张分榜
- 配套
- 1,000+ 真实用户任务的 prompt hub,可看各 agent 的完整执行过程
- 上榜组合示例
- LangChain + Brave-Search + GPT-4o 对阵 LlamaIndex + Wikipedia + Claude-3.5-Sonnet
- 状态
- 2024 年上线后近年活跃度一般
它测什么
Chatbot Arena 思路在 agent 上的移植:用户出一道题,两个 agent 各自实跑,用户投票选更好的那个。它的独特之处是把 agent 拆成「模型 + 框架 + 工具」三元组来评——比如 LangChain + Brave-Search + GPT-4o 对阵 LlamaIndex + Wikipedia + Claude-3.5-Sonnet——用扩展的 Bradley-Terry 模型把一场对局的胜负归因到每个子组件上,因此除了 agent 总榜,还能拆出模型榜、工具榜、框架榜。平台还带一个 1,000+ 任务的 prompt hub,可以看到真实用户都在让 agent 干什么。
怎么测
计分是 Elo 式对战评分:每局对战胜负更新双方评分,并用逻辑回归(L2 正则)拟合各子组件对胜负的贡献,避免常见组合搭配带来的混淆。排名实时更新,既能看整体 agent 强弱,也能回答「是不是这个搜索工具拖了后腿」这类问题。
分数怎么看
看这个榜的正确姿势是盯子组件榜而不只是总榜:总 Elo 告诉你哪个组合强,子组件分告诉你强在模型还是工具。适合给「我该选什么框架配什么模型」找参考。注意它近年活跃度一般,投票量有限时 Elo 波动较大,排名只能当方向性参考。
局限
重名重灾区:本站锚定 Berkeley Gorilla 团队这个 Agent Arena,勿与微软 Windows Agent Arena、Android Agent Arena 等同名基准混淆。机制上它是用户投票式评估,主观性强、样本量小,权威性不如执行校验型基准;平台规划中的多轮、私有数据接入等能力多年未完全落地。
典型任务
官方博客展示的真实对战:用户给一份去年销售数据 CSV 让 agent 分析该加大哪些产品——GPT-4o + SQL agent 把 CSV 误当 SQLite 数据库报错卡壳,GPT-4o + Pandas DataFrame 则顺利找出畅销的 Laptop、Smartphone 并建议扩产 Headphones。另一例是「规划旧金山到 Carmel-by-the-Sea 的一日游,选最省油且景点最多的路线」,crewAI 旅行规划 agent 与 LangChain 搜索 agent 同题竞技,胜负由用户看谁给的行程更靠谱。
沿革
- 2024-09-29:Berkeley Gorilla 团队发布博客宣布上线 agent-arena.com
- 2024-10:平台正式开放,配套 prompt hub 积累真实用户任务
- 2024 之后:路线图中的多轮对话、私有数据接入(Jira/GitHub/GSuite)等规划多年未完全落地,活跃度走低