AA-Omniscience 测试集档案
AA-Omniscience 测试集中文档案:6000 道事实题:答对加分、答错扣分、拒答不扣,专治不懂装懂 由 Artificial Analysis,2025-11 发布,arXiv:2511.13029 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- AA-Omniscience
- AA-omniscience
- AA-Omniscience 幻觉率/知识
- AA Omniscience 非幻觉率
- Artificial Analysis,2025-11 发布,arXiv:2511.13029
已发布事实
- 题量
- 6,000 题、6 领域 42 主题
- 选题依据
- 覆盖领域合计占 2024 年美国工资总额 44%
- 出题
- 出题 agent 从权威一手来源生成并按难度/歧义过滤
- 核心指标
- Omniscience Index(−100 ~ +100),另报 Accuracy 与 Hallucination Rate
- 地位
- AA Intelligence Index v4.1 组成指标
它测什么
AA-Omniscience 是第三方评测机构 Artificial Analysis 做的「知识可靠性」基准,核心思想是:光有知识不够,还得知道自己不知道。全库 6,000 道事实性问题,覆盖 6 个经济价值高的领域(商业、人文社科、健康、法律、软件工程、科学与工程数学)下的 42 个主题——这些领域合计占 2024 年美国工资总额的 44%。题目由专门的出题 agent 从权威一手资料(官方文档、公认教材等)生成,再按相似度、难度、歧义度过滤,保证答案有据可查且对前沿模型足够难。
怎么测
模型逐题作答,可以选择回答也可以拒答。核心指标 Omniscience Index 范围 −100 到 +100:答对加分、答错扣分、拒答(说「我不知道」)不扣分,0 分意味着答对和答错一样多——乱猜在这套规则下是净亏的。除指数外还公布 Accuracy(答对率)、Hallucination Rate(错误作答的比例)等子指标。这样设计是因为现有考试大多奖励猜测,训练出了「自信地胡说」的模型,而真实业务场景里一个自信的错误答案远比「我不知道」危险。
分数怎么看
发布时的结果相当难看:最高的 Claude 4.1 Opus 也只有 4.8 分,全场仅 3 个模型在 0 分以上——也就是说绝大多数前沿模型在这套「答错要罚」的规则下,答错比答对还多。指数越接近 +100 越好,负分就是「知识可靠性不合格」。这个指标已被纳入 Artificial Analysis 的 Intelligence Index v4.1 综合指数,是少数专门衡量「拒答校准」的主流分数。
局限
题目由出题 agent 自动生成、人工只做审核,题目质量依赖流水线而非逐题手工打磨。题库有公开版本(AA-Omniscience-Public),存在被纳入训练数据的污染风险。拒答判定的松紧、以及「答错扣多少、答对加多少」的权重设计本身带有主办方的主观选择,换一套奖惩规则排名可能不同。
典型任务
一道典型题目是短而硬的事实问答,比如健康领域会问「成年男性有几条动脉越过骨盆上口进入小骨盆?」这类教科书上有唯一答案、但极易记混的问题。模型面前有三条路:答对(加分)、凭印象硬答一个错的(扣分,拉低 Omniscience Index)、老实拒答(不扣分)。于是这个榜上经常出现戏剧性结果:一个准确率中等但懂得闭嘴的模型,指数可以高过一个准确率更高但满口胡猜的模型。
沿革
- 2025-11-17:arXiv:2511.13029 发布:6,000 题、6 领域 42 主题
- 2025-11:发布时最高 Claude 4.1 Opus 仅 4.8 分,全场仅 3 个模型在 0 分以上
- 2026:纳入 AA Intelligence Index v4.1 组成指标
- 2026-08:Claude Fable 5 指数升至 40(AA 口径,第三方转述)