测试集:AA-Omniscience
| 名称 | AA-Omniscience |
|---|---|
| 类别 | reasoning |
| 主办方 | Artificial Analysis,2025-11 发布,arXiv:2511.13029 |
| 开源状态 | partial |
| 网址 | 官方页面 |
aa-omniscience406000 题 6 领域、答错扣分、拒答不扣分、专门衡量幻觉、AA 独立评测
测试集content/benchmarks/aa-omniscience.md
一句话
6000 道事实题:答对加分、答错扣分、拒答不扣,专治不懂装懂
测什么
AA-Omniscience 是第三方评测机构 Artificial Analysis 做的「知识可靠性」基准,核心思想是:光有知识不够,还得知道自己不知道。全库 6,000 道事实性问题,覆盖 6 个经济价值高的领域(商业、人文社科、健康、法律、软件工程、科学与工程数学)下的 42 个主题——这些领域合计占 2024 年美国工资总额的 44%。题目由专门的出题 agent 从权威一手资料(官方文档、公认教材等)生成,再按相似度、难度、歧义度过滤,保证答案有据可查且对前沿模型足够难。
怎么测
模型逐题作答,可以选择回答也可以拒答。核心指标 Omniscience Index 范围 −100 到 +100:答对加分、答错扣分、拒答(说「我不知道」)不扣分,0 分意味着答对和答错一样多——乱猜在这套规则下是净亏的。除指数外还公布 Accuracy(答对率)、Hallucination Rate(错误作答的比例)等子指标。这样设计是因为现有考试大多奖励猜测,训练出了「自信地胡说」的模型,而真实业务场景里一个自信的错误答案远比「我不知道」危险。
典型任务
一道典型题目是短而硬的事实问答,比如健康领域会问「成年男性有几条动脉越过骨盆上口进入小骨盆?」这类教科书上有唯一答案、但极易记混的问题。模型面前有三条路:答对(加分)、凭印象硬答一个错的(扣分,拉低 Omniscience Index)、老实拒答(不扣分)。于是这个榜上经常出现戏剧性结果:一个准确率中等但懂得闭嘴的模型,指数可以高过一个准确率更高但满口胡猜的模型。
分数怎么看
发布时的结果相当难看:最高的 Claude 4.1 Opus 也只有 4.8 分,全场仅 3 个模型在 0 分以上——也就是说绝大多数前沿模型在这套「答错要罚」的规则下,答错比答对还多。指数越接近 +100 越好,负分就是「知识可靠性不合格」。这个指标已被纳入 Artificial Analysis 的 Intelligence Index v4.1 综合指数,是少数专门衡量「拒答校准」的主流分数。
含金量与局限
题目由出题 agent 自动生成、人工只做审核,题目质量依赖流水线而非逐题手工打磨。题库有公开版本(AA-Omniscience-Public),存在被纳入训练数据的污染风险。拒答判定的松紧、以及「答错扣多少、答对加多少」的权重设计本身带有主办方的主观选择,换一套奖惩规则排名可能不同。
冷知识
这个榜的「及格线」是 0 分——代表答对和答错一样多。发布时受测的前沿模型里只有 3 个在 0 分以上,其余全是负分,等于整个行业被盖上「普遍不懂装懂」的戳。
数据来源
本页由仓库 content/benchmarks/aa-omniscience.md 初始化。后续修订通过公开审核队列发布。