跳转到内容

测试集:AA Intelligence Index

来自封神榜 Wiki
名称 AA Intelligence Index
类别 arena
主办方 Artificial Analysis(独立第三方评测机构)
开源状态 partial
网址 官方页面

aa-intelligence-index639 个评测加权合成(v4.1.1)、Agents 权重最高(34%)、AA 自跑统一协议(zero-shot、pass@1)、官方 95% 置信区间 ±1%、v4.0 起跨版本分数不可比

测试集content/benchmarks/aa-intelligence-index.md

一句话

第三方机构统一跑题,把 9 个硬基准揉成智能指数

测什么

独立评测机构 Artificial Analysis 出品的综合智能分。与厂商自报分数不同,AA 用统一协议自己跑所有模型(zero-shot 指令提示、统一温度、pass@1 为主),再按固定权重合成指数。当前 v4.1.1 由 9 个评测按四大类加权:Agents 34%(GDPval-AA v2、τ³-Banking)、Coding 24%(Terminal-Bench v2.1、SciCode)、科学推理 24%(HLE、GPQA Diamond、CritPt)、综合 18%(AA-LCR 长文推理、AA-Omniscience 知识幻觉)。权重明显向 Agent 能力倾斜,是该指数的鲜明立场。榜单常与价格、速度并列展示,方便算「性价比」。

怎么测

所有模型在相同条件下跑题:非推理模型 temperature 0、推理模型 0.6;部分评测重复 3-10 次取平均;官方估计指数的 95% 置信区间小于 ±1%。每个模型页公开各子项分数,指数外还有一批单独报告的评测(LiveCodeBench、IFBench、MMLU-Pro、AA-Briefcase 等)不计入总分。评测仅限英文文本,多模态和多语言另有独立指数。

典型任务

指数里最重的一项 GDPval-AA v2:模型被丢进 E2B 沙箱,带着联网搜索和代码执行工具,最多 250 个回合,交出一份真实职业交付物(报告、PPT、表格),再由三家前沿模型组成的评审团盲评两份交付物谁更好,拟合成锚定「人类专家 = 1000」的 Elo。另一项 AA-LCR 则给模型塞约 10 万 token 的公司年报、法律文件,问 100 道硬问题,考长文推理。

分数怎么看

头部模型在指数上通常只差几个点,官方 ±1% 的置信区间意味着 2-3 分以上的差距才比较有把握。注意 2026-01 的 v4.0 大改版把 MMLU-Pro 等一批趋于饱和的老基准踢出指数、换成 Agentic 和真实工作类评测(VentureBeat 有报道),所以新旧版本的分数不能直接比。

含金量与局限

指数的构成和权重由 AA 单方决定且会换版(v4.0 起构成大改),跨版本排名不可比;Agents 占 34% 是价值判断而非行业共识,想看纯推理或纯编程应看分项。别名里的 AA Agentic、AA Coding Agent Index、AA-Briefcase 是它家的细分指数,口径各自独立。

冷知识

指数里权重最大的一项不是考试而是「上班」:GDPval-AA 让模型在沙箱里用最多 250 个回合交出 PPT、报告等真实职业交付物,再由 GPT、Gemini、Claude 三家模型组成的评审团盲评——评委席上坐的正是参赛选手的同行。

数据来源

本页由仓库 content/benchmarks/aa-intelligence-index.md 初始化。后续修订通过公开审核队列发布。