测试集:AA Intelligence Index
| 名称 | AA Intelligence Index |
|---|---|
| 类别 | arena |
| 主办方 | Artificial Analysis(独立第三方评测机构) |
| 开源状态 | partial |
| 网址 | 官方页面 |
aa-intelligence-index639 个评测加权合成(v4.1.1)、Agents 权重最高(34%)、AA 自跑统一协议(zero-shot、pass@1)、官方 95% 置信区间 ±1%、v4.0 起跨版本分数不可比
测试集content/benchmarks/aa-intelligence-index.md
一句话
第三方机构统一跑题,把 9 个硬基准揉成智能指数
测什么
独立评测机构 Artificial Analysis 出品的综合智能分。与厂商自报分数不同,AA 用统一协议自己跑所有模型(zero-shot 指令提示、统一温度、pass@1 为主),再按固定权重合成指数。当前 v4.1.1 由 9 个评测按四大类加权:Agents 34%(GDPval-AA v2、τ³-Banking)、Coding 24%(Terminal-Bench v2.1、SciCode)、科学推理 24%(HLE、GPQA Diamond、CritPt)、综合 18%(AA-LCR 长文推理、AA-Omniscience 知识幻觉)。权重明显向 Agent 能力倾斜,是该指数的鲜明立场。榜单常与价格、速度并列展示,方便算「性价比」。
怎么测
所有模型在相同条件下跑题:非推理模型 temperature 0、推理模型 0.6;部分评测重复 3-10 次取平均;官方估计指数的 95% 置信区间小于 ±1%。每个模型页公开各子项分数,指数外还有一批单独报告的评测(LiveCodeBench、IFBench、MMLU-Pro、AA-Briefcase 等)不计入总分。评测仅限英文文本,多模态和多语言另有独立指数。
典型任务
指数里最重的一项 GDPval-AA v2:模型被丢进 E2B 沙箱,带着联网搜索和代码执行工具,最多 250 个回合,交出一份真实职业交付物(报告、PPT、表格),再由三家前沿模型组成的评审团盲评两份交付物谁更好,拟合成锚定「人类专家 = 1000」的 Elo。另一项 AA-LCR 则给模型塞约 10 万 token 的公司年报、法律文件,问 100 道硬问题,考长文推理。
分数怎么看
头部模型在指数上通常只差几个点,官方 ±1% 的置信区间意味着 2-3 分以上的差距才比较有把握。注意 2026-01 的 v4.0 大改版把 MMLU-Pro 等一批趋于饱和的老基准踢出指数、换成 Agentic 和真实工作类评测(VentureBeat 有报道),所以新旧版本的分数不能直接比。
含金量与局限
指数的构成和权重由 AA 单方决定且会换版(v4.0 起构成大改),跨版本排名不可比;Agents 占 34% 是价值判断而非行业共识,想看纯推理或纯编程应看分项。别名里的 AA Agentic、AA Coding Agent Index、AA-Briefcase 是它家的细分指数,口径各自独立。
冷知识
指数里权重最大的一项不是考试而是「上班」:GDPval-AA 让模型在沙箱里用最多 250 个回合交出 PPT、报告等真实职业交付物,再由 GPT、Gemini、Claude 三家模型组成的评审团盲评——评委席上坐的正是参赛选手的同行。
数据来源
本页由仓库 content/benchmarks/aa-intelligence-index.md 初始化。后续修订通过公开审核队列发布。