测试集:BenchLM
| 名称 | BenchLM |
|---|---|
| 类别 | arena |
| 主办方 | benchlm.ai 独立站点(运营主体未披露),数据刷新至 2026-08 |
| 开源状态 | partial |
| 网址 | 官方页面 |
benchlm82.9聚合榜:自身无考题,索引约 400 个外部基准、私有 BenchAlign 方法论:27 个计权基准、8 大类加权合成、Supported / Estimated 证据强度标签、附价格、速度与上下文窗口数据、方法论私有,外部无法复算验证输入值为“聚合榜:自身无考题,索引约 400 个外部基准、私有 BenchAlign 方法论:27 个计权基准、8 大类加权合成、Supported / Estimated 证据强度标签、附价格、速度与上下文窗口数据、方法论私有,外部无法复算验证”的属性“特征”(作为页面类型)含有无效字符或不完整,因此会在查询或注解过程中导致预期外结果。
测试集content/benchmarks/benchlm.md
一句话
自己不出题,把几百个外部基准加权揉成总分
测什么
一个聚合型榜单:它自己没有任何一道题,而是索引约 400 个外部基准(编程、推理、数学、知识、Agent 等各类)外加价格、速度数据,用私有方法把别人的分数揉成综合排名和分榜。定位类似「基准的基准」——给你一个一眼看全局的入口。按核验结论,它属二手聚合榜,权威性不及 LMArena、Artificial Analysis 这类一手数据方。
怎么测
私有方法论叫 BenchAlign,当前版本 v5.2:约 400 个被索引的基准中只有 27 个计入加权总分(其余仅作展示),先归一化再按 8 大类加权合成——Agentic 22%、Coding 20%、Reasoning 17% 等。每个模型带证据强度标签:Supported 表示有直接第三方证据,Estimated 表示证据不足时的估计值——Estimated 也保留在榜上,官方理由是免得新模型只因没被测够就被当成弱模型。
典型任务
它不是一道题而是一摞别人的题:编程分榜里 SWE-bench Verified 一项占该类约 16% 权重,旁边拼着 LiveCodeBench 等信号;数学分榜引用 FrontierMath、AIME 之类。点开任一模型,能看到它的总分由哪些外部基准、各占多少权重拼出来,比如某模型的编程分项会标注主要差距来自哪个基准。
分数怎么看
官方自己强调:分数是「相对当前证据宇宙的校准分」,不是任何单一测试的原始百分数,所以 80 分不代表做对了 80% 的题。2026-08 快照里头部模型总分在 80 上下、编程分榜头部约 80 分。Estimated 行的不确定性明显更大,看榜时要区分。
含金量与局限
聚合榜的天花板是被引用的基准:源数据错了它会跟着错,且方法论私有、外部无法复算验证。适合快速扫一眼行业格局,不适合在严肃对比中当定论引用;要深究某项能力,应该回到它引用的一手基准去查原始分数。
冷知识
它自己从不动手测任何一个模型,却写了大量长文拆解别家榜单的缺陷(比如 LMArena 的啰嗦偏置和 Elo 误读),形成了一个有趣的套娃生态:评测榜单的榜单,顺便给别的榜单写「体检报告」。
数据来源
本页由仓库 content/benchmarks/benchlm.md 初始化。后续修订通过公开审核队列发布。