跳转到内容

测试集:LiveBench

来自封神榜 Wiki
名称 LiveBench
类别 arena
主办方 Abacus.AI / NYU / NVIDIA / USC / UMD 等(Yann LeCun、Tom Goldstein 等),arXiv:2406.19314,ICLR 2025 Spotlight
开源状态 open
网址 官方页面

livebench83月度滚动换题防污染、只接受唯一正确答案、客观 ground-truth 自动判分、7 大类 23 任务、分数绑定题目批不可跨批比

测试集content/benchmarks/livebench.md

一句话

每月换题的防污染联考,客观答案自动判分

测什么

针对「测试题泄露进训练集」这个行业顽疾设计的联考:题目全部取材自时效性来源——最近 11 个月内的数学竞赛题、新发表的 arXiv 论文、新上映电影的简介、新发布的数据集——并且按月滚动发布新题,让模型来不及「背题」。分 6 大类:数学、编程、推理、语言理解、指令遵循、数据分析,每类 2-4 个任务、每任务 40-100 题,难度刻意校准到让头部模型落在 30-70% 区间。与偏好榜相反,它拒绝任何主观评判,只要唯一正确答案。

怎么测

每题都有可验证的客观 ground-truth,程序自动判分,不用 LLM 评审、不用人类投票,从机制上杜绝评审偏置。报各类目分和总分(0-100 正确率)。题目按月更新、任务不定期加难或扩充,官方明确提示不同时间窗口的分数不可直接比较。站内常引用的「LiveBench Coding」只是其中的编程类目分。

典型任务

论文里的真实构造:数学类用近 11 个月高中数学竞赛改编题加 AMPS 加难版;编程类取当期 LeetCode / AtCoder 新题(经 LiveCodeBench);推理类把 BIG-Bench Hard 的「Web of Lies」加难,再配斑马谜题(「五个人住五栋不同颜色的房子……谁养斑马」式逻辑题)和空间推理;语言类把新片在 IMDb 上的剧情简介打乱顺序让模型复原,或玩 Connections 连词谜题;指令遵循类拿《卫报》近期新闻,要求改写成指定字数并满足若干硬性约束。

分数怎么看

2024-06 发布时最强模型总分也压不到 70%,区分度明显好于同期已饱和的榜单。由于题目按月换,它的分数更像「当期快照」:看分数时务必核对题目版本日期,跨年比较意义有限。编程类目分(LiveBench Coding)常被单独引用,别和总分混为一谈。

含金量与局限

滚动更新只能降低不能根除污染——老题一旦公开就永远流传。客观判分的另一面是测不了开放式写作、对话这类没有唯一答案的能力。第三方统计站点上该榜大量结果为厂商自报,与官方统一跑分可能不一致,引用时最好对照 livebench.ai 官方榜。

冷知识

它的出题方式是「追热点」:刚上映电影的 IMDb 简介、本月新发的 Kaggle 数据集、最近的数学竞赛题——模型想靠背题刷分,得先发明时光机。讽刺的是头部模型总分还是从发布时的不足 70% 涨到了 2026 年中的 83%,逼得官方不断加难题目。

数据来源

本页由仓库 content/benchmarks/livebench.md 初始化。后续修订通过公开审核队列发布。