跳转到内容

测试集:MRCR

来自封神榜 Wiki
名称 MRCR
类别 other
主办方 原始任务出自 Google「Michelangelo」论文(Vodrahalli 等,arXiv:2409.12640);GDM 版=eval_hub MRCR v2;OpenAI 版=2/4/8-needle(HF openai/mrcr)
开源状态 open
网址 官方页面

mrcr91.5多轮共指消解、相似内容辨析、8-needle 最难档、hash 前缀防作弊、GDM/OpenAI 两版

测试集content/benchmarks/mrcr.md

一句话

聊了好几轮相似内容,让 AI 复述「第 2 次」那段

测什么

全称 Multi-Round Coreference Resolution(多轮共指消解),考超长上下文里的「相似内容辨析 + 次序推理」。场景是一段程序生成的超长多轮对话:用户反复多次让模型写文风相似的内容(比如「写一首关于 X 的诗」),中间隔着大量干扰对话,最后突然问「把你第 2 次写的那首复述出来」。难点在于每次的「针」和干扰项来自同一分布——内容都长得像,模型既要全部记住又要数清是第几次,比传统大海捞针难得多。

怎么测

按模型输出与目标段落的 SequenceMatcher 相似度计分(Mean Match Score),OpenAI 版有个硬规则:复述内容必须带上原文随附的随机 hash 前缀,否则该题记 0 分——这堵死了「重新编一首类似的」的退路。常报 8-needle(对话里埋 8 次相似请求,最难档),按 128K/1M 等上下文长度分桶。对话语料由 GPT-4 合成,可按需生成任意长度。

典型任务

一个典型 8-needle 实例:128K token 的合成对话里,用户先后 8 次说「给我写一首关于秋天的诗」,模型每次即兴创作一首,且每首前面都附了一个随机字符串(如「xk42-」);其余几十轮是无关闲聊。最后用户问:「把第 4 次写的那首诗原样复述一遍,包括前缀。」模型必须定位到 8 首相似的诗里正好第 4 首、一字不差地背出来,前缀错或拿错第几首都不得分。

分数怎么看

按 0–1 的相似度分读,越高越好,且必须带 needle 数和长度档:「GDM-MRCR v2 (8-needle, 128K)」是常见典型口径。第三方收录显示头部模型在 128K 档 8-needle 已能上 0.9 左右,1M 档明显回落;2-needle 与 8-needle 难度差很多,引用时不可省略档位。

含金量与局限

最大坑是一级两版:GDM 版(eval_hub MRCR v2)和 OpenAI 版(openai/mrcr,2/4/8-needle)同名不同数据、不同判分细节,分数不可互比,引用必须标明版本。OpenAI 版 2025-12-05 出过 v2 修复,此前分数与之后不完全可比。合成数据污染风险低,但「背诗」形式和真实长文本任务有距离。

冷知识

防作弊靠一串随机字符:每次「写诗」前都附一个随机 hash 前缀,复述时不带前缀直接 0 分——模型没法现场再编一首风格差不多的蒙混,因为编得出诗、编不出那串随机前缀。

数据来源

本页由仓库 content/benchmarks/mrcr.md 初始化。后续修订通过公开审核队列发布。