测试集:MRCR
| 名称 | MRCR |
|---|---|
| 类别 | other |
| 主办方 | 原始任务出自 Google「Michelangelo」论文(Vodrahalli 等,arXiv:2409.12640);GDM 版=eval_hub MRCR v2;OpenAI 版=2/4/8-needle(HF openai/mrcr) |
| 开源状态 | open |
| 网址 | 官方页面 |
mrcr91.5多轮共指消解、相似内容辨析、8-needle 最难档、hash 前缀防作弊、GDM/OpenAI 两版
一句话
聊了好几轮相似内容,让 AI 复述「第 2 次」那段
测什么
全称 Multi-Round Coreference Resolution(多轮共指消解),考超长上下文里的「相似内容辨析 + 次序推理」。场景是一段程序生成的超长多轮对话:用户反复多次让模型写文风相似的内容(比如「写一首关于 X 的诗」),中间隔着大量干扰对话,最后突然问「把你第 2 次写的那首复述出来」。难点在于每次的「针」和干扰项来自同一分布——内容都长得像,模型既要全部记住又要数清是第几次,比传统大海捞针难得多。
怎么测
按模型输出与目标段落的 SequenceMatcher 相似度计分(Mean Match Score),OpenAI 版有个硬规则:复述内容必须带上原文随附的随机 hash 前缀,否则该题记 0 分——这堵死了「重新编一首类似的」的退路。常报 8-needle(对话里埋 8 次相似请求,最难档),按 128K/1M 等上下文长度分桶。对话语料由 GPT-4 合成,可按需生成任意长度。
典型任务
一个典型 8-needle 实例:128K token 的合成对话里,用户先后 8 次说「给我写一首关于秋天的诗」,模型每次即兴创作一首,且每首前面都附了一个随机字符串(如「xk42-」);其余几十轮是无关闲聊。最后用户问:「把第 4 次写的那首诗原样复述一遍,包括前缀。」模型必须定位到 8 首相似的诗里正好第 4 首、一字不差地背出来,前缀错或拿错第几首都不得分。
分数怎么看
按 0–1 的相似度分读,越高越好,且必须带 needle 数和长度档:「GDM-MRCR v2 (8-needle, 128K)」是常见典型口径。第三方收录显示头部模型在 128K 档 8-needle 已能上 0.9 左右,1M 档明显回落;2-needle 与 8-needle 难度差很多,引用时不可省略档位。
含金量与局限
最大坑是一级两版:GDM 版(eval_hub MRCR v2)和 OpenAI 版(openai/mrcr,2/4/8-needle)同名不同数据、不同判分细节,分数不可互比,引用必须标明版本。OpenAI 版 2025-12-05 出过 v2 修复,此前分数与之后不完全可比。合成数据污染风险低,但「背诗」形式和真实长文本任务有距离。
冷知识
防作弊靠一串随机字符:每次「写诗」前都附一个随机 hash 前缀,复述时不带前缀直接 0 分——模型没法现场再编一首风格差不多的蒙混,因为编得出诗、编不出那串随机前缀。
数据来源
本页由仓库 content/benchmarks/mrcr.md 初始化。后续修订通过公开审核队列发布。