跳转到内容

测试集:Video-MME

来自封神榜 Wiki
名称 Video-MME
类别 multimodal
主办方 Chaoyou Fu 等(中科大/厦大等),CVPR 2025,arXiv:2405.21075
开源状态 open
网址 官方页面

video-mme87.4900 段 YouTube 视频、按时长分三档、纯规则判分、w/ 与 w/o 字幕口径、CVPR 2025

测试集content/benchmarks/video-mme.md

一句话

从 11 秒到 1 小时的视频理解全科考试

测什么

900 段 YouTube 视频、254 小时、2700 道人工标注的选择题(每视频 3 题),覆盖知识、影视、体育、艺术表演、生活记录、多语言 6 大领域 30 个子类。核心设计是按时长分档:短片(2 分钟内)、中片(4–15 分钟)、长片(30–60 分钟),专门考察模型在视频变长时理解力衰减多少。所有题目都是标注者反复看完整个视频后新出的,不是从旧数据集搬来的。出题后还有一道防线:把纯文本题干喂给 Gemini 1.5 Pro,不看视频也能答对的题一律淘汰(最终纯文本瞎答准确率不到 15%)。

怎么测

多选 VideoQA,每题 4 个选项,按准确率计分(随机猜 25%)。输入为抽帧后的视频画面 + 题目,官方报两个口径:w/o subtitles(只给画面)和 w subtitles(附带字幕文本),音频维度另有单独实验。判分是纯规则匹配选项字母,不引入第三方模型当裁判。

典型任务

论文举的真题:一段旅行 vlog 里,画面显示「Day 1 是 2021 年 5 月 31 日」、旁白提到优胜美地国家公园,问题问出发日期是哪天——模型得同时读画面文字、听/读字幕,再做一步日期推算。另一类难题把答案线索打散在 30 分钟长片的不同片段里,不看完整个视频根本凑不齐选项依据。

分数怎么看

发布时 Gemini 1.5 Pro 以 75%(无字幕)领跑,GPT-4o 为 71.9%,最强开源模型 VILA-1.5 约 59%;Gemini 2.5 Pro 官方口径已到 84.8%。所有模型都有统一规律:视频越长分越低,长片子集是最能拉开差距的部分。

含金量与局限

视频来自 YouTube 公开内容,存在被爬进训练语料的可能;官方 2024-06 刷新过一次失效链接并重标。分数对抽帧数量很敏感(GPT-4o 从 10 帧加到 384 帧后准确率明显上涨),不同模型的评测配置不齐会直接影响可比性。另外别和 Video-MMMU 混淆,后者考的是「从课程视频学知识」。

冷知识

质检环节的「守门员」是 Gemini 1.5 Pro:论文举例,「阿根廷 10 号 2022 年最大的成就是什么」这种不看视频也知道是世界杯冠军的题会被直接淘汰。一年后同一个团队又亲手「拆台」:Video-MME-v2 把答案选项扩到 8 个、改用组群非线性计分,让榜上一堆 80+ 的模型重新跌回 50 分档。

数据来源

本页由仓库 content/benchmarks/video-mme.md 初始化。后续修订通过公开审核队列发布。