测试集:BabyVision
| 名称 | BabyVision |
|---|---|
| 类别 | multimodal |
| 主办方 | UniPat AI 等(Liang Chen 等,联合北大、清华、阿里、月之暗面等),arXiv:2601.06521(2026-01) |
| 开源状态 | open |
| 网址 | 官方页面 |
babyvision49.7388 题纯视觉、幼儿发展测评原型、剥离语言先验、Avg@3 判分、人机同卷对比
测试集content/benchmarks/babyvision.md
一句话
3 岁小孩秒答的纯视觉题,AI 集体翻车
测什么
388 道「纯视觉」题,分 4 大类 22 个子类:细粒度辨别、视觉追踪、空间感知、图案识别,任务原型取自幼儿发展测评。设计的出发点是:人类在学会语言之前就会这些视觉技能,而多模态模型在知识榜上刷高分,很可能是靠语言先验「说」出来的,不是真「看」出来的——BabyVision 刻意把语言捷径剥掉,题目不需要任何文字知识,只看眼睛好不好使。
怎么测
388 题中 135 道选择题、253 道填空题。填空题由 judge 判语义等价(不卡字面匹配),报 Avg@3(每题测 3 次取平均)。同时做了真人实测作对照:3–6 岁儿童、成年人分批答题,形成人机同卷对比。
典型任务
典型题目画风:「找不同」——在一堆形状、朝向、颜色几乎一样的图案里找出那个不一样的;「连线追踪」——在多条互相缠绕交叉的线里盯住一条走到底,或走简易迷宫;「数积木」——看一堆积木的透视图,数出被挡住的隐藏方块共有几块;「图形推理」——看一组按规律旋转的图形序列,选出下一个该出现的图案。这些题幼儿园孩子做得飞快,模型却大面积答错。
分数怎么看
论文实测:成年人平均 94.1 分,而当时最强的 Gemini 3 Pro Preview 只有 49.7 分,连 6 岁儿童的水平都没到。这个榜读法很直白——分数越接近 94,说明模型的「视觉基本功」越接近成人;50 分上下意味着一半幼儿园级别的题都答不对。
含金量与局限
2026 年 1 月的新榜,题目是人工构造的测评题而非自然图像,代表性偏「视觉原语」这一窄面,不能外推为整体多模态能力。填空题由 judge 判分,判分口径会影响绝对值;且榜单年轻,各模型分数多为论文自测,第三方复现还少。
冷知识
署名阵容罕见地「联合作战」:UniPat AI 牵头,北大、清华、阿里、月之暗面、阶跃星辰、普林斯顿、南洋理工等十余家同列——其中好几家是互相竞争的模型厂商,等于联合发布了一个打脸包括自家模型在内的基准。
数据来源
本页由仓库 content/benchmarks/babyvision.md 初始化。后续修订通过公开审核队列发布。