终极指南:Accuracy与MRA双指标如何量化大模型的空间理解力?VSI-Bench评测体系全解析
【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space
大模型真的能"看懂"一个房间并记住空间布局吗?为了量化这个问题,CVPR 2025 Oral 论文Thinking in Space提出了VSI-Bench 空间理解力评测基准,并引入了Accuracy 与 MRA 双指标评估体系。本文将用通俗易懂的方式,为你拆解这套评测体系的设计思路、双指标的计算逻辑,以及如何用它检验任意多模态大模型的空间理解力。
VSI-Bench 是什么:一套专测"空间智商"的题库
VSI-Bench(Visual-Spatial Intelligence Benchmark)是专为衡量多模态大语言模型(MLLM)视觉空间智能而设计的评测基准。它包含超过 5000 个问答对,全部来源于288 段第一视角室内视频,这些视频取自 ScanNet、ScanNet++ 与 ARKitScenes 三个公开 3D 场景重建数据集的验证集,覆盖家庭、办公室、实验室等多种真实环境。
与普通的视频问答不同,VSI-Bench 的问题不会在画面中直接给出答案——模型必须像人类一样,在看完整段视频后建立一张"认知地图",再回答关于空间关系、物体数量、距离与路线的问题。
8 大任务如何划分:为什么单一指标不够用
VSI-Bench 的 8 个任务被划分为三大类别,这正是"双指标"存在的根本原因:
- 布局类任务(Configurational):物体相对方向(易/中/难)、物体相对距离、路线规划、物体出现顺序;
- 测量估计类任务(Measurement Estimation):物体绝对距离、物体计数、物体大小估计、房间大小估计;
- 时空类任务(Spatiotemporal):在视频中判断物体出现的先后顺序。
可以看到,布局与时空类任务的答案通常是明确的选项(比如"水壶在沙发的哪一侧?"),而测量类任务的答案则是连续的数值(比如"床与沙发的距离是多少米?")。选项题可以用"答对与否"来打分,数值题却无法用简单的对错衡量——因此 VSI-Bench 设计了 Accuracy 与 MRA 两套指标分工协作。
Accuracy 指标:选择题的"标准答案"判分法
对于多选题(MCA,Multiple-Choice Answer)类任务,VSI-Bench 使用Accuracy(精确匹配准确率)作为核心指标。模型输出经过简单的模糊匹配处理后,与标准答案做精确比对——完全一致记 1 分,否则记 0 分,最后按任务类型取平均。
这一指标直观易懂:它衡量的是模型能否在给定候选中精准命中正确选项,对应我们在 lmms_eval/tasks/vsibench/utils.py 中看到的exact_match实现。随机猜测的基线得分会远低于人类水平(Human Level 约 79.2%),这让 Accuracy 成为衡量模型空间推理"正确性"的可靠标尺。
MRA 指标:数值题的"容差打分"妙招
数值估算题最棘手的地方在于:模型回答"2.9 米"而标准答案是"3.2 米",这算对还是算错?VSI-Bench 提出了MRA(Mean Relative Accuracy,平均相对准确率)指标来解决这个问题。
MRA 的核心思想是按误差容限分层打分。它会在置信阈值区间(0.5 到 0.95,步长 0.05)内逐层判断:预测值与真实值的相对误差是否在可接受范围内。模型预测越接近真实值,通过的"置信层"就越多,MRA 得分越高。例如误差在 50% 以内算合格、30% 以内算良好、5% 以内算优秀,最后取所有层级的平均表现。这一设计既惩罚离谱的猜测,又不会因为微小偏差否定模型的合理估算能力。
双指标如何统一:从 Overall 到排行榜
在 vsibench_aggregate_results 中,VSI-Bench 将每个任务的 Accuracy 与 MRA 得分统一为百分比并求平均,得到Overall 综合得分,用于模型间的横向排名。
值得注意的是,开源模型与商业 API 模型在同一套规则下零样本(zero-shot)评测,保证公平可复现。评测覆盖了 Gemini、GPT-4o 等闭源模型,以及 InternVL2、VILA、LongVA、LLaVA-OneVision、LLaVA-NeXT-Video 等主流开源模型——这也是 GitHub 加速计划镜像的 thinking-in-space 仓库中附带完整评测代码的原因。
如何亲手运行 VSI-Bench 评测
想验证自己模型的空间理解力?项目的 evaluate_all_in_one.sh 提供了"一键评测"脚本,支持批量指定模型与并行评测:
bash evaluate_all_in_one.sh --model all --num_processes 8 --benchmark vsibench评测配置位于 vsibench.yaml,其中为数值题与选择题分别指定了不同的提示词模板,确保模型输出格式可解析;各场景的元信息(房间大小、物体包围盒等)也随仓库一并开放,位于 data/meta_info 目录。
总结:双指标背后的评测哲学
Accuracy 与 MRA 双指标的巧妙之处,在于它承认了空间理解力的多样性:选择题考验"定性判断"的精确度,数值题考验"定量估算"的稳健度。两者结合,才构成对多模态大模型空间理解力的完整量化画像。无论你是模型开发者、评测工程师,还是单纯对"AI 如何理解空间"感兴趣的学习者,这套评测体系都值得深入研读与上手实践。
【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考