ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

HuggingFace Daily Papers(社区热门论文)·2026-07-17 08:00·59天前
AI 导读

最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。

HuggingFace Daily Papers(社区热门论文)
精选
73AI 编辑部评分,满分 100

ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

2026-07-17 08:00· 59天前
AI 导读

最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。

推荐理由

前沿多模态模型在需要反复观察的任务上几乎全部翻车,最高分模型只做对 10%,人类 96%,说明现在的大模型不是真在看,而是在猜。做视觉的人应该认真看这篇。

正文 · AI 翻译

人类视觉是一个闭环:视线并非由单一快照决定,而是由中间假设持续引导重新定向。数十年的心理物理学和认知科学研究表明,这种主动观察对于广泛的任务至关重要。当前的多模态大语言模型(MLLM)是否具备主动观察能力,是一个现有视觉-语言基准无法回答的经验性问题。我们提出了 ActiveVision,这是一个让 MLLM 的主动观察能力变得可测量的基准,包含 3 个类别下的 17 项任务。这些任务旨在强制模型进行重复的视觉感知,而非单一的静态描述。前沿 MLLM 在 ActiveVision 上表现崩溃:我们评估中得分最高的模型 GPT-5.5(在最高暴露推理努力层级下)仅解决了 10.6% 的项目,并在 17 项任务中有 11 项得分为零;而 Claude Fable 5 尽管在大多数推理和编程排行榜上名列前茅,也仅解决了 3.5%,远低于平均得分 96.1% 的三位人类参与者。此外,即使模型编写并运行自己的视觉代码,大部分差距依然存在:此类代码在真实图像上不可靠,而捕捉其失败本身就需要模型所缺乏的主动感知能力。综合来看,这些结果表明当前 MLLM 缺乏稳健的主动视觉观察能力,这激励着能够闭合感知-推理循环的架构和训练目标。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org