# ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-17 08:00
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmrx3dmt7001mro6976afq35y
- 原文链接：https://arxiv.org/abs/2607.16165

## 精选理由

前沿多模态模型在需要反复观察的任务上几乎全部翻车，最高分模型只做对 10%，人类 96%，说明现在的大模型不是真在看，而是在猜。做视觉的人应该认真看这篇。

## AI 摘要

最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型（MLLM）的主动观察能力。得分最高的 GPT-5.5（最高推理层级）仅解决 10.6% 的任务，在 11 项任务上得零分；Claude Fable 5 仅解决 3.5%，而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码，差距依然显著，表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。

## 正文

人类视觉是一个闭环：视线并非由单一快照决定，而是由中间假设持续引导重新定向。数十年的心理物理学和认知科学研究表明，这种主动观察对于广泛的任务至关重要。当前的多模态大语言模型（MLLM）是否具备主动观察能力，是一个现有视觉-语言基准无法回答的经验性问题。我们提出了 ActiveVision，这是一个让 MLLM 的主动观察能力变得可测量的基准，包含 3 个类别下的 17 项任务。这些任务旨在强制模型进行重复的视觉感知，而非单一的静态描述。前沿 MLLM 在 ActiveVision 上表现崩溃：我们评估中得分最高的模型 GPT-5.5（在最高暴露推理努力层级下）仅解决了 10.6% 的项目，并在 17 项任务中有 11 项得分为零；而 Claude Fable 5 尽管在大多数推理和编程排行榜上名列前茅，也仅解决了 3.5%，远低于平均得分 96.1% 的三位人类参与者。此外，即使模型编写并运行自己的视觉代码，大部分差距依然存在：此类代码在真实图像上不可靠，而捕捉其失败本身就需要模型所缺乏的主动感知能力。综合来看，这些结果表明当前 MLLM 缺乏稳健的主动视觉观察能力，这激励着能够闭合感知-推理循环的架构和训练目标。
