Answer.AI 发布 ReadBench:揭示视觉语言模型在长文本图像阅读上的显著性能衰减
Answer.AI 推出新基准 ReadBench,专门评估视觉语言模型(VLM)从图像中提取和推理文本信息的能力。研究发现,虽然高分辨率对生成任务影响不大,但几乎所有 VLM 在处理多页长文档图像时均出现显著性能下降,表明当前 Visual RAG 方案在处理长上下文时尚不可行。相比之下,GPT-4o 在短上下文和多页场景中表现相对较好,整体性能衰减较小。该基准已开源,涵盖 MMLU、GPQA 等数据集的图像化版本。
推荐理由:针对热门的多模态检索增强生成(Visual RAG)场景提供了关键实证数据,揭示了 VLM 在长文档阅读上的实际瓶颈,为开发者选择模型和优化管道提供重要参考。