多模态领域泛化真的进步了吗?一项全面的基准研究

HuggingFace Daily Papers(社区热门论文)·2026-05-07 08:00·136天前
AI 导读

针对多模态领域泛化评估标准不统一的问题,研究团队推出了首个统一基准MMDG-Bench。该基准涵盖动作识别、故障诊断和情感分析三大任务的六个数据集,系统评估了六种模态组合和九种方法在多种场景下的性能。基于大规模实验得出关键结论:现有专用方法相比基线提升有限;无单一方法能持续领先;当前性能与理论上限差距显著;三模态融合未稳定优于双模态;所有方法在数据损坏和模态缺失时性能均大幅下降,部分还损害了模型可信度。

HuggingFace Daily Papers(社区热门论文)
精选
70AI 编辑部评分,满分 100

多模态领域泛化真的进步了吗?一项全面的基准研究

2026-05-07 08:00· 136天前
AI 导读

针对多模态领域泛化评估标准不统一的问题,研究团队推出了首个统一基准MMDG-Bench。该基准涵盖动作识别、故障诊断和情感分析三大任务的六个数据集,系统评估了六种模态组合和九种方法在多种场景下的性能。基于大规模实验得出关键结论:现有专用方法相比基线提升有限;无单一方法能持续领先;当前性能与理论上限差距显著;三模态融合未稳定优于双模态;所有方法在数据损坏和模态缺失时性能均大幅下降,部分还损害了模型可信度。

推荐理由

7 千多次训练揭示的多模态领域泛化真相:近年专门方法相比简单 ERM 几乎原地踏步,并且所有方法在损坏或缺失模态下直接跪。做这个方向的该醒醒了。

正文 · AI 翻译

尽管多模态领域泛化(MMDG)在提升模型鲁棒性方面日益流行,但报告的性能提升究竟是反映了真正的算法进步,还是不一致评估协议带来的人为产物,目前仍不明确。当前研究较为零散,各研究在数据集、模态配置和实验设置上差异显著。此外,现有基准主要聚焦于动作识别,往往忽略了输入损坏、模态缺失和模型可信度等关键的现实世界挑战。

这种标准化的缺失使得对该领域进展的可靠评估变得模糊不清。为解决这一问题,我们引入了 MMDG-Bench,这是首个统一且全面的 MMDG 基准,它标准化了涵盖三个不同任务(动作识别、机械故障诊断和情感分析)的六个数据集的评估。

MMDG-Bench 包含六种模态组合、九种代表性方法以及多种评估设置。除了标准准确率之外,它还系统性地评估了损坏鲁棒性、缺失模态泛化能力、误分类检测以及分布外检测。MMDG-Bench 总共训练了 7,402 个神经网络,跨越 95 个独特的跨领域任务,得出了五个关键发现:(1)在公平比较下,近期专门的 MMDG 方法相比 ERM 基线仅带来边际提升;(2)没有任何单一方法能在不同数据集或模态组合上持续优于其他方法;(3)与上限性能之间仍存在显著差距,表明 MMDG 远未得到解决;(4)三模态融合并不总是优于最强的双模态配置;(5)所有被评估的方法在损坏和模态缺失场景下均表现出显著性能下降,且部分方法进一步损害了模型可信度。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org