跳到正文
热点事件观察中

无视觉编码器多模态预训练缩放规律研究

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年9月28日,HuggingFace Daily Papers 收录一篇社区热门论文,研究无编码器与有编码器多模态大模型的缩放定律。研究对比两者发现,去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,而文本目标几乎不变;两者在文本目标上的损失-算力前沿几乎重合,但在多模态目标上无编码器模型在较小规模时落后,预计约 10^22 FLOPs 时追平。研究还指出,无编码器时语言模型通过视觉专属适配接管视觉编码器的角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。

AI 根据报道生成 · 56 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月28日
  1. HuggingFace Daily Papers(社区热门论文)
    距离去掉视觉编码器还有多远?无编码器多模态预训练的缩放定律

    研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。