跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分49

距离去掉视觉编码器还有多远?无编码器多模态预训练的缩放定律

How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining

AI 导读

研究对比了无编码器与有编码器多模态大模型的缩放定律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型,文本目标则几乎不变。两者在文本目标上损失-算力前沿几乎重合,但多模态目标上无编码器模型小规模时落后,预计约 10^22 FLOPs 时追平。无编码器时语言模型通过视觉专属适配接管其角色:视觉 token 双向交互随算力增长愈发有益,视觉处理前移,视觉 token 的专家路由更集中。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org