跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分40

Where-OPD:用合成场景对 MLLM 做空间引导的在线自蒸馏

Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

AI 导读

Where-OPD 提出一种面向多模态大模型(MLLM)的在线自蒸馏方法,让教师模型获得文本形式的空间定位引导,从而定位并整合多个相关图像区域的证据,学生模型仅凭图像和问题学习复现该行为。

来源:HuggingFace Daily Papers · arxiv.org