跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分38

SCOPD:面向高效视觉语言模型的稀疏上下文同策略自蒸馏

SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models

AI 导读

针对推理型视觉语言模型(VLM)视觉 token 序列过长导致推理昂贵的问题,研究者提出稀疏上下文同策略自蒸馏框架 SCOPD:学生模型基于剪枝后的视觉 token 生成推理轨迹,由拥有完整上下文的教师模型对同一同策略前缀进行监督,无需真实答案、架构改动或额外推理开销。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org