HuggingFace Daily Papers·· 3 天前AI 评分49
LoHi:重新思考长视频效率,帧、像素与前段延迟的联合分配
Rethinking Long-Video Efficiency: A Joint Allocation Perspective on Frames, Pixels, and Front-End Latency
AI 导读
面向 VLM 长视频理解,LoHi 提出免训练、单次前向的框架,将密集低分辨率视频流与稀疏高分辨率图像帧通过 VLM 原生视频与图像通路结合。在三个长视频 benchmark 上,LoHi 在相同 token 预算下平均准确率比原生分辨率基线高 10.6 个百分点,比最强效率方法高 5.2 个百分点,并将小时级视频的前端解码延迟最多降低 7 倍。
来源:HuggingFace Daily Papers · arxiv.org