HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分43
FocusVTC:自适应分辨率的高效视觉文本压缩
FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution
AI 导读
FocusVTC 通过自适应分辨率打破视觉文本压缩的固定分辨率权衡,在保留通用多模态能力的同时压缩输入长度。在 RULER v1 上以 72 DPI 取得 87.4 分、2.9 倍输入压缩,超过 Glyph 的 57.5 分;LongBench 得分 56.40 高于文本输入基线的 55.86,MRCR 宏平均提升 13.91 分,在线端到端延迟较纯文本提速 2.79 倍。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org