HuggingFace Daily Papers·· 8 天前AI 评分43
LVMT:面向长时视频分割的视频掩码 Transformer
LVMT: Video Mask Transformer for Long-term Video Segmentation
AI 导读
研究者提出长时视频掩码 Transformer(LVMT),用轻量 GRU 时序传播模块自适应选择跨时间保留的对象信息,并引入 Truncated Query Propagation(TQP)训练策略,按帧块处理视频、仅在块内反向传播,从而在长视频上实现更长时序监督且不爆显存。
来源:HuggingFace Daily Papers · arxiv.org