跳到正文
HuggingFace Daily Papers·· 3 天前AI 评分36

SemanTok:为高效自回归视频生成提供可预测的语义 token

SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

AI 导读

SemanTok 是一种灵活视频 tokenizer,将冻结的 DINO 特征输入编码器,并加入轻量 head,使每个保留的 token 前缀都能单独重建这些特征。201M 的 SemanTok AR 模型匹配或超越 3.4 倍规模的 VideoFlexTok AR 模型,更大模型还能进一步提升保真度。它在分布外类别上保持语义对齐,并在包括纯噪声在内的各噪声水平上为解码器提供更高语义对齐。

来源:HuggingFace Daily Papers · arxiv.org