HuggingFace Daily Papers·· 2 天前AI 评分43
解读 Diffusion Transformer 中的上下文 token:一项可解释性与生成质量研究
Learning to Read the Contextual Tokens in Diffusion Transformers
AI 导读
研究提出一种框架,用轻量瓶颈网络将 MM-DiT 中间上下文 token 映射到冻结 LLM 的输入空间,让 LLM 直接根据隐藏表示回答关于生成图像的问题。结果显示,上下文 token 在去噪早期就编码了全局语义,即使输入空提示词仍可解码出图像特定信息,且可读性更高的生成往往获得更高人类偏好分数。基于此提出的 Contextual Alignment 训练技术可提升生成质量与分布覆盖。
来源:HuggingFace Daily Papers · arxiv.org