跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分39

UMM-Reflection:用交错强化学习让统一多模态模型学会原生反思

Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

AI 导读

UMM-Reflection 通过交错强化学习,让统一多模态模型在一条轨迹内完成"诊断—修改—再观察"的完整反思循环,轨迹级优势同时更新反思 token 与基于流的图像修改,推理时无需外部验证器。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org