HuggingFace Daily Papers·· 3 天前AI 评分34
Adaptive Reward Routing:面向联合音视频扩散模型的前向过程 RL 动态多奖励优化
Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
AI 导读
针对联合音视频扩散模型的多奖励强化学习,研究者提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中同时自适应调整更新位置与奖励协调方式。
来源:HuggingFace Daily Papers · arxiv.org