跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分38

DexPolicy:面向轨迹引导灵巧操作的调度式探索方法

DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation

AI 导读

DexPolicy 将探索噪声尺度设为训练步数的显式函数,从宽到窄退火,在 PPO、GRPO 和流参数化 PPO(FPO)三种设置下提升轨迹引导灵巧操作的成功率。

来源:HuggingFace Daily Papers · arxiv.org