HuggingFace Daily Papers·· 2 天前AI 评分38
DexPolicy:面向轨迹引导灵巧操作的调度式探索方法
DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation
AI 导读
DexPolicy 将探索噪声尺度设为训练步数的显式函数,从宽到窄退火,在 PPO、GRPO 和流参数化 PPO(FPO)三种设置下提升轨迹引导灵巧操作的成功率。
来源:HuggingFace Daily Papers · arxiv.org