跳到正文
HuggingFace Daily Papers·· 4 天前AI 评分34

APPL:用智能体先验引导策略学习,打通技能组合与泛化

Agent Priors-guided Policy Learning

AI 导读

Agent Priors-guided Policy Learning(APPL)将每个策略的结构先验同时用作训练约束与组合接口:构建智能体把完整演示切分为可复用技能,为每个技能提出多个结构先验并逐一训练、验证策略,运行时智能体再按先验选择并组合这些策略。

来源:HuggingFace Daily Papers · arxiv.org