HuggingFace Daily Papers·· 4 天前AI 评分34
APPL:用智能体先验引导策略学习,打通技能组合与泛化
Agent Priors-guided Policy Learning
AI 导读
Agent Priors-guided Policy Learning(APPL)将每个策略的结构先验同时用作训练约束与组合接口:构建智能体把完整演示切分为可复用技能,为每个技能提出多个结构先验并逐一训练、验证策略,运行时智能体再按先验选择并组合这些策略。
来源:HuggingFace Daily Papers · arxiv.org