HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分38
ActFirst-OPD:让多轮智能体先行动后推理,on-policy 蒸馏最高提速 4.9 倍
Act First, Reason Later: Accelerating On-Policy Distillation for Multi-Turn Agents via Reference-Conditioned Inverse Dynamics
AI 导读
研究者提出 ActFirst-OPD,一种"先行动、后推理"的 on-policy 蒸馏训练框架,将环境交互与完整回复生成解耦:学生模型借助参考条件逆动力学推断并执行动作,当实际转移偏离参考轨迹时切换为自主预测下一动作,再异步生成完整 think-then-act 回复接受 token 级教师监督。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org