HuggingFace Daily Papers·· 2 天前AI 评分44
ASCENT:通过自蒸馏验证经验实现长程智能体的在线测试时训练
ASCENT: Online Test-Time Training of Long-Horizon Agents via Self-Distillation of Verified Experience
AI 导读
针对长程 LLM 智能体部署中仅靠终止验证信号、难以持续改进的问题,研究者提出 ASCENT,用冻结的初始模型以验证轨迹作为特权信息预测 next-token 分布,再蒸馏进持久 LoRA 快速权重,无需外部参考解或更强教师。在 ALFWorld、WebShop 和 AppWorld 上,ASCENT 随经验积累提升任务成功率与交互效率,优于在线适应方法,并可迁移到未见场景。
来源:HuggingFace Daily Papers · arxiv.org