HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分45
PivotOPD:让多轮智能体从关键错误中恢复的在线策略蒸馏框架
PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents
AI 导读
PivotOPD 是一个在线策略蒸馏框架,同时训练学生模型避免关键错误并从其造成的状态中恢复。研究在三个 Qwen3 模型(8B 至 235B)上发现,超过一半的失败轨迹包含早期出现的关键错误,且引导模型在关键轮次后仅几轮即可恢复任务成功。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org