跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分45

PivotOPD:让多轮智能体从关键错误中恢复的在线策略蒸馏框架

PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

AI 导读

PivotOPD 是一个在线策略蒸馏框架,同时训练学生模型避免关键错误并从其造成的状态中恢复。研究在三个 Qwen3 模型(8B 至 235B)上发现,超过一半的失败轨迹包含早期出现的关键错误,且引导模型在关键轮次后仅几轮即可恢复任务成功。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org