跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分36

AlignOPSD:面向长程智能体的决策对齐在线策略蒸馏

Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

AI 导读

针对长程智能体在线策略自蒸馏中的"决策—时间戳错配"问题,研究者提出 AlignOPSD,通过决策对齐监督校正与半马尔可夫分层信用分配,将监督对齐后再分配信用。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org