HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分36
AlignOPSD:面向长程智能体的决策对齐在线策略蒸馏
Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents
AI 导读
针对长程智能体在线策略自蒸馏中的"决策—时间戳错配"问题,研究者提出 AlignOPSD,通过决策对齐监督校正与半马尔可夫分层信用分配,将监督对齐后再分配信用。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org