跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分40

QwenGyre:面向超长程智能体训练的弹性强化学习框架

QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

AI 导读

阿里发布 QwenGyre,一个面向超长程(xlong-horizon)智能体在线强化学习的端到端框架,可在不中断执行的情况下弹性重分配 GPU,并通过轨迹处理器去重冗余分支路径。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org