HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分40
AREX-2:用长时程反思任务推进 LLM 智能体自我改进
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
AI 导读
AREX-2 通过从机器学习和算法编程任务合成长期改进轨迹,训练出基于 Qwen3.8-27B 的智能体,在 MLE-bench Lite 上得分 81.8、Frontier-CS 上 70.7。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org