HuggingFace Daily Papers·· 1 天前AI 评分42
ActiveSaddler:面向 Agent Harness 优化的自动化课程学习
ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization
AI 导读
ActiveSaddler 将 Agent harness 优化中"训练场景如何选择"这一维度建模为非平稳 bandit 问题,把反复出现的失败抽象为可复用的失败模式臂,动态估计各模式的潜在学习收益,在复现已知弱点与探索新场景之间自适应平衡。
来源:HuggingFace Daily Papers · arxiv.org