跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分44

AutoDataBench:智能体能写出自我改进循环所需的数据吗?

AutoDataBench: Can Agents Write the Data That Feeds the Self-Improvement Loop?

AI 导读

新基准 AutoDataBench 要求智能体根据原始基准任务和目标模型的尝试记录,写出满足有效性、新颖性、难度和行为覆盖等验收标准的新任务。在三个可执行智能体任务基准上,默认 45 分钟预算内没有智能体得分超过 20/100;给最强智能体四倍时间后得分大幅提升,但单个可用任务的成本几乎不变。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org