AI 智能体能否进行开放式 AI 研究?两项案例的早期证据

HuggingFace Daily Papers(社区热门论文)·2026-07-29 08:00·47天前
AI 导读

一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。

HuggingFace Daily Papers(社区热门论文)
精选
72AI 编辑部评分,满分 100

AI 智能体能否进行开放式 AI 研究?两项案例的早期证据

2026-07-29 08:00· 47天前
AI 导读

一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。

推荐理由

这篇论文给「AI即将自我进化」的说法泼了盆冷水,虽然代理能跑通工程,但在解决开放性研究问题上全线溃败,对打算用AI做科研的团队是个重要的现实检验。

正文 · AI 翻译

关于AI爆炸式进展的预测,其核心前提是AI智能体能够自动化AI研究本身。然而,关于智能体能否开展开放式AI研究的证据目前还很薄弱。现有的评估要么是在狭窄、可验证的任务上测试智能体,这排除了开放式研究;要么是将AI生成的论文提交给盲审同行评议,而这种方式负担过重、随机性大,且评审质量堪忧。

我们引入了第三种衡量AI研发自动化进展的方法:让一个智能体去攻克一篇高质量未发表论文的核心开放式研究问题,并由该论文的原作者对其产出进行评分。我们称之为“影子评估”。我们对两篇未发表的NeurIPS 2026投稿论文进行了影子评估,给予前沿智能体六天时间和数千美元的计算资源。

智能体在无需人工帮助的情况下完成了所有工程任务,但在解答研究问题方面却未能取得实质性进展。结果,两篇论文均被作者明确拒绝。我们识别出五个反复出现的失败模式:对可发表研究的门槛判断力差、对研究设计缺陷的应对缺乏创造性、从死胡同中无效回溯、资源意识薄弱,以及指令漂移。

使用第二个模型和脚手架进行的稳健性检验复现了这些失败。我们公开了专家评审意见、调查回复、智能体代码库和日志。我们的结果提供了早期证据,表明当今的智能体能够完成AI研究的工程部分,但在研究生命周期的关键环节上仍存在困难。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org