Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

Google Research:Blog(网页)·2026-07-30 00:00·54天前
AI 导读

Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。

Google Research:Blog(网页)
精选
76AI 编辑部评分,满分 100

Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

2026-07-30 00:00· 54天前
AI 导读

Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。

推荐理由

对自主科研系统而言,可验证性从后置修补变为前置架构,提出的审计方法让生成论文的完整性有了可量化的衡量尺度。

正文 · AI 翻译

推出 Science One 框架,这是一个实验性研究原型,旨在通过原生构建可验证的证据链来消除模型幻觉;同时推出 CoE Audit,这是一套用于评估 AI 生成论文完整性的自动化协议。

快速链接

大语言模型(LLM)正越来越多地不仅被用作编码助手,还被用作能够执行端到端科学研究工作流的自主智能体。近期的系统(例如 Sakana 的 AI-ScientistAutoResearchClawDeepScientistAI-Researcher)能够综述文献、提出假设、执行实验,并撰写可与人类撰写论文相媲美的完整稿件。然而,随着这些 AI 生成稿件表面质量的提升,一个关键的结构性问题浮现出来:可验证性。由于当前的自主研究流水线以迭代方式生成文本,任何阶段引入的错误都会被放大。一些现有系统会生成不存在的引用,表现出所描述方法与实际代码之间的不一致,并报告无法从所提供代码中完全复现的实验分数。

在我们的论文中,我们通过引入证据链(Chain-of-Evidence,CoE)来应对这一问题,这是一个面向 AI 驱动研究的全新可验证性框架。我们以 Science One Framework 和 CoE Audit 来实例化 CoE:前者是一个自主研究原型,能够原生地构建并维护证据链;后者是一套自动化评估指标,用于衡量 AI 生成论文相对于其底层代码和证据的完整性。我们的结果表明,基线系统会幻觉出高达 21% 的参考文献,并且经常出现代码与文本不一致的情况,而 Science One Framework 则实现了零幽灵参考文献和完全可验证的得分,同时在 MLE-BenchParameter-Golf 等前沿基准上达到了 SOTA 性能。

证据链:一个面向可验证研究的框架

CoE 是一个概念框架,它定义了什么样的研究成果才值得信赖,正如 ACID 定义了什么样的数据库事务才是可靠的。该框架并不规定如何构建研究智能体,而是规定其输出必须具备哪些属性。它遵循一条原则,包含两个方面:研究成果中的每一项主张都必须携带一条有记录的证据链(完整性),并且每条证据链都必须真正支持其所附着的该项主张(正确性)。一项主张可以是一条参考文献、一个报告的数字、一段方法描述或一个结论,它必须链接回相应的证据,例如一篇同行评审论文、一行实验日志、实际运行的代码或结果表格。

一条幻觉参考文献指向了一篇并不存在的论文。一个无法复现的分数在代码重新运行后并未再次出现。一段描述有误的方法声称论文中采用某种算法,而代码实现的却是另一种。每一项都是其证据链条断裂的主张;CoE Audit 让这些断裂变得可测量。

Science One Framework

为了证明可验证的 AI 研究能够在不牺牲问题求解性能的前提下实现,我们设计了 Science One Framework。与以往那些先生成论文、再试图回溯性地关联事实的智能体不同,Science One Framework 通过三个主要模块在构建之初就实例化了 CoE 框架:

  • 问题调查器(文献接地):为防止幻觉参考文献,Science One Framework 通过 Semantic Scholar API 构建引文图谱。它针对每个主题读取最多 100 篇全文 PDF,以生成结构化的研究简报。最终论文中的每一条参考文献都源自这一接地的 API 调用,从而完全消除了对模型记忆的依赖。
  • 发现引擎(并行探索-利用):Science One Framework 在多个并行分支上系统地探索和利用想法。在每个隔离的循环中,一个 Solver 智能体实现一个解决方案,一个针对具体任务的评估器为其打分。表现优异的分支会被迭代优化,所有评估器的原始输出都会被汇编成一份严格的、只读的记录。
  • 论文撰写器与论断验证器:在生成稿件之前,Science One Framework 会为每一条事实性论断构建结构化表示,并附带一个内联证据标签,将其绑定到特定的工作区产物。一个专门的论断验证器会对照每条论断所声明的来源进行核查。对于超出其证据支撑范围的论断,会与来源进行调和——以更保守的方式重新表述,而非直接删除,从而使论文与工作本身所能支撑的内容保持一致。

Image 2: Science-One-1-final

Science One Framework 流水线。问题调查器通过检索到的 PDF 为文献提供依据。发现模块探索并评估解决方案。论文撰写与验证模块撰写并验证论文,由论断验证器确保所有论断与其证据来源相符。

CoE Audit:衡量可验证性

为了严格评估 Science One Framework 原型相对于最先进基线(例如 Sakana AI 的 AI Scientist v2AutoResearchClawDeepScientistAI-Researcher)的表现,我们开发了 CoE Audit。这一事后评估协议充当自动化取证审查员,对生成的产物(论文、解决方案、代码和参考文献)运行四项严格的完整性检查:

  • 分数验证:从论文中提取所报告的分数,并将其与对提交代码进行的完全独立重跑结果进行比较。
  • 规范违反: 检查解决方案代码,确保它真正解决了任务,而不是利用评估指标漏洞或读取真实答案文件。
  • 参考文献验证: 将每一条参考文献条目与学术 API 进行交叉核对,以捕捉不存在的幽灵参考文献。
  • 方法-代码一致性: 使用 LLM 评审员将论文的方法部分与代码进行并排比较,以确保文本忠实描述了所实现的算法。

Image 3: Science-One-2

CoE Audit 框架及其四项核心诚信检查概述。

结果

我们将 CoE Audit 应用于五个系统优化任务(PrismCloudcastEPLBLLM-SQL事务调度)中生成的 75 篇论文,这些任务来自 Automated Design of Research Systems(ADRS)基准。

Science One 框架在可验证性方面显著优于现有基线。CoE Audit 对每个系统应用同一套独立协议,对照实时学术数据库重新核查每一条参考文献,在该协议下,Science One 框架在全部四项诚信检查中均处于领先。

它的参考文献没有一条是虚构的:每一条都指向一篇真实、可检索的论文,而基线的模型幻觉率高达 21%,因为 Problem Investigator 会检索每一条参考文献,而不是凭记忆生成。它还实现了完美的评分验证,以及最高的方法—代码一致性。

相比之下,基线系统常常声称使用了复杂算法(如“混合神经符号求解器”),而它们提交的代码却只是一个简单、确定性的启发式方法。

Image 4: Science-One-3-Final

五个系统的 CoE Audit 结果。

关键在于,实施严格的可验证性并未损害该智能体的科学能力。Science One 框架在全部五项 ADRS 任务上达到或超过了人类专家表现,并在其中两项任务(Cloudcast 和 EPLB)上取得了所有系统中的最佳总分。

Image 5: Science-One-4-Final

五个 MLE-Bench 任务及 Parameter Golf 上求解器性能的对比。

为测试其泛化能力,我们将 Science One 框架部署到六项高度复杂的外部任务上:

  • MLE-Bench:在涵盖医学影像、细粒度识别和 3D 感知的五项高难度 Kaggle 竞赛中,Science One Framework 斩获两枚金牌(其中包括在基线系统完全失败的 3D 目标检测任务中取得获胜分数)和两枚银牌。
  • Parameter-Golf:我们在一个对硬件和文件大小有严格限制的实时 LLM 训练竞赛中测试了 Science One Framework。基线系统未能产出有效提交,而 Science One Framework 成功遵守了所有约束,并取得了最先进的分数(截至 2026 年 4 月 27 日)。值得注意的是,Science One Framework 发现的是真正且新颖的算法技术,而不仅仅是调整表面的超参数。

展望未来

随着自主研究系统规模不断扩大,以解决日益困难的科学问题,仅靠求解器质量将不再足以区分它们。真正区分其产出的是,所得到的研究是否可信。我们的发现表明,可验证性必须被视为一等架构约束。通过在主张产生之时构建证据链,而不是事后试图重建依据,The Science One Framework 证明 AI 智能体能够产出严谨、可信且极具竞争力的科学研究。

我们希望 Chain-of-Evidence 框架及其审计能够成为社区的有价值工具,帮助我们继续构建下一代 AI 科学家。

致谢

我们要感谢 Bhavana Dalvi Mishra、Jiefeng Chen、Chun-Liang Li、Palash Goyal、Mihir Parmar、Yiwen Song、Yale Song、Raj Sinha、Parthasarathy Ranganathan、Burak Gokturk 和 Jinsung Yoon 对本项工作做出的宝贵贡献。

免责声明

Science One Framework 是一个实验性研究原型,并非可用于生产的工具。

来源:Google Research:Blog(网页)· research.google