跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-14精选AI 评分73

迈向自我进化的智能文献检索系统

Towards Self-Evolving Agentic Literature Retrieval

AI 导读

针对传统检索无法理解复杂意图、而前沿大语言模型成本高且存在幻觉的问题,研究团队提出了自我进化的智能文献检索系统PaSaMaster。该系统通过迭代式意图分析、检索与排序,将文献检索转变为动态演进的过程,并采用三项关键设计:利用排序证据揭示信息缺口以优化搜索;将检索定义为意图-论文相关性排序任务,从根本上杜绝虚假文献;通过分离规划与检索来提升效率,仅用大模型理解意图,而将大规模检索与评分交由轻量模型处理。在涵盖38个学科的基准测试中,该系统将传统关键词检索的F1分数提升15.6倍,完全消除了文献幻觉,且性能超越GPT-5.2达30%,计算成本仅为后者的1%。

推荐理由

学术文献检索一直被关键词和LLM幻觉两头堵,这个系统用规划与检索分离做到了零幻觉,F1暴涨15.6倍,比GPT-5.2强30%却只花1%算力,做科研的可以马上跑起来。

正文 · AI 翻译

sjtu0267098@sjtu.edu.cn

\fnm

田

\sur

金

\fnm

静

\sur

康

\fnm

祥和

\sur

庞

\fnm

静怡

\sur

柴

\fnm

婷佳

\sur

苗

\fnm

芬怡

\sur

刘

\fnm

文浩

\sur

王

\fnm

思凯

\sur

姚

\fnm

宇智

\sur

张

sihengc@sjtu.edu.cn

摘要

科学文献检索必须理解复杂的搜索意图,同时保持来源的真实性。传统的基于关键词和嵌入向量的系统能返回真实来源,但会遗漏细微的意图;而大语言模型能捕捉更丰富的意图,但可能捏造引用。我们提出 PaSaMaster,一个递归自演进的智能体文献检索系统,它迭代地分析意图、检索经过验证的论文,并基于证据给出相关性评分进行排序。PaSaMaster 结合了自演进检索(根据排序后的证据随时间优化搜索意图)、基于验证论文而非生成引用的无幻觉排序,以及成本高效的规划-检索分离(将前沿大语言模型保留用于意图理解,同时将检索和评分任务委托给轻量级模型和定制语料库)。在 PaSaMaster-Bench 涵盖的 38 个学科中,PaSaMaster 的 F1 分数比 Google Scholar 高 16.5,比 GPT-5.2 高 37.8%,而成本仅为后者的约 1%,同时将来源幻觉从生成式大语言模型的 32.66% 降至零:https://github.com/sjtu-sai-agents/PaSaMaster

关键词:

科学文献发现,智能体 AI,大语言模型

媒体内容 · 前往原文查看
表 1:科学文献发现的五种范式。现有范式各自改进了文献检索的某一方面,但未能同时实现自适应的意图理解、无幻觉的证据溯源以及成本高效的规模化扩展。PaSaMaster 通过智能体递归自演进和基于证据的检索解决了这些局限。
范式层级 代表性系统 意图自适应性 来源可靠性 成本效率
第 0 级:词汇检索 Google Scholar [google_scholar], PubMed [pubmed-ncbi-official] 基于关键词;意图压缩严重 经过验证的已索引论文 高效但语义层面浅显
第 1 级:语义检索 OpenScholar [asai2024openscholar], Bohrium Navigator [zhang2025bohriumscimaster] 被动嵌入匹配;意图压缩有限 经过验证的索引论文 高效但语义浅层
第二级:生成式大语言模型 GPT-5.2 [openai2026gpt54]、Gemini 3.1 Pro [google2026gemini31pro]、DeepSeek [deepseekai2025deepseekv32] 强大的自然语言理解能力 容易产生模型幻觉论文 大规模部署成本高昂
第三级:固定流程智能体检索 Google Scholar Labs [google2025scholarlabs]、PaSa [he2025pasa] 用户意图在开始时固定;检索过程中无认知更新 经过验证的索引论文 成本可控,但受限于固定的意图解读
第四级:递归自进化智能体检索 PaSaMaster(我们的方案) 利用排序后的证据迭代优化意图 经过验证的索引论文 成本高效的规划-检索分离

a

Refer to caption

b

Refer to caption
图 1:PaSaMaster 与 PaSaMaster-Bench 概览。a,PaSaMaster 通过三个层级将复杂的自然语言搜索意图转化为经过验证、按证据排序的论文列表:一个优化意图和搜索策略的导航器、一个负责检索、验证和评分候选论文的图书馆员集群,以及将所有输出锚定于真实来源的已验证语料库和工具。b,PaSaMaster-Bench 通过专家编写的搜索意图、多通道候选检索和基于清单的专家标注来评估复杂文献检索。该基准包含覆盖 38 个学科的 244 个任务,能够评估意图理解、来源可靠性和排序质量。

科学文献检索是所有科学探究的公理起点[gusenbauer2021searching]。在提出假设、设计实验或构建新理论之前,研究人员必须从根本上驾驭庞大且不断扩展的现有知识体系[fortunato2018science]。然而,近几十年来,科学出版物的数量呈指数级增长,彻底压垮了研究人员有限的认知带宽[bornmann2015growth, Landhuis_2016, houssard2025gerontocratization]。这种严重的信息过载迫使人们不可避免地依赖人工智能来自动化和加速知识发现[wang2023scientific]。更重要的是,现代文献检索很少是简单的关键词查找[furnas1987vocabulary, beel2010aseo]。研究人员经常表达复杂的学术意图,涉及技术约束、应用背景和隐含的背景知识[white2009exploratory, gusenbauer2021searching, ajith2024litsearch]。随着大语言模型重塑科学研究工作流程,文献检索因此面临一个新的核心挑战:如何深入理解复杂的搜索意图,同时确保返回的每一个来源都是真实且可验证的[zhang2025llmscimethod, ajith2024litsearch]。

现有的文献检索系统仍然难以同时实现复杂意图理解和来源真实性。一些方法以牺牲浅层意图理解为代价来保留来源真实性[google_scholar, asai2024openscholar, zhang2025bohriumscimaster],而另一些方法则在提高语义理解的同时牺牲了事实可靠性[deepseekai2025deepseekv32, kimiteam2026kimik2, minimax2025minimaxm1, glm5team2025glm45, google2026gemini31pro, openai2026gpt54]。这在可靠但有限的检索与更智能但可信度较低的文献发现之间造成了持续的权衡。

从文献检索范式的演变来看,意图理解与来源可靠性之间的权衡关系更为清晰(表1)。第0级(词汇检索)[google_scholar, pubmed-ncbi-official] 通过索引数据库保证来源真实性,但将复杂的研究意图压缩为僵化的关键词,导致严重的意图压缩。第1级(语义检索)[asai2024openscholar, zhang2025bohriumscimaster] 通过基于嵌入向量的相似度匹配和检索增强匹配 [karpukhin2020dense, lewis2021rag] 改进了精确关键词匹配,但仍将检索视为被动的查询-文档匹配过程,缺乏主动澄清、分解或细化复杂意图的能力。第2级(生成式大语言模型)[deepseekai2025deepseekv32, kimiteam2026kimik2, minimax2025minimaxm1, glm5team2025glm45, google2026gemini31pro, openai2026gpt54] 提供了更强的意图理解能力,但其概率生成特性会引入伪造论文 [zhang2025sirenssong, Farquhar_2024],损害了科学探究所需的事实可信度。第3级(固定流水线智能体检索)[google2025scholarlabs, he2025pasa] 通过将大语言模型智能体锚定在可验证的检索工具上 [nakano2021webgpt, schick2023toolformer, qin2023toolllm, yao2023react, du2026openseeker, du2026openseekerv2],缓解了来源幻觉问题。然而,这些系统通常遵循预定义的“检索-阅读-回答”流水线,其中对用户问题的解释在很大程度上在开始时就被固定下来。对于复杂的研究意图,这种初始解释可能不完整,或仅偏向请求的某一部分,导致后续检索步骤遗漏相关的子主题,或返回仅满足部分约束条件的论文。这一局限性促使人们开发能够在证据积累过程中更新对意图理解的检索系统。

对自适应、可验证且高效检索的未解决需求,催生了第四级(递归自进化智能体检索),其代表为 PaSaMaster。PaSaMaster 是一个递归自进化智能体文献检索系统,它迭代分析意图、检索经过验证的论文,并依据有证据支撑的相关性分数对其进行排序。该系统并非将文献搜索视为一次性查询-文档匹配问题,而是将科学文献发现构建为一个递归自进化的意图-论文相关性排序过程。这种设计使系统能够与复杂的研究意图对齐,同时确保每个返回的来源都是真实、可验证且基于定制语料库的。

PaSaMaster 基于三项关键设计构建。首先,递归自进化检索:它将文献检索从一次性查询-文档匹配转变为随时间演化的自适应搜索过程 [guo2024multiagent, shinn2023reflexion],在此过程中,检索并排序后的证据被用于识别覆盖缺口、优化研究意图,并引导后续检索轮次。其次,无幻觉排序:它将文献发现视为意图-论文相关性排序而非生成任务,并在多学科查询-论文证据上训练一个轻量级排序器,使得图书馆员智能体能够跨学科做出专家级的相关性判断,同时仅对基于原始证据的已验证论文进行排序。第三,成本高效的规划-检索分离:它仅使用前沿大语言模型进行意图理解与优化,而将大规模检索和相关性评分委托给定制化科学语料库和轻量级模型。这些设计共同使 PaSaMaster 能够与复杂的研究意图对齐,同时保持来源可验证性和成本高效的扩展能力。

为评估在复杂自然语言文献检索问题上的检索能力,我们引入了 PaSaMaster-Bench,这是首个面向复杂搜索意图的多学科文献检索基准。与围绕简短关键词查询构建的传统检索基准不同,PaSaMaster-Bench 专注于高度具体、多约束条件的自然语言搜索意图,要求系统能够搜索、验证并对所有满足明确标准的论文进行排序。该基准包含 244 个由专家策划的任务,涵盖 38 个科学学科,其查询、约束条件、目标论文列表及评估检查表均由人类领域专家标注和验证。

PaSaMaster-Bench 的评估揭示了传统关键词检索存在的严重不准确性和不完整性,PaSaMaster 将 F1 分数提升了 16.5。评估还暴露了生成式大语言模型的不可靠性,其模型幻觉率高达 32.66%。值得注意的是,PaSaMaster 在仅使用 GPT-5.2 计算成本 1% 的情况下,性能却高出 37.8%,并且保持了零源幻觉。这些结果表明,基于递归自演进、证据支撑的相关性排序能够提升对复杂意图的理解,消除源幻觉,并实现大规模、低成本的科学文献发现。

1 结果

1.1 PaSaMaster 系统概述

图 1a 总结了 PaSaMaster 如何将自然语言搜索意图转化为可审计的排序论文列表。该系统首先将请求的隐含结构显式化,将主题范围、方法论要求、应用背景、元数据限制和排除规则转化为检索策略和验证检查表。随后,它返回排名靠前的候选论文,并附带论文级别的相关性评分、推荐理由以及约束条件级别的判断。每个判断都关联了做出该判断所依据的证据,包括元数据、摘要、全文片段以及将证据与所述约束条件联系起来的推理过程。

PaSaMaster 由三个层级构成。导航器负责意图消歧、清单构建、搜索规划以及逐轮反思。图书馆员集群执行多渠道检索、证据验证、意图-论文评分以及基于标准的重排序。经过验证的语料库与工具集层提供科学语料库、搜索与访问工具、检索算子以及用于元数据、摘要和证据片段的阅读工具。导航器与图书馆员之间的策略-反馈循环使检索能够自我演进:每一轮排序后的证据会更新系统对用户意图的理解,并决定下一轮搜索方向,而经过验证的语料库层则确保所有排序后的论文真实可靠且基于证据。

1.2 PaSaMaster-Bench 捕捉复杂搜索意图

PaSaMaster-Bench 评估检索系统能否解决真实研究工作中出现的组合式搜索意图 [white2009exploratory, gusenbauer2021searching, ajith2024litsearch]。这类意图很少能简化为一个主题关键词:用户可能同时指定科学范围、所需方法、应用领域、发表场所或时间窗口,以及排除那些看似相关但并非目标论文的条件。由于这些约束条件是以自然语言而非显式数据库筛选条件表达的,系统必须在识别出正确的论文集合之前推断出完整的意图。

一个代表性任务是:能否帮我找到关于联邦学习用于多家医院协同训练医学影像 AI 模型的实证研究,发表于《自然·医学》、《自然·通讯》或《IEEE 医学影像汇刊》,时间范围在 2023 年至 2025 年 10 月之间?这是研究人员在准备综述、基金申请或相关工作章节时可能提出的请求。它要求系统同时满足主题、方法、应用、发表场所、时间和排除条件;仅讨论联邦学习或仅研究医学影像的论文是不够的。

该基准测试涵盖 38 个科学学科的 244 项独立文献发现任务。针对每项任务,领域专家撰写自然语言意图,将其分解为客观检查清单条目,通过多种检索渠道构建广泛的候选论文池,并依据检查清单对每篇候选论文进行标注(图 1b)。由此得到的目标集合比主题相关性更为严格:一篇论文只有满足所有必要约束条件才算正确。PaSaMaster-Bench 衡量的是系统能否根据真实研究问题还原出预期的论文集合,而不仅仅是能否检索到同一领域的论文。

1.3 实验设置

我们将 PaSaMaster 与四组基线方法进行比较。词汇检索系统以 Google Scholar 为代表,搜索已验证的索引记录,但主要依赖关键词匹配。语义检索系统(包括 OpenScholar 和 Bohrium Science Navigator)采用语义匹配或检索增强的科学搜索。生成式大语言模型基线包括 DeepSeek、Kimi、MiniMax、GLM、Gemini 和 GPT。这些大语言模型作为工具辅助的搜索智能体进行评估,而非闭卷模型:每个模型都配备搜索和访问工具,并被提示在返回论文之前进行搜索、检查证据并验证来源,遵循工具使用智能体评估协议。对于固定流程的智能体检索,我们使用 Google Scholar Labs 作为预定义智能体搜索工作流的代表。

检索质量采用标准信息检索指标进行衡量 [manning2008introduction, jarvelin2002cumulated]。Recall@20 衡量在前 20 个结果中召回的真实目标论文数量;Precision@20 衡量返回的前 20 篇论文中有多少是真正的目标论文;F1-score@20 总结了召回率与精确率之间的平衡;NDCG@20 衡量相关论文是否排在更靠前的位置。我们还报告了每次查询的成本和来源幻觉率。成本反映了理解复杂约束和执行检索的计算开销,而幻觉率衡量的是返回论文中无法匹配到真实学术记录或包含可证明错误来源元数据的比例。这些指标共同评估了意图理解、来源真实性和成本效益检索。

1.4 低成本下准确、无幻觉的检索

媒体内容 · 前往原文查看
表 2:PaSaMaster 与其他方法的性能对比。在保证零幻觉的前提下,PaSaMaster 以低成本实现了强大的召回率和排序能力。生成式大语言模型基线允许在返回最终论文列表前调用搜索和访问工具在网络上查找论文。
方法 NDCG 召回率 精确率 F1 分数 幻觉率 成本(美元)
词汇检索系统
Google Scholar 2.07 1.69 1.48 1.39 0 –
语义检索系统
OpenScholar 14.61 11.68 8.52 7.92 0 –
Bohrium Science Navigator 22.39 19.37 12.50 12.26 0 –
生成式大语言模型
DeepSeek-v3.2 35.82 24.76 15.35 15.56 12.94 0.28
Kimi-K2.5 37.80 28.08 16.95 17.36 26.59 0.16
MiniMax-M2.7 30.70 24.23 14.42 15.11 32.66 0.18
GLM-5 35.89 28.99 16.93 18.18 21.64 0.56
Gemini-3.1-pro 31.34 21.30 11.68 12.48 27.54 0.38
GPT-5.2 31.59 25.32 16.82 16.69 5.65 6.06
固定流水线智能体检索
Google Scholar Labs 30.54 29.01 18.79 18.87 0 –
递归自进化智能体检索
PaSaMaster 39.52 33.24 23.46 23.00 0 0.05

表 2 报告了 PaSaMaster-Bench 上的主要结果,图 2 总结了跨学科鲁棒性、源错误模式以及排序器的增益。总体而言,PaSaMaster 在保持零源幻觉和低计算成本的同时,实现了最佳的检索质量。这些结果支持了我们系统的三个核心主张:递归自进化检索提升了对复杂自然语言搜索意图的理解,意图-论文相关性排序防止了幻觉源的出现,以及规划-检索分离实现了成本高效的大规模文献发现。

递归式自我进化检索提升了复杂意图理解能力。如表2所示,PaSaMaster在所有主要质量指标上均取得了最高检索性能,其NDCG@20为39.52,Recall@20为33.24,Precision@20为23.46,F1-score@20为23.00。这表明PaSaMaster能够更好地找回复杂多约束研究意图所隐含的目标论文。与谷歌学术相比,PaSaMaster将F1-score@20从1.39提升至23.00,提升了16.5倍,显示出以关键词为核心的检索在复杂自然语言查询下的严重局限性。与语义检索系统相比,PaSaMaster也大幅优于OpenScholar和Bohrium Science Navigator,表明被动语义匹配对于需要约束推理和意图优化的查询仍然不足。在生成式大语言模型中,最强的F1基线是GLM-5,得分为18.18,而固定流程的智能体检索基线Google Scholar Labs得分为18.87。PaSaMaster达到了23.00,分别比这些最强基线提升了26.5%和21.9%。图3从机制层面展示了这一优势。在图3a中,连续多轮检索到的论文向不同主题区域偏移,表明前几轮检索到的证据改变了系统对查询的理解,并开辟了新的搜索方向。在图3b中,找回的真实论文数量随轮次增加而增加,表明这些新的搜索方向带来了更多相关论文,而不仅仅是重复初始检索。综合两幅图来看,递归式自我进化检索通过利用检索到的证据更新认知,并引导后续搜索指向目标论文集合的互补部分,从而提升了复杂意图理解能力。

意图-论文相关性排序消除了来源幻觉。如表2所示,PaSaMaster在保持最强检索质量的同时实现了0%的幻觉率。这一结果直接支持了我们将文献发现视为意图-论文相关性排序而非生成任务的设计选择。相比之下,采用工具辅助的生成式大语言模型基线(包括DeepSeek-v3.2、Kimi-K2.5、MiniMax-M2.7、GLM-5、Gemini-3.1-pro、GPT-5.2)表现出显著的幻觉率,其中MiniMax-M2.7为32.66%,Gemini-3.1为27.54%,Kimi-K2.5为26.59%,GLM-5为21.64%,DeepSeek-v3.2为12.94%,GPT-5.2为5.65%。这些结果表明,即使是配备了搜索和访问工具的前沿大语言模型,仍然容易捏造或错误报告科学来源。图2b进一步显示,幻觉源于多个引用字段,包括标题、作者、日期和链接错误。相比之下,PaSaMaster仅对从经过验证的语料库中检索到的论文进行排序,并将相关性判断建立在原始论文证据之上,从而确保来源信息零幻觉。

规划-检索分离降低了成本。表2显示,PaSaMaster实现这一性能的成本仅为每次查询0.05美元。这远低于GPT-5.2的6.06美元、GLM-5的0.56美元、Gemini-3.1-pro的0.38美元以及DeepSeek-v3.2的0.28美元。特别值得注意的是,PaSaMaster在F1-score@20指标上比GPT-5.2高出37.8%,而计算成本仅为其约1%。这证实了将高层规划与大规模检索相分离的优势,使PaSaMaster能够以显著更低的成本保持高质量的检索。

a

Refer to caption

b

Refer to caption

c

Refer to caption
图 2:PaSaMaster-Bench 上的检索质量、来源幻觉与排序性能。a,不同检索系统在各科学学科上的 F1 分数分布。PaSaMaster 实现了最强的整体检索性能,并在多个学科领域广泛领先,其下限和上限性能范围均高于对比范式。b,工具辅助生成式大语言模型的引文来源幻觉率,按整体来源幻觉率排序。柱状图展示了各领域在标题、作者、日期和链接上的错误,折线表示返回论文中存在任何来源错误的整体比例。c,经过排序器训练后,整体及按学科划分的排序前后性能对比,以 NDCG@20、Recall@20 和 Precision@20 衡量。首先展示整体增益,随后是按平均增益排序的学科组,突出展示了多学科排序器训练带来的广泛改进。

a

Refer to caption

b

Refer to caption
图 3:证据反馈驱动意图演化与目标论文发现。a,六次代表性检索案例在连续搜索轮次中的 t-SNE 可视化。每种颜色代表一轮检索到的论文,星号标记原始查询,密度阴影表示检索论文的集中程度,注释标识主导主题。随着轮次推进,检索到的论文向不同主题区域偏移并形成独特分布,表明 PaSaMaster 从先前检索到的证据中发展出对用户意图的新理解,并利用这种理解探索新的搜索方向。这种不断演化的认知有助于后续轮次超越初始查询解释,检索到互补的相关论文。b,所有学科平均的检索动态。每轮检索到的论文被反馈给导航器,以优化其对用户意图的理解并更新下一轮搜索策略。随着自我演化过程的推进,PaSaMaster 检索到更大的候选池,识别出更多高分论文,并找回更多真实目标论文。跨轮次真实命中数的增加表明,每一轮迭代都贡献了额外的相关论文,而不仅仅是重复先前的检索结果。

跨学科的一致性能提升。图 2 展示了 PaSaMaster-Bench 中 38 个科学学科在检索鲁棒性、来源幻觉和排序性能方面的表现。在图 2a 中,PaSaMaster 在多个学科组中均取得了领先的 F1 分数分布。其性能范围相较于竞争范式整体上移,在困难案例上具有更高的检索下限,在简单案例上具有更高的上限范围,这表明该系统在跨学科场景下同时提升了鲁棒性和峰值检索质量。在图 2c 中,整体行显示经过排序器训练后,NDCG@20、Recall@20 和 Precision@20 均有一致性提升,而各学科行则显示在大多数学科中均有改进。这些提升得益于对数万个多学科查询-论文样本的训练,这有助于排序器超越单一领域进行泛化,并在最终列表中更准确地定位相关论文。图 3b 进一步表明,递归自进化检索能够跨学科逐轮扩展证据空间,增加了检索到的论文数量、高分论文数量以及恢复的真实论文数量。综合来看,这些结果表明 PaSaMaster 的性能提升并非源于狭窄的领域特定优势。相反,它们反映了三个设计原则的通用性:递归自进化检索支持复杂意图理解,基于证据的排序确保来源真实性,而规划-检索分离则实现了跨异构科学领域的可扩展检索。

2 讨论

PaSaMaster 表明,科学文献发现可以被构建为一个递归自演化、基于证据的排序问题,而非关键词匹配或引文生成。在 PaSaMaster-Bench 上,这种方案在复杂搜索意图下提升了目标论文的召回率,同时保持了零源幻觉,并大幅降低了计算成本。这一点很重要,因为当前系统面临一个结构性权衡:基于数据库的检索能保证来源真实性,但往往无法捕捉精细研究需求背后的意图;而前沿大语言模型可以对更丰富的请求进行推理,却可能捏造或误报科学来源。PaSaMaster 通过将输出空间限制在已验证的论文上,同时允许搜索过程本身不断演化,缩小了这一差距。

其核心机制是在检索过程中利用排序后的证据持续更新系统对用户意图的理解。这使得 PaSaMaster 具备递归自演化能力:搜索过程并非仅仅执行初始查询,而是随着证据的积累逐步修正查询本身的含义。研究人员在查看文献之前很少能确切知道最佳查询是什么;他们会搜索、检查部分结果、识别缺失的约束条件并调整方向。PaSaMaster 通过让导航器(Navigator)在观察来自图书馆员集群(Librarian swarm)的评分候选结果后,修正检索策略和验证清单,将这一过程操作化。由此形成的循环帮助系统摆脱对初始查询的静态解释,这对于多约束意图尤其有价值——在这些意图中,相关性取决于主题、方法、数据集、应用场景和排除条件的组合。跨学科的结果表明,这一机制不仅是特定领域的优化,更是将检索与复杂科学需求对齐的通用策略。

同样重要的是,决定对论文进行排序而非生成引用。在许多基于大语言模型的文献工作流程中,模型幻觉的产生是因为模型被要求直接从参数记忆或部分有依据的上下文中生成文献条目。PaSaMaster 改变了这种失败模式,它要求每个候选文献都必须从经过验证的语料库中检索,并且每个相关性判断都必须有原始论文中的证据支持。因此,该系统并不保证每个相关性判断都完美无缺,但它确实让每个相关性得分都可追溯到论文层面的证据,并确保推荐的来源是真实且可核查的。这一区别对于科学用途至关重要,因为伪造的论文可能会扭曲文献综述,制造虚假的证据链,并误导后续的假设形成或实验设计。PaSaMaster 通过使每条推荐都可追溯到真实论文以及用于判断其相关性的证据,降低了这种风险。

低成本的设计也塑造了 PaSaMaster 的潜在用途。文献发现并非一次性任务;研究人员在规划项目、撰写相关工作、检查新颖性以及更新综述时都会反复进行搜索。一个依赖前沿大语言模型进行每次检索和评分操作的系统,很难按这种频率和规模进行部署。通过将高层规划与大规模检索及轻量级相关性评分分离,PaSaMaster 使智能体驱动的文献发现对于广泛的多学科应用变得更加实用。在此角色中,该系统应被视为一个辅助层,用于扩展和组织候选证据空间,而非替代专家判断。当它能够以低成本提供更全面、更准确的检索,揭示论文被推荐的原因,并使遗漏更易于诊断时,其价值最为显著。

仍存在若干局限性。首先,PaSaMaster-Bench 由专家策划,其目标集可能仍会受到标注者学科专长、先验知识和搜索视野的影响。我们通过使用多种检索渠道帮助专家汇集广泛的候选池,并要求进行逐项清单评分(使每篇候选论文均依据既定意图进行验证,而非仅凭印象接受)来缓解这一局限。其次,当前评估侧重于排名靠前的论文检索,而非下游文献综合、假设生成或手稿撰写的质量。因此,未来工作应测试改进后的检索是否能在人机协同场景中带来更优的科学产出,包括专家对覆盖度、新颖性、有用性和可信度的评估。第三,PaSaMaster 可从检索相关论文扩展至帮助科学家重构领域历史发展脉络、识别新兴研究轨迹,并基于文献生成候选研究方向。此类能力将有助于研究人员快速理解某一主题的演变过程,并利用经过验证的证据来定义新的研究问题。最后,尽管 PaSaMaster 通过设计消除了来源幻觉,但相关性评分仍可能继承来自语料库、模型和清单设计的偏差。因此,一个可部署的系统应足够清晰地呈现证据、不确定性和失败模式,以便研究人员对其建议进行审计。综合来看,这些结果表明,自我进化的验证式检索是可信赖的 AI 辅助科学研究的坚实基础,但其全部价值将取决于透明的评估、持续的语料库更新,以及审慎地融入专家研究工作流程。

3 方法

3.1 PaSaMaster 概述

PaSaMaster 是一个智能体化的递归自进化文献检索系统,它能够将复杂的自然语言搜索意图映射为一个经过排序、有证据支撑的论文集合,其中 是第 篇推荐论文, 是输出列表的长度。其设计遵循三项原则,直接针对现有文献检索范式的局限性:递归自进化检索、无幻觉的意图-论文相关性排序,以及成本高效的规划-检索分离。PaSaMaster 并非从参数化记忆中生成论文列表,而是从定制的科学语料库中检索真实论文,利用原始证据验证其相关性,并基于排序后的检索结果迭代地优化搜索意图。

形式上,PaSaMaster 在一个定制的科学语料库和一个智能体可访问的操作工具集 上运行。给定查询 ,一个具有策略 的导航器(Navigator)首先生成一个检索策略和一个针对查询的验证检查清单 ,其中 是检查项的数量,每个检查点编码了一个相关论文必须满足的具体要求。该系统还使用并行的图书馆员(Librarian)智能体,记为 ,其中 是第 个图书馆员的策略。设 Plan 表示导航器规划,Retrieve 表示语料库搜索,Verify 表示基于证据的候选评分,Rerank 表示最终的列表排序。整个检索流程如下:

(1)
(2)
(3)
(4)

这里 是初始检索到的候选集, 是经过证据评分的候选集, 是最终的排序论文列表。公式 1-4 将 PaSaMaster 概括为一个分阶段的过程,其中规划定义了搜索方向,图书馆员从可信工具中检索并验证论文,重排序则将评分后的候选集转换为最终的推荐列表。

3.1.1 基于排序证据的递归自进化检索

PaSaMaster 的第一个核心设计是将文献检索从一次性查询-文档匹配转变为递归自进化搜索过程。现有检索系统通常在开始时固定其对用户查询的解释 [google_scholar, asai2024openscholar, zhang2025bohriumscimaster, google2025scholarlabs, he2025pasa],并在这种静态理解下执行检索。而 PaSaMaster 则将检索视为一个迭代过程,在此过程中,使用排序后的证据来更新系统对研究意图的理解。

该过程由导航智能体协调。给定初始查询后,导航智能体首先分析用户的研究意图并生成两个输出:一个检索策略,指定应搜索什么内容;以及一个验证清单,指定应如何评判候选论文。设索引为检索轮次,并设、和分别表示第轮次的检索策略、清单和评分后的候选集。在每一轮检索之后,导航智能体会检查排序后的结果,识别缺失的覆盖范围、模糊的约束条件或探索不足的方向,并通过反思算子 Reflect 来优化下一轮的策略和清单:

(5)

公式 5 形式化了自进化步骤:来自第轮次的排序证据更新了系统对查询的理解,并生成了用于第轮次的策略和清单。

3.1.2 无幻觉意图-论文相关性排序

第二个核心设计是通过将文献发现表述为意图-论文相关性排序而非生成,来防止产生幻觉来源。PaSaMaster 从不要求大语言模型直接从参数化记忆中综合生成引用或论文列表。相反,每一篇候选论文都必须从经过验证的科学语料库中检索,并且每一项相关性判断都必须基于原始论文中可追溯的证据。

为了支持可验证的检索与证据锚定,PaSaMaster 将超过百万篇论文重构为三层智能体原生知识库 [lo2020s2orc]。该知识库包含结构化元数据、用于粗粒度语义筛选的摘要级表征,以及从全文切分的段落级证据块。语料库表示如下:

(6)

公式 6 定义了语料库布局,用于将元数据检索、摘要级筛选和段落级证据锚定保持分离,同时让智能体能够联合访问。

对于每篇候选论文和清单条目,令 表示属于论文 的证据块集合,令 表示该集合中的一个候选块,令 为共享文本编码器,令 表示待检索的证据块数量,令 表示对得分最高的块进行选择,令 表示选出的支持清单条目 判断的前 个证据块。证据块定位器通过余弦相似度检索支持性段落:

(7)

公式 7 通过选取论文中与待检查要求语义最对齐的段落,将每个清单判断与显式文本证据绑定。

随后,每篇候选论文由轻量级评分器模型进行评估,该模型通过多学科蒸馏流程训练。我们首先跨学科采样种子主题,并用其构建初始文献查询和种子论文集合。然后对检索到的论文进行聚类,获得更细粒度的主题组,从中合成逼真的搜索查询和查询专属清单,涵盖主题、方法、应用元数据约束及排除标准。每条合成查询通过 PaSaMaster 检索流水线获取候选论文,生成包含正匹配、部分匹配和难负样本的多学科查询-论文对。更强的教师模型随后根据清单对每个配对进行标注,分配检查点级分数、基于证据的推理以及整体相关性判断。

这一训练过程赋予了轻量级评分器跨学科的广泛、专家级相关性评估能力。在推理阶段,对于每篇论文和检查点,评分器会输出一个满意度分数和基于证据的推理说明,数值越大表示对该检查表项目的满足程度越高。对于一篇论文,设其表示各检查表项目的平均满意度分数:

(8)

公式 8 将检查点级别的证据汇总为候选论文在单一准则层面的相关性信号。

为了纳入整体置信度,PaSaMaster 还提取评分器模型对其整体相关性判断的校准输出概率。设表示论文的最终归一化相关性分数。最终相关性分数为:

(9)

其中分母 6 对的最大可能值进行归一化,因为且。公式 9 将检查表满意度与整体置信度合并为论文层面的单一相关性分数。随后,排名靠前的候选论文被传递给列表式重排序器,进行全局跨论文比较。最终结果是一份按相关性排序的真实论文列表,每条推荐都可追溯到论文层面的证据。

3.1.3 成本高效的规划-检索分离

第三个核心设计是规划-检索分离,通过仅在最具价值的环节使用前沿大语言模型来提升可扩展性。前沿大语言模型擅长理解、分解和优化复杂的研究意图,但如果将其用于每一次检索、阅读和排序操作,成本将过高。因此,PaSaMaster 将高层推理任务分配给导航器,而将大规模检索和相关性评分任务委托给定制化语料库以及轻量级并行图书馆员智能体。

设表示用于构建候选池的检索工具,表示用于检查元数据、摘要和证据片段的阅读工具。操作工具集被划分为这两个子集:

(10)

公式 10 表明,PaSaMaster 将用于查找候选论文的工具与用于阅读和验证论文的工具分离开来,从而支持成本高效的分工协作。

检索工具通过互补的检索通道构建一个广泛的候选池,这些通道包括语义直接检索、引文网络扩展以及网络到仓库验证。设 \( r \) 表示 \( R \) 中的一个检索算子,设 \( C_{r,s}(D) \) 表示算子 \( r \) 在策略 \( s \) 下对语料库 \( D \) 返回的候选结果,设 \( C(D) \) 表示所有检索算子返回的候选结果的并集:

(11)

公式 11 将初始候选池定义为互补检索通道的并集,从而在证据验证和重排序之前提高了覆盖率。语义直接检索提供高精度的语义候选结果,引文网络扩展沿着引文链接发现结构相关的论文,而网络到仓库验证则将外部网络发现映射回经过验证的仓库条目。随后,阅读工具支持高效的元数据查找、摘要阅读以及证据片段定位,避免了代价高昂的全文阅读,并大幅降低了计算成本。

最后,经过知识蒸馏的评分器充当每个 Librarian 智能体的验证组件。给定一份针对查询的检查清单和检索到的证据片段,它会分配检查清单级别的分数,生成基于证据的推理依据,并给出整体的相关性判断,而无需针对每篇候选论文重复调用前沿大语言模型。这使得 Librarian 智能体能够在大型科学语料库上以低得多的推理成本复现专家式的结构化验证。

3.2 PaSaMaster-Bench

PaSaMaster-Bench 旨在评估文献检索系统在接近真实科学论文发现场景下的表现。在实际操作中,研究人员很少只询问一个主题;他们会提出自然语言问题,这些问题结合了科学范围、方法、应用场景、元数据限制和排除条件,并且通常是在开放网络上搜索,而非在固定语料库中。任何遗漏了这些维度的基准测试都可能高估检索能力:简短的关键词式查询低估了意图推理能力,宽松的相关性标签无法测试完整的约束满足能力,单一领域的任务掩盖了跨学科的脆弱性,而固定语料库的设置则绕过了真实搜索环境中的来源验证。

表 3 总结了这一差距。现有的文献搜索和研究智能体基准测试 [he2025pasa, kang2025researcharenabenchmarkinglargelanguage, bragg2026astabenchrigorousbenchmarkingai, xiong2026autoresearchbenchbenchmarkingaiagents, ajith2024litsearch] 涵盖了问题的有用部分,但通常至少缺少一项现实论文发现所需的关键属性:复杂的组合式自然语言意图、广泛的跨学科覆盖范围,或真实的网络搜索。PaSaMaster-Bench 的设计旨在同时满足所有这四个属性。它包含涵盖 38 个科学学科的 244 个独立任务,每个任务都将一个真实的自然语言搜索意图与一组专家标注的目标论文配对。

这种设计使 PaSaMaster-Bench 成为直接测试 PaSaMaster 所提供能力的试验场。系统必须推断用户的完整意图,在真实环境中进行搜索,返回真实的论文,并通过论文级别的证据筛选候选结果。只有满足专家定义的所有检查清单标准的论文才算正确,而不仅仅是共享相同主题。因此,该基准测试评估的是检索系统能否恢复真实研究需求背后的目标论文集合,而不仅仅是能否检索到看似合理或广泛相关的论文。

媒体内容 · 前往原文查看
表 3:与现有文献搜索和研究智能体基准测试的比较。该表格将我们的基准测试与具有代表性的基准测试进行了比较,涵盖了现实科学论文发现所需的四个属性,包括自然语言查询、复杂组合搜索需求、多学科覆盖以及真实网络搜索。
基准测试维度 RealScholar 查询 [he2025pasa] Research Arena [kang2025researcharenabenchmarkinglargelanguage] AstaBench 论文查找器 [bragg2026astabenchrigorousbenchmarkingai] AutoResearch 基准测试 [xiong2026autoresearchbenchbenchmarkingaiagents] LitSearch [ajith2024litsearch] PaSaMaster- 基准测试
自然语言查询
复杂搜索意图
多学科覆盖
在真实网络环境中搜索

3.2.1 数据整理

整理流程旨在保持真实性的同时,使评估客观化(图 1b)。首先,领域专家根据 38 个学科中的真实研究场景撰写搜索意图。意图以自然语言形式保留,使任务类似于科学家询问论文的方式,但同时将其分解为一份客观标准的检查清单。这些标准规定了定义目标论文集的主题范围、所需方法、应用场景、数据集或基准测试条件、发表限制以及排除规则。

其次,每个查询通过多个检索渠道执行,以模拟真实的开放网络搜索过程。我们使用支持网络的先进大语言模型、PaSaMaster 的原生搜索引擎以及传统网络搜索,来构建一个有意为之的广泛候选池。其目的并非将任何检索器视为真实标准,而是让专家接触到多样化的可能目标,包括可能被某个搜索渠道遗漏的论文。检索到的论文经过验证、去重,并在标注前映射到一个统一的候选集中。

第三,领域专家逐项对照清单对候选论文进行标注。一篇论文只有在满足所有必要标准时才会被收录。那些主题相关但不符合方法要求、应用场景、元数据约束或排除规则的论文会被标记为不正确。这种逐元素标注将复杂的自然语言需求转化为可验证的目标集合,同时保留了原始查询的组合难度。

3.2.2 评估协议

评估协议考察系统能否重建复杂用户意图所隐含的目标论文集合。给定一个查询,系统必须自主搜索、验证并返回一个排序列表,其中第 个元素是返回的第 篇论文。该列表与专家标注的、满足所有清单标准的论文集合进行比较。这种设置使得评估比主题相关性更为严格:一篇返回的论文只有在满足完整意图时才被视为有用。

覆盖率和排序质量使用标准排序指标进行评估。在截断点 处,Recall@K 衡量系统能否覆盖预期的论文集合;Precision@K 衡量返回的论文是否满足专家清单;F1@K 体现覆盖率与约束满足之间的平衡;NDCG@K 衡量最相关的目标论文是否排在靠前位置 [manning2008introduction, jarvelin2002cumulated, thakur2021beir]。在本基准测试中,这些指标共同测试了在组合约束条件下的自然语言意图理解、论文级过滤和排序能力。

超越检索质量本身,PaSaMaster-Bench 还评估了来源真实性和成本效率,这是可部署的科学搜索系统的两项要求。来源幻觉率衡量的是返回的论文中,无法匹配到真实学术记录或包含可证伪的错误源元数据的比例。Token 使用量和每次查询成本则衡量复杂的检索能否保持足够低的开销,从而在科学工作流程中大规模、重复且广泛地使用。对于生成式大语言模型基线,我们评估的是工具辅助的文献搜索,而非直接的参数化回答:每个模型都配备了搜索和访问工具,并被提示执行 ReAct 风格的搜索、证据检查和来源验证,然后生成最终的排序列表 [nakano2021webgpt, schick2023toolformer, qin2023toolllm, yao2023react, du2026openseeker, du2026openseekerv2]。这种设置测试的是大语言模型智能体能否使用外部工具来发现真实、满足约束条件的论文,而不仅仅是生成看似合理的引用。

因此,PaSaMaster-Bench 衡量了现实科学文献发现所需的四种能力:意图理解、满足约束的检索、排序质量和来源真实性。这些也正是 PaSaMaster 的自我进化检索、基于证据的排序以及规划-检索分离所针对的能力。

3.2.3 搜索意图示例

PaSaMaster-Bench 围绕自然语言意图设计,这些意图真实反映了研究人员实际搜索文献的方式。查询覆盖了科研工作中四种常见的研究需求:寻找已知类型的研究、在仅明确研究问题时定位目标论文、准备带有严格元数据约束(如会议或时间范围)的文献综述,以及排除那些表面相似但不符合实际要求的论文。这些场景共同使该基准比关键词式检索任务更贴近真实的文献发现过程。下面的示例展示了 PaSaMaster-Bench 如何结合主题范围、方法要求、应用背景、元数据限制和排除标准,要求系统检索出满足完整意图的论文,而不仅仅是共享关键词。

这是一个直接意图查询。用户知道自己想找什么,但目标仍然是复合性的:相关论文必须同时涉及 RNA 修饰鉴定、质谱分析、基于机器学习的谱图注释以及串联质谱碎片证据。

这是一个问题驱动型查询。用户不知道确切的模型族、描述词或关键词来搜索,但明确陈述了一个研究瓶颈。一个高效的检索智能体必须推断出相关的方法论空间,并将用户的需求转化为搜索标准,然后才能推荐论文。

这是一个元数据约束型查询。系统必须检索目标主题的论文,同时强制执行出版物类型和时间范围。因此,它测试了检索能否将语义相关性与严格的论文级元数据约束结合起来。

这是一个排除敏感型查询,要求选择特定的电池体系和电解质化学组成,同时排除相近但不正确的目标,例如锂离子电池或非 PDOL 凝胶电解质。因此,该任务需要对正反条件进行判断,而不仅仅是与主题的语义相似性。

这些示例共同涵盖了实际科研工作中遇到的大部分检索行为:直接指定的检索、基于研究问题的探索性推荐、受元数据限制的论文查找,以及细粒度的假阳性排除。因此,PaSaMaster-Bench 既评估了文献发现的真实感,也评估了其组合难度,要求系统理解用户的意图,在领域内进行垂直搜索,并验证每篇候选论文是否真正满足预期要求。

参考文献

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org