Ai2 开源科学报告生成模型 AstaBrief 8B 及其训练数据
Open-sourcing AstaBrief, the fast report-generation model in Asta
Ai2 开源基于 Qwen3-8B 的科学报告生成模型 AstaBrief 8B 及训练数据,该模型将研究问题和检索到的文献片段一次性生成带引用的报告,已作为 Fast 模式上线 Asta 的报告生成功能。
同一新闻,精选展示《Ai2 开源 8B 科学报告生成模型 AstaBrief》
语言模型已经可以帮助研究人员检索文献、综合证据并处理复杂问题。但科学工作对这类模型有着特殊的要求——答案必须始终以证据为依据,模型需要保留证据实际支持的内容,而不是悄悄扩大研究结论的范围,研究人员还需要能够验证最终输出。
我们从科学家使用 Asta(我们用于科学工作的智能体平台)的方式中看到了这一点。用户往往不是进行简单的关键词搜索,而是带来大量上下文和诸多约束——例如,要求 Asta 在考虑特定方法、人群或背景的情况下,比较一批文献中的各种方法。许多用户还会在之后重新查看生成的报告,把它们当作可继续使用的研究成果,而非一次性的答案。
我们希望帮助科学家更快地生成带引用的报告,并且使用一个他们可以自行下载和运行的模型。为此,我们测试了一个专门为科学报告生成而训练的小型开放模型,能否在报告质量上匹配我们当时使用的专有模型,同时减少生成时间和服务成本。
我们构建了 AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转化为带引用报告的模型。AstaBrief 现已在 Asta 的“生成报告”功能中作为 Fast 模式提供,与由 Claude 驱动的 Thinking 模式并列。我们还将其开源,并公开训练数据,以便他人研究、复现并基于我们的方法继续构建。
开发 AstaBrief 需要数万条真实研究查询、以引用为重点的过滤、偏好数据,以及重新设计的报告生成流程——该流程一次性写出完整报告,而不是逐节生成。其结果是,与我们跟踪的专有模型相比,报告生成时间减少了近一个数量级——在整个 Asta 流程中,Fast 模式平均每份报告耗时 51.1 秒,而 Thinking 模式为 178.5 秒,约快 3.5 倍。
这些效率提升共同使 AstaBrief 成为一个有用的测试案例,服务于一个更宏大的目标:构建能够适应科学工作特定需求的开放语言模型。
开放权重还将使机构能够在自己的基础设施上运行 AstaBrief,当研究问题涉及敏感或未发表的工作时,这一点是必要的。除了模型权重,我们还发布了一个示例工作流,研究人员可以对其进行调整,以根据自己的 PDF 生成报告,为本地报告生成提供了一个起点
本文将介绍我们如何训练 AstaBrief、我们在使其以科学证据为依据方面学到了什么,以及我们认为我们的方法中哪些部分可以延续到未来的科学模型。所描述的大部分训练和评估工作已于 2025 年完成,因此用于生成训练数据和作为对比基准的专有模型反映的是当时的前沿水平。我们尚未针对当今的前沿模型重新运行完整评估;以下结果最好被理解为关于我们所测试的特定训练和系统设计选择的证据。
训练模型
我们打造 AstaBrief 的目标是构建一个开放权重的模型,具备对长篇科学综合而言最重要的所有品质:答案质量、相关性、结构和引用依据。我们从 Qwen3-8B 出发,将大部分精力集中在后训练数据、评估以及围绕报告生成的脚手架上。
让通用模型适应科学工作——以及从零开始训练新的科学模型——是我们在 Ai2 广泛探索的方向。通过 NSF OMAI——一项由 Ai2 牵头、旨在为科学发现构建完全开放的人工智能基础设施和模型的美国国家计划——我们的研究人员正直接与科学界合作,了解他们对未来开放模型的需求,以及当今通用模型的不足之处。这包括研究不同科学领域和工作流程中的需求差异,未来我们将分享更多来自该研究的发现。
近期的工作,包括我们的 DR Tulu,已经表明基于强化学习(RL)的方法可以提升开放权重模型的长篇报告生成能力,尤其是在训练循环中引入评判模型时。我们曾考虑将这条路径用于 AstaBrief,但最终聚焦于一个更简单的方案,围绕监督微调(SFT)和直接偏好优化(DPO)构建。
基于 RL 的训练可能不稳定且成本高昂。我们想看看,用一套更便宜、更易于运营管理——同时也更易于调试和迭代——的设置,能把报告生成质量推进到何种程度。
这使得训练数据的质量尤为重要。我们没有依赖更复杂的优化方法来弥补噪声样本,而是将项目的大部分时间用于弄清楚如何生成、选择和过滤那些真正展示了我们想要的报告撰写行为的样本。
我们还希望 AstaBrief 更快,以便用户能快速获得初步报告,然后在后续轮次中对其进行迭代。为了提升速度,我们决定训练 AstaBrief 在给定用户查询和相关检索片段的情况下,直接一次性生成最终报告,绕过我们基于 Claude 的 Thinking 模式所使用的昂贵的片段摘要和聚类阶段,也不再逐节写出答案。有趣的是,我们发现可以在不牺牲性能的情况下做到这一点。
收集 SFT 训练数据
训练流程始于通过我们论文“Synthesizing scientific literature with retrieval-augmented LMs”中描述的系统以及 ScholarQA(如今支撑 Asta“生成报告”功能的框架)提交的真实用户查询。我们不想仅用合成提示或基准式任务来训练,而是希望 AstaBrief 能从真实科学家的真实查询中学习。
我们的研究表明,科学家对语言模型的提问往往与用户对通用聊天机器人或传统搜索工具的提问不同。在我们对 数十万条 Asta 查询的分析中,专家研究人员经常提供大量上下文、多重约束以及概念之间的关系,而不是依赖简短的关键词式提示。
较新的 Asta 用户研究还揭示了研究人员希望 AI 以何种方式参与其工作的差异——有些人乐于使用模型进行构思或实验,而另一些人则更倾向于让模型在综合、文献监测或模式发现中扮演更有限的角色。在这些差异之中,参与者都希望有更清晰的来源可追溯性、对模型正在做什么有更高的可见性,以及对其所使用的上下文有更强的控制力。
我们对收集到的用户日志进行了质量、相关性和隐私方面的过滤,剔除了 beta 测试者和机器人流量,丢弃了过短而无意义的查询,并使用基于 LLM 的过滤流程来捕捉非英语查询、非科学请求以及包含个人信息的提示。最终留下了一个包含 9 万条以研究为重点的查询池。
对于 SFT,我们使用 Asta 报告生成背后的多步骤 ScholarQA 流水线,从过滤后的查询中生成完整报告作为目标输出。该流水线检索相关文献,将材料组织成章节,并使用一个后台报告生成模型将证据综合为带引用的报告。我们混合使用了多种专有系统:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。经过质量过滤后,这产生了 4.7 万个可用的训练样本。
创建 DPO 配对
DPO 需要一种不同类型的训练数据。不是每个查询对应一个目标报告,而是需要成对的报告,其中一个优于另一个。
我们从 SFT 数据生成期间未使用的一个独立查询子集中构建了这些配对。每个查询的一份报告来自现有的 ScholarQA 流水线,通常由 Claude 3.5 Sonnet 或 3.7 Sonnet 支持。与之竞争的报告则是将 ScholarQA 检索到的文献摘录输入到另一个模型生成的:根据样本不同,使用 o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1。
两个评判模型——GPT-4.1 和 DeepSeek-R1——对每一对进行比较并选出胜者。我们确保 LLM 评判与人类偏好一致(95% 一致率),并且只保留两个评判都同意的配对,这为我们提供了更干净的偏好集,并消除了大规模生成偏好数据中通常出现的大部分噪声。
经过质量过滤后,最终的 DPO 数据集约为 6 千个样本。
使用多个生成器并要求两个评判之间达成一致,为我们提供了一种相对简单的方法来构建偏好数据,而无需将任何单一模型的输出或判断视为绝对真理。
过滤数据以实现更好的归因
我们的主要评估目标是 SQABench-CS2,这是一组 200 个由用户编写的计算机科学研究问题。在 AstaBrief 的开发过程中,我们跟踪了四项指标:
- 评分标准得分,衡量报告覆盖了多少必要内容。
- 答案精确度,衡量每个段落是否与问题相关。
- 引用精确度,衡量每条引用是否支持其所附带的论断。
- 引用召回率,衡量报告中的论断是否完全由所提供的引用支持。
对于我们的最终模型,我们还进行了次级评估:DeepScholarBench,一个基于近期 ArXiv 论文构建的、包含 63 个查询的长篇研究综述基准,以及两项分别针对 Claude 驱动流程生成报告的成对评估——一项是在 SQABench-CS2 上由 LLM 评判的比较,另一项是小规模的人类研究。
一份报告可以听起来既精炼又完整,却偏离了问题本身,或者把引用附加到那些底层证据并不支持的论断上。对于科学综述而言,我们需要分别衡量这些行为。但引用支持只是科学忠实性的一部分——模型可以引用正确的研究,却仍然做出比该研究本身所能支持的更强的论断。这可能以微妙的方式发生,例如,把关于某个特定样本的发现变成关于整个总体的泛化论断,把以过去时报告的结果变成听起来更具普遍真实性的现在时陈述,或者把描述性发现变成对临床医生、政策制定者或研究人员应该怎么做的建议。
这类泛化对科学报告生成尤为重要,因为每一步都可能在不引入明显虚假陈述的情况下扩大证据的表观范围。因此,一个带引用的句子可能在技术上与其来源相关,却仍然夸大了研究人员实际确立的内容。我们的开发指标主要关注相关性、覆盖率和引用依据;对科学报告撰写者更丰富的评估还应测试他们是否保留了来源中论断的范围和强度。
我们最初的 SFT 运行提升了整体内容质量,但在答案精确性和引用质量上仍落后于我们由 Claude 驱动的报告生成流程。换句话说,模型在撰写报告方面变得更好了,但它在证据依据方面仍没有达到科学综述所需的稳定程度。
这促使我们在数据质量上投入更多时间。我们测试了四种基于统计的过滤器,以识别较弱的合成训练样本:
- 输出与输入 token 比。比值非常高的答案往往噪声较大,因为它们从过少的证据中生成了大量文本。
- 引用相关性。对于训练集中的每份合成报告,我们对其引用论文的检索相关性得分取平均。平均值低表明该报告过于依赖排名较低的证据。
- 引用密度。我们衡量了至少有一条引用的陈述所占比例。低密度报告往往包含大段无支持文本。
- 引用多样性:在 Claude 驱动的报告检索流程返回的论文集合中,我们衡量了答案所引用论文所占的比例。得分低表明报告过度依赖少数几篇论文。
最大的收益来自过滤掉引用密度低的合成报告;更激进的过滤、过滤器组合以及学习率扫描都没有带来有意义的增益。
这是该项目最明确的教训之一:更精细的过滤未必更好。一个相对简单的信号——合成报告是否始终为其论断提供引用——比我们尝试过的几种更复杂的组合更有用。换句话说,科学专业化并不一定意味着在预训练中加入更多科学文本;后训练数据的构成和质量,以及它是否展现出诸如接地和归因之类的行为,能够实质性改变最终模型的表现。
对扎实、有用输出的这种关注,也与我们在 Asta 用户调研中听到的反馈一致。参与者指出,生成更多文本未必更有帮助;他们想要的是简洁的综合,以及足够的来源可追溯性,以便审查和验证结果,而不必在多余的输出中艰难跋涉。
在获得更强的 SFT 检查点后,我们在其之上进行了 DPO 训练。这一阶段进一步提升了性能,使 AstaBrief 在报告生成方面接近 Asta 中由 Claude 驱动的报告流水线以及 DR Tulu 的水平。
验证该方法
由于该模型旨在作为我们智能体式 Asta 报告生成框架的一部分来工作(不一定作为独立模型),我们的主要问题是 AstaBrief 能否在保持我们所关注的报告质量的同时,实现一个大幅更快、更便宜的报告生成流水线。换句话说,我们不仅是在问该模型能否在单项基准上匹敌更强的专有模型;我们想知道,用一个简单得多的系统,我们能保留多少这样的质量。
每一行均按最优在前排序;在所有指标上均为越高越好。Qwen3-8B 仅在 SQABench-CS2 测试上进行了评估。SQABench-CS2 是一组用户编写的计算机科学研究问题;DeepScholarBench 使用其自有指标对长篇研究综合进行评分,这些指标与 SQABench-CS2 的指标不可比。
在我们开发期间使用的评估中,AstaBrief 在答案和引用质量的若干衡量指标上与 Claude 驱动的流水线和 DR Tulu 不相上下。下图展示了 LLM 评判的比较——在一项单独的 14 问题人类研究中,三位科研人员各自贡献了 4-5 个问题,并对三个系统的报告在总体偏好、完整性、相关性、组织结构和引用准确性方面进行排名(允许并列)。在总体偏好上,DR-Tulu 胜出,但三位研究人员中有两位在引用准确性指标上更偏好 AstaBrief 而非其他系统,这证明了我们 SFT 数据质量过滤器的效用。
柱状图显示每个系统在相同问题上相对于 Thinking 模式所赢得的 LLM 评判报告比较的份额。人类评判单独评估,未包含在内。Thinking 模式是比较基准,因此没有柱状图。与 DR-Tulu 不同,Asta Brief 在 DPO 阶段针对这种成对报告排名进行了优化。
这些数字最好被理解为对我们开发时所采用的工程方法的验证,而不是关于这个特定基础模型相对于当今前沿模型所处位置的断言。模型生态变化迅速——数据构建、归因过滤和部署方面的经验才是我们预期能够推广的部分。
在 Asta 中验证 AstaBrief 实用性的过程中,Fast 模式已显示出令人鼓舞的早期使用情况。在 374 名尝试过它的 Asta 用户中,29.1% 已使用它两天或更久,用户平均用它生成 3.67 个报告线程。尝试过 Fast 模式的用户中,有 23% 继续使用它,并且在后续线程中从未切回 Thinking 模式。另有 18% 会根据目标在 Fast 和 Thinking 模式之间切换,约 40% 的线程使用 Fast 模式。
虽然反馈总体上过于稀疏,难以得出强有力的结论,但我们看到 Fast 模式获得正面反馈的比例与 Thinking 模式相近(84.2% 对 85.2%)。
下一步走向
Asta 的报告生成是 AstaBrief 的首次生产使用,为研究人员在现有的 Thinking 模式之外提供了一种开放权重的 Fast 模式。由于该模型是开放权重,机构可以将其部署在自己的硬件上,包括部署在自己的防火墙之后,而无需依赖专有模型 API 来生成报告。
在 Asta 中,这也意味着我们可以直接研究和改进报告生成流程的这一部分,同时保留 Thinking 模式作为计算密集型任务的选项。
还有更多工作要做。我们正在探索更细粒度的偏好学习、更强的 RAG-plus-RL 方法、多轮和多工具能力、更多科学数据源以及查询分解。我们还对超越“某个主张是否有支持性引用”的评估感兴趣,转而追问模型是否保留了证据范围——这既是为了更好地捕捉报告作为研究产物的质量,也是为了追问模型是否保留了其来源的证据范围。这包括简洁性和组织性等品质,以及模型是否会将样本特定的发现变成宽泛的概括,或将描述性结果变成建议。
AstaBrief 是面向科学的语言模型这一更长系列工作中的一项实验,从 ScholarQA 和 DR Tulu 到如今开始成形的未来版本 Olmo。这里的经验——尤其是围绕训练数据、过滤和评估——可以帮助指导我们下一步构建什么。
来源:Hugging Face:Blog · huggingface.co



