跳到正文
Ai2 / Allen Institute for AI·· 9 小时前精选AI 评分62

Ai2 开源 8B 科学报告生成模型 AstaBrief

Open-sourcing AstaBrief, the fast report-generation model in Asta

AI 导读

Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。

推荐理由

原文给出训练数据构成、过滤方法与速度成本对比,读者可据此判断开源科学报告模型的具体做法是否可迁移。

正文 · AI 翻译

2026年10月2日

Ai2


模型数据

语言模型已经可以帮助研究人员检索文献、综合证据并处理复杂问题。但科研工作对这些模型有着特殊的要求——答案必须始终以证据为依据,模型需要保留证据实际支持的内容,而不是悄悄扩大研究结论的范围,研究人员还需要能够验证最终输出。

我们从科学家使用 Asta 的方式中看到了这一点,Asta 是我们用于科研工作的智能体平台。用户往往不是进行简单的关键词搜索,而是带来大量上下文和诸多约束——例如,要求 Asta 在考虑特定方法、人群或背景的情况下,比较一批文献中的各种方法。许多用户还会在之后重新查看生成的报告,把它们当作可用的研究资料,而非一次性的答案。

我们希望帮助科学家更快地生成带引用的报告,并且使用一个他们可以自行下载和运行的模型。为此,我们测试了一个专门为科学报告生成而训练的小型开放模型,能否在报告质量上媲美我们当时使用的专有模型,同时减少生成时间和服务成本。 

我们构建了 AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转化为带引用报告的模型。AstaBrief 现已在 Asta 的“生成报告”功能中作为 Fast mode 提供,与由 Claude 驱动的 Thinking mode 并列,同时我们也将它和训练数据开源,以便他人研究、复现并在我们的方法基础上继续构建。

开发 AstaBrief 需要数万条真实研究查询、以引用为中心的过滤、偏好数据,以及一个重新设计的报告生成流程——它一次性写出完整报告,而不是逐节生成。其结果是,与我们跟踪的专有模型相比,报告生成时间减少了近一个数量级——在整个 Asta 流程中,Fast mode 平均每份报告耗时 51.1 秒,而 Thinking mode 为 178.5 秒,约快 3.5 倍。 

这些效率提升共同使 AstaBrief 成为一个有用测试案例,服务于一个更宏大的目标:构建能够适应科研工作特定需求的开放语言模型。 

开放权重还将使机构能够在自己的基础设施上运行 AstaBrief,当研究问题涉及敏感或未发表的工作时,这是必要的。除了模型权重,我们还发布了一个示例工作流,研究人员可以对其进行调整,以从自己的 PDF 生成报告,为本地报告生成提供了一个起点

本文介绍了我们如何训练 AstaBrief、我们在将其扎根于科学证据方面学到了什么,以及我们认为我们的方法中哪些部分可以延续到未来的科学模型。所描述的大部分训练和评估工作已于 2025 年完成,因此用于生成训练数据和作为对比点的专有模型反映的是当时的前沿水平。我们尚未针对当今的前沿模型重新运行完整评估;以下结果最好被理解为关于我们所测试的特定训练和系统设计选择的证据。

训练模型

我们在 AstaBrief 上的目标是构建一个开放权重模型,使其具备长篇科学综合所需的最重要特质:答案质量、相关性、结构和引用依据。我们从 Qwen3-8B 出发,将大部分精力集中在后训练数据、评估以及围绕报告生成的配套框架上。

让通用模型适应科学工作——以及从零开始训练新的科学模型——是我们在 Ai2 广泛探索的方向。通过 NSF OMAI——一项由 Ai2 牵头、旨在为科学发现构建完全开放的 AI 基础设施和模型的美国国家计划——我们的研究人员正直接与科学界合作,了解他们对未来开放模型的需求,以及当今通用模型的不足之处。这包括研究不同科学领域和工作流程中的需求差异,未来我们将分享更多来自该研究的发现。

近期的工作,包括我们的 DR Tulu,已经表明基于强化学习(RL)的方法可以提升开放权重模型的长篇报告生成能力,尤其是在训练循环中引入评判模型时。我们曾考虑为 AstaBrief 采用这条路线,但最终聚焦于一个更简单的方案,围绕监督微调(SFT)和直接偏好优化(DPO)构建。

基于 RL 的训练可能不稳定且成本高昂。我们想看看,用一套更便宜、更易于操作管理——同时也更易于调试和迭代——的方案,能把报告生成质量推进到多远。

这使得训练数据的质量尤为重要。我们没有依赖更复杂的优化方法来弥补噪声样本,而是将项目的大部分时间用于弄清楚如何生成、筛选和过滤那些真正体现了我们想要的报告撰写行为的样本。 

我们还希望 AstaBrief 更快,以便用户能快速获得初步报告,然后在后续轮次中迭代完善。为了提升速度,我们决定训练 AstaBrief 在给定用户查询和相关检索片段的情况下,直接一次性生成最终报告,绕过我们基于 Claude 的 Thinking 模式所使用的昂贵的片段摘要和聚类阶段,也不再逐节撰写答案。有趣的是,我们发现这样做可以在不牺牲性能的情况下实现。 

收集 SFT 训练数据

训练流程始于通过我们论文“Synthesizing scientific literature with retrieval-augmented LMs”中描述的系统以及 ScholarQA(如今支撑 Asta“生成报告”功能的框架)提交的真实用户查询。我们不想仅用合成提示或基准式任务来训练,而是希望 AstaBrief 能从真实科学家的真实查询中学习。

我们的研究表明,科学家对语言模型的提问往往与用户对通用聊天机器人或传统搜索工具的提问不同。在我们对 数十万条 Asta 查询的分析中,专家研究人员经常提供大量背景信息、多重约束以及概念之间的关系,而不是依赖简短的关键词式提示。

较新的 Asta 用户研究还揭示了研究人员希望 AI 以何种方式参与其工作的差异——有些人乐于使用模型进行构思或实验,而另一些人则更倾向于让模型在综合、文献监测或模式发现中扮演更有限的角色。在这些差异之中,参与者都希望有更清晰的来源可追溯性、对模型正在做什么有更高的可见性,以及对其所使用的上下文有更大的控制权。

我们对收集到的用户日志进行了质量、相关性和隐私方面的过滤,剔除了 beta 测试者和机器人流量,丢弃了过短而无意义的查询,并使用基于 LLM 的过滤流程来捕捉非英语查询、非科学请求以及包含个人信息的提示。最终留下了一个包含 9 万条以研究为重点的查询池。

对于 SFT,我们使用 Asta 报告生成背后的多步骤 ScholarQA 流水线,从过滤后的查询中生成完整报告作为目标输出。该流水线检索相关文献,将材料组织成章节,并使用一个后台报告生成模型将证据综合为带引用的报告。我们混合使用了多种专有系统:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。经过质量过滤后,这产生了 4.7 万个可用的训练示例。

创建 DPO 对

DPO 需要一种不同类型的训练数据。不是每个查询对应一个目标报告,而是需要成对的报告,其中一个优于另一个。

我们从 SFT 数据生成期间未使用的一个独立查询子集中构建了这些配对。每个查询的一份报告来自现有的 ScholarQA 流水线,通常由 Claude 3.5 Sonnet 或 3.7 Sonnet 支持。竞争报告则是将 ScholarQA 检索到的文献摘录输入到另一个模型生成的:根据示例不同,使用 o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1。

两个评判模型——GPT-4.1 和 DeepSeek-R1——比较每一对并选出胜者。我们确保 LLM 评判者与人类偏好一致(95% 一致率),并且只保留两个评判者都同意的配对,这为我们提供了更干净的偏好集,并消除了大规模生成偏好数据中通常出现的大量噪声。

经过质量过滤后,最终的 DPO 数据集约为 6 千个示例。 

使用多个生成器并要求两个评判者达成一致,为我们提供了一种相对简单的方法来构建偏好数据,而无需将任何单一模型的输出或判断视为绝对真理。

过滤数据以实现更好的归因

我们的主要评估目标是 SQABench-CS2,这是一组由 200 个用户编写的计算机科学研究问题。在 AstaBrief 的开发过程中,我们跟踪了四项指标:

  • 评分标准得分,衡量报告覆盖了多少必要内容。
  • 答案精确度,衡量每个段落是否与问题相关。
  • 引用精确度,衡量每条引用是否支持其所附带的论断。 
  • 引用召回率,衡量报告中的论断是否完全由所提供的引用支持。

对于我们的最终模型,我们还进行了二次评估:DeepScholarBench,这是一个包含 63 个查询的基准测试,用于长篇幅研究综合,基于近期 ArXiv 论文构建;以及两项针对 Claude 驱动流程生成报告的独立成对评估——一项是在 SQABench-CS2 上由 LLM 评判的比较,另一项是小规模人类研究。 

一份报告可能听起来既精炼又完整,却偏离了问题,或者把引用附在那些底层证据并不支持的论断上。对于科学综合,我们需要分别衡量这些行为。但引用支持只是科学忠实性的一部分——模型可以引用正确的研究,却仍然做出比该研究本身所能支持的更强的论断。这可能以微妙的方式发生,例如,把关于某个特定样本的发现变成关于整个总体的泛化论断,把用过去时报告的结果变成听起来更具普遍真实性的现在时陈述,或者把描述性发现变成对临床医生、政策制定者或研究人员应该做什么的建议。

这类泛化对于科学报告生成尤其重要,因为每一步都可能扩大证据的表观范围,而不引入明显错误的陈述。因此,一个带引用的句子可能在技术上与其来源相关,却仍然夸大了研究人员实际确立的内容。我们的开发指标主要关注相关性、覆盖范围和引用依据;对科学报告撰写者更丰富的评估还应测试他们是否保留了来源中论断的范围和强度。

我们最初的 SFT 运行改善了整体内容质量,但在答案精确性和引用质量上仍落后于我们由 Claude 驱动的报告生成流程。换句话说,模型更擅长写报告了,但它仍没有像我们在科学综合中所需的那样始终以证据为依据。

这促使我们在数据质量上投入更多时间。我们测试了四种基于统计的过滤器,以识别较弱的合成训练样本:

  • 输出与输入 token 比率。 比率非常高的答案往往噪声很大,因为它们从过少的证据中生成了大量文本。
  • 引用相关性。对于训练集中的每份合成报告,我们对其引用论文的检索相关性分数取平均值。平均值低表明该报告过于依赖排名较低的证据。
  • 引用密度。 我们测量了至少有一个引用的陈述所占比例。低密度报告往往有大段无支持的文本。
  • 引用多样性:我们测量了在 Claude 驱动的报告检索流程返回的论文集合中,答案所引用论文的占比。分数低表明报告过度依赖少数几篇论文。

最大的收益来自过滤掉引用密度低的合成报告;更激进的过滤、过滤器组合以及学习率扫描并未带来有意义的增益。

这是该项目最明确的教训之一:更精细的过滤未必更好。一个相对简单的信号——合成报告是否一致地引用了其主张——比我们尝试过的几种更复杂的组合更有用。换句话说,科学专业化并不一定意味着在预训练中加入更多科学文本;后训练数据的构成和质量,以及它是否展现出诸如接地和归因等行为,能够实质性地改变最终模型的表现。

对基于事实、有用输出的关注,也与我们在 Asta 用户调研中听到的反馈一致。参与者指出,生成更多文本未必更有帮助;他们想要的是简洁的综述,以及足够的来源可追溯性,以便审查和验证结果,而无需费力浏览不必要的输出。

一旦我们有了更强的 SFT 检查点,就在其基础上运行了 DPO 训练。这一阶段进一步提升了性能,使 AstaBrief 在报告生成方面接近 Asta 中由 Claude 驱动的报告流水线和 DR Tulu 的水平。

验证该方法

由于该模型旨在作为我们代理式 Asta 报告生成框架的一部分(不一定是独立模型),我们的主要问题是 AstaBrief 能否在保留我们所关心的报告质量的同时,实现大幅更快、更便宜的报告生成流水线。换句话说,我们不仅是在问该模型能否在单个基准上匹敌更强的专有模型;我们想知道,用一个简单得多的系统,我们能保留多少这样的质量。

在我们开发期间使用的评估中,AstaBrief 在答案和引用质量的几项指标上与 Claude 驱动的流水线和 DR Tulu 不相上下。下图展示了 LLM 评判的比较——在一项独立的 14 题人类研究中,三位科学研究人员各自贡献了 4-5 个问题,并对三个系统的报告在总体偏好、完整性、相关性、组织性和引用准确性方面进行了排名(允许并列)。在总体偏好上,DR-Tulu 胜出,但三位研究人员中有两位在引用准确性指标上更偏好 AstaBrief 而非其他系统,这证明了我们的 SFT 数据质量过滤器的效用。

这些数字最好被解读为对我们开发时工程方法的验证,而不是关于这个特定基础模型相对于当今前沿模型所处位置的声明。模型生态系统发展迅速——数据构建、归因过滤和部署经验是我们预期能够推广的部分。

验证 AstaBrief 在 Asta 中的实用性,Fast 模式已显示出令人鼓舞的早期使用情况。在尝试过它的 374 名 Asta 用户中,29.1% 已使用它两天或以上,用户平均用它生成 3.67 个报告线程。尝试过 Fast 模式的用户中,有 23% 继续使用它,并且在未来的线程中从未切换回 Thinking 模式。另有 18% 根据目标在 Fast 和 Thinking 模式之间切换,约 40% 的线程使用 Fast 模式。 

虽然反馈总体上过于稀疏,无法得出强有力的结论,但我们看到 Fast 模式获得正面反馈的比例与 Thinking 模式相似(84.2% 对 85.2%)。

下一步走向

Asta 的报告生成是 AstaBrief 的首次生产使用,为研究人员提供了开放权重的 Fast 模式,与现有的 Thinking 模式并存。由于该模型是开放权重的,机构可以将其部署在自己的硬件上,包括在自己的防火墙之后,而无需依赖专有模型 API 来生成报告。 

在 Asta 中,这也意味着我们可以直接研究和改进报告生成流程的这一部分,同时保留 Thinking 模式作为计算密集型任务的选项。

还有更多工作要做。我们正在探索更细粒度的偏好学习、更强的 RAG 加 RL 方法、多轮和多工具能力、更多的科学数据源以及查询分解。我们还对超越断言是否有支持性引用的评估感兴趣,以询问模型是否保留了证据——这既能更好地捕捉报告作为研究产物的质量,也能询问模型是否保留了其来源的证据范围。这包括简洁性和组织性等品质,以及模型是否将样本特定的发现转化为广泛的概括,或将描述性结果转化为建议。

AstaBrief 是语言模型用于科学研究的长期工作中的一项实验,从 ScholarQA 和 DR Tulu 到如今开始成形的未来版本 Olmo。这里的经验——尤其是在训练数据、过滤和评估方面——可以帮助指导我们下一步构建什么。

立即在 Asta 中试用 Fast 模型

, 或

从 Hugging Face 下载 AstaBrief

. 

加入我们

在 Ai2,我们正在构建透明、开源 AI 的未来——以开放的方式构建,以赋能科学进步和对这项改变世界的技术的基本理解。我们不是为了盈利,而是为了确保 AI 的好处被广泛分享并造福人类。如果这吸引你,请看看我们的开放职位。

开放职位

订阅以接收有关最新 Ai2 新闻的每月更新。

来源:Ai2 / Allen Institute for AI · allenai.org