跳到正文
原文
Microsoft Research 博客(RSS)· Nicolo Fusi, Jonathan M. Carlson·· 2 小时前精选AI 评分61

Microsoft Research 发布 AI 生物研究系统 Quine,并开放 Quine Fellows 项目申请

Introducing Quine: An AI research system designed for the complexity of biology

AI 导读

Microsoft Research 推出 Quine,一个包含生物学世界模型和交互式 harness 的 AI 研究系统,可跨基因组、蛋白质、化学、细胞状态和生物成像等模态联合学习并推理干预后果。

推荐理由

原文给出 PDAC 化合物筛选一个周末完成并经湿实验验证的结果,读者可据此评估 AI 驱动生物发现的实际路径。

正文 · AI 翻译
Diagram of Project Quine’s closed-loop approach to biological research. A scientist asks questions that are passed to Quine for in silico computation. Quine combines a world model of biology, spanning genomics, proteins, chemistry, cell state, and bioimaging, with a harness for orchestration and reasoning, supported by knowledge and tools. Quine generates proposals that are tested through real-world wet-lab experiments. Experimental measurements return to the scientist and inform the next question, creating an iterative loop between computational modeling and real-world experimentation.

概览

  • Quine(在新标签页中打开) 是一项研究计划,旨在构建生物学多模态世界模型,以及一个连接模型、科学工具、文献和研究者的交互式框架。 
  • 我们与哈佛大学和麻省理工学院布罗德研究所的研究人员合作,利用该系统优先筛选出预计能驱动治疗性肿瘤状态转变的化合物,并在多项湿实验检测中验证了若干排名靠前的候选化合物。 
  • Quine Fellows 计划(在新标签页中打开) 将让一批科学家获得该系统的使用权限,并有机会加速他们自己的研究并提供科学反馈。  
  • Quine 是实验性研究技术,仅供研究使用,不用于临床或医疗用途,其输出可能不完整或不准确,需要由合格的研究人员审查并进行适当的科学和实验验证。随着技术成熟,我们预计将通过 Microsoft Discovery(在新标签页中打开) 等产品扩大使用范围。

二十多年来,微软研究院一直致力于计算与生物学的交叉领域。我们的研究涵盖免疫学、病毒学、基因组学、生物医学成像、细胞生物学和蛋白质工程。这些工作产生了基础性方法、新科学以及进入临床的技术,从罕见病和传染病诊断到癌症生物标志物检测。

在这些工作中,一个教训日益清晰:生物学并不会按照我们的模型和工具常常划分出的整齐边界来划分自身。基因影响蛋白质;蛋白质在细胞内相互作用;细胞组织成组织;实验不断重塑科学家已知的内容以及他们接下来选择提出的问题。因此,要在最困难的生物学问题上取得进展,需要的不仅仅是对单个数据集或任务越来越强大的模型。它需要能够跨尺度和模态连接知识、对实验和证据进行推理,并参与科学进步所依赖的迭代过程的系统。 

今天,微软研究院推出 Quine(在新标签页中打开),这是一项旨在跨越这些边界的研究计划,体现了我们对一个通过科学使用而不断演进的发现系统的长期愿景。Quine 将生物学世界模型与一个连接科学工具、文献、湿实验室以及使用它们的研究者的框架结合在一起。

实验的局限

尽管实验技术不断改进、湿实验室通量不断提高,生物学仍然从根本上受限于时间和复杂性。自然无法被催促,也无法从第一性原理推导出来。实验缓慢,迭代周期漫长,而许多最重要的问题涉及相互作用、组合设计空间和下游效应,这些仅靠实验探索实在过于庞大。

与此同时,大规模机器学习的进步,尤其是能够迭代解决问题的通用基础模型和推理模型的出现,暗示了一种新的可能性。这些系统开始展现出超越模式识别之外的能力:跨领域整合信息、对抽象概念进行推理,并支持迭代式的问题求解。同样重要的是,许多为人类语言开发的技术已被证明对生物学的诸多方面具有惊人的适应性,使模型能够跨多种数据类型和尺度学习生物系统的表征。

这给我们提出了一个颇具挑衅性的问题:构建一个生物学世界模型需要什么?我们所说的世界模型,是指一个能够表征生物系统状态、预测该状态在干预下将如何演变,并对这些干预在未来多步之后的后果进行推理的系统。这样的系统不会取代实验。相反,它将使我们能够利用计算来探索、提出、排序并优先考虑潜在的前进路径,然后再投入稀缺的实验室资源。我们的北极星是一个科学家、模型和实验在持续加速的循环中运作的未来。  

我们构建了什么

Quine 是我们迈向这一愿景的第一步。它既包含一个生物学世界模型,也包含一个将模型与编排和推理模型、科学工具、文献以及使用它们的科学家团队连接起来的框架。  

图 1:Quine 的两个前沿组件——一个生物学世界模型和一个交互式框架——位于一个以科学家为起点和终点的循环之中。一个问题变成一组提案,提案变成值得测试的设计,而实验返回的测量结果既磨砺了科学家的下一个问题,也磨砺了模型本身。 

这项工作的核心是世界模型,它学习跨生物模态和尺度的共享表征,包括序列、结构、功能、细胞状态和成像数据。通过跨这些模态联合训练,Quine 可以利用来自一种模态的证据来为另一种模态的预测提供信息,捕捉那些在由系统编排的独立单领域专家模型下否则会保持孤立或丢失的关系。这种多模态设计反映了生物学的现实:理解任何一个层面都需要来自其他层面的背景。我们发现,跨这些相互关联的表征进行学习非但没有稀释性能,反而增强了性能,使模型能够更有效地泛化,并支持更广泛的生物学推理任务。

 图 2:生物学是多尺度、多模态的。(A) 生物学证据从分子堆叠到细胞、组织、患者,而科学语言贯穿其下。(B) Project Quine 训练所依据的模态——基因组学、蛋白质、化学、RNA 与细胞状态、生物成像——各自观察该范围的不同跨度,且它们相互重叠。向下阅读是从基因型到表型的因果路径;横向阅读是物理尺度。由于模型是联合学习这些表征,而非编排独立的专家模型,因此一个层面的证据可以为另一个层面的预测提供信息。 

通过将该模型整合到一个统一的系统中,促进计算实验并从迭代中学习,研究人员可以跨模态生成预测,并在实验室测试之前对生物干预的后果进行推理。关键在于,世界模型不需要完美——事实上,它永远不会完美地模拟生物学——它只需要能够有效地指导实验设计。 

这在癌症生物学中意味着什么

一个具体的例子来自我们在胰腺导管腺癌(PDAC)方面的工作,这是胰腺癌最常见的形式,也是最难治疗的癌症之一。在与麻省理工学院和哈佛大学布罗德研究所研究人员的合作中,我们花费数年时间开发和应用患者来源的离体模型,以研究一个长期存在的假设:肿瘤行为和药物反应不仅取决于遗传学,还取决于转录细胞状态。在PDAC中,肿瘤细胞可以处于不同的细胞状态,这些状态与它们对治疗的反应方式相关。 

借助Quine,我们现在已将这一假设付诸实践,探索癌症的非遗传特征——特别是细胞状态——是否可以作为可操作的治疗靶点。我们使用Quine根据数千种化合物将肿瘤细胞在治疗相关状态之间转换的潜力对其进行预测和优先级排序。在聚焦于从经典型向基底型细胞状态转变的湿实验室研究中,Quine排名最高的化合物在各项实验检测中产生了最大的预期转变。整个过程——从快速缩小化合物搜索空间到优先选出少数有前景的候选化合物以供实验室验证——仅用了一个周末,可能节省了数月的实验工作和大量研究成本。值得注意的是,一些最强的效果来自具有意外作用机制的化合物,这提供了早期证据,表明AI可以发现药物重定位和发现的新机会。 

虽然反向状态转变被证明更为困难(从基底型到经典型细胞状态),但Quine预测现有化合物会产生这种较弱的效果。更值得注意的是,实验揭示了某些我们并未完全预料到的现象:Quine预测几种化合物会持续将细胞推向一种独特的第三种表型——这一观察在实验室中得到了证实——表明胰腺癌细胞状态图谱比简单的经典型-基底型轴更为丰富。这些实验不仅检验了模型的假设,还产生了新的假设。 

图3:Quine引导的胰腺癌细胞状态探索。在胰腺导管腺癌(PDAC)细胞系中,排名最高的化合物产生了最大的经典型向基底型转录转变,并经湿实验室实验验证。较弱的反向转变以及向额外表型的意外移动也与Quine的预测一致。

我们在此处的持续工作将使用新整合的RNA数据集和任务来表征这一更丰富的图谱,增强状态转变预测,并提供校准的置信度估计,帮助科学家优先选择最有前景的假设进行湿实验室测试。而这正是Quine被构建来支持的反馈循环。每一轮实验都增进我们对生物学的理解,每一个新见解都可以成为下一代系统的训练信号。  

在探索中学习——一份邀请

我们创建 Quine 是为了改进我们自己从事科学研究的方式。随着系统不断演进,我们将其嵌入到正在进行的科研项目中。每一个研究问题、实验结果和意外发现,都成为完善模型、改进工作流程、更好地理解 AI 能在何处切实加速我们研究的机会。随着时间推移,该系统成为我们在多个领域开展发现工作的核心,包括癌症生物学、蛋白质工程、基因组学和生物成像。

我们希望在这一基础上继续前行,因此在早期阶段就介绍 Quine。Quine 源于我们自己的研究,但我们不希望它的持续发展孤立进行。许多将决定其下一步走向的问题,并非我们独自能够回答;它们需要更广泛科学界的专业知识、创造力和视角。因此,我们开放了 Quine Fellows 项目,将系统直接交到工作在生物学和医学前沿的科学家手中。

首批 Quine Fellows cohort 申请现已开放

负责任地建设始终是第一位的。我们相信,AI 和生物学的进步必须与安全、安保和负责任的管理齐头并进。我们对 Quine 的开发和访问采取审慎、分阶段的方式,初期仅限 Quine Fellows 项目和选定的研究合作。持续的内部审查和内置保障措施将帮助我们在系统演进过程中保持适当的监督。随着技术成熟,我们预计将通过 Microsoft Discovery(在新标签页中打开) 等产品扩大访问范围。

人们很容易用基准测试和排行榜来框定 AI 在生物学领域的进展。这些固然重要,但对 Quine 的真正考验,是当它遇到实际进行的科学时会怎样。当证据不完整时,它能有帮助吗?面对从未被真正提出过的问题时呢?它能帮助缩短从问题到发现的路径吗?

归根结底,这才是我们在意的标准。我们的愿景是让 Quine 退隐到科学实践的背景之中,而科学在前台更快地前进。主角不是模型或平台,而是科学家、实验以及随之而来的发现。 

在新标签页中打开

文章 Introducing Quine: An AI research system designed for the complexity of biology 首次发表于 Microsoft Research。

来源:Microsoft Research 博客(RSS) · microsoft.com