虚拟细胞+知识图谱:零样本预测未表征药物的单细胞响应,多模态对齐成关键

薛定谔了么
2026-09-07 19:01:26
人工智能
生命科学
技术教程

理解、预测并最终编程细胞对内部信号和外部刺激的响应,是生物学中的最大挑战之一。虚拟细胞(Virtual Cell)作为人工智能与生物学交叉领域的一个新兴前沿,有望解决这一挑战,从而彻底改变生命科学研究范式。


预测细胞对化学(药物)扰动的响应,对于构建虚拟细胞模型至关重要,然而,实验测得的化合物仅覆盖了庞大的化学空间的极小一小部分。现有的虚拟细胞模型通常将药物分子视为孤立的标识符,而未编码其作用机制之间的关联,这导致它们难以泛化到未表征的化合物,这也成为了构建出真正虚拟细胞的一大瓶颈。


2026年8月26日,上海交通大学人工智能学院谢伟迪副教授、张娅教授作为共同通讯作者,在Nature子刊Nature Machine Intelligence上发表了题为:A Knowledge-driven Framework for Predicting Single-cell Responses for Unprofiled Drugs的研究论文。



Image


该研究提出了一种名为MAP(Mechanism-Aware Perturbation Response Predictor,机制感知的扰动响应预测器)的知识驱动框架,通过构建大规模生物医学知识图谱(MAP-KG),首次赋予了虚拟细胞模型在“零样本”(Zero-shot)条件下预测全新、未表征药物扰动响应的能力,为虚拟药物筛选打通了关键的技术闭环。


虚拟细胞发展的瓶颈


单细胞测序和大规模扰动实验的飞速发展,让我们能够能够在细胞层面系统性刻画药物作用引发的转录组水平变化,彻底改变了我们探究药物因果作用的能力,这也为构建“虚拟细胞”(Virtual Cell)提供了关键基础。


所谓“虚拟细胞”,即能够系统性模拟和预测细胞对先前未观察到的扰动和条件下的响应(例如敲除一个基因,或添加一种药物,细胞会产生什么变化)的模型。如果这些模型准确且具有泛化能力,便可实现对大规模化学空间进行可扩展的计算模拟筛选,在实际实验之前优先确定候选治疗药物和给药策略,降低早期药物发现的成本和周期,从而彻底改变传统药物研发流程。


然而,当前的“虚拟细胞”发展存在一个致命瓶颈——巨大的化学空间与有限的实验数据之间存在鸿沟。人类已知的化学分子空间极其庞大(高达1060种),而现有实验手段能够详细记录其细胞效应的,只有寥寥数百种。这意味着,绝大多数化合物的生物学效应,我们几乎一无所知。


传统的人工智能(AI)方法在处理这个问题时遇到了瓶颈——它们通常把药物当作一个“标签”来处理,比如“药物A”“药物B”。如果一个药物没有出现在训练数据中,模型就无法对它做出任何有意义的预测。


该研究开发了一种机制感知的扰动响应预测器(Mechanism-Aware Perturbation Response Predictor,简称为MAP),MAP的突破在于:它不再把药物看作孤立的标签,而是学习药物背后的“语言”——化学结构、蛋白质靶点、作用机制、功能描述……然后将这些多维度的药理学知识整合到细胞响应预测中。


MAP是如何做到的?


MAP框架包含三个核心创新:


第一,构建了最大的药物-基因知识图谱


研究团队整合了14个公开数据库的信息,构建了一个名为MAP-KG的超大型知识图谱。这个图谱包含了187089种药物、22924个人类基因、694246条药物与基因之间的机制关系。这就像一张巨大的“生物互联网”,每个药物和基因都是一个节点,每条边都代表着它们之间的相互作用——比如“某种药物会抑制某个基因的表达”。


更重要的是,每条关系都被赋予了自然语言描述,而不是简单的数字编码,这让AI能够真正“理解”这些关系的生物学含义。


第二,多模态知识预训练


有了这张知识图谱,MAP还需要学会如何“阅读”它。研究团队设计了一套巧妙的对比学习方法,让AI同时学习三种不同的“语言”:



  1. 化学语言:药物的SMILES分子结构式;

  2. 蛋白质语言:基因编码的氨基酸序列;

  3. 文本语言:关于药物作用机制和基因功能的自然语言描述。


通过将这些不同模态的信息对齐到同一个“语义空间”,MAP学会了判断:“虽然这两种药物化学结构不同,但它们作用于同一个蛋白靶点,因此可能产生类似的细胞效应。”


第三,与单细胞基础模型的深度融合


最后,MAP将学到的“药物知识”与现有的虚拟细胞模型STATE相结合,这个模型已经学会了如何解读一个细胞在未受干扰时的状态。


当输入一种药物时,MAP会提取药物的知识嵌入向量,读取目标细胞的初始状态,结合基因层面的知识,进而预测细胞在药物作用下会发生怎样的变化。


Image


MAP和MAP-KG概述


效果验证


研究团队在多个基准数据集上对MAP进行了严格测试,结果令人振奋。


场景一:未见过的细胞类型-药物组合


在这种设置下,模型需要在新的细胞类型中预测一个已知药物的效果。例如,药物A已经在肺癌细胞中被测试过,现在要在肝癌细胞中预测它的效果。


MAP在Tahoe-100M数据集上,将Top-50差异表达基因的皮尔逊德尔塔相关性提升了 12.3%,方向准确率提升了11.3%。


Image


在未见过的细胞系-药物组合上的零样本泛化性能


场景二:对从未见过药物的零样本预测


这是最具挑战性的场景——模型必须预测那些在训练数据中完全没有出现过的药物。


结果同样出色:MAP在Tahoe-100M上将Top-50差异表达基因的皮尔逊德尔塔相关性提升了11.8%,方向准确率提升了17.5%。也就是说,即使面对一个全新的从未见过的化合物,MAP也能相当准确地预测它会如何影响细胞内的基因表达。


Image


MAP对从未见过药物的泛化性能


场景三:虚拟药物筛选


为了验证MAP的实际应用价值,研究团队模拟了一个真实的药物筛选场景。他们选择了A-549非小细胞肺癌细胞系,从58种候选药物中筛选潜在的有效抗癌药物。


结果显示——



  1. 5种已获批的抗癌药物中有4种被排在前15名;

  2. 排名第二的阿达格拉西布和排名第四的阿法替尼都是临床上用于治疗非小细胞肺癌的标准药物;

  3. 排名靠前的候选药物中,还发现了文献支持的潜在新适应症药物。


这些结果表明,MAP不仅能够预测基因表达的变化,还能在通路层面提供有生物学意义的解读。


Image


虚拟药物筛选


未来展望


研究团队指出,MAP框架还有两个重要的拓展方向:


第一,超越小分子药物。目前的MAP主要针对小分子化合物,但其方法论完全可以扩展到基因编辑、细胞因子疗法等其他类型的干预手段。


第二,与更大规模的虚拟细胞模型融合。随着虚拟细胞模型不断升级,MAP作为一个“插件式”的知识增强模块,可以无缝集成到更强的虚拟细胞模型中,持续提升模型性能。


MAP的出现,标志着AI在生命科学领域迈出了重要一步,它不再是简单地“记住”实验数据,而是开始“理解”生物学的基本规律。


这让我们想起AlphaFold在蛋白质结构预测领域的突破——当AI掌握了物理和化学的基本原理,它就能预测出从未被实验解析过的蛋白质结构。同样地,当AI掌握了药物与细胞相互作用的“语法规则”,它就能预测出从未被实验验证过的药物的效果。


虚拟细胞的梦想,也正在一步步变成现实。


而这背后,是知识图谱、多模态学习和单细胞组学三大技术的交汇融合。正如论文中所说:“生物学知识的注入,为数据驱动的扰动建模提供了一个正交且经济高效的范式。”



论文链接:https://www.nature.com/articles/s42256-026-01286-w


原文链接:https://mp.weixin.qq.com/s/4qi9UOsPTwTIMDP-TOAlWA


318
0
0
0
关于作者
相关文章
  • 多模态分子表征+宏观图拓扑:稳健毒性预测如何降低假阴性风险 ...
    了解详情 
  • Science|从蛋白质到完整基因组:Evo首次生成可存活噬菌体 ...
    了解详情 
  • AI制药基于结构的药物设计如何用数学物理约束破解扩散模型“结构 ...
    了解详情 
  • FAK激酶怎么精准调控?RFdiffusion从头设计小蛋白,低纳摩尔抑制 ...
    2026年7月13日,华盛顿大学蛋白质设计研究所、Fred Hutchinson癌症中心、加州理工学院和西班牙Mi ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas