从基因到完整细胞:AI虚拟细胞正在走向多尺度“数字孪生”

超能小量子
2026-09-02 18:34:59
人工智能
生命科学
技术教程
本帖最后由 超能小量子 于 2026-9-2 18:57 编辑


20263月,中国海洋大学、南京大学医学院、青岛大学附属医院及英国曼彻斯特大学研究团队在《Briefings in Bioinformatics》发表综述文章,题为“Artificial intelligence-enabled multi-scale virtual cell: perspective, challenges, and opportunities”。文章围绕人工智能虚拟细胞(AIVC)的概念、技术体系、数据资源、模型方法、应用场景及未来挑战进行了系统梳理,并提出以基因蛋白质通路细胞为核心的跨尺度虚拟细胞框架。与单纯利用AI预测基因表达或细胞状态不同,作者所设想的AIVC更接近一个细胞数字孪生系统:它需要将不同生物尺度的信息连接起来,使发生在基因或蛋白质层面的变化能够逐层传递,最终预测细胞功能和行为的改变。



本内容转载自《智药邦》链接:https://mp.weixin.qq.com/s/SxDF49CDdmVTRlkYo-tGEA


Image


从传统细胞研究走向AI虚拟细胞


细胞是生命活动的基本结构和功能单位,其行为同时受到微观分子机制和更高层级组织环境的共同调控。长期以来,细胞研究主要依赖实验观察、生化分析以及人工数据处理。例如,研究人员通过基因敲除和基因编辑探索特定基因的作用,利用放射性标记、Western blot等技术追踪信号分子的变化。这些方法为现代细胞生物学奠定了基础,但也存在明显局限:实验设备的分辨率和观测窗口限制了研究人员捕捉细胞内部快速、细微动态变化的能力,同时实验往往需要投入大量时间、人力和材料成本。随着单细胞测序、空间组学、蛋白质组学等技术快速发展,生物数据呈指数级增长,传统研究方式也越来越难以处理如此复杂的数据。


虚拟细胞并不是一个突然出现的概念。早期的VCellE-CellCellML已经尝试通过计算方法描述细胞过程。其中,VCellE-Cell主要基于已知生化规则模拟细胞中的生化反应网络,CellML则更侧重通过标准化模型描述促进不同生物模型的交换和复用。随着大规模多组学数据积累和深度学习技术的发展,虚拟细胞研究开始从主要依赖机制规则的模拟,转向机制建模与数据驱动预测相结合的新阶段。


近年来,一批具有代表性的模型进一步推动了这一变化。例如,JCVI-syn3A能够较为系统地模拟最小合成细胞的代谢、基因表达和生长过程;scFoundation使用超过5000万个单细胞转录组进行预训练,可以学习不同细胞类型和状态下复杂的基因关系;GET则利用染色质可及性和序列信息预测213种人类细胞类型中的基因表达,并进一步定位远端调控区域和转录因子相互作用。


1 AIVC相关代表性模型汇总


Image


什么才是真正的AI虚拟细胞?


在此基础上,作者进一步给出了AIVC的定义:AIVC是一种由AI驱动的多尺度计算框架,通过多组学和多模态数据融合,将基因、蛋白质、通路和细胞等不同生物层级连接起来,最终建立能够模拟细胞功能和行为的数字孪生系统。细胞功能并不能只从某一个层级完整解释,而需要同时考虑基因、蛋白质、信号通路和细胞四个尺度。基因尺度构成细胞的遗传信息基础,涵盖DNA序列、转录调控和表观遗传修饰;蛋白质尺度描述蛋白质合成、修饰、结构与相互作用,相当于细胞中真正执行功能的分子机器;信号通路尺度通过分子级联反应把这些事件组织成调控网络;细胞尺度则进一步整合前面所有信息,最终表现为空间组织、相互作用和细胞行为。


Image


1 AIVC的功能特征


构建AIVC需要怎样的数据基础?


真正实现多尺度模拟,仅依赖单细胞转录组显然远远不够。作者因此系统整理了从基因到细胞不同尺度的数据资源。在基因尺度,ClinVarHGMD提供疾病相关突变数据,ProThermDBFireProtDB包含蛋白突变稳定性的实验数据,UK BiobankGWAS CatalogDisGeNETGEO则从不同角度提供基因型、表型、疾病和基因表达关系。在蛋白质尺度,PDBUniProt仍然是重要基础资源;SKEMPI 2.0提供突变对蛋白质蛋白质相互作用影响的数据,而PDBbindMISATO进一步提供蛋白质配体复合物及结合信息。在通路尺度,STRINGBioGRIDIntAct等数据库提供大规模分子相互作用网络,KIBADavisHuman等资源则用于描述药物与蛋白质的关系。到了细胞尺度,数据规模进一步扩大。Human Cell Atlas提供超过6000万个细胞的单细胞转录组图谱,Tabula Sapiens覆盖28个人体器官和组织,IDR则储存大量细胞和组织显微图像。


特别值得关注的是 Tahoe-100M。该数据集包含超过1亿个单细胞转录组,来自约6万次药物扰动实验,系统记录50种癌细胞系对1100多种小分子药物的响应。与此同时,scBaseCount采用AI Agent自动检索并标准化处理公开单细胞RNA测序数据,目前已覆盖21种生物和72种组织、超过2.3亿个细胞。作者认为,这类大规模扰动和标准化数据资源将成为下一代AIVC训练与评估的重要基础。


2 AIVC构建相关数据集汇总


Image


AIVC是一套跨尺度技术架构


作者将其总体技术逻辑划分为表示构建、表示学习和功能预测三个阶段。首先是跨尺度表示构建。在同一个尺度内部,需要完成不同模态的横向融合,例如把蛋白质序列、三维结构和动力学信息整合起来;不同尺度之间则进行纵向贯通,使基因层面的特征能够向蛋白质、通路和细胞层逐级传递。随后,不同尺度分别进入基因、蛋白质、通路和细胞功能子模块进行学习,最终根据任务调用相应的预测模块。


Image


2 AIVC技术架构概念图


如何评价一个真正的虚拟细胞?


由于AIVC覆盖多个生物层级,评价方式也不能依赖单一指标。作者分别为基因、蛋白质、通路和细胞尺度整理了评价框架。基因尺度可以参考Virtual Cell Challenge中的差异表达评分(DES)、扰动区分评分(PDS)和MAE;蛋白质尺度则可以利用AUPRF1-maxPearson相关系数;通路尺度可采用MCCF1以及Spearman相关系数;细胞尺度则可以使用ARISilhouette Coefficient以及Macro F1衡量细胞聚类、细胞类型识别和状态预测效果。


但作者进一步指出,这依然不够。真正的AIVC最终需要跨尺度联合评价指标。如果模型声称能够模拟一种疾病,就不仅需要准确预测基因表达变化,还应验证其预测的蛋白质变化、通路异常以及最终细胞表型是否能够构成一条一致的疾病机制链。与此同时,计算效率和跨数据模态泛化能力也应成为评估AIVC的重要维度。


真正的AIVC还有哪些关键障碍?


尽管发展迅速,AIVC仍然处于早期阶段。首先需要解决的是机制模型与数据驱动模型之间的融合。机制模型基于已知生物规律进行自下而上的模拟,可解释性强但泛化能力有限;数据驱动模型能够直接从海量数据学习复杂规律,却经常缺乏机制解释。两类模型还分别采用确定性规则与概率性输出,因此如何协调二者,并进一步追踪预测不确定性如何沿着基因蛋白质通路细胞不断传递,是未来的重要课题。


数据也是另一个明显瓶颈。虽然各个尺度都已经积累了大量数据库,但真正面向AIVC全链条训练的数据集仍然很少。单细胞RNA测序存在基因漏检,空间组学分辨率仍难以完整捕捉亚细胞动态,大量细胞状态变化又是连续时间过程。不同物种之间的数据差异也会进一步影响临床转化,例如小鼠和人体在药物代谢酶表达上的差异就可能导致药物预测出现系统性偏差。


此外,模型黑箱、跨组织和跨疾病泛化不足,以及计算资源需求巨大也限制着AIVC的发展。整个细胞内部存在成千上万种生化反应,如果希望同时模拟基因表达、蛋白质结构、信号网络和细胞行为,计算复杂度会迅速膨胀。文章提出,可解释AI、联邦学习以及未来更先进的计算系统,都可能成为进一步推动AIVC发展的关键技术。


总结


作者所描述的下一代AIVC,要进一步打通基因、蛋白质、信号通路和细胞之间的信息壁垒,使一个基因突变造成的蛋白质结构变化能够正确传播至信号网络,并进一步预测细胞最终会发生怎样的改变。与此同时,这些计算预测还需要不断通过实验进行验证和修正,最终形成虚拟扰动模型预测实验验证模型更新的闭环。因此,未来虚拟细胞竞争的重点可能不再只是谁的数据更多、参数更大或者扰动预测指标更高,而是模型能否真正理解不同尺度之间的关联和因果传递,能否描述一个微观分子事件如何演变为宏观细胞表型,以及这种预测能否经受真实实验检验。从这个角度而言,AIVC所代表的不只是AI分析细胞,而是一种生命科学研究范式的变化:从观察细胞,到预测细胞,再到模拟乃至设计细胞。而本文提出的基因蛋白质通路细胞多尺度耦合体系,正是在尝试给这条道路绘制一张更完整的技术蓝图。



参考链接:


https://doi.org/10.1093/bib/bbag104


276
1
0
0
关于作者
相关文章
  • 利用条件生成对抗神经网络加速密度泛函理论计算 ...
    了解详情 
  • Nature_Materials必读综述:AI材料设计路线全景
    了解详情 
  • 金属显微组织图像识别大综述-从分割检测到性能逆向设计 ...
    了解详情 
  • Buchwald-Hartwig反应的鲁棒性分布外预测
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas