Nat Protoc|浙江大学/澳门理工大学等:AI驱动结构虚拟筛选平台CVSP-AIE助力药物发现

薛定谔了么
2026-07-17 17:54:45
生命科学
量子信息
论文精读与讲座笔记



20266月,浙江大学、澳门理工大学等团队在《Nature Protocols》发表研究,推出AI驱动的结构虚拟筛选平台CVSP-AIE,旨在降低AI分子对接与虚拟筛选的应用门槛,平衡筛选速度与准确性,助力基于结构的药物发现。该平台核心整合了三类自研AI模型:高速对接模型KarmaDock(基于E(n)-等变图神经网络,单次对接仅需0.017秒)、高精度对接模型CarsiDock(通过距离矩阵重构构象,物理合理性更强)、亲和力预测重打分模型RTMScore,采用“KarmaDock初筛-CarsiDock精筛-RTMScore打分的层级策略,在DEKOIS 2.0基准测试中,其核心模型的早期富集能力、ROC_AUC等指标均显著优于GlideAutoDock Vina等传统工具。平台同时支持在线网页端与本地命令行部署:在线端提供全流程模块化功能,内置多个商用化合物库,支持预处理、多模式筛选、相互作用分析及结果可视化,单任务最多支持100万分子筛选;针对超大规模筛选需求,本地部署版本封装为Docker镜像与PyPI包,不受在线队列与任务规模限制。相较于现有虚拟筛选平台,CVSP-AIE具备用户友好、功能完整、性能优异、开源可定制四大优势,但也存在在线并发任务受限、需参考配体定义结合口袋、模型泛化性有待提升等局限。该平台为药物研发人员提供了低门槛、高效率的AI虚拟筛选工具,也为相关算法的二次开发提供了支撑。










背景











药物发现具有周期长、投入高和风险大的特点。在早期研发阶段,快速发现具有潜在活性的苗头化合物,是后续先导优化和临床前研究能否顺利推进的重要基础。传统湿实验筛选能够提供直接实验验证,但其覆盖化学空间有限,且耗时、耗力、成本较高。


虚拟筛选为这一过程提供了重要补充。根据是否依赖靶点结构,虚拟筛选大致可分为配体基础方法和结构基础方法。配体基础方法利用已知活性分子的结构和性质建立预测模型,但容易受已有活性分子化学空间限制,发现全新骨架化合物较难。结构基础虚拟筛选则从靶点蛋白三维结构出发,将化合物库中的分子逐一对接到结合口袋中,再根据预测结合强度排序,因此在没有大量已知配体信息时也具有应用价值。


过去,结构虚拟筛选的瓶颈之一是蛋白三维结构获取困难。随着RCSB PDB数据库积累和AlphaFold系列模型发展,这一问题已有明显缓解。新的瓶颈则转向蛋白-配体对接与打分:如何在大规模化合物库中既快又准地预测结合构象和亲和力。


近年来,AI驱动的对接和打分模型在速度和回顾性筛选性能上表现突出,但其实际应用仍有门槛。不同模型算法架构不同,速度、构象合理性和打分准确性各有取舍;同时,部署模型、准备蛋白和分子文件、处理异常结果、完成后处理分析,都需要一定计算和编程经验。对于以实验研究为主的药物发现团队,这些要求可能限制了AI工具的普及。








CVSP-AIE










CVSP-AIE的核心是三个由团队开发的AI模型:RTMScore、KarmaDock和CarsiDock。







图1 CVSP-AIE的核心功能与结构概览





RTMScore是一个重打分模型,通过学习实验验证蛋白-配体复合物中“配体原子-结合位点残基”距离分布,用于预测结合亲和力。该模型此前在CASF-2016、DEKOIS2和DUD-E等基准上取得了较好表现。


KarmaDock是一个高速分子对接模型,使用带自注意力机制的E(n)-等变图神经网络,直接更新配体原子的笛卡尔坐标,从而快速生成结合构象。它的优势是速度极快,也具备一定打分功能;但由于直接更新坐标、缺少显式键约束,生成构象的物理合理性可能不足。


CarsiDock同样用于分子对接,但路线不同。它先预测蛋白-配体原子距离矩阵,再通过平移、旋转和扭转引导的几何优化,将距离矩阵重构为可信结合构象。相比KarmaDock,CarsiDock计算成本更高,但结合构象的物理合理性更好。


CVSP-AIE通过层级筛选策略将三者串联起来:先用KarmaDock对完整化合物库进行高速初筛,再选取排名靠前的分子,进一步用CarsiDock进行更精细对接,并用RTMScore进行打分或重打分。这样既避免了对所有分子进行高成本精确对接,又能在候选分子阶段提高构象和评分可靠性。








在线平台与本地部署










CVSP-AIE包含在线Web服务器本地软件包。在线服务器面向希望快速开展结构虚拟筛选的用户,用户只需上传靶点蛋白结构和用于定义结合口袋的参考配体,即可完成从预处理、虚拟筛选到结果后处理的完整流程。







图2 CVSP-AIE云服务与本地部署服务流程概览





在线平台包括六个主要功能模块。Preprocess模块用于蛋白结构修复和化合物标准化;HeVS模块使用KarmaDock进行高效率筛选;HpVS模块使用CarsiDock进行高精度筛选;HierarchicalVS模块执行层级筛选,依次调用KarmaDock、CarsiDock和RTMScore;HpRS模块使用RTMScore对其他工具生成的结合构象进行重打分;CvPL模块用于任意蛋白-配体复合物的相互作用分析和可视化。


平台还内置多种常用商业化合物库,包括Clustered ChemDiv、Enamine Hit Locator Library、Specs和DrugBank。用户也可以上传自定义化合物库,并通过预处理模块清洗非标准分子格式,减少筛选过程中断风险。








图3 基于HierarchicalVS模块的完整虚拟筛选流程




对于超大规模筛选,在线平台的共享资源会成为限制。因此,CVSP-AIE同时提供本地部署版本,将核心HierarchicalVS模块封装为Docker镜像和PyPI包。用户可在本地计算资源上执行命令行筛选,不受在线队列和任务规模限制。在线服务器单任务最多支持100万小分子;超过该规模时,作者建议使用本地部署版本。







性能比较:AI模型在DEKOIS 2.0上表现突出










文章将CVSP-AIE内嵌模型与多种传统和AI对接/打分工具进行比较。根据DEKOIS 2.0数据集的六项平均指标,CarsiDock、KarmaDock和RTMScore均显示出较强筛选能力。例如,在早期富集指标EF_0.5%上,传统工具中Glide为13.628,Surflex为8.365,LeDock为6.777,AutoDock Vina为5.464;KarmaDock达到16.989,CarsiDock达到20.460,Glide生成构象后经RTMScore重打分达到20.990。EF_1%上,KarmaDock为15.833,CarsiDock为18.910,Glide_RTMScore为18.530,同样优于多数传统工具。ROC_AUC方面,KarmaDock为0.782,CarsiDock为0.793,也高于表中传统对接方法。







图4 CVSP-AIE流程的预期结果





计算效率方面,KarmaDock优势尤其明显。单次蛋白-配体对接和打分平均耗时仅0.017秒,而CarsiDock为1.726秒,AutoDock GPU为2.772秒,GOLD为3.988秒,LeDock为7.938秒,Glide SP为23.798秒,Glide XP为139.106秒。如此高效率为超大规模虚拟筛选提供了基础。




表1 不同对接与打分工具在DEKOIS 2.0数据集上的六项指标平均值







表2 不同对接程序完成单次对接运行所需的平均时间






不过,作者也提醒,表中传统工具主要基于单线程CPU计时,而AI工具依赖GPU加速,因此比较时需要考虑硬件差异。在实际筛选中,多核CPU并行也可显著提高传统对接工具效率。







与其他虚拟筛选平台相比:完整流程和多模式筛选是核心优势










文章还将CVSP-AIE与InstaDock、VSTH、DrugRep、DockThor、OpenVS和DrugCLIP等平台进行对比。早期平台多依赖物理对接工具,虽然提供图形界面,但大规模筛选效率受限。OpenVS将主动学习与RosettaVS结合,兼顾一定效率和准确性,但缺少图形化界面。DrugCLIP使用对比学习对齐蛋白口袋和小分子表示,速度很快,但仍需外部对接工具进一步分析蛋白-配体结合模式。




表3 各类虚拟筛选平台的描述








相比之下,CVSP-AIE强调完整虚拟筛选闭环:数据预处理、筛选、打分、相互作用分析、化学空间分析和结果可视化均可在平台内完成。同时,它提供多种筛选模式,用户可根据任务需求选择高效率、高精度、层级筛选或重打分流程。对于在线平台无法承载的大规模任务,用户还可通过本地安装包部署核心模块。


 


作者将CVSP-AIE优势概括为四点:第一,用户友好,网页端通过上传文件即可完成完整流程,结果以可视化和交互形式呈现;第二,功能多样,整合多个AI模型,支持云端和本地服务;第三,性能较强,内置模型已在多个基准和真实筛选案例中验证;第四,开源,核心代码通过Docker镜像和PyPI包提供,便于用户二次开发和定制。








应用流程











使用CVSP-AIE前,用户需要准备靶点蛋白三维结构和已知结合配体结构。已知配体主要用于定义结合口袋。如果靶点结构可从RCSB PDB获取,可直接下载;如果缺少实验结构,作者建议先使用AlphaFold3或Boltz2等工具预测蛋白-配体复合物。对于来自PDB的蛋白结构,通常建议先经过平台预处理模块修复,例如补全缺失侧链、处理非标准残基等。


化合物库方面,用户既可选择平台内置库,也可上传自定义库。预处理模块可过滤PAINS结构,移除读取失败、InChIKey生成失败或构象生成失败的分子,从而减少后续筛选异常。


完成筛选后,平台会输出按预测结合分数排序的分子列表,并对排名靠前的分子进行后处理。不同模块的后处理内容略有差异:HeVS主要进行化学空间分析,包括结构聚类和性质计算;HpVS和HierarchicalVS还可进行蛋白-配体相互作用计算与可视化;HpRS则主要针对已有对接构象进行RTMScore重打分和相互作用分析。





表4 故障排查表












局限性










CVSP-AIE仍存在一些限制。首先,在线服务器需要处理多个用户任务,同一时间最多并行两个筛选任务,用户在高负载时可能需要排队。虚拟筛选通常涉及数万乃至更多分子,单个任务可能耗时数小时,因此队列等待不可避免。其次,任务预计运行时间可能不准确。尽管系统会在提交任务后估算完成时间,但实际耗时会受分子结构优化难度和并发任务影响。第三,平台目前只支持具有明确结合位点的受体结构,需要参考配体来定义结合口袋。如果用户只有蛋白结构而没有配体或结合位点信息,就需要先借助其他工具预测复合物或口袋,增加前处理步骤。此外,当前AI模型本身仍有局限,包括预测构象物理合理性不足、对结合口袋扰动不够敏感,以及在新靶点或新化学实体上性能可能下降。作者也提醒,AI模型在回顾性基准上表现较好,并不必然意味着在所有真实筛选项目中都稳定可靠;基准集偏倚可能让模型学到数据分布捷径,而非真正泛化的蛋白-配体相互作用规律。





参考链接:


https://doi.org/10.1038/s41596-026-01389-z


平台地址:


https://cadd.zju.edu.cn/cvsp/






32
1
0
1
关于作者
相关文章
  • 分子动力学+MM/GBSA:AI药物发现的大规模结合自由能数据引擎 ...
    了解详情 
  • 量子-经典异构计算驱动的生物分子模拟研究进展:从千原子到万原 ...
    本文介绍2026年5月克利夫兰诊所、日本理化学研究所与IBM团队的量子计算生物医药应用突破。研究依 ...
    了解详情 
  • npj Comp. Mater. | 统一扩散框架加速无机晶体材料设计:DiffCry ...
    传统无机晶体生成扩散模型多采用晶格、原子种类与坐标分步扩散架构,存在参数量庞大、采样效率偏 ...
    了解详情 
  • Cell: 当 Ising 模型遇见 Perturb-seq:用统计物理反推百万细胞 ...
    本文介绍加州理工学院与洛克菲勒大学团队发表于《Cell》的研究——D-SPIN(单细胞扰动 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas