AI增强的大规模化合物库自适应虚拟筛选用于配体发现

宇宙微尘
2026-09-10 18:15:40
人工智能
生命科学
技术教程

超大规模虚拟筛选(ultralarge virtual screeningULVS)能够在计算机中评估数十亿乃至更多化合物,为早期药物发现提供远超传统高通量实验筛选的化学空间覆盖范围。然而,随着可合成化合物库迅速扩展到千亿甚至万亿规模,对全部分子进行穷举式分子对接已经面临巨大的计算成本、软件兼容性和硬件扩展性问题。为解决这一瓶颈,研究人员开发了开源平台AdaptiveFlow,将超大规模配体库准备、分子对接、自适应化学空间搜索以及人工智能和机器学习方法整合到统一框架中。



AdaptiveFlow首先将Enamine REAL Space整理为可直接用于分子对接的超大规模数据库。原始约315亿个枚举分子经过立体异构体、互变异构体和质子化状态处理后,形成约687亿、即接近690亿个ready-to-dock分子,是目前规模最大的此类药物样化合物库之一。研究人员进一步利用18种分子性质建立高维化学空间网格,将整个数据库划分为约1200万个实际被占据的“tranche”。在此基础上提出Adaptive Target-Guided Virtual ScreeningATG-VS),通过首先筛选每个tranche中的少量代表分子,确定与特定靶点最匹配的化学空间,再集中计算资源筛选这些区域中的化合物。机器学习模型还可以根据初筛数据进一步预测最有希望的分子,从而形成自适应搜索过程。


AdaptiveFlow整合约1,500种由不同构象采样方法和评分函数组合而成的对接方案,并兼容CPUGPU和云计算环境。在AWS环境中,该平台可扩展至560万个虚拟CPU并保持接近线性的扩展性能。基准测试显示,仅筛选传统随机策略十分之一数量的分子,ATG-VS即可获得相当甚至更优的高评分候选;加入主动学习后富集能力进一步提高。研究人员最终在FSP1PARP1两个疾病相关靶点上进行了实验验证,成功获得纳摩尔级抑制剂,并通过晶体结构、生化实验和细胞实验验证其结合模式与功能活性。整体而言,AdaptiveFlowULVS从单纯依赖更多计算资源的暴力搜索模式,推进为利用化学空间组织和AI进行智能导航的自适应筛选模式。


Image


早期药物发现的核心任务之一,是从巨大的化学空间中寻找能够高亲和力、高选择性结合生物大分子的初始命中化合物。传统实验高通量筛选虽然已经产生大量成功药物先导,但通常只能测试数十万至数百万个实体化合物,而且受到化合物采购、实验成本、时间以及检测体系可扩展性的限制。相比之下,理论上的药物样化学空间极其庞大,而现代按需合成数据库已经发展到数十亿甚至数万亿分子的规模,因此实验筛选实际上只能覆盖其中极小的一部分。


结构基础虚拟筛选改变了这一局面。随着分子对接算法、高性能计算和按需合成化学的发展,虚拟筛选规模已经由早期的数百万分子增加到数亿乃至数十亿分子。更大的数据库不仅提高发现高亲和力配体的概率,而且有机会发现传统筛选库中不存在的新型化学骨架,对蛋白蛋白相互作用界面、变构口袋等传统意义上的难成药靶点尤其重要。


但数据库越大,传统穷举式筛选的局限也越突出。首先,对数百亿乃至万亿分子逐一进行高精度对接需要惊人的计算资源。其次,不同靶点适合不同的构象采样和评分方法,单一对接软件难以覆盖全部应用。再次,CPUGPU、云计算和深度学习硬件快速发展,传统虚拟筛选软件往往无法充分利用异构计算资源。因此真正的问题已经从能否建立更大的化合物库逐渐转变为如何智能地搜索如此巨大的化学空间


研究人员由此提出AdaptiveFlow。其核心思想并不是简单扩大计算规模,而是首先对化学空间进行结构化组织,再针对特定靶点寻找最值得投入计算资源的区域。平台包括负责超大规模配体预处理的AFLP、负责虚拟筛选的AFVS,以及将配体准备和对接整合起来的AFU三个主要模块,同时引入ATG-VS和可选的主动学习机制,使数百亿化合物的筛选转变为靶点导向的自适应搜索。


方法


研究人员首先利用AFLPEnamine REAL Space进行系统预处理,包括去盐、中和、立体异构体与互变异构体枚举、质子化状态预测、三维构象生成、结构质量检查以及不同分子对接格式转换,并计算28种理化性质和化学信息学描述符。其中18种性质被用于构建18维化学空间矩阵,包括分子量、logP、氢键供体和受体数、可旋转键数、拓扑极性表面积、溶解度、分子折射率、芳香性、形式电荷、正负电荷数量、sp3碳比例、手性中心以及卤素和硫原子数量等。随后,ATG-VS从约1200万个已占据tranche中选择1–10个代表分子进行预筛,根据对接结果确定与目标蛋白结合最有希望的化学空间,再对入选tranche进行主要筛选。可选的机器学习模块使用预筛分子的Morgan指纹和对接得分训练分类器,并进一步过滤低潜力化合物。研究人员在10种蛋白靶点上比较随机ULVSATG-VS和结合主动学习的ATG-VS,同时在完整690亿化合物数据库上开展生产规模测试。平台通过SlurmAWS Batch支持大规模CPU/GPU并行计算。最后,以FSP1PARP1为实验靶点,将虚拟命中化合物进行合成,并利用酶活实验、热稳定性分析、表面等离子共振、细胞实验、NMRX射线晶体学等手段验证其活性和结合模式。


Image


1AdaptiveFlow超大规模虚拟筛选平台总体架构


结果


AdaptiveFlow构建统一的超大规模虚拟筛选平台


AdaptiveFlow的一个重要特点是将过去相对独立的配体准备、分子对接、计算调度和机器学习模块统一起来。AFLP负责把原始分子转换成适合对接的标准化三维结构,同时完成立体异构体枚举、结构检查和分子性质计算;AFVS负责实际的超大规模筛选,并允许用户自由组合不同构象采样和评分方法;AFU则进一步将二者整合成自动化流程,使用户从原始SMILESSELFIES甚至氨基酸序列出发即可直接获得对接结构和评分。


平台支持小分子、肽、蛋白和共价配体,并可处理蛋白质、RNADNA等不同受体。通过组合40余种独立对接程序中的构象预测和评分组件,可形成约1,500种对接方案,同时整合DiffDockTANKBindEquiBind等机器学习方法。平台还支持GPU加速、ARMx86 CPU以及云计算环境,使同一工作流可以根据不同计算条件进行部署。


在云端扩展方面,AdaptiveFlow通过将大量配体划分为collectionsubjobwork unit进行分层调度,能够将数十亿分子的任务拆解为大量相互独立的小型计算单元。在AWS测试中,系统实现了超过560万个vCPU同时运行,并表现出接近线性的扩展特征,使过去可能需要数周甚至数月完成的超大规模计算有机会缩短至小时级。


690亿分子的REAL Space被组织为可导航的18维化学空间


研究人员进一步解决了数据库巨大但难以导航的问题。原始Enamine REAL Space包含约315亿个枚举分子,这些分子来自约13.7万个经过验证的化学构建模块以及167种内部验证的一锅合成方案。经过AFLP处理并考虑不同立体异构体和互变异构体后,可直接进行对接的数据库扩大到约687亿个分子。数据库拥有超过10亿种独特Murcko骨架,99%的化合物符合Lipinski五规则,说明其不仅规模巨大,也具有较高的药物样性和结构多样性。


研究人员没有将这些分子简单保存为一个超大列表,而是依据18种分子属性把它们映射到18维网格。理论上该网格包含约244亿种可能的属性组合,但实际只有约1200万个trancheREAL Space占据,每个tranche平均约含5,600个分子。这种稀疏、高维组织方式使研究人员可以通过目标结合口袋所偏好的分子量、疏水性、极性、立体复杂度等性质迅速定位特定化学区域。


值得注意的是,超过620亿个分子至少包含一个手性中心,占数据库约74%,说明REAL Space大量覆盖传统平面芳香化合物之外的三维化学空间。此外约230亿个化合物含有卤素,其中约174亿个含氟。高维矩阵中大量尚未被分子占据的区域也提示,可通过未来的定向合成进一步拓展目前尚未充分探索的化学空间。


Image


2Enamine REAL Space的配体准备流程及18维化学空间组织方式


ATG-VS将暴力筛选转变为靶点导向的自适应搜索


AdaptiveFlow最关键的方法创新是ATG-VS。传统ULVS会对数据库中的大量分子直接进行逐一对接,而ATG-VS首先询问:哪些化学空间最可能适合当前靶点?


具体而言,研究人员从每个tranche中抽取1–10个具有代表性的分子进行ATG预筛。由于整个数据库只有约1200万个已占据tranche,因此即使每个tranche仅选择一个代表分子,也只需要约1200万次对接,即可初步探索690亿分子的整体化学空间。随后根据代表分子的对接得分构建靶点特异性的化学空间热图,确定最有希望的tranche,再集中筛选这些区域中的全部或部分分子。


测试发现,每个tranche选择一个代表分子并采用较低的对接搜索强度,在很多应用中已经能够较好地定位优势化学区域。这意味着用约1200万次预筛探索690亿分子的空间,计算工作量可比全部穷举减少超过5,000倍。


研究人员还加入机器学习进一步提高筛选效率。模型根据预筛分子的Morgan指纹和对接结果学习哪些结构更可能成为高评分配体,再预测尚未对接分子的结合潜力。在不同靶点上,该步骤通常可以进一步过滤30%–70%的待对接化合物,同时维持甚至提高高质量候选的富集程度。


Image


3ATG-VS靶点导向自适应虚拟筛选的概念流程


AI增强筛选以十分之一计算量获得更优候选


为了检验这种策略是否真正优于随机筛选,研究人员在10种具有不同结合口袋特征的蛋白靶点上进行了系统比较,包括激酶、磷酸酶、G蛋白偶联受体以及蛋白蛋白相互作用界面等。


500万分子的测试数据库中,传统方法随机筛选100万个分子,而ATG-VS总计仅使用10万次对接,计算规模缩小至十分之一。结果显示,即使不使用主动学习,ATG-VS得到的高排名候选通常已经能够达到或超过随机筛选;加入机器学习主动学习后,高亲和力虚拟命中化合物进一步富集。换言之,模型并不是简单用AI替代分子对接,而是利用少量对接结果学习下一步应该把昂贵的对接计算花在哪里


这一优势具有一定的靶点依赖性。具有复杂、特征丰富结合口袋的蛋白,尤其同时具有较大疏水表面和明确极性亚口袋的靶点,从化学空间分区和机器学习中获益最明显。进一步使用不同对接算法和评分函数重复测试后,18维理化性质分区依然能够有效富集高评分分子,说明这一策略并非仅针对某一种特定对接程序有效。


Image


410种蛋白靶点上随机ULVSATG-VSATG-VS结合主动学习的性能比较


实验验证发现新型纳摩尔级FSP1抑制剂


研究人员随后将AdaptiveFlow真正用于药物发现。第一个靶点是FSP1,这是一种参与铁死亡调控的氧化还原酶。研究人员首先通过祖先序列重建获得稳定的FSP1蛋白,并解析了FSP1FADNAD以及辅酶Q等底物和辅因子的高分辨率结构,从而明确了辅酶Q结合位点以及潜在的小分子抑制区域。


FSP1辅酶Q位点为目标,研究人员首先完成约1200万次代表分子预筛,再选择1000万个分子进行主要筛选。经过理化性质、潜在毒性和结构警示过滤后选择42个候选,其中33个成功合成并接受实验检测。最终两个初始命中化合物表现出显著FSP1抑制活性,其中afi-FSP1-1afi-FSP1-2的抑制常数分别达到0.283 μM0.777 μM,并能够在细胞环境中直接结合FSP1


更重要的是,afi-FSP1-1FSP1的共晶结构基本验证了虚拟筛选预测的结合模式。该化合物占据正常情况下辅酶Q所在的结合区域,与Y290F354等关键芳香残基形成疏水或π堆积作用,其中央羰基还形成关键氢键。随后研究人员利用该共晶结构进行第二轮虚拟筛选,在20个实验测试的类似物中又发现4种活性分子,形成afi-FSP1-1afi-FSP1-6系列。其中afi-FSP1-3还表现出更有利的ADME性质,为进一步药物化学优化提供了起点。


Image


5afi-FSP1系列抑制剂与FSP1结合的共晶结构及关键相互作用


AdaptiveFlowPARP1上发现低纳摩尔级抑制剂


为了证明AdaptiveFlow并非只适用于FSP1,研究人员进一步选择临床上已经得到充分验证的DNA损伤修复靶点PARP1进行筛选。经过ATG预筛后,研究人员对1亿个分子进行了主要筛选,并从中选择160个具有潜力的候选化合物进行合成和实验验证。两种浓度下的酶活性筛选最终发现7PARP1抑制剂,其中iParp1iParp2iParp3iParp4的半数抑制浓度均低于250 nM。部分命中化合物与已知PARP1抑制剂具有共同的关键骨架,但也出现了不同的骨架变化,表明超大规模化学空间搜索能够在保留有效药效团特征的同时探索新的结构区域。


其中最突出的化合物iParp1IC50达到8.8 nM,与已获批PARP抑制剂奥拉帕利处于相近水平。值得注意的是,这一化合物直接来源于虚拟筛选,在命中发现阶段并没有利用已知PARP1抑制剂信息,也没有经过后续系统性的药物化学优化,因此其低纳摩尔级活性进一步体现了AdaptiveFlow在巨大化学空间中直接发现高质量起始分子的能力。


研究人员进一步利用蛋白NMR验证iParp1能够直接结合PARP1活性位点,观察到的化学位移变化与预测结合位置相符。随后解析的PARP1催化结构域与iParp1水解产物的2.05 Å分辨率X射线晶体结构进一步确认了其结合模式和关键分子相互作用。在BRCA1缺陷型三阴性乳腺癌细胞中进行的克隆形成实验还显示,iParp1iParp2具有选择性细胞毒性。不过,iParp1在细胞中的活性明显弱于其生化活性,研究人员认为这主要与化合物水解后膜通透性下降有关。这也说明AdaptiveFlow能够高效发现具有优异靶点结合能力的初始命中化合物,但从高亲和力配体进一步转化为具有理想细胞活性和药代性质的候选药物,仍然需要传统药物化学优化。


FSP1PARP1两个案例共同构成了AdaptiveFlow最重要的实验验证:前者代表相对新颖、结构和药理学研究仍在发展的铁死亡靶点,后者则是具有成熟药理学基础和临床药物的经典肿瘤靶点。AdaptiveFlow在两种明显不同的蛋白体系中均能够从超大规模化学空间中直接发现纳摩尔级抑制剂,说明其价值不仅体现在计算加速,更体现在将超大规模虚拟筛选结果真正转化为可实验验证的活性分子。


讨论


随着按需合成技术和组合化学的发展,可获得的药物样化合物数量正在以前所未有的速度增长。近年来,可购买或按需合成的化合物已经从数十亿迅速增长到数万亿。然而,即使如此庞大的数据库,与理论药物样化学空间相比仍然只是极小的一部分。未来药物发现面临的问题因此不再只是如何建立更大的分子库,而是如何在持续膨胀的化学空间中,以可接受的计算成本找到真正值得实验验证的候选分子。


AdaptiveFlow提供了一种不同于传统暴力计算的解决思路。研究人员首先建立约690亿个ready-to-dock分子的REAL Space,并通过18维理化性质矩阵将庞大的数据库转化为可以被系统导航的化学空间。ATG-VS随后利用少量代表分子判断哪些区域与目标结合口袋更加匹配,再将后续计算资源集中到这些区域。其本质是将虚拟筛选从对所有分子进行同等计算转变为根据靶点特征动态分配计算资源


这种策略对于未来万亿级化合物库尤其重要。在690亿分子的REAL Space中,ATG-VS相对于穷举式筛选可将筛选成本降低最高约1,000倍,而深度学习对接和GPU加速还可以进一步提高约10–100倍的计算吞吐量。研究人员此前寻找KEAP1–NRF2纳摩尔抑制剂时,需要对约13亿个分子进行无偏筛选,而此次FSP1研究通过靶点导向策略仅进行了约2,200万次对接便获得了具有类似活性水平的候选物。这种差异直观体现了从扩大筛选规模提高搜索效率转变的意义。


当然,化学空间聚焦的收益并非对所有靶点完全相同。不同蛋白结合口袋对分子大小、疏水性、极性、电荷和三维形状具有不同偏好,因此某些具有明确结构特征的口袋能够通过18维属性空间得到非常有效的富集,而其他靶点的改善程度可能相对有限。这意味着ATG-VS并不是一个固定的通用过滤器,而更接近于针对每个靶点重新学习其优势化学空间。这一特点也是主动学习具有重要价值的原因:随着每一轮对接或实验结果不断加入,模型可以重新训练,并继续调整下一轮应当探索的区域。


AdaptiveFlow的另一优势在于开放性和模块化。平台支持约1,500种由构象采样算法和评分函数组合形成的对接方案,并可以整合传统物理方法、GPU加速方法以及DiffDockTANKBind等机器学习对接方法。与此同时,SELFIES表示、分子性质计算以及主动学习流程使其可以直接连接生成式AI和强化学习模型。因此,AdaptiveFlow并不仅仅是一个超大规模“dock-and-rank”工具,也可以成为生成模型与真实结构靶点之间的评价基础设施:生成模型负责提出新分子,AdaptiveFlow负责大规模准备、对接、筛选和反馈,筛选结果又可以继续作为下一轮生成模型优化的目标。


这种闭环模式可能是该研究对于AI药物发现更重要的启示。传统生成式模型面临的一个问题是,可以快速产生海量候选结构,但高质量物理或结构评价通常远慢于分子生成本身。当候选数量扩展到数百万乃至数十亿时,评价过程会成为新的瓶颈。AdaptiveFlow通过高维化学空间分区、主动学习、GPU计算以及云端并行化,为这种生成评价学习再生成的闭环提供了可扩展的计算基础。


实验结果也说明,虚拟筛选的最终价值不能只通过对接得分衡量。FSP1研究中,AdaptiveFlow首先发现afi-FSP1-1afi-FSP1-2,随后共晶结构验证了预测的结合位置,并进一步指导类似物搜索,最终形成多个具有纳摩尔至低微摩尔活性的化合物。结构分析还揭示这些抑制剂主要占据辅酶Q结合区域,却基本保留NAD(P)H结合方式,因此对FSP1的辅酶Q还原活性具有更明显的抑制作用,而对其NADH氧化酶活性的影响相对较弱。这一发现不仅证明筛到了活性分子,还进一步提供了理解FSP1催化机制以及探索铁死亡调控的新结构基础。


与此同时,PARP1案例也暴露了虚拟筛选到药物开发之间仍然存在的距离。iParp1在生化实验中达到8.8 nM的高活性,但由于水解和膜通透性问题,其细胞水平表现有所下降。因此,高质量结构结合和优异体外抑制活性只是药物发现的起点,吸收、分布、代谢、排泄、毒性以及细胞通透性等性质仍需要在后续优化中解决。


总体而言,这项研究的核心贡献并不是单纯把虚拟筛选规模提高到690亿个分子,而是提出了一种更适合未来万亿级化学空间的搜索范式:先利用分子性质建立可导航的化学空间,再通过靶点导向预筛确定高价值区域,进一步利用机器学习动态聚焦候选分子,最后将有限的高成本计算和实验资源集中于最有希望的化学空间。 随着可合成数据库继续扩大,穷举式筛选将越来越难以持续,而这种化学空间组织+靶点导向搜索+主动学习+大规模异构计算的模式,可能成为下一代AI驱动虚拟药物发现的重要基础设施。


从更广泛的角度看,随着冷冻电镜、蛋白质结构预测和功能基因组学不断提供新的靶点结构与功能信息,越来越多过去缺乏明确药物结合口袋的生物学体系正在进入结构基础药物发现的范围。分子胶、靶向蛋白降解剂以及针对蛋白表面的功能性小分子也进一步扩大了传统药物口袋的定义。在这种背景下,AdaptiveFlow提供的价值是让研究人员能够以相对统一的计算框架快速测试不同类型靶点和不同化学空间,并把传统分子对接与现代AI模型连接起来。


因此,AdaptiveFlow代表的并非简单的更大规模虚拟筛选,而是从“brute-force screening(暴力穷举筛选)向AI-enhanced adaptive screeningAI增强的自适应筛选)的转变。研究人员通过FSP1PARP1的实验结果进一步证明,这种计算效率的提高并没有以牺牲真实命中质量为代价:平台能够从数百亿规模的化学空间中发现具有纳摩尔级活性的真实抑制剂,并通过高分辨率结构实验确认其结合机制。由此,超大规模化学空间不再只是一个不断膨胀、难以完全计算的数据库,而开始成为能够根据具体生物靶点进行智能导航和持续学习的药物发现空间。



参考资料:Cecchini, D., Nigam, A., Tang, M. et al. AI-enhanced adaptive virtual screening of large libraries for ligand discovery. Nat Biotechnol (2026). 


https://doi.org/10.1038/s41587-026-03217-x


原文链接 :https://mp.weixin.qq.com/s/XoaRO8B-H5I-JiGjPVqBTg


8
0
0
0
关于作者
相关文章
  • 扩散模型 + 物理引导推理求解偏微分方程
    这篇解读的对象是 2026 年 3 月发布在 arXiv 上的论文《Diffusion models with physics-guided i ...
    了解详情 
  • 图解人工智能——Diffusion Model 扩散模型
    了解详情 
  • 机器学习引导的单原子电催化剂用于CO₂还原的基因逆向设计 ...
    了解详情 
  • mRNA与蛋白质相关性由什么决定?
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas