Nat Commun|让AI自主完成生物电子等排替换与多性质优化

Dorian
2026-09-28 17:50:05
人工智能
生命科学
技术教程

在药物设计中,找到一个能够结合靶点的分子,往往只是起点。真正困难的是后续优化:研究人员既希望提高溶解性、类药性和合成可及性,又不愿破坏已经获得的生物活性。多个目标彼此牵制,一处看似局部的结构改动,可能同时改变分子的脂溶性、构象、代谢稳定性乃至靶点结合。如何在尽量保留原有功能的前提下,做出“小而有效”的化学修改,是先导化合物优化中的核心问题。


生物电子等排替换正是解决这一问题的经典策略。它以一个化学片段替换另一个在结构、电子或生物学功能上相近的片段,希望微调分子性质,同时维持关键相互作用。过去,这项工作高度依赖药物化学家的经验;数据库方法虽然可以从匹配分子对中总结常见替换规律,却通常仍需要人工指定修改位置,而且难以处理数据库中少见的片段,更难同时控制依赖全分子结构的复杂性质。 








2026年7月,韩国科学技术院与HITS Inc.团队在《Nature Communications》发表文章,题为“Autonomous bioisosteric replacement for multi-property optimization in drug design”。作者提出一种名为DeepBioisostere的方法,把生物电子等排替换建模为一个端到端的序列决策过程:模型不仅推荐换成什么,还自主决定从哪里换以及怎样接回去,并根据给定条件同时调节多个分子性质。作者希望把原本依赖经验和预设规则的局部改造,推进为可计算、可条件控制的分子优化流程。
 
DeepBioisostere代码仓库:https://github.com/Hwoo-Kim/DeepBioisostere
 
 


图1|三种生物电子等排替换方式,人工方法由药物化学家选择替换位点和候选片段;数据库方法仍需人工确定删除片段,再按历史频次推荐替换;DeepBioisostere则结合完整分子环境,自主选择删除片段、插入片段及连接方式。
 


从推荐片段走向端到端替换
 
DeepBioisostere将一次结构修改拆成三个连续步骤:选择需要删除的片段,从片段库中选择插入片段,再预测新片段与剩余结构的连接方向。模型首先按BRICS规则把分子切分成化学上较合理的片段,并将原分子同时表示为原子图和片段图。原子级消息传递网络捕捉局部化学环境,片段级网络进一步整合片段与周围结构之间的关系。性质控制条件也被加入表示,使同一个分子在提高脂溶性和降低脂溶性等不同目标下,可以触发不同的修改决策。
 
训练数据来自ChEMBL。团队从约418万条分子记录出发,经过分子量、盐形式和活性等预筛选,保留约105万种分子,再用BRICS切分和匹配分子对方法寻找仅有小范围结构差异、且在同一生物测定中保持活性的分子对。最终训练数据包含约287万组匹配分子对,形成包含140,096个片段的候选库。与单纯统计片段出现频率不同,模型学习的是原分子、性质目标与替换结果之间的条件关系。
 
这一设计的关键,是替换片段不能脱离其所在的化学环境。一个片段在分子A中能够改善性质,并不意味着放入分子B后仍然有效。论文用两个都含吡唑基、但周围取代基和整体脂溶性差异很大的分子进行验证。把针对分子A选出的片段直接移植到分子B时,logP仍可能按预期变化,但QED反而下降。这是因为logP在一定程度上可以看作局部基团贡献的累积,而QED是由分子量、氢键供受体、芳香性、柔性等多种全局特征共同决定的非线性指标。实验说明,对复杂性质的优化不能只记住某片段通常带来什么变化,还要判断它进入当前分子后会产生什么结果。
 


同时改变一个性质,并保留另一个性质
 
作者设置了三组双性质控制任务。第一组要求在分子量基本不变时,将logP提高或降低1。logP相差1对应辛醇—水分配比约10倍的变化,因此这不是简单的数值微调。模型生成的分子平均logP分别变化+0.83和-0.84,而分子量平均仅变化+0.04和-0.28,表明它能够在几乎不改变分子尺度的情况下调节脂溶性。
 
第二组任务是在保持分子量的同时提升QED。面对初始QED低于0.4的分子,模型收到“提高0.1”或“提高0.2”的条件后,实际平均提升分别为0.067和0.100。目标越激进,结果与要求之间的偏差越大,原因之一是训练集中能够带来大幅QED改善的替换本就稀少。这一结果也提示,条件生成模型并不保证精确达到输入目标,它更像是在已有化学空间中寻找最接近要求的可行改动。
 
第三组任务要求降低合成可及性评分SAscore,同时尽量维持较高QED。需要注意,SAscore越低,通常表示预计越容易合成。当目标是将SAscore降低0.5或1.0时,实际平均变化为-0.424和-0.719,而QED平均仅下降0.026和0.028。模型没有完全达到设定幅度,但在两个相互牵制的代理指标之间取得了较好的平衡。
 





图2|性质条件会改变模型选择的替换位置,橙色表示提高logP、蓝色表示降低logP,模型针对同一分子选择不同删除片段,并生成分子量相近而脂溶性方向相反的结构。
 


这些结果背后的重要变化,是模型开始共同决定改哪里和怎么改。以论文中的CHEMBL5434005为例,当目标是提高logP时,模型倾向替换亲水性的羧酸基;当目标变为降低logP时,更常选择氯苯片段。也就是说,模型不是先由人固定一个修改位置,再在有限列表中挑替代物,而是让替换位点本身随优化目标变化。这更接近药物化学家在实际项目中的思考方式。
 


在数据库没有现成答案时扩展候选空间
 
数据库挖掘方法的局限在罕见片段上尤为明显。团队建立的140,096个片段中,有98,459个片段在数据库里对应的已知生物电子等排体不超过10个。以4-氮杂吲哚片段为例,匹配分子对数据库只能找到4种替代片段,而且大多只是重原子略有差别的稠合杂环,能够探索的结构空间非常有限。
 
研究人员固定4-氮杂吲哚为删除片段,并要求替换前后QED保持不变。DeepBioisostere从完整片段库中生成50个新结构,排名靠前的候选不仅包括六元环与五元环稠合体系,还出现了两个六元环组成的体系。它们与原片段结构并不完全相似,却保留了相近的氢键位点、芳香环数量和脂溶性,生成分子的QED也集中在原分子附近。这说明模型有机会提出数据库中没有直接记录、但在当前分子环境下可能发挥类似功能的替换方案。
 





图3|罕见片段的替换探索。数据库仅给出少量相近稠合杂环;DeepBioisostere进一步提出结构更为多样的候选,并使替换后分子的QED接近原分子。
 


先导优化
 
论文最后将DeepBioisostere接到Pocket2Mol、DeepICL、TargetDiff和DecompDiff四种结构基础3D分子生成模型之后。作者从CrossDocked2020测试集中选择3个靶点,专门挑出QED偏低、SAscore偏高的计算生成分子,再要求DeepBioisostere提高QED、降低SAscore并尽量保持对接分数。
 
在PDB靶点4RV4上,DeepBioisostere处理四类模型生成分子后,同时满足QED改善、SAscore改善和对接分数保持的联合成功率分别为0.56、0.56、0.72和0.68。相比之下,随机、频次和匹配分子对分析三类替换策略的联合成功率多为0.06—0.36。单独看对接分数,各种策略普遍都能保持较高成功率;真正拉开差距的是能否在保留对接结果的同时改善另外两个性质。
 





图4|虚拟hit-to-lead案例,两个DeepICL生成分子经片段替换后,QED提高、SAscore降低,同时计算对接分数基本保持。粉色为原片段,紫色为替换片段。
 


这组实验展示了一个值得关注的组合思路:3D生成模型负责提出与蛋白口袋匹配的初始结构,DeepBioisostere再处理类药性和合成复杂度等问题。它不是取代前端生成模型,而是充当下游的“结构修整器”,使分子向先导化合物要求靠近。
 
但论文所称的hit-to-lead仍是虚拟流程。QED和SAscore是启发式指标,对接分数也不能等同于真实结合亲和力;所谓“保持活性”,在该部分实际上是保持计算对接结果,而不是经过生化实验验证。数据构建虽然使用同一测定中的活性分子对来学习替换规律,却仍难覆盖不同靶点、构象、立体化学和ADMET终点。作者也提出,未来需要通过多任务学习和迁移学习,将易获得的QED、logP和SAscore知识转移到标签更稀缺、噪声更高的ADMET性质上。
 


总结
 
DeepBioisostere的价值,不在于把分子生成规模继续做大,而在于把药物设计中的一种经典操作转化为可条件控制的完整决策。它将修改位点、替换片段和连接方式纳入同一流程,并显式考虑完整分子环境,使模型能够在多个目标之间寻找折中,也能为罕见片段提出数据库之外的候选。这项工作同时揭示了当前AI分子优化的边界:模型已经能够在计算指标上进行有方向的精细修改,但距离“自主完成先导优化”仍缺少合成、活性、选择性和ADMET实验闭环。更现实的定位,是把DeepBioisostere视为药物化学家的候选方案生成与优先级排序工具。它可以扩大可考虑的替换空间、减少对固定规则的依赖,并帮助研究人员更快提出值得验证的结构;最终哪些替换真正有效,仍要由实验和项目语境作出判断。
 
参考链接:https://doi.org/10.1038/s41467-026-75512-9
 
本文转载于智药邦:https://mp.weixin.qq.com/s/V6J_F913vKN7WplrcNyLyQ

81
0
0
0
关于作者
相关文章
  • AI利用物理感知生成金属微结构:一种新的材料逆向设计方法 ...
    金属材料的性能,很大程度上写在微结构里。晶粒大小、形貌以及晶体取向共同决定材料在受力时如何 ...
    了解详情 
  • TrajCast:自回归等变网络驱动的无力场分子动力学新框架 ...
    研究背景与科学挑战分子动力学(Molecular Dynamics, MD)模拟作为现代科学研究的核心工具,已被 ...
    了解详情 
  • 量子+AI横扫高熵合金:同时强韧、高强、耐腐蚀的新材料诞生 ...
    本文解读npj Computational Materials 2026的研究,提出QaML框架,将特征选择、支持向量机训练与 ...
    了解详情 
  • 告别“分布坍缩”—— 首个基于流匹配的蛋白质设计框架 ProtFlow ...
      在蛋白质工程领域,设计具有特定功能的全新蛋白质序列是一项核心且极具挑战的任务。传统的生 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas