ConfRetro:融合3D构象与距离注意力Transformer的模板自由逆向合成

超能小量子
2026-08-18 18:10:35
人工智能
生命科学
技术教程

202685日,来自华东师范大学、上海分子智能合成前沿科学中心的钱莹与周爱民团队在Bioinformatics上发表题为ConfRetro: A 3D-aware Template-free Method for Enhancing Retrosynthesis via Molecular Conformer Information的研究论文,提出了一个名为ConfRetroTransformer-based模板自由方法,通过整合分子构象者信息和空间结构来增强逆向合成预测,在多个基准数据集上达到了模板自由方法中的最佳性能。





背景


逆向合成(retrosynthesis)是有机合成和药物发现中的核心问题,其目标是根据目标产物分子找到一组能够合成它的反应物。近年来,基于深度学习的模板自由方法将逆向合成视为序列到序列的机器翻译任务,取得了显著进展,但这些方法主要依赖一维SMILES序列或二维分子图,缺乏对分子三维空间结构的显式建模。这种三维信息的缺失可能导致模型在预测涉及立体化学和空间约束的复杂反应时出现偏差,尤其是对于含有多个手性中心、稠环或杂环的分子,预测结果往往在化学上不够合理。因此,如何将三维构象信息有效整合到逆向合成模型中,成为一个亟待解决的关键问题。


面对这一挑战,ConfRetro的核心思路是在Transformer框架中引入分子三维构象信息,通过两个关键模块——原子对齐融合和距离加权注意力——分别解决三维特征与序列特征的对齐问题以及注意力机制中空间约束的建模问题。与以往仅依赖一维或二维表示的方法不同,ConfRetro首次在模板自由逆向合成中系统性地引入了三维几何信息,并且通过设计精巧的注意力机制,使模型能够根据原子之间的三维距离重新分配注意力权重,从而更准确地捕捉化学上相关的原子对。这一思路的创新性在于,它不是在输入层面简单拼接三维特征,而是通过原子级别的对齐和注意力权重的重新分配,将三维信息深度融入模型的编码过程,使得模型能够学习到更加丰富和化学合理的分子表示。


在研究方法上,作者构建了一个基于Transformer的编码器-解码器架构,通过三个关键模块来整合三维构象信息,分别在USPTO-50KUSPTO-FULL数据集上进行了系统评估。以下将按照方法对应的研究结果分别阐述。


原子对齐融合模块实现序列与三维表示的对齐


最直接的特征融合方法是将一维和三维表示进行拼接,但这会破坏原子令牌与其对应三维表示之间的对齐关系。为了解决这一问题,作者设计了原子对齐融合模块。该模块首先使用ComENet从分子构象者中提取每个原子的三维位置嵌入,然后通过零填充的方式将原子数量扩展为SMILES令牌数量,确保非原子令牌对应的三维嵌入为零。最后,通过两个可训练参数自适应地融合SMILES令牌嵌入和三维位置嵌入,从而在保持原子级别对齐的前提下整合三维信息。在USPTO-50K数据集上的消融实验显示,加入该模块后,模型在Top-1准确率上提升了0.5个百分点(从53.5%提升到54.0%),同时SMILES有效性也有所提高,表明原子级别的对齐确实有助于模型更准确地捕捉三维结构信息。


Image


1 ConfRetro基于Transformer的架构概览


距离加权注意力机制引导空间注意力分配


Transformer中的多头注意力机制在捕捉化学知识方面存在不足,而分子内原子之间的三维距离反映了原子对在物理化学中的空间关系,如键能、稳定性和原子间作用力。作者将注意力头分为正常注意力头和空间注意力头,前者按照传统方式学习序列全局信息,后者则利用原子间三维距离作为外部注意力权重,实现基于距离的注意力重新分配。具体而言,首先从分子构象者中构建距离矩阵,然后通过高斯核函数将距离映射到高维空间,再经过非线性层得到三维距离权重。在空间注意力头中,该权重与标准注意力分数进行逐元素相乘,从而约束每个原子的感受野(receptive field),使其更关注空间上邻近的原子。此外,该模块还通过一个全连接层逐层精炼三维距离权重,使其能够根据更新后的上下文信息进行调整。消融实验结果表明,加入距离加权注意力后,模型在Top-1Top-10的准确率上均有显著提升,且在大k值(即Top-5Top-10)上的提升更为明显,说明该模块有助于模型在更大的候选集中保持高质量预测。


SMILES对齐模块增强交叉注意力


在化学反应中,大多数原子在反应前后保持不变,因此可以利用原子映射构建产物与反应物之间的对应关系。作者将这种原子层次的对齐关系转化为SMILES令牌之间的对齐映射(SMILES Alignment Map, SAM),并在解码器的最后一层交叉注意力中引入引导损失,鼓励模型加强对应令牌之间的注意力权重。消融实验显示,加入SMILES对齐后,各Top-k准确率均有提升,尤其是Top-5Top-10的提升更为显著,表明该模块在波束搜索解码过程中起到了稳定和解锁的作用。


1 USPTO-50K数据集上逆向合成预测的Top-k准确率


Image


2 USPTO-50K数据集上Top-k SMILES有效性与往返准确率


Image


USPTO-FULL数据集上验证可扩展性与泛化能力


为了进一步验证模型在大规模、多样化化学空间中的表现,作者在USPTO-FULL数据集(包含超过100万条原子映射反应,无反应类标签)上进行了评估。ConfRetroTop-1/3/5/10准确率上分别达到51.7%69.2%74.5%79.7%,在模板自由方法中取得了最佳性能,相比此前最强的NAG2G模型分别提升了2.04.65.24.3个百分点。这一结果说明,ConfRetro不仅在小规模基准数据集上表现优异,在大规模、更具噪音和多样性的真实场景中同样保持了优势。


消融实验验证各模块贡献


作者通过逐步添加各模块的消融实验,定量分析了每个模块的贡献。基线模型(不含任何模块)的Top-1准确率为50.9%,单独加入SMILES对齐后提升至53.5%,进一步加入原子对齐融合后提升至54.0%,加入距离加权注意力后提升至54.8%,而三个模块组合后的完整模型达到56.2%。同时,SMILES有效性也从99.1%逐步提升至99.8%。此外,作者通过一系列控制实验进一步确认,性能提升确实来源于三维几何信息而非其他因素:将真实构象者替换为随机坐标后,Top-1准确率从56.2%下降至53.4%,而移除距离项后同样下降至53.0%,说明真实的二维距离是性能提升的关键因素。


案例研究展示复杂分子上的预测能力


为了验证ConfRetro在处理具有复杂空间结构的分子时的表现,作者选取了四类代表性分子进行案例研究,包括多手性分子、杂芳香族分子、稠环/桥环分子和复合型分子。结果显示,ConfRetro能够在Top-1Top-2预测中给出合理的反应物,而缺乏三维信息的Transformer模型则难以生成准确的预测,甚至在某些情况下无法生成有效的SMILES。以复合型分子为例,ConfRetroTop-1就成功预测出了正确的反应物,而TransformerTop-3预测中全部生成了无效的SMILES。在与另一个三维感知方法NAG2G的定量比较中,ConfRetro在所有四个类别和所有Top-k值上均表现更优,尤其是在多手性分子这一最难类别上,优势最为明显。


Image


2 复杂结构的案例研究 


Image


3 ConfRetroNAG2GVanilla Transformer在四类复杂分子上的定量比较


合成路线规划验证实际应用价值


为了展示ConfRetro在实际多步合成路线规划中的潜力,作者以喜树碱作为测试案例,该分子是一个结构复杂的抗癌天然产物,具有稠环体系和多个手性中心。将ConfRetro作为单步预测器迭代应用于喜树碱的逆合成分析,最终得到的合成路线与文献报道的合成路线高度吻合。在12个逆合成步骤中,ConfRetroTop-6预测内全部恢复了文献中的前体分子,而同样使用三维输入的NAG2G仅恢复了4步,且主要集中在末端构建块的断开步骤,遗漏了多个早期环系构建步骤。这一结果进一步说明,ConfRetro的性能优势不仅来源于使用了三维输入,更来源于如何利用三维信息——即原子对齐融合和距离加权注意力这两个核心设计。


Image


4 喜树碱多步逆合成预测结果


Image


5 ConfRetroNAG2G在喜树碱合成路线上的对比


总结与展望


这篇论文的主要贡献在于提出了ConfRetro,一个端到端的Transformer模型,通过原子对齐融合和距离加权注意力两个核心模块,将三维构象信息有效整合到逆向合成预测中。该研究的主要可取之处包括:第一,首次在模板自由逆向合成方法中系统性地引入三维构象信息,并通过精心设计的模块实现了深层次融合;第二,在多个基准数据集上取得了模板自由方法中的最佳性能,在SMILES有效性和往返准确率上也有显著提升;第三,通过消融实验和控制实验,严谨地验证了三维几何信息是性能提升的根本原因,而非模型参数增加或数据增强的副产品;第四,在实际药物分子的多步合成路线规划中展示了应用潜力。


然而,该研究也存在一些不足:首先,模型依赖RDKit生成的单一构象者,而分子在溶液中实际上存在多个构象,这可能导致模型对构象生成过程的不确定性敏感;其次,尽管在USPTO-FULL上取得了良好效果,但该数据集中的反应类型仍然有限,对于全新的化学反应类型,模型的泛化能力有待进一步验证;最后,模型在训练过程中需要原子映射信息,这在一定程度上限制了其在缺乏原子映射数据场景下的应用。


未来的研究方向包括:探索多构象集成或动态构象采样策略以提高模型对构象不确定性的鲁棒性,将模型扩展到更大规模、更多样化的反应数据集,以及开发无需原子映射的训练策略以扩大模型的适用范围。



参考资料:


https://doi.org/10.1093/bioinformatics/btag575


16
0
0
0
关于作者
相关文章
  • 基于残基相互作用的GAT模型:识别非同源蛋白口袋隐藏药物靶点 ...
    了解详情 
  • 伊辛机求解无线资源分配问题:从QUBO建模到MIMO波束赋形与无人机 ...
    组合优化是无线通信资源分配中的核心挑战,许多实际问题如信道分配、功率控制、用户调度等均可归 ...
    了解详情 
  • 基于流匹配的反应路径生成:MolGEN框架实现过渡态与产物的统一高 ...
    化学反应机理的阐明依赖于对过渡态(TS)和产物的高效生成。传统方法如攀爬图像微推弹性带法(CI ...
    了解详情 
  • Chemeleon2:强化学习引导生成模型发现新型晶体结构 ...
    本研究将强化学习引入晶体生成模型,用奖励函数替代似然目标,让模型从"模仿已知材料"转向"主动 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas