化学反应机理的阐明依赖于对过渡态(TS)和产物的高效生成。传统方法如攀爬图像微推弹性带法(CI-NEB)和生长弦法虽然提供了强大的计算框架,但构建一个中等规模的反应网络往往需要数千个基元步骤和数百万次DFT单点计算,计算瓶颈极为突出。
近年来,扩散模型作为分子生成的前沿方法,通过学习逆向随机扩散过程将简单先验分布转化为复杂数据分布。TSDiff和OA-ReactDiff等方法已被用于生成反应网络中各基元反应的过渡态。然而,扩散模型依赖随机微分方程(SDE),其固有的随机噪声增加了训练难度、降低了采样效率,且条件采样需要复杂的任务特定引导方案。
流匹配(Flow Matching)提供了一种确定性替代方案。它学习常微分方程(ODE)的速度场,将先验分布连续传输到目标分布,以平滑、解析定义的流替代SDE公式,具有训练稳定、轨迹可控、采样快速等优势。本文提出的MolGEN框架正是基于这一范式,首次实现了由生成模型同时驱动过渡态和产物采样的端到端反应网络生成。

MolGEN框架设计
MolGEN采用条件流匹配框架,通过最优传输路径将标准高斯分布映射到化学分布。其核心架构基于消息传递神经网络(MPNN)。
▲ Fig.1 | 该过程将所有三种状态的键信息整合到反应消息中。类似地,对于反应产物生成任务,我们将反应物消息与产物插值消息拼接以形成反应消息。随后,模型将这些反应消息通过消息传递层来预测演化分布的速度场。MolGEN从标准高斯分布开始初始化,因此它还包含随机性。
如图1所示,对于过渡态生成任务,MolGEN将过渡态插值点的消息与反应物-产物对的消息拼接形成"反应消息",将三种状态的键信息整合在一起。对于产物生成任务,则拼接反应物消息与产物插值点消息。模型随后通过消息传递层预测驱动分布演化的速度场。
MolGEN从标准高斯分布起始,因此在确定性前向传播中仍包含随机性,其模拟的概率路径与扩散模型类似——均实现从高斯分布到复杂目标分布的变换。训练采用两个损失函数:流匹配损失用于衡量预测速度场与最优传输速度场之间的偏差;条件修正Jensen-Shannon散度损失则度量预测概率路径与最优传输概率路径的差异。
这一设计兼具扩散模型和流匹配两种范式的优势:通过最优传输路径采样实现约0.8秒的快速推理,同时能以更高精度生成过渡态和产物。
过渡态生成性能
研究者在Transition1x数据集上训练并评估MolGEN。该数据集包含11,961个反应,涉及至多7个重原子(C、N、O)和23个原子的体系,所有数据均以分子式分层划分。
MolGEN与TSDiff、OA-ReactDiff(扩散模型)和ReactOT(双端流匹配模型)进行了对比。关键区别在于:ReactOT将TS预测视为从反应物-产物中点到唯一TS的确定性映射,而MolGEN从高斯先验出发生成随机分布。这意味着MolGEN的生成发生在势能面的驻点附近,能够通过并行生成30个独立样本并选取最低能量构型来提升预测质量。
▲ Table 1 | 均方根距离(RMSD)和能垒误差的统计摘要
表1总结了各方法在均方根偏差(RMSD)、势垒高度误差、有效过渡态比例和更新TS比例等指标上的表现。MolGEN将过渡态几何预测误差降低至扩散模型的一半,同时采样时间缩减至亚秒级。值得注意的是,MolGEN还能发现比参考数据具有更低势垒的替代过渡态构型,这是双端流匹配模型所不具备的能力,凸显了其揭示前所未知反应通道的潜力。
反应产物生成
MolGEN利用相同的骨干网络进行反应产物生成,通过将反应物信息作为条件输入,从高斯先验中采样产物结构。该方法在top-k准确率指标上达到了与当前最优序列模型相当的水平,同时天然保持了质量守恒和电子守恒约束——这是序列模型难以保证的优势。
反应网络生成:γ-酮氢过氧化物分解案例
MolGEN最具实际意义的应用在于无模板的反应网络探索。研究者将其应用于γ-酮氢过氧化物(KHP)的分解网络,这是一个大气化学中的重要体系。


▲ Table 2 | γ-酮氢过氧化物(KHP)第一步反应的比较
表2展示了MolGEN与传统弦方法在KHP分解第一步中的对比。传统方法需要1,156次量子化学计算,而MolGEN仅需12次量子化学评估即可产生更多有效过渡态,并识别出一条比文献报道最低势垒更低的新分解路径。这一结果充分展示了生成式方法在反应网络探索中的巨大效率优势。
MolGEN的工作流程为:首先从给定反应物生成可能的产物,然后为每对反应物-产物生成过渡态,通过迭代展开即可构建完整的反应网络——整个过程无需模板、无需手工规则,完全由生成推理驱动。
总结与展望
MolGEN的主要贡献在于:(1)首次将流匹配范式成功应用于反应机理生成的完整流程;(2)以确定性最优传输路径替代随机扩散,实现亚秒级采样和更高几何精度;(3)统一了过渡态和产物的生成框架,使端到端反应网络探索成为可能;(4)在实际化学体系中展现了数量级的计算效率提升。
该研究的局限性在于当前训练数据仅涉及小分子体系(至多7个重原子),向更大分子体系和更复杂反应类型的扩展仍需验证。此外,生成的过渡态仍需少量量子化学验证以确保物理合理性。
对于从事计算化学和机器学习交叉研究的学者,MolGEN表明流匹配作为一种通用的生成范式,在化学空间探索中具有比扩散模型更优的效率-精度平衡,值得在更广泛的分子设计和反应发现任务中进一步探索。
参考文献:Tuo, P., Chen, J. & Li, J. Flow matching for reaction pathway generation. Nat Commun (2026). https://doi.org/10.1038/s41467-026-75654-w
|