Buchwald-Hartwig反应的鲁棒性分布外预测

超能小量子
2026-08-24 18:29:16
人工智能
量子科普

2026810日,来自洛桑联邦理工学院(EPFL)和强生(Johnson & Johnson)的研究人员在Nature Computational Science上发表题为Robust out-of-distribution prediction of Buchwald-Hartwig reactions的研究论文,通过系统整合高通量实验(HTE)数据与主动学习(active learning)策略,构建了能够对全新底物和反应条件进行可靠预测的机器学习模型,并成功通过实验验证了其在实际药物合成中的应用价值。



Image


Buchwald-HartwigBH)交叉偶联反应是现代药物合成中不可或缺的工具,广泛应用于(杂)芳基胺类化合物的合成。然而,对其反应结果进行预测建模一直面临数据质量和化学空间覆盖度的双重挑战。电子实验室笔记本(ELN)中的数据异构、噪声大,且缺乏负例数据,而开源的高通量实验数据集则碎片化严重、范围狭窄,导致模型在面临未见过的底物和反应条件时性能急剧下降。面对这一困境,该研究团队提出的核心思路是:通过对分散的多源反应数据集进行系统标准化和整合,构建一个高质量、唯一结构对应唯一实体的统一数据集,再结合主动学习策略,利用模型不确定性指导新实验的设计,从而战略性地扩展化学空间覆盖度。这一思路的突破性在于,它不再被动地依赖既有数据集的规模,而是通过主动的、数据驱动的实验设计,以最小的实验成本实现对未知化学空间的高效探索。


在研究方法上,该团队采用了一套完整的数据生成与建模流程。他们首先利用自动化HTE平台,在96孔板和384孔板中执行了超过11,300个反应,并通过超高效液相色谱-质谱-电雾式检测器(UPLC-MS-CAD)进行定量分析。同时,他们系统收集并标准化了所有已发表的开源BH HTE数据集,将总计约27,500个反应统一为二元分类框架(以10%产率为阈值),解决了不同定量方法(如CAD、分离产率、MisER等)之间的可比性问题。在建模方面,他们训练了六种机器学习模型,使用了两种特征表示——差异反应指纹(DRFP)和理化属性向量,以及一种基于SMILESAI模型,并在分布外(OOD)测试集上进行了严格评估。以下将按照研究的主要成果分别阐述。


数据整合与主动学习驱动模型迭代


在第一阶段,研究团队围绕信息集(informer set)、结构多样性标准、空间密度标准和非期望子结构过滤四项原则设计初始实验,搭建基线模型。在后续迭代中,团队采用模型指导的实验设计策略,优先选择模型不确定性高的反应开展验证,以不确定性为导向探索新的化学空间。经过三轮主动学习迭代,研究累计获得11300个高质量反应数据,构成目前已发表文献中规模最大、覆盖最全面的BH HTE数据集,模型性能随数据多样性扩展持续提升。


Image


1 项目总体概览


Image


2 自动化与HTE驱动的模型构建


OOD测试揭示数据多样性的关键作用


研究团队通过严格的分布外测试取得了核心发现。他们基于差异反应指纹(DRFP)对所有反应进行k-means聚类,共划分为12个簇;测试仅在训练数据未覆盖的簇上开展,同时排除所有测试集中底物出现在训练集的情况,构建了严格的OOD评估条件。结果显示,模型的OOD预测性能并非主要由数据集规模决定,而是由此前未被揭示的数据多样性与预测精度的关联关系所决定。研究团队提出一项全新的数据中心指标——化合物-反应多样性评分(CRDS),该指标综合了独特反应物对数量、独特试剂组合数量与数据集规模三项维度。在难度最高的OOD测试中,CRDS与模型ROC AUCPearson 相关系数达到0.79,而数据集规模本身的相关系数仅为0.60。这一发现挑战了数据集越大泛化能力越强的传统认知,表明对反应空间的战略性、多样性覆盖,才是实现鲁棒预测的核心驱动力。


Image


3 基于数据源的模型指标评估


1 CRDS、简化CRDS和训练数据集规模与ML模型在OOD簇中反应合成成功预测性能之间的PearsonSpearman相关性


Image


模型不确定性校准与高置信度OOD预测


利用置信度指标,可以将任何给定底物对的试剂组合按成功可能性进行排序。研究发现,一个相对简单的随机森林(RF)模型,在经妥善整理的数据集上训练后,在高置信度OOD预测中达到了超过90%ROC AUC。这表明,模型架构的复杂性可能不如此前认为的那样关键,至少在单一反应类型、约27,500个样本的化学空间内是如此。进一步分析表明,特征表示的选择对OOD性能的影响大于顶级ML模型之间的选择,当特征表示能够清晰编码相关化学信息时,简单的模型足以胜任。


Image


4 模型不确定性校准与OOD预测的置信度分箱性能


实验验证:从挽救失败反应到前瞻性预测


两个实验验证了模型的实际应用价值。第一个实验针对11个历史上失败的芳基卤化物-胺底物组合,利用模型作为试剂推荐工具,从1,092种试剂条件组合中为每个底物对推荐排名前四的条件进行实验测试。在44个反应中,有27个成功(产率>10%),为11个底物中的10个(91%)提供了可行的合成路线。第二个实验是前瞻性验证,从约2.46×10¹¹个可能的BH反应中,选择完全新颖的芳基和胺组合进行测试。与基线组的约19%成功率相比,模型中等置信度(<0.85)预测的反应成功率为21%,富集倍数为1.11,而高置信度(>0.85)预测的反应成功率达到了33%,富集倍数为1.64。这两个实验共同验证了模型在识别有效反应条件方面的卓越能力,无论是在挽救失败反应还是在探索未知化学空间时。


Image


5 实验验证


总结


总结而言,这篇论文的核心贡献在于建立了一个统一、经主动筛选打磨的机器学习框架,实现了BH交叉偶联反应的鲁棒OOD预测。研究的主要可取之处包括:第一,通过系统标准化和整合多源HTE数据,创建了目前文献中最大、最全面的BH HTE数据集;第二,提出了CRDS这一新的数据中心指标,揭示了数据多样性而非数据集规模是驱动OOD性能的关键因素;第三,通过两项实验验证(挽救失败反应和前瞻性预测),充分证明了模型的实际应用价值;第四,发现简单的RF模型在适当的数据和特征表示下即可达到卓越性能,为实际部署提供了经济可行的方案。


然而,该研究也存在一些不足:首先,模型仅覆盖了训练中涉及的32种钯预催化剂、12种碱和12种溶剂,对全新试剂类别的预测需谨慎解读;其次,10%产率的二元分类阈值无法提供定量产率信息,且不同数据源的产率定量方法存在差异;最后,CRDS的权重系数是针对BH反应经验拟合的,对其他反应类型需要重新校准。


未来的研究方向包括:整合更多HTE数据和更丰富的反应上下文表示以进一步提升预测能力,开发能够处理噪声ELN数据的算法,以及将预测框架扩展到其他反应类型,最终实现跨反应类型的全局预测模型。



参考资料:



https://doi.org/10.1038/s43588-026-01017-6

109
0
0
0
关于作者
相关文章
  • ConfRetro:融合3D构象与距离注意力Transformer的模板自由逆向合 ...
    了解详情 
  • 基于残基相互作用的GAT模型:识别非同源蛋白口袋隐藏药物靶点 ...
    了解详情 
  • 伊辛机求解无线资源分配问题:从QUBO建模到MIMO波束赋形与无人机 ...
    组合优化是无线通信资源分配中的核心挑战,许多实际问题如信道分配、功率控制、用户调度等均可归 ...
    了解详情 
  • 基于流匹配的反应路径生成:MolGEN框架实现过渡态与产物的统一高 ...
    化学反应机理的阐明依赖于对过渡态(TS)和产物的高效生成。传统方法如攀爬图像微推弹性带法(CI ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas