2026年8月10日,来自洛桑联邦理工学院(EPFL)和强生(Johnson & Johnson)的研究人员在Nature Computational Science上发表题为Robust out-of-distribution prediction of Buchwald-Hartwig reactions的研究论文,通过系统整合高通量实验(HTE)数据与主动学习(active learning)策略,构建了能够对全新底物和反应条件进行可靠预测的机器学习模型,并成功通过实验验证了其在实际药物合成中的应用价值。

Buchwald-Hartwig(BH)交叉偶联反应是现代药物合成中不可或缺的工具,广泛应用于(杂)芳基胺类化合物的合成。然而,对其反应结果进行预测建模一直面临数据质量和化学空间覆盖度的双重挑战。电子实验室笔记本(ELN)中的数据异构、噪声大,且缺乏负例数据,而开源的高通量实验数据集则碎片化严重、范围狭窄,导致模型在面临未见过的底物和反应条件时性能急剧下降。面对这一困境,该研究团队提出的核心思路是:通过对分散的多源反应数据集进行系统标准化和整合,构建一个高质量、唯一结构对应唯一实体的统一数据集,再结合主动学习策略,利用模型不确定性指导新实验的设计,从而战略性地扩展化学空间覆盖度。这一思路的突破性在于,它不再被动地依赖既有数据集的规模,而是通过主动的、数据驱动的实验设计,以最小的实验成本实现对未知化学空间的高效探索。
在研究方法上,该团队采用了一套完整的数据生成与建模流程。他们首先利用自动化HTE平台,在96孔板和384孔板中执行了超过11,300个反应,并通过超高效液相色谱-质谱-电雾式检测器(UPLC-MS-CAD)进行定量分析。同时,他们系统收集并标准化了所有已发表的开源BH HTE数据集,将总计约27,500个反应统一为二元分类框架(以10%产率为阈值),解决了不同定量方法(如CAD、分离产率、MisER等)之间的可比性问题。在建模方面,他们训练了六种机器学习模型,使用了两种特征表示——差异反应指纹(DRFP)和理化属性向量,以及一种基于SMILES的AI模型,并在分布外(OOD)测试集上进行了严格评估。以下将按照研究的主要成果分别阐述。
数据整合与主动学习驱动模型迭代
在第一阶段,研究团队围绕信息集(informer set)、结构多样性标准、空间密度标准和非期望子结构过滤四项原则设计初始实验,搭建基线模型。在后续迭代中,团队采用模型指导的实验设计策略,优先选择模型不确定性高的反应开展验证,以不确定性为导向探索新的化学空间。经过三轮主动学习迭代,研究累计获得11300个高质量反应数据,构成目前已发表文献中规模最大、覆盖最全面的BH HTE数据集,模型性能随数据多样性扩展持续提升。

图1 项目总体概览

图2 自动化与HTE驱动的模型构建
OOD测试揭示数据多样性的关键作用
研究团队通过严格的分布外测试取得了核心发现。他们基于差异反应指纹(DRFP)对所有反应进行k-means聚类,共划分为12个簇;测试仅在训练数据未覆盖的簇上开展,同时排除所有测试集中底物出现在训练集的情况,构建了严格的OOD评估条件。结果显示,模型的OOD预测性能并非主要由数据集规模决定,而是由此前未被揭示的数据多样性与预测精度的关联关系所决定。研究团队提出一项全新的数据中心指标——化合物-反应多样性评分(CRDS),该指标综合了独特反应物对数量、独特试剂组合数量与数据集规模三项维度。在难度最高的OOD测试中,CRDS与模型ROC AUC的Pearson 相关系数达到0.79,而数据集规模本身的相关系数仅为0.60。这一发现挑战了 “数据集越大泛化能力越强” 的传统认知,表明对反应空间的战略性、多样性覆盖,才是实现鲁棒预测的核心驱动力。

图3 基于数据源的模型指标评估
表1 CRDS、简化CRDS和训练数据集规模与ML模型在OOD簇中反应合成成功预测性能之间的Pearson和Spearman相关性

模型不确定性校准与高置信度OOD预测
利用置信度指标,可以将任何给定底物对的试剂组合按成功可能性进行排序。研究发现,一个相对简单的随机森林(RF)模型,在经妥善整理的数据集上训练后,在高置信度OOD预测中达到了超过90%的ROC AUC。这表明,模型架构的复杂性可能不如此前认为的那样关键,至少在单一反应类型、约27,500个样本的化学空间内是如此。进一步分析表明,特征表示的选择对OOD性能的影响大于顶级ML模型之间的选择,当特征表示能够清晰编码相关化学信息时,简单的模型足以胜任。

图4 模型不确定性校准与OOD预测的置信度分箱性能
实验验证:从挽救失败反应到前瞻性预测
两个实验验证了模型的实际应用价值。第一个实验针对11个历史上失败的芳基卤化物-胺底物组合,利用模型作为试剂推荐工具,从1,092种试剂条件组合中为每个底物对推荐排名前四的条件进行实验测试。在44个反应中,有27个成功(产率>10%),为11个底物中的10个(91%)提供了可行的合成路线。第二个实验是前瞻性验证,从约2.46×10¹¹个可能的BH反应中,选择完全新颖的芳基和胺组合进行测试。与基线组的约19%成功率相比,模型中等置信度(<0.85)预测的反应成功率为21%,富集倍数为1.11,而高置信度(>0.85)预测的反应成功率达到了33%,富集倍数为1.64。这两个实验共同验证了模型在识别有效反应条件方面的卓越能力,无论是在挽救失败反应还是在探索未知化学空间时。

图5 实验验证
总结
总结而言,这篇论文的核心贡献在于建立了一个统一、经主动筛选打磨的机器学习框架,实现了BH交叉偶联反应的鲁棒OOD预测。研究的主要可取之处包括:第一,通过系统标准化和整合多源HTE数据,创建了目前文献中最大、最全面的BH HTE数据集;第二,提出了CRDS这一新的数据中心指标,揭示了数据多样性而非数据集规模是驱动OOD性能的关键因素;第三,通过两项实验验证(挽救失败反应和前瞻性预测),充分证明了模型的实际应用价值;第四,发现简单的RF模型在适当的数据和特征表示下即可达到卓越性能,为实际部署提供了经济可行的方案。
然而,该研究也存在一些不足:首先,模型仅覆盖了训练中涉及的32种钯预催化剂、12种碱和12种溶剂,对全新试剂类别的预测需谨慎解读;其次,10%产率的二元分类阈值无法提供定量产率信息,且不同数据源的产率定量方法存在差异;最后,CRDS的权重系数是针对BH反应经验拟合的,对其他反应类型需要重新校准。
未来的研究方向包括:整合更多HTE数据和更丰富的反应上下文表示以进一步提升预测能力,开发能够处理噪声ELN数据的算法,以及将预测框架扩展到其他反应类型,最终实现跨反应类型的全局预测模型。
参考资料:
https://doi.org/10.1038/s43588-026-01017-6 |