本文介绍了Vinod与Zaspel发表于《Journal of Chemical Theory and Computation》(2026)的LFaB(Low Fidelity as Bias)方法,针对量子化学等计算密集型领域中主动学习(AL)的偏差-方差权衡问题提出新范式。传统基于方差的AL策略常因误差主导项为偏差而失效甚至不及随机采样,LFaB从偏差-方差分解出发,利用多保真度机器学习思想,以低成本低保真度(如HF、MP2)标签作为高保真度(如CCSD(T))偏差的代理,用模型在低保真度上的预测残差指导样本选择。研究以高斯过程回归为基模型,在QM7b(原子化能)、VIB5(势能面)、QeMFi(激发能)数据集验证,LFaB显著优于方差类方法与随机采样,在VIB5上近乎匹配贪婪最优上限,达同精度所需迭代减约2~5倍,训练数据消耗降达一个量级。校准曲线显示其偏差度量与真实误差强相关。该方法为高效化学构型空间采样提供即插即用方案,未来需探索保真度相关性边界及向神经网络等模型的推广。

研究背景与动机
机器学习(ML)代理模型已广泛应用于量子化学(QC)、药物发现等计算密集型领域,可替代昂贵的从头算计算并实现快速预测。然而训练数据的生成成本极高,因此如何以最少的训练样本获得最优模型性能,成为该领域的核心问题。
主动学习(Active Learning, AL)作为一类典型的样本选择策略,通过迭代地从未标注数据池中选取"信息量最大"的样本进行标注,理论上能够显著降低训练数据需求。在量子化学应用中,主流AL方法多采用基于方差(variance)的不确定性采样策略,例如利用高斯过程回归(GPR)的预测方差、神经网络集成的输出方差等。
然而一个长期困扰研究者的现象是:在许多实际场景下,基于方差的AL方法甚至不如纯随机采样。Vinod与Zaspel在最新发表于*J. Chem. Theory Comput.*的工作中,从偏差-方差分解的经典理论出发,揭示了这一悖论的本质原因,并提出了一种突破性的解决方案——低保真度作为偏差(Low Fidelity as Bias, LFaB) 方法。
核心洞察:从方差到偏差的范式转变
根据机器学习中经典的偏差-方差分解,模型预测误差可分解为偏差(bias)、方差(variance)与噪声三部分。作者的关键假设是:当方差驱动的AL方法失效时,预测误差的主导来源是偏差而非方差。在这种情况下,再多地降低方差也无法显著提升模型性能。
然而,直接计算模型偏差需要获取所有候选样本的真实标签,这与AL"避免昂贵标注"的初衷相矛盾。作者巧妙地借鉴了多保真度(multifidelity)机器学习与Δ-ML的思想,提出用低成本计算的低保真度标签作为高保真度偏差的近似代理。
具体而言,对于待预测的量子化学性质(如CCSD(T)精度的原子化能),可使用计算成本低得多的Hartree-Fock(HF)或MP2方法快速生成近似标签。LFaB方法以训练后模型在低保真度上的预测残差作为偏差代理量,以此指导主动学习的样本选择。

▲ Fig.1 | 采用低保真度作为偏差(LFaB)方法进行数值基准测试的工作流程图示。数值基准测试在三个数据集上开展,分别为QM7b、VIB5和QeMFi,对应于原子化能、从头算势能面和激发能。在计算量子化学性质(或标签)后,选取初始分子构型集用于训练GPR模型。已训练模型的不确定性,可以是t
图1展示了LFaB方法的整体工作流程:以初始小样本集训练GPR模型,对未标注数据池中的样本使用低保真度方法快速计算近似标签,将模型预测与低保真度标签之间的差异作为采样准则,迭代选择残差最大的样本进行高保真度标注并加入训练集。
方法学框架
研究采用高斯过程回归(GPR)作为基础模型,其优势在于天然提供预测均值与方差估计。GPR模型的复杂度直接与训练样本数量挂钩,便于通过学习曲线评估其性能演化。论文系统比较了五种采样策略:
1. 随机采样:作为基线对比; 2. GPR方差采样:选取预测方差最大的样本; 3. 集成方差采样:基于Bootstrap聚合的多模型集成方差; 4. LFaB采样:以低保真度残差为采样准则; 5. 贪婪最优采样(greedy-optimal):作为理论上限,需借助全部候选样本的真实标签,实际不可行。
贪婪最优采样代表了AL在理论上能够达到的最佳性能,是评估其他方法接近最优性能程度的标尺。
数值实验结果
研究团队在三个具有代表性的量子化学数据集上进行了系统性验证:QM7b(原子化能预测)、VIB5(CH₃Cl与CH₃F的从头算势能面)以及QeMFi(多种分子的激发能预测)。

▲ Fig.2 | 采用不同主动学习采样技术对QM7b数据集进行原子化能预测的学习曲线。对于LFaB方案,低保真度通过量子化学方法的选择来表达,各面板分别展示不同基组的选择。因此,高保真度为CCSD(T),低保真度为HF或MP2。右侧图中的参考虚线表明,采用LFaB采样方案可减少所需主动学习迭代次数
图2展示了QM7b数据集上原子化能预测的学习曲线。以CCSD(T)为高保真度,分别采用HF或MP2作为低保真度。结果显示LFaB方法相对随机采样和GPR方差采样均有显著优势,达到相同精度所需主动学习迭代次数减少约2倍,且对低保真度方法的选择(HF或MP2)表现稳健。

▲ Fig.3 | 学习曲线显示了来自VIB5数据库的CH3Cl和CH3F从头算势能面预测的预测误差(以MAE衡量)随训练样本数量的变化情况。每条学习曲线采用不同的主动学习采样方案。在预测误差方面,LFaB方法优于随机采样训练数据的方式。此外,其预测误差与贪婪最优采样方法几乎相同,优于GPR方差和
图3显示了VIB5数据集上从头算势能面预测的学习曲线。在CH₃Cl和CH₃F两种分子上,LFaB方法的预测误差曲线几乎与贪婪最优采样完全重合,明显优于随机采样、GPR方差与集成方差等所有传统方法。

▲ Fig.4 | 来自QeMFi数据集的多样化分子激发能预测的学习曲线。每个数据点均在采用相应采样方案完成一轮主动学习后添加。LFaB指标括号中的术语表示所使用的较低保真度,在本例中对应于进行量子化学计算时所选用的基组。同时展示了随机采样方法以作对比,这是通常采用的常见方法
图4进一步验证了LFaB在QeMFi数据集上预测激发能任务中的表现。在不同分子与不同低保真度选择下(以基组大小区分保真度等级),LFaB方法均显著超越方差类方法和随机采样,所需迭代次数最多可减少5倍以上,体现了方法的良好普适性。
选样行为分析:与贪婪最优的高度一致性
为深入理解LFaB为何能逼近贪婪最优表现,作者使用库仑矩阵(CM)描述符的主成分分析(PCA)对采样行为进行了可视化对比。

▲ Fig.5 | 本研究所选分子的PCA散点图,展示了贪婪最优方法和LFaB方法在前500次迭代中选择的数据点。两种方法共同选择的点单独标注。坐标轴经过缩放,使CM分子描述符的前两个主成分(PC-1和PC-2)落在单位值范围内。LFaB方法选择的数据点几乎与贪婪最优方法完全一致。这表明新颖的LFaB方法与贪婪最优方法效果相当
图5的PCA散点图揭示了一个关键现象:LFaB方法选择的样本与贪婪最优方法选择的样本在主成分空间中高度重合,绝大多数样本被两种方法同时选中。这表明,低保真度残差能够准确捕捉到模型在高保真度上的真实误差分布模式,从而引导AL选择真正"信息量最大"的样本。
这一发现具有重要的方法论意义:它说明在多保真度学习的框架下,不同保真度之间的误差结构具有强相关性,使得低成本的近似可可靠地代理高成本的真实信息。这一性质也是Δ-ML和多保真度学习方法成功的内在基础。
校准曲线分析

▲ Fig.6 | 本研究所用数据集中所选分子在留出测试集上已训练模型的不确定性与经验误差(以MAE计算)的关系。这些曲线也称为校准曲线。点的颜色方案对应于主动学习迭代次数。LFaB和GPR方差均以归一化单位报告。左轴对应LFaB,右轴对应GPR方差。CH3Cl的曲线对应于a的预测
图6展示了模型校准曲线——即模型不确定性度量与测试集经验误差(MAE)之间的关系。理想的校准曲线应呈现单调线性关系,表明不确定性度量能够准确反映真实预测误差。
结果显示,LFaB采用的偏差度量与经验误差呈现近乎完美的线性相关性,明显优于GPR方差度量。这从校准角度进一步证实了LFaB作为不确定性度量的合理性与可靠性,也揭示出传统方差度量在某些场景下与真实误差脱钩,正是基于方差的AL方法表现欠佳的根本原因。
创新贡献与意义
本工作的核心贡献可总结为以下三个层面:
理论层面:从偏差-方差分解的视角,明确指出了基于方差的AL方法在高偏差主导场景下的失效机制,为AL领域提供了新的理论分析框架。 方法层面:提出了简洁而高效的LFaB方法,巧妙利用多保真度量子化学计算的天然分层结构,将低成本的低保真度数据转化为偏差代理,无需修改模型架构即可显著提升AL效率。 应用层面:在原子化能、势能面、激发能三类代表性任务上系统验证了方法的普适性,最多可将训练数据消耗降低一个数量级,对降低量子化学机器学习的整体计算开销具有重要现实意义。
局限性与展望
尽管LFaB展现出优异性能,仍存在若干值得进一步探索的问题。首先,方法的有效性依赖于低保真度与高保真度之间存在合理的相关性,对于两者差异极大的体系,其性能可能受限。其次,目前的验证主要基于GPR模型,将其推广到神经网络等参数化模型仍需进一步研究,特别是如何在NN框架下高效计算低保真度残差并融入主动学习循环。此外,对于"何为最佳低保真度选择"这一问题,目前更多依赖经验判断,仍缺乏系统的理论指导。
未来研究可从以下方向展开:探索LFaB与多保真度建模(如多任务学习、Δ-学习)的有机结合;将该框架推广至材料科学、分子动力学等更广泛的领域;研究自适应保真度切换策略以进一步优化计算成本。
结语
Vinod与Zaspel的这项工作为量子化学机器学习的高效训练数据生成提供了一个既理论扎实、又实用便捷的新方案。其"以偏差替代方差"的思路不仅适用于量子化学,对更广泛的科学机器学习领域同样具有重要启示意义。对于在数据稀缺、标注昂贵场景下工作的研究者,LFaB提供了一个简单、即插即用的工具,有望显著降低机器学习辅助科学研究的整体开销,推动数据驱动方法在物理化学、材料设计等领域的进一步深入应用。
参考文献:Vivin Vinod* and Peter Zaspel. LFaB: Low Fidelity as Bias for Active Learning in the Chemical Configuration Space Journal of Chemical Theory and Computation (2026) https://doi.org/10.1021/acs.jctc.6c00009
原文地址:https://doi.org/10.1021/acs.jctc.6c00009
代码地址:https://github.com/SM4DA/LFaB
|