本研究发表于《Science Advances》(2026),针对二维平带材料稀缺、传统筛选依赖高成本密度泛函理论(DFT)计算的瓶颈,提出了Struct2Flat高通量发现框架。团队首先构建物理启发的连续平坦度评分体系,融合能带色散与态密度双指标,通过贝叶斯优化确定权重,消除了人为阈值偏差;进而开发多模态深度学习模型,融合门控线图神经网络的结构编码与RoBERTa的文本编码,仅从晶体结构即可直接预测平坦度分数,无需预计算电子结构。将该模型应用于C2DB数据库超10000种未标注材料,结合kagome类亚晶格筛选,经DFT验证平带识别准确率达98%,成功发现Nb₃TeI₇、Cu₃AsO₄等新型拓扑非平庸平带材料。该工作为强关联量子材料的高效挖掘提供了可推广的方法论范式。

平带电子结构是凝聚态物理中最富想象力的领地之一。当电子能带色散趋于平坦,动能被压制到极致,电子间的库仑排斥便接管了游戏规则。这种"交通拥堵"式的物理图景下,关联量子现象层出不穷——从非常规超导到分数量子霍尔态,从拓扑序到量子自旋液体,平带几乎成为了强关联体系的代名词。kagome晶格、Lieb晶格、魔角扭转双层石墨烯,这些名字背后都隐藏着同一个物理内核:近乎零色散的平带。
然而一个令人尴尬的事实是,已知的平带材料实在太少了。传统的高通量发现方法需要逐材料运行密度泛函理论(DFT)计算能带结构,再人为设定带宽阈值判定"平"与"不平"。这条路不仅计算量巨大,还背负着两个根本性缺陷:带宽阈值的选取高度主观——0.1 eV和0.3 eV的截断会筛出截然不同的候选集;而基于深度学习的分类器虽然聪明,仍需以DFT计算好的能带结构作为输入,对于尚未计算过的化学空间依旧束手无策。换句话说,整个领域长期缺少一种能直接从原子结构出发、无需预计算电子结构就能嗅到平带气息的通用方法。
2026年7月,西安交通大学王向文课题组在Science Advances上发表了一项工作,试图合上这道缺口。他们提出的Struct2Flat框架,将物理启发的连续平坦度评分与多模态图神经网络结合,仅凭晶体结构本身就能预测材料的平带倾向,并成功在C2DB数据库中筛选出多个此前未被报道的二维平带材料,其中98%的候选者经DFT验证确认真实平带特征。

▲ Fig.1 | 基于结构信息算法的二维材料平带相自动标注与识别框架。(A) 数据集标注与平坦度评分。结合带宽和态密度(DOS)特征的复合平坦度评分用于基于电子能带结构自动标注训练数据。(B) 多模态模型开发。基于结构和文本特征训练的多模态模型仅从晶体结构预测平坦度评分,其性能经过验证。
连续评分取代二元标签
Struct2Flat的第一个核心创新,是用连续评分函数替代传统的"带宽低于某阈值即为平带"的二元判定。评分体系由两个正交的物理指标复合而成。
动量空间色散指标关注能带的"胖瘦"。框架首先检测能带交叉点,将纠缠的能带结构拆分为连续的非交叉片段,重新连接后选取能量展宽最窄的路径作为代表性分支。随后通过余弦变换将原始带宽平滑映射到0到1之间的连续值——完全平坦的能带趋近于1,色散剧烈的能带趋近于0。态密度(DOS)指标则从另一个维度切入,捕捉平带系统最直观的实验指纹:能谱上陡然耸立的范霍夫奇点。在代表性能带中心能量附近设定局域窗口,计算窄窗口内平均DOS与宽参考范围DOS的对比度,归一化后同样得到连续分数。
两个子指标的融合遵循"双高原则"——只有色散约束和DOS峰同时突出的材料才能获得高总分。这是一种刻意保守的设计:单独在某个指标上刷高分是容易的,但真正有物理意义的平带必须在两个窗口下都经得起审视。两指标的组合权重并非人为拍定,而是通过贝叶斯优化从标注数据中自动学习,确保了评分体系与物理直觉的自洽。

▲ Fig.2 | 平坦度评分优化与电子结构数据分析。(A至C) 不同带宽窗口(0.1、0.3和0.5 eV)的箱线图,展示Stotal > 0的样本中Stotal的分布,按Sbandwidth(上图)和SDOS(下图)区间分组;颜色深浅反映各区间内的样本数量,以表征数据在各区间的均衡程度。(D) 三种不同带宽窗口(0.1、0.3和0.5 eV)下数据集级别质量指标的评估。
作者在2DMatPedia数据库中约5100种二维材料上校准了评分框架,对比了0.1、0.3和0.5 eV三种带宽窗口。0.3 eV最终被选定为最优平衡点——它在样本覆盖率、评分分辨率和物理约束强度三重目标之间取得了最佳折中。
图神经网络直接从结构预测平带
评分体系解决了标注问题,但真正的预测挑战在于:能否跳过DFT,直接从晶体结构推断平带特征?Struct2Flat给出的答案是肯定的。
模型架构由三条通路汇聚而成。结构编码支路采用门控线图神经网络,将原子的种类、坐标、键合拓扑以及晶格周期性全部编码为几何特征向量。文本编码支路基于RoBERTa架构,把材料的化学式、空间群等描述性信息转化为上下文语义表征。两条支路的输出通过双线性注意力机制进行模态融合——这不是简单的向量拼接,而是让结构和文本表征在注意力权重下进行交互,使模型学会"某个局部结构单元在某种化学语境下是否易于形成平带"。
在标注数据集上的验证结果显示,预测评分与真实评分之间呈现稳健的正相关性,尤其在高分区间的识别精度表现突出。这表明模型学到的不只是局部的键长键角分布,而是捕捉到了与平带形成相关的更高阶结构特征——例如亚晶格的几何阻挫模式。

▲ Fig.3 | 用于预测平坦度评分和评估模型性能的多模态架构。(A) 从晶体结构到平坦度评分预测的模型概览。原子结构通过门控线图神经网络进行编码,文本材料描述通过RoBERTa编码器处理。两种模态通过双线性注意力机制融合,生成连续的平坦度评分。(B) 不同带宽阈值实验中预测值与真实值之间的成对关系。
嵌入空间中的结构与泛化
跨数据集泛化能力是评估此类预训练模型的关键准绳。作者对训练集(2DMatPedia)和推理集(C2DB)的结构嵌入进行了UMAP降维可视化,结果展示了两层令人安心的信息。在训练集的嵌入空间中,高平坦度评分的材料的确在特定区域形成聚集——这意味着模型构建的隐空间确实编码了结构-性质的对映关系,而非记忆了标签分布。当模型被迁移到C2DB数据集进行推理时,预测的高分材料在嵌入空间中呈现出与训练集高度一致的分布模式,验证了架构的跨数据库迁移能力。

▲ Fig.4 | 结构嵌入空间的聚类可视化与数据集泛化能力。(A) 训练数据集(2DMatPedia)结构嵌入的UMAP投影,按真实平坦度评分着色。(B) 推理数据集(C2DB)结构嵌入的UMAP投影,按预测平坦度评分着色。(C) 训练数据集与推理数据集在嵌入空间中的分布差异。红色区域表示C2DB材料过度集中的区域,指示结构上的差异。
更值得玩味的是两个数据集在嵌入空间的分布差异分析。部分区域出现了C2DB材料的过度富集,提示这些区域代表了C2DB中过度采样的特定结构类型。这种认知本身就有操作价值——它为后续的靶向筛选提供了地理上的指引,告诉研究者哪个方向更可能存在尚未被计算的平带候选。
从预测到验证:98%的命中率
训练有素的模型被部署到C2DB数据库中超过10000种未标注材料上。筛选管道分为两阶段:首先提取预测平坦度评分不低于0.9的候选材料;随后对高评分子集进行亚晶格投影分析,锁定具有kagome类几何阻挫拓扑的结构。通过这一双重滤网的候选者进入最终的第一性原理验证环节。
DFT计算结果令人振奋:在全部进入验证的候选材料中,98%被确认具备真实的平带特征。脱颖而出的新材料包括Nb₃TeI₇、Cu₃AsO₄和Cu₃SbO₄——它们在现有文献中从未被标记为平带体系。进一步的能带表示分析揭示,这些材料在费米能级附近展现脆弱拓扑特征。这意味着Struct2Flat不仅筛出了平带,更精准地锁定了平带中最有价值的那一类——拓扑非平庸的平带体系。

▲ Fig.5 | 高平坦度评分材料的筛选与第一性原理验证。(A) 已标注的2DMatPedia数据库中筛选出的平带材料的逐簇分布。插图:选定簇(0、2和5)的原子投影质量。(B) 未标注C2DB数据库中高评分候选材料的筛选流程与DFT验证。左图:完整数据集的预测平坦度评分分布,选取评分≥0.9的结构。右图:DFT计算得到的平坦度评分。
从方法论层面审视,这项工作在三个维度上推进了领域边界。它用连续评分将平带识别从一刀切的分类重塑为精细化的回归问题,消除了阈值选取的主观性。它建立了原子结构到平带性质的直接预测通路,彻底绕过了对DFT预计算的路径依赖。它通过98%的验证命中率证明,物理直觉驱动下的机器学习架构可以在材料发现中同时实现高通量与高精度。当然,模型的物理精度终究受限于训练数据的DFT标注质量——引入更高阶的电子结构方法(如GW或杂化泛函)作为新标注基准,将框架推广至三维块体和异质结体系,以及借助主动学习策略更高效地勘探稀有平带相,都是值得期待的方向。
对于凝聚态物理和材料信息学两个圈子而言,这项工作提供的方法论范式的价值或许比所发现的几个新材料本身更为持久。毕竟,当你不再需要为每一个候选材料单独跑一遍DFT时,平带材料的搜索空间就从一个精心修剪的花园变成了整片森林。 |