图神经网络+物理启发评分:高通量发现二维平带材料新框架登Science Advances

宇宙微尘
2026-07-27 12:22:10
人工智能
材料科学
算法解析

本研究发表于《Science Advances》(2026),针对二维平带材料稀缺、传统筛选依赖高成本密度泛函理论(DFT)计算的瓶颈,提出了Struct2Flat高通量发现框架。团队首先构建物理启发的连续平坦度评分体系,融合能带色散与态密度双指标,通过贝叶斯优化确定权重,消除了人为阈值偏差;进而开发多模态深度学习模型,融合门控线图神经网络的结构编码与RoBERTa的文本编码,仅从晶体结构即可直接预测平坦度分数,无需预计算电子结构。将该模型应用于C2DB数据库超10000种未标注材料,结合kagome类亚晶格筛选,经DFT验证平带识别准确率达98%,成功发现Nb₃TeI₇、Cu₃AsO₄等新型拓扑非平庸平带材料。该工作为强关联量子材料的高效挖掘提供了可推广的方法论范式。




平带电子结构是凝聚态物理中最富想象力的领地之一。当电子能带色散趋于平坦,动能被压制到极致,电子间的库仑排斥便接管了游戏规则。这种"交通拥堵"式的物理图景下,关联量子现象层出不穷——从非常规超导到分数量子霍尔态,从拓扑序到量子自旋液体,平带几乎成为了强关联体系的代名词。kagome晶格、Lieb晶格、魔角扭转双层石墨烯,这些名字背后都隐藏着同一个物理内核:近乎零色散的平带。


然而一个令人尴尬的事实是,已知的平带材料实在太少了。传统的高通量发现方法需要逐材料运行密度泛函理论(DFT)计算能带结构,再人为设定带宽阈值判定"平"与"不平"。这条路不仅计算量巨大,还背负着两个根本性缺陷:带宽阈值的选取高度主观——0.1 eV和0.3 eV的截断会筛出截然不同的候选集;而基于深度学习的分类器虽然聪明,仍需以DFT计算好的能带结构作为输入,对于尚未计算过的化学空间依旧束手无策。换句话说,整个领域长期缺少一种能直接从原子结构出发、无需预计算电子结构就能嗅到平带气息的通用方法。


2026年7月,西安交通大学王向文课题组Science Advances上发表了一项工作,试图合上这道缺口。他们提出的Struct2Flat框架,将物理启发的连续平坦度评分与多模态图神经网络结合,仅凭晶体结构本身就能预测材料的平带倾向,并成功在C2DB数据库中筛选出多个此前未被报道的二维平带材料,其中98%的候选者经DFT验证确认真实平带特征。



▲ Fig.1 | 基于结构信息算法的二维材料平带相自动标注与识别框架。(A) 数据集标注与平坦度评分。结合带宽和态密度(DOS)特征的复合平坦度评分用于基于电子能带结构自动标注训练数据。(B) 多模态模型开发。基于结构和文本特征训练的多模态模型仅从晶体结构预测平坦度评分,其性能经过验证。


连续评分取代二元标签


Struct2Flat的第一个核心创新,是用连续评分函数替代传统的"带宽低于某阈值即为平带"的二元判定。评分体系由两个正交的物理指标复合而成。


动量空间色散指标关注能带的"胖瘦"。框架首先检测能带交叉点,将纠缠的能带结构拆分为连续的非交叉片段,重新连接后选取能量展宽最窄的路径作为代表性分支。随后通过余弦变换将原始带宽平滑映射到0到1之间的连续值——完全平坦的能带趋近于1,色散剧烈的能带趋近于0。态密度(DOS)指标则从另一个维度切入,捕捉平带系统最直观的实验指纹:能谱上陡然耸立的范霍夫奇点。在代表性能带中心能量附近设定局域窗口,计算窄窗口内平均DOS与宽参考范围DOS的对比度,归一化后同样得到连续分数。


两个子指标的融合遵循"双高原则"——只有色散约束和DOS峰同时突出的材料才能获得高总分。这是一种刻意保守的设计:单独在某个指标上刷高分是容易的,但真正有物理意义的平带必须在两个窗口下都经得起审视。两指标的组合权重并非人为拍定,而是通过贝叶斯优化从标注数据中自动学习,确保了评分体系与物理直觉的自洽。



▲ Fig.2 | 平坦度评分优化与电子结构数据分析。(A至C) 不同带宽窗口(0.1、0.3和0.5 eV)的箱线图,展示Stotal > 0的样本中Stotal的分布,按Sbandwidth(上图)和SDOS(下图)区间分组;颜色深浅反映各区间内的样本数量,以表征数据在各区间的均衡程度。(D) 三种不同带宽窗口(0.1、0.3和0.5 eV)下数据集级别质量指标的评估。


作者在2DMatPedia数据库中约5100种二维材料上校准了评分框架,对比了0.1、0.3和0.5 eV三种带宽窗口。0.3 eV最终被选定为最优平衡点——它在样本覆盖率、评分分辨率和物理约束强度三重目标之间取得了最佳折中。


图神经网络直接从结构预测平带


评分体系解决了标注问题,但真正的预测挑战在于:能否跳过DFT,直接从晶体结构推断平带特征?Struct2Flat给出的答案是肯定的。


模型架构由三条通路汇聚而成。结构编码支路采用门控线图神经网络,将原子的种类、坐标、键合拓扑以及晶格周期性全部编码为几何特征向量。文本编码支路基于RoBERTa架构,把材料的化学式、空间群等描述性信息转化为上下文语义表征。两条支路的输出通过双线性注意力机制进行模态融合——这不是简单的向量拼接,而是让结构和文本表征在注意力权重下进行交互,使模型学会"某个局部结构单元在某种化学语境下是否易于形成平带"。


在标注数据集上的验证结果显示,预测评分与真实评分之间呈现稳健的正相关性,尤其在高分区间的识别精度表现突出。这表明模型学到的不只是局部的键长键角分布,而是捕捉到了与平带形成相关的更高阶结构特征——例如亚晶格的几何阻挫模式。



▲ Fig.3 | 用于预测平坦度评分和评估模型性能的多模态架构。(A) 从晶体结构到平坦度评分预测的模型概览。原子结构通过门控线图神经网络进行编码,文本材料描述通过RoBERTa编码器处理。两种模态通过双线性注意力机制融合,生成连续的平坦度评分。(B) 不同带宽阈值实验中预测值与真实值之间的成对关系。


嵌入空间中的结构与泛化


跨数据集泛化能力是评估此类预训练模型的关键准绳。作者对训练集(2DMatPedia)和推理集(C2DB)的结构嵌入进行了UMAP降维可视化,结果展示了两层令人安心的信息。在训练集的嵌入空间中,高平坦度评分的材料的确在特定区域形成聚集——这意味着模型构建的隐空间确实编码了结构-性质的对映关系,而非记忆了标签分布。当模型被迁移到C2DB数据集进行推理时,预测的高分材料在嵌入空间中呈现出与训练集高度一致的分布模式,验证了架构的跨数据库迁移能力。



▲ Fig.4 | 结构嵌入空间的聚类可视化与数据集泛化能力。(A) 训练数据集(2DMatPedia)结构嵌入的UMAP投影,按真实平坦度评分着色。(B) 推理数据集(C2DB)结构嵌入的UMAP投影,按预测平坦度评分着色。(C) 训练数据集与推理数据集在嵌入空间中的分布差异。红色区域表示C2DB材料过度集中的区域,指示结构上的差异。


更值得玩味的是两个数据集在嵌入空间的分布差异分析。部分区域出现了C2DB材料的过度富集,提示这些区域代表了C2DB中过度采样的特定结构类型。这种认知本身就有操作价值——它为后续的靶向筛选提供了地理上的指引,告诉研究者哪个方向更可能存在尚未被计算的平带候选。


从预测到验证:98%的命中率


训练有素的模型被部署到C2DB数据库中超过10000种未标注材料上。筛选管道分为两阶段:首先提取预测平坦度评分不低于0.9的候选材料;随后对高评分子集进行亚晶格投影分析,锁定具有kagome类几何阻挫拓扑的结构。通过这一双重滤网的候选者进入最终的第一性原理验证环节。


DFT计算结果令人振奋:在全部进入验证的候选材料中,98%被确认具备真实的平带特征。脱颖而出的新材料包括Nb₃TeI₇、Cu₃AsO₄和Cu₃SbO₄——它们在现有文献中从未被标记为平带体系。进一步的能带表示分析揭示,这些材料在费米能级附近展现脆弱拓扑特征。这意味着Struct2Flat不仅筛出了平带,更精准地锁定了平带中最有价值的那一类——拓扑非平庸的平带体系。



▲ Fig.5 | 高平坦度评分材料的筛选与第一性原理验证。(A) 已标注的2DMatPedia数据库中筛选出的平带材料的逐簇分布。插图:选定簇(0、2和5)的原子投影质量。(B) 未标注C2DB数据库中高评分候选材料的筛选流程与DFT验证。左图:完整数据集的预测平坦度评分分布,选取评分≥0.9的结构。右图:DFT计算得到的平坦度评分。


从方法论层面审视,这项工作在三个维度上推进了领域边界。它用连续评分将平带识别从一刀切的分类重塑为精细化的回归问题,消除了阈值选取的主观性。它建立了原子结构到平带性质的直接预测通路,彻底绕过了对DFT预计算的路径依赖。它通过98%的验证命中率证明,物理直觉驱动下的机器学习架构可以在材料发现中同时实现高通量与高精度。当然,模型的物理精度终究受限于训练数据的DFT标注质量——引入更高阶的电子结构方法(如GW或杂化泛函)作为新标注基准,将框架推广至三维块体和异质结体系,以及借助主动学习策略更高效地勘探稀有平带相,都是值得期待的方向。


对于凝聚态物理和材料信息学两个圈子而言,这项工作提供的方法论范式的价值或许比所发现的几个新材料本身更为持久。毕竟,当你不再需要为每一个候选材料单独跑一遍DFT时,平带材料的搜索空间就从一个精心修剪的花园变成了整片森林。

126
0
0
0
关于作者
相关文章
  • mRNA与蛋白质相关性由什么决定?
    了解详情 
  • 扩散模型+大语言模型双轮驱动:AI小分子生成从虚拟设计走向临床 ...
    本文系统梳理了2016年以来AI驱动小分子设计的发展脉络。文章将分子生成AI拆解为四大核心模块:分 ...
    了解详情 
  • JACS Au|SynPROTAC模型实现可合成PROTAC分子的理性设计 ...
    中山大学等多单位合作在 JACS Au 发表研究,提出名为 SynPROTAC​ 的生成式AI模型,用于解决PROT ...
    了解详情 
  • World Action Models:具身智能的下一个前沿
    视觉-语言-动作模型(VLA)在具身策略学习中展现了强大的语义泛化能力,然而它们学习的是反应式 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas