一句话看懂
材料设计的核心矛盾只有一个:化学-结构空间太大,从钢到半导体的几亿种组合,按 DFT 一遍一遍算要算到下个世纪。AI 介入这件大事十年了,但路径换过三回——先做代理模型做高通量筛选,做不过就进化算法、贝叶斯与强化学习做闭环采样;最近 5 年靠 VAE、扩散模型、大语言模型做"按目标直接生成"。MIT Quantum Measurement Group(Mingda Li 团队)的这篇 Nat. Mater. 综述把这十年演进压成 6 张图,关键是告诉你:生成模型不是终点,是新起点。
小编划重点
范式转移:正向筛选 → 逆向设计,核心理由是"算力都浪费在注定失败的材料上"
5 条主路径:遗传算法 / 粒子群 / MCTS / 贝叶斯优化 + 强化学习 / VAE + 扩散 + 大模型
扩散模型代表 MatterGen:稳定+新颖概率是前模型 2 倍,离局部能量极小近 10 倍
真正落地仍有鸿沟:MatterGen 一次性给 8192 个 候选,只合成出 1 个(TaCr₂O₆)
闭环逆设计拿到钙钛矿太阳能电池空穴传输层认证效率 26.2%(基准 24.6%)
当前模型主要"插值"已知分布,"外推"找到室温超导 / 高 zT / 核聚变这类"圣杯"仍是开放问题
逐图精讲
Fig.1 正向筛选:从"候选库"漏下去

Fig.1 正向筛选:候选库 → 目标函数代理 → 滤后结果
最朴素的范式。a 子图画漏斗:候选库 → ML 目标函数预测器 → 通过的候选。b 子图是 CGCNN 晶体图卷积网络,把原子当节点、化学键当边,R 个卷积层 + 全局池化层 + 两个隐藏层后输出预测性质。c 子图给出五阶段光电半导体筛选的真实工作流——结构/组分 → 稳定性 → 粗描述符 → 精描述符 → 精修,每一步紫色圆盘代表高通量计算,红色箭头是计算成本、绿色箭头是 ML 加速。d 子图是 2D 铁磁材料筛选:从晶体结构出发,配置自旋做共线/非共线 DFT 能量计算 → Hamiltonian 拟合 → 邻居映射 → Metropolis Monte Carlo 估居里温度 Tc,最终找到 TC>400K 的 2D 铁磁候选。
问题 所有筛选都是"单向"的,只能在已有库上加阈值过滤;而且绝大多数候选根本过不了,浪费严重。
Fig.2 进化算法:把候选当种群

Fig.2 进化算法:GA、PSO、MCTS 三件套
第一次范式转移是引入"演化"。a 子图是遗传算法(GA)的 mutation + crossover + selection 三件套,b 子图是粒子群优化(PSO),c 子图是蒙特卡洛树搜索(MCTS)。真正的对比在 d–f 三个真实案例:d 子图是 tetracene(并四苯)多晶型 GA 演化路径——交叉、框旋转、角应变三种策略从 P2₁/c、Pbam 空间群走向目标 P1/T2,能量 Niching 适值函数 + 单重裂变性能共同打分;e 子图是 3285 个原子的 Pt-Pd-Au 三金属纳米颗粒 PSO 优化过程,最低能量从 -4.39 eV/atom 收敛到 -4.44 eV/atom,三个插入的结构渲染图清晰展示"颗粒从无序到分层稳定"的过程;f 子图是 4 原子银团簇 MCTS(蓝)与随机采样(橙)的对比——MCTS 用 1% 的评估次数就找到 A 结构(更接近 fcc 能量极小),随机采样只能停在 B。
局限 算力需求仍大;早熟收敛卡局部极小;多针对预定义化学体系,泛化差;参数敏感。
Fig.3 自适应与交互式:把实验接进来

Fig.3 自适应:BO、RL、机器人合成(A-Lab)
a 子图是自适应逆设计的通用图——逆设计模型 + 高通量实验 + 反馈更新循环。b 子图是 BO 在化学反应优化上的标准样例:高斯过程代理(蓝均值 + 浅蓝 2σ 区间)拟合实验数据,橙色 Expected utility 曲线(这里是高维情形下的"面")最大值点决定下一组实验条件,整个过程收敛比人类决策更快。c 子图是强化学习(RL)用于能量采集超材料设计的流程——把设计空间切成决策序列、形式化马尔可夫决策过程,Actor-Critic 智能体在有限元仿真环境里学策略。d 子图是 A-Lab 闭环:计算给目标物相 + 文本挖掘给前驱体 + 机器人合成 + 表征自动判 XRD + 主动学习更新,整套流程不依赖人。
这是上一波"AI for Science"的代表 A-Lab 已实现连续合成-表征-判相。
Fig.4 VAE:把晶体压缩进潜空间

Fig.4 VAE 逆向设计:上半 autoencoder vs VAE + 右侧 3D 潜空间梯度下降
VAE 是早期深度生成模型的核心思路——把高维结构压成连续潜空间,再用属性映射做逆向设计。a 子图把 autoencoder(编码器把输入映射到潜空间一个"点")和 VAE(映射到分布 N(μ, σ²))对比,VAE 的潜空间天然连续、可采样。b 子图最值得细看:右侧那张 3D 潜空间曲面图,直接在潜空间上做梯度下降寻优——找到 f(z) 的全局极大后解码成目标分子结构。c 子图更进一步,结构编码器(橙)和性质编码器(红)把分子结构和性质对齐到同一潜空间,从性质反推结构只需一次解码。
真实落地:磁性材料 VAE 发现 46 个稳定化合物,其中 20 个在凸包 0.25 eV/atom 内(可合成性高);热电方向找到 2 个 SOTA 功率因子晶体;有机光伏命中率高 5 倍以上。
Fig.5 扩散模型:从噪声里长出晶体

Fig.5 扩散模型:CDVAE + MatterGen + SCIGEN + 真实生成结构
这是综述的"重头"。a 子图给出扩散模型标准工作流——加噪把数据推向标准高斯,去噪把噪声反向还原;可加条件偏置引导。b 子图是 CDVAE:VAE 出晶格 L、初始组分 c、原子数 N,再用扩散模块联合去噪更新原子类型 A 与坐标 X,PGNNENC + PGNNDEC 是图神经网络编码-解码。c 子图是 MatterGen——607,683 个晶体训练的基础模型,适配器微调后能按化学元素、对称性、磁性密度 m、块体模量等条件生成;TaCr₂O₆ 已被实验合成。d 子图是 SCIGEN——把结构基元(honeycomb、kagome 等)作为"硬约束"嵌入扩散过程。e 子图是这篇综述最直观的视觉证据 SCIGEN 实际生成的 honeycomb(Gd/Ca/Ba)与 kagome(Co/Ni/Ho)晶体结构,原子排布清晰、空间群对称完整。
扩散模型当前是 SOTA,但有三个真问题:① 离散成分(如原子数)需在去噪全程保持一致;② 概率插值不保证物理可行;③ 计算资源消耗大、对训练数据质量敏感。
Fig.6 案例研究:闭环把 PCE 拉到 26.2%

Fig.6 案例:钙钛矿 HTM 闭环 + AI-MOF 实验合成
综述用 5 个案例回应"AI 设计的材料到底能不能落地"。a 子图是钙钛矿太阳能电池空穴传输层(HTM)的闭环逆设计:先用 10⁶ 个 Suzuki 偶联分子建库,Kennard-Stone 选 10² 个、RDkit 计算描述符(NumAtom、Mw、MoILPogP、HOMO、LUMO、Rotation constant b),10⁴ → 10¹ → 10¹ 迭代收窄,BO 提建议 → 微波反应器 HT 合成 → HT 纯化 → HT 电化学/光学测量,每一轮把效率往上推一格:8.5% → 15.4% → 17.3% → 20.5% → 20.9% (26.2% 认证),超过传统 spiro-OMeTAD 等 HTM 的 24.6% 基准。b 子图是 MOFGen 多智能体系统生成的"AI 梦见的" MOF——丁烯二酸基(AI-MOF-3)和苝-3,9-二羧酸基(AI-MOF-2)两类结构,实验合成后粉末 XRD(红)与模拟 XRD(黑)几乎完全重合,右下角光学显微照片能看到清晰晶体形貌。
另一组案例(正文未配图但同样关键):热电材料 VAE-GAN + 数据增强,预测 100 个 zT>1.0 的掺杂材料(25 个此前未报道),Mg₃.₁Sb₀.₅Bi₁.₄₉₇Te₀.₀₀₃ 合成实测 zT=0.75@300K;超导体逆设计 InvDesFlow-AL 找到 B₅CN₂ (Tc=15.93K)、B₄CN₃ (Tc=24.08K)、Li₂AuH₆ (Tc≈140K 常压)。
全文总结
AI 驱动的材料设计走过三个阶段:① 用 ML 代理模型加速 DFT 做高通量筛选;② 用进化算法、贝叶斯优化、强化学习做闭环自适应搜索;③ 用 VAE、扩散模型、大语言模型做"按目标属性直接生成"。MIT 团队这篇综述把三者放进同一张图——核心论点是:生成模型已能造出新晶体,但造出的绝大多数离真正"圣杯"还远。MatterGen 给 8192 个候选,实验只来得及合成 1 个,瓶颈从"设计"转移到了"实验验证"与"分布外生成"。
对工程材料读者最值得记住的 3 件事:① 当前模型主要做"插值"已知分布,找不到新家族;② 实验闭环是决胜点,纯计算已不够;③ 多目标同时优化(zT + 成本、强度 + 韧性)正变成主流,机会在领域知识引导的逆向设计。
原文链接:https://mp.weixin.qq.com/s/WFnMLQTFXKrHOI3Z6psjVA
|