传统材料研究依靠直觉试错;AI推动其向数据驱动、算法引导范式转型。
- 专用AI:作用于材料发现全流水线:假设生成、实验规划优化、表征分析、知识挖掘。
- 通用AI:面向普适科学任务,实现知识表达、智能体驱动的自主实验室、人机协同推理。
- 展望构建AI4Mat未来生态,剖析现存关键挑战与发展方向。
深度句:materials science is undergoing a profound paradigm shift driven by artificial intelligence (AI), transitioning from traditional intuition‑driven trial‑and‑error to an accelerated, data‑centric, and algorithmically guided discipline(AI正驱动材料科学发生深刻范式转变:从直觉试错,转向加速化、以数据为中心、算法引导的学科)。
1. 引言 Introduction
- 文明进步与材料掌控紧密绑定。传统材料研究历经:直觉试错→热力学/物理理论→计算模拟。材料属于典型复杂多尺度耦合系统,微小微观变化会剧烈改变宏观性能;小分子化学空间高达,传统还原论、单尺度模拟已经力不从心。
- AI4S(AI for Science)不只是效率提升,而是方法论层面革命。深度学习擅长处理高维数据、捕捉复杂非线性关联,AlphaFold、核聚变等离子体控制、AI气象预报证明AI可以处理过去难以求解的复杂系统。
- 文献统计:过去十年AI4S、AI4Mat论文数量分别增长36倍、57倍;材料领域AI渗透率由2015年0.14%增长至2025年5.74%,预测2035年可达52.01%。
- 核心二元框架:
• 专用AI(狭义人工智能ANI):务实“解决者”,深耕垂直科学问题,追求精度,是当下和可预见未来的主力。
• 通用AI(通向AGI):未来“总指挥”,依托基础大模型,擅长知识表征、逻辑推理、任务规划;通过智能体串联碎片化工具链,愿景是实现自动驾驶实验室Self‑driving Labs。
深度句:This represents not merely an improvement in efficiency but a profound methodological revolution(这不仅仅是效率提升,而是一场深刻的方法论革命)。
2. 材料科学中的专用AI Task‑Specific AI in Materials Science
沿着材料发现完整工作流分为四小节:假设生成、实验规划与优化、表征数据分析、知识发现。
2.1 假设生成 Hypothesis Generation
1. 传统:依靠化学直觉、有限数据外推,只能探索极小部分化学空间。AI实现算法式假设生成+虚拟预实验,在做实验前就可以在计算机内评估百万级候选材料。
2. 材料表征学习的演进:从人工设计描述符(元素统计、库仑矩阵)→晶体图神经网络GNN(CGCNN等),原子为节点、键为边,自动学习与性质相关特征,摆脱手工特征工程;后续M3GNet、MACE‑MP‑0等原子基础模型进一步提升泛化能力。
3. 高通量虚拟筛选HTVS代表工作:GNoME通过GNN筛选十亿候选,结合主动学习与DFT得到220万新稳定无机晶体,大幅拓展已知无机晶体空间。MatterSim、MACE‑MP‑0实现接近DFT精度的机器学习原子间势,支撑极端温压条件下的分子动力学模拟。
4. 局限:模型受训练数据分布约束,真正反直觉、处于化学空间稀疏区域的候选识别能力有限;需要不确定性量化,同时必须和实验迭代反馈耦合。
深度句:predictive modeling transforms the pre‑experimental stage from a speculative exercise to a systematic, data‑driven search for knowledge and possibility(预测建模将预实验阶段,从推测性工作,转变为系统化、数据驱动的知识与可能性搜索)。
2.2 实验规划与优化 Experimental Planning and Optimization
合成新材料是材料发现资源消耗最大的瓶颈。AI把实验从直觉试错变为数据驱动闭环优化,打通虚拟预测到物理实现的数字‑物理闭环。
- 2.2.1 实验优化算法
• 贝叶斯优化BO:适合连续变量、昂贵实验,平衡探索‑利用;应用于碳纳米管生长、电池快充协议优化。
• 启发式搜索(MCTS、Quality‑Diversity)适合类别、组合空间,例如纳米材料形貌探索。
• 生成式+强化学习:逆设计,直接生成满足目标的分子/合成方案。
• 知识嵌入优化:把热力学、机理先验融入算法,显著降低实验迭代次数。
• 现实痛点:BO理想假设(高斯噪声、光滑响应面)在真实实验经常不成立,需要鲁棒变体与人在回路监督。
- 2.2.2 硬件集成:闭环自主实验室四大模块:算法规划器、机器人执行器、自动表征、数据反馈流水线。分为两类硬件:
• 专用高通量平台:流动化学CVD等,吞吐量高;
• 通用机械臂机器人:模仿科研人员,在多设备间搬运样品;固体粉末试剂自动化分发仍是一大难点;SiLA2、软件抽象层(如AEcroscopy)用来解决仪器异构、接口不统一。
- 2.2.3 AI驱动合成规划:逆合成推理。从3N‑MCTS蒙特卡洛树搜索,到LocalRetro、EditRetro迭代式结构编辑模型;把逆合成从专家直觉转变为机器可执行多步策略。
深度句:AI empowers both the speed and directionality of exploration. Optimization and synthesis planning transform synthesis itself into a self‑improving scientific process(AI既提升探索速度,也决定探索方向;优化与合成规划将合成本身变成一个自我迭代改进的科学过程)。
2.3 表征与数据分析 Characterization and Data Analysis
表征是传统科研流程里速度瓶颈,高度依赖人工判读,仪器每日产出TB级高维数据,人工无法处理。AI充当感知接口,把原始信号转为标准化定量结构/成分信息。
1. 2.3.1 显微学Microscopy:
• 深度学习分割、检测TEM/SEM图像,效率远超人工;无监督学习可以发现人类容易忽略的原子缺陷;扩散模型实现计算层面的像差校正,普通电镜实现亚埃分辨率;生成模拟图像解决标注数据稀缺。
• 发展出自驱动显微镜,AI自主决定采集哪些数据。
2. 2.3.2 光谱与散射 Spectroscopy and Scattering
• XRD:AI自动物相识别、相图映射,融合晶体学先验知识;
• 质谱、EELS、XANES:实现重叠信号解混、自动识别离子与配位环境。
3. 现存挑战:大多数模型只能适配特定仪器,跨设备泛化差。
深度句:AI is transforming this landscape by acting as both an observer and an analyst‑automating the conversion of raw experimental signals into standardized, quantitative descriptors of structure, composition, and dynamics(AI同时充当观察者与分析师:自动把原始实验信号,转化为结构、组分、动力学的标准化定量描述子)。
2.4 知识发现 Knowledge Discovery
前面章节AI主要用来加速工作流程(工具属性);本节目标是获得科学理解,挖掘可解释物理知识,构建原理与定律,AI从计算助手变为科学推理参与者。分为三层:定律层级、介观描述符层级、复杂系统解释层级。
1. 2.4.1 揭示支配定律与对称性
• 符号回归(SINDy、AI‑Feynman)从数据直接提取简洁解析方程。案例:通过符号回归推导出异相催化金属‑载体相互作用MSI解析公式,揭示晚过渡金属封装行为由金属‑金属相互作用主导,而不是传统认为的亲氧性。
• 机器学习挖掘隐藏对称性,找到让物理规律最简表达的隐坐标。
2. 2.4.2 从数据到原理与描述符
• SISSO挖掘低维物理解释描述符;无监督学习(PCA)从态密度数据自动提取电子描述符;AI还可以定位传统经验规则失效的参数区间,提示新物理出现。
3. 2.4.3 复杂系统解释与验证理解
• 可解释AI XAI(SHAP等)解析高维模型,获得因果认识;不确定性分解区分不同误差来源;闭环实验验证AI得到的机理(如三重态态密度决定分子光稳定性)。
• 重大开放性难题:如何区分AI输出是真实物理洞见,还是单纯统计拟合;需要统计鲁棒性、物理自洽、独立实验证伪多层校验。
4. 三层知识产出不是终点,输出的描述符、机理会回流,作为特征重新输入到假设生成、实验优化,形成自强化闭环。
深度句:the objective is not to achieve higher accuracy or faster discovery, but to pursue understanding‑to use AI as a means of extracting interpretable physical knowledge, discovering governing principles, and formulating data‑driven laws(目标不是追求更高精度或更快发现,而是追求理解:把AI作为工具,提取可解释物理知识、挖掘支配原理、构建由数据驱动得到的科学定律)。
3. 材料科学中的通用AI Generalist AI in Materials Science
通用AI不直接做高精度物性预测,聚焦知识表达、智能体工作流、人机协同推理,把分散的专用AI模块打通。
3.1 知识表达与工程 Knowledge Representation and Engineering
要实现AI推理规划,首先必须把海量多模态、非结构化文献数据转为机器可读形式,经历四代发展:
1. 无监督嵌入(Word2Vec、Atom2Vec、Mol2vec):从海量摘要中学习化学隐式规律;
2. 领域适配Transformer大模型(MatSciBERT、ElementBERT);
3. NLP/LLM结构化抽取:从散文文献抽取出材料、前驱体、性质、反应条件结构化记录;
4. 本体与标准化描述语言(XDL/χDL):把合成步骤写成硬件无关可执行指令,直接驱动机器人。
瓶颈:多模态对齐(文本‑图‑表)困难;文本挖掘会继承旧文献偏见;长上下文错误、缺少不确定性估计。
深度句:These developments collectively form the cognitive substrate upon which higher‑level agentic intelligence can operate(以上进展共同构成高层智能体得以运行的认知底层)。
3.2 Agentic Workflow 智能体工作流
从“能读懂知识”走向“可以执行科学行动”。核心概念计划绑定plan binding:把自然语言科学规划映射为物理设备可执行确定指令。
1. 工具增强大模型:ChemCrow、Coscientist,LLM调用外部工具(文献检索、代码、机器人API)完成化学任务,遵循思考‑行动‑观测ReAct循环。
2. 多智能体编排:多个专门子智能体分工(文献检索、实验设计者、硬件执行者、谱图解析)协同完成闭环实验。案例:LLM‑RDF、AI‑Chemist、ORGANA。
3. 自主性谱系:人在回路副驾驶(增强科研人员) ↔ 混合系统 ↔ 完全闭环自主实验室(A‑Lab、Artificial Chemist)。不是非黑即白;应当依据实验风险、可逆程度、新颖度动态调整人类监督强度。
4. 智能体反思纠错:自我评估、自动修复代码与方案,提升可复现与安全性。
深度句:artificial intelligence systems cease to be passive repositories of understanding and begin to function as agents‑entities capable of reasoning about experimental goals, formulating executable plans, and carrying out physical or computational tasks(AI系统不再仅仅是被动存储知识的仓库,而进化成为智能体:能够对实验目标进行推理,生成可执行方案,完成物理或计算任务)。
3.3 人机协同推理 Human‑AI Collaborative Reasoning
不同于2.4节面向数据的硬可解释性;这里是推理层面协同,大模型充当人类科研人员认知伙伴:做类比、头脑风暴、解释矛盾证据、生成可检验假设。
1. LLMatDesign:大模型在修改材料结构前,先输出显式化学假设;当计算结果与假设冲突时,自我反思并修正策略,模拟科学方法。
2. 类比推理:从已知体系迁移机理,生成全新可实验验证假设(钙钛矿钝化剂案例)。
3. 上下文感知逆设计:把人类模糊自然语言需求(骨科植入物要匹配骨模量+生物相容性)转化为定量约束,输出候选材料同时给出推荐理由。
4. 现状局限:现有大模型仅达到本科生材料知识水平,高阶科学推理仍然不如人类专家;因此人机协同不是可选项,而是现阶段的必然需求。
深度句:these systems augment the epistemic processes of science. They do not merely automate labor; they expand the conceptual search space available to the researcher(这类系统增强科学的认知过程;不只是自动化体力劳动,还拓展科研人员可触及的概念搜索空间)。
4. 展望与观点 Outlook and Perspectives
4.1 数据生态与自动化基础设施
AI性能受限于数据质量、数量、可获得性。
1. 打破数据孤岛:推广标准化本体;重视失败实验/负向数据(暗数据dark data),消除幸存者偏差。
2. 建设自主实验室,走向云实验室Cloud‑Lab,让更多课题组可以远程提交实验;硬件异构、跨学科人才缺口、高昂成本是现实阻碍;软件抽象层比硬件标准化更容易落地。
3. 承认大量前沿材料属于小数据场景,不能一味追求大数据;需要样本高效算法、少样本、物理先验驱动的“小数据智能”;缺少多仪器联合基准数据集,模型跨设备泛化是重大缺口。
深度句:expecting purely data‑driven models to solve every problem is unrealistic…the community must prioritize the engineering of “Small Data” intelligence(指望纯数据驱动模型解决全部问题并不现实;学界必须优先发展“小数据智能”)。
4.2 通用性与专用性的平衡
不应该迷信“越大模型越好”。提出生物隐喻:
• 专用AI = 器官:高精度垂直求解具体科学任务;
• 通用AI = 循环系统/总指挥:负责解析意图、调度工具、流转推理逻辑,不直接求解薛定谔方程。 未来不是通用大模型完全替代专用模型;而是二者共生,通用智能体调用专用专家模型。
深度句:the paradigm shift in AI4Mat lies not in replacing the specialized AI with a generalist AI, but in optimizing the circulation between them(AI4Mat范式转变不在于用通用AI取代专用AI,而是优化二者之间信息流转)。
4.3 打通模拟‑实验‑理论的鸿沟
现在大量AI成果基于理想模拟数据;真实合成是非平衡、充满缺陷、动力学约束的现实世界,存在“死亡谷”:大量虚拟预测材料无法被实验合成。
1. 具身智能Embodied Intelligence:AI智能体直接与机器人硬件、传感反馈交互,从真实物理世界学习,跨越模拟与现实鸿沟。
2. 终极目标演进路线:AI从预言机(Oracles) →执行智能体(Agents) →理论家(Theorists);不只是造出新材料,还要提炼物理原理。
3. 提出新概念:材料编译科学与工程 MCSE:把原子尺度设计模块化、可编译地转化为宏观功能。
深度句:its ultimate objective is not merely utility (making things work), but understanding (knowing why they work)(材料科学终极目标,不只是实现效用——把东西做出来;而是获得理解——搞懂为什么它会这样)。
4.4 AI4Mat时代的协同生态
三层协同:人人协同(跨学科人才)、AI‑AI协同(多智能体)、人机双向协同。
• 人类的价值:在前沿领域直觉推理、校验AI输出、提供高质量反馈;
• 安全伦理:AI拥有操控实物能力,人类必须作为安全护栏;依据风险、不可逆程度建立分级监督准则。
4.5 从AI4Mat走向Mat4AI(双向共生)
大部分文章只讨论AI如何帮助材料科学(AI4Mat);本文强调双向关系,材料科学反过来赋能AI(Mat4AI):
1. 硬件底层:CMOS摩尔定律逼近极限;低维材料、忆阻、相变材料是下一代神经形态计算硬件的物质基础;
2. 机器人具身智能需要先进复合材料、柔性驱动器;
3. AI巨大能耗需要能源材料突破;
4. 更深层认知层面:材料科学提供由物理法则约束的高保真真实世界数据,AI的进化已经从互联网文本学习第一阶段,进入与物理世界交互创造新知识的第二阶段;材料科学是AI能力迭代的重要训练场。
深度句:AI has completed its “first half” of learning from the Internet’s stock knowledge and is now entering the “second half” of creating incremental knowledge through interaction with the physical world(AI已经完成第一阶段:从互联网存量知识学习;现在进入第二阶段:通过与物理世界交互,去产生增量新知识)。
参考文献:论文团队(北京大学李越、王舒睿、王建平、钱璐、张锦院士);
Li, Y., Wang, S., Wang, J., Qian, L., Zhang, J., 2026. Artificial Intelligence for Materials Science: Transforming Research Paradigms: Focus Review. Chem. Rev. 126, 6776–6803. https://doi.org/10.1021/acs.chemrev.6c00012
原文链接:https://mp.weixin.qq.com/s/W7UZTlebRRzpo_VZ2KNUfA
|