金属显微组织图像识别大综述-从分割检测到性能逆向设计

超能小量子
2026-09-16 11:51:39
人工智能
材料科学
技术教程

金属材料显微组织识别的第一道坎,从来不是模型不够强,而是一张图代表不了这块材料.


一块轴承钢到底耐不耐用,答案常常不在成分表里,而藏在显微图像中那几百个晶粒的尺寸分布,几十处夹杂物的形状,以及辐照之后位错环的密度里.过去这些数字靠人拿着标尺在金相照片上一个一个量;现在,越来越多的团队把它交给计算机视觉(CV).


中国原子能科学研究院反应堆工程技术研究所的董晓萌,许鹏宇,白冰等人,Materials Today Communications上发表了一篇17页的综述,系统梳理了计算机视觉如何识别金属材料的显微组织.从多尺度取图与数据清洗,到语义分割,目标检测,再到把图像变成定量参数,最终反推成分与工艺.本文带你完整走一遍这条链路.



,为什么这件事偏偏难在金属材料上


金属材料是建筑,机械,航空航天和核电装备的核心承载者,它的宏观服役性能直接决定结构的安全与寿命.而在核反应堆环境里,材料同时承受中子辐照与高温,微观缺陷不断形核,长大,聚集,结构完整性被一点点削掉.


问题的实质是:宏观性能归根到底由显微组织的形貌,空间分布,演化行为与缺陷特征决定.可传统分析严重依赖人工经验,效率低,主观性强,规模上不去,与高通量材料研发的需求天然冲突.这正是CV切入的地方--它不是替代显微镜,而是把显微镜的输出变成可计算,可统计,可回算的量.


,一张图看懂全流程:从取图到设计闭环


Image


1面向性能的材料设计全流程:(a)数据获取与处理 (b)显微特征提取 (c)显微信息量化 (d)性能映射与优化设计(Materials Today Communications 2026)


综述把整条链路拆成四个阶段,而且强调它们是一个整体,不是四件各干各的事.第一阶段是数据获取与处理:选合适的成像手段拍图,再做去噪,增强,扩充.第二阶段是显微特征提取,也是全链条的分析内核--按目标不同,走语义分割(逐像素分类)或者目标检测(定位离散缺陷).


第三阶段把分割图和检测框变成统计上可度量的描述符:晶粒尺寸,相分数,界面特征,缺陷密度.第四阶段才把它们接到宏观性能上,用正向模型评估性能,再用逆向模型反推成分与工艺.到这一步,整个框架才合拢成一个数据与知识共同驱动的设计闭环.


,第一步:多尺度取图,再把它""干净


Image


2多尺度显微图像:OM,EBSD,SEM,TEM,STEM各自能看到什么


金属组织的多尺度特性,直接决定了必须挑不同的镜子.光学显微镜(OM)与电子背散射衍射(EBSD)宏观到介观--晶粒形貌,尺寸分布,晶体取向,大尺度缺陷;扫描电镜(SEM)管析出物与夹杂物这些介观细节;透射电镜(TEM)和扫描透射电镜(STEM)才能看到原子排列,点缺陷和位错结构,这是研究元素偏聚,相变和辐照损伤机理的前提.


但仅仅"多拍几张"是不够的.综述特别强调代表性体积元(RVE)的约束:视野太小,相分数,缺陷密度这类描述符的统计方差会明显偏大,量出来的东西偏离真实材料.所以一个优化的流程,必须同时兼顾"大尺度的训练多样性""符合RVE的单次采样",把局部的图像识别和具有代表性的物理性能预测真正接上.


原始显微图普遍有噪声,伪影和批次差异,因此预处理是独立一环:局部对比度标准化把不同批次的灰度分布拉齐,焦点堆叠把表面粗糙样品的局部散焦补回来,再做几何与光度增强.对于辐照缺陷,原子级结构这类稀缺样本,传统二维增强就不够用了,综述引用了用生成对抗网络(GAN)造数据的工作--StyleGAN能生成逼真的铁素体-马氏体双相钢SEM;条件GAN则能把索引率只有6%EBSP修复到80%,晶体取向误差控制在2度以内.


,方法是怎么长出来的:从手工特征到大模型


Image


3显微组织分析中CV方法的演进时间线(2017-2025):上半轴是语义分割,下半轴是目标检测


3这张"双箭头时间线"把十几年的路线压得很清楚.早期是靠专家知识设计图像描述子,再配阈值分割,形态学运算这类确定性算法.它们对显式的几何特征很高效,但一旦遇到低对比度,特征重叠,缺陷形状不规则,就明显吃力;而且手工描述子基本绑死在特定材料类别上,跨合金,跨成像模态的泛化能力很差.


深度学习的到来把范式从"人工设计特征"换成"自动学习特征".模型能直接从数据里学出晶界形貌,缺陷纹理这类复杂表示.再往前一步,就是大规模预训练视觉模型--这是当前正在发生的一步.


Image


4语义分割与目标检测的目标差异:前者给每个像素分类,后者框出离散目标


综述把CV任务归成互补的两类,4说得很直观:同一张含氦泡的TEM,语义分割输出的是逐像素的类别图(黑白掩膜),适合连续,有明确区域的组织特征,换来的是精确的边界和形状;目标检测输出的是一个个矩形框,适合裂纹,夹杂,空洞,位错环这类离散缺陷,换来的是数量,位置和类别.两者一个管"",一个管"",缺一不可.


,语义分割:把组织和相""出来


Image


5UHCSDB数据库中的六类超高碳钢组织:珠光体,先共析渗碳体网,球化渗碳体,珠光体+球化渗碳体,魏氏体渗碳体,马氏体+贝氏体


先说数据.深度模型的能力边界,很大程度上由标注数据决定.DeCost等人构建的UHCSDB(超高碳钢显微图数据库)系统整理了六类典型超高碳钢组织,如图5;更早的NFFA-EUROPE SEM数据集则覆盖了多孔海绵,颗粒,纤维等十多个类别,两万余张图.这些标准化数据资源,是后续一切监督学习的地基.


在此之前,主流做法还是手工特征加浅层模型.比如用支持向量机(SVM)做组织分类,它在像素强度上做统计关联,却无法内化组织的空间拓扑与语义层次--学到的是经验相关,而不是材料的物理本质;换个非标准图,性能就掉.这和"既要算法简单,又要物理保真"的矛盾,把领域推向了深度网络.


Image


6两类代表性深度学习架构:(a)CNN逐层提取层级特征 (b)U-Net用编码器-解码器加跳跃连接做逐像素预测


6是两种最基础也最重要的架构.CNN通过卷积层,池化层逐级提取层级特征,擅长分类;2018年就有工作用CNN直接从原始EBSD花样预测晶体取向,免去了预计算衍射字典这一步.U-Net则用编码器-解码器加跳跃连接,在压缩语义信息的同时保留精细空间细节,天生适合晶界模糊,形貌不规则的金属组织.


围绕U-Net的改造是这一节的重头.面向双相钢和淬火-配分钢,有团队把原位配对的EBSDSEM数据一起喂进去,在编码器加梯度滤波,在解码器做动态像素对齐,把单样品的分析时间从100分钟压到35.面向钛合金,有两阶段网络先分类再分割,并在U-Net里嵌注意力模块,最终组织分割mIoU达到82%,层片和网篮结构的匹配度超过90%,一次覆盖15种合金,6类组织.面向增材制造的Ni-WC复合材料,则用嵌套密集跳跃连接和跨层特征融合的U-Net++来对付类别不均衡.


Image


7多相组织分割效果对比:标准U-Net与改进版MPU-Net(橙色虚框处为关键差异区)


  本团队材料+AI开发的晶粒度智能评级软件


多相组织是更难的一档:基体与析出相共存,界面模糊,细小的析出物嵌在大晶粒里.7给出了很直观的对比--针对GH4198这类析出相密集的高温合金,研究者提出MPU-Net,在共享编码器里引入参数共享与多任务学习,减少了碎片化边界带来的过分割.U-Net在橙框处把细晶粒漏掉或连成一片,MPU-Net则给出了更连续的相界和更清晰的析出物轮廓,而且计算量更低.用它做晶粒度测定,相对误差只有2.03%(FESEM)1.78%(OM).


卷积网络的软肋是感受野有限,难以建模长程依赖,于是边界混淆和细相漏检始终存在.Transformer用自注意力做全局特征交互(8),让整幅图的信息自由交换,对相形貌与连通性依赖远距离上下文的情况特别有利;它对阴影,散焦这类局部伪影也更有韧性.当然代价是自注意力计算量随分辨率平方增长,所以后续工作要么用轴向自注意力做轻量化(三维EBSD),要么走CNN+注意力的混合路线.


Image


8Transformer架构:用自注意力捕捉全局上下文,编码器-解码器建模长程特征关系


这里有一个数字值得记住:混合架构CS-UNet只用四张训练图,在晶界和析出相分割上就做到超过80%mIoU,并且能跨镍基高温合金,氧化层等多种体系泛化.它说明了一件事--把卷积的局部精度和注意力的全局视野接起来,小样本场景是有解的.


Image


9SAM的提示分割框架:图像编码器与提示编码器并行,由解码器生成掩膜


真正把"标注依赖"这条绳子松开的,分割一切模型(SAM).它采用提示驱动的范式,把掩膜生成和任务训练解耦(9).但材料显微图相形貌复杂,又是多晶,直接套用SAM并不好使.MatSAM的解法是把均匀的提示网格换成区域引导提示加自适应关键点,不用训练就能改善掩膜质量;另有一类工作走"领域知识后处理"的路子,先用SAM自动生成初始掩膜,再按组织属性的物理规则精修模糊相界,在四种典型合金数据集上做到了接近全监督的水平.


选算法不该看架构新不新,而该看组织有多复杂,问题要什么粒度--均质清晰的结构,分水岭和自适应阈值就够了.


,目标检测:把缺陷""出来并跟踪它


Image


10金属材料跨尺度缺陷类型:(a)断口裂纹 (b)辐照位错环 (c)辐照空洞


缺陷决定了材料的服役寿命,而它们的尺度横跨好几个数量级(10).力学载荷下,应力集中催生裂纹的萌生与扩展,影响疲劳和蠕变寿命;辐照条件下,点缺陷聚集为位错环和空洞,引起肿胀和结构完整性退化.10里三类缺陷的成像特征差别极大,单一模型很难通吃.


裂纹检测按尺度分档.宏观表面裂纹长径比极端,对比度弱,背景复杂,而且标注图难得--有工作干脆用Blender生成逼真的合成裂纹图来训练全卷积网络,IoU提升约5%,精度提升13%.介观尺度上,NEU表面缺陷数据集上对比十多种CNN,DenseNet201取得最佳表现,滚动微裂纹识别精度约98%.微观断裂分析则常与定量表征耦合:微调后的VGG16能分析Ti6Al4V的原位SEM序列,识别裂纹分叉以及与alpha/beta界面的相互作用(偏折与止裂),还能通过量化裂纹尖端张开位移刻画裂纹闭合效应--发现裂纹在相当一部分低载荷循环中其实是物理闭合的,而这正是有效裂纹驱动力评估的关键.


夹杂物这条线经历了从手工到深度学习的完整换代:早期用积分几何的Minkowski泛函提取体积分数和圆度,后来用自适应阈值加分水岭,配合SEM/EDS与双分辨率X射线CT做三维识别,减少二维截面的尺寸低估;再往后,YOLO配合可变形卷积处理成簇的微米级钙铝酸盐夹杂,YOLOv12在铝合金多种夹杂物数据集上做到了精度与推理速度的最佳平衡.


辐照缺陷的检测与跟踪是这篇综述的重点之一.早期靠CNN加级联检测分类:FeCrAl合金STEM,先用CNN分类器筛出候选缺陷区,再做分水岭分割与椭圆拟合提取位错环轮廓,1605个增强样本训出的模型在测试集上准确率86.5%.真正把标注标准立起来的是CNL数据集--238Inconel X-750高分辨TEM,标注了超过12000个尺寸112纳米的氦泡;基于它的Faster R-CNN取得F10.78,尺寸预测误差低于10%.但这类模型只输出框,尺寸还要靠后续图像处理来估,离端到端仍有距离.此后有工作把CNLNOME合并成近400TEM,34000个肿胀缺陷的更大数据集(加入CW-316不锈钢,T91铁素体钢,覆盖多种辐照类型与低剂量,倾转成像),再用Mask R-CNN直接输出像素级掩膜,一次性算出空洞直径,体积和肿胀率.这里有个反直觉的结论:大缺陷(大于15纳米)的尺寸误差会显著影响肿胀计算,而小缺陷(小于5纳米)即使漏检率高,影响也很有限.


Image


11YOLO在不同辐照剂量下检测与跟踪位错环:上排人工标注,下排模型预测


静态图看不全缺陷的"一生",于是有了视频跟踪.11是很有代表性的一组结果:YOLOv3配合迁移学习与数据增强,再接入Trackpy做跨帧关联,Fe18Cr3Al合金1176帧原位TEM视频实现了位错环的跟踪与尺寸提取,可以直接观察不同损伤剂量下的演化.后续为了提升数据效率,有工作用YOLOv11在少标注条件下保持跨合金体系的稳定检测;也有工作把增强版YOLOv8与超分辨率网络ESRGAN接起来,5纳米的氦泡从33像素放大到4848像素,小泡检出率从42%提升到78%,离焦条件下的精度从37%提升到96%,假阳性则减少49.8%(正常条件)98.3%(离焦条件),同时多检出了25%15纳米以下空洞.


,"看清楚""算得准":组织到性能的正向映射


Image


12CV把显微图像连到性能的两条路径:(a)正向映射到力学场 (b)缺陷统计到辐照硬化评估


12上半部分是力学性能这条线:显微图像经CV模块分割成相分布,再叠加物理知识,最后用场学习直接预测应力应变场.镍基高温合金上,有工作用自监督的变分自编码器(VAE)EBSD图编码到隐空间,从中导出晶粒均匀度与尺寸离散度,再用随机森林预测屈服强度--尺寸离散度呈现出Hall-Petch型关系,物理可解释性和预测精度同时成立.更直接的例子是用U-Net从相分布直接预测拉伸下的应力应变场,计算效率提升数个量级,DP800双相钢的预测应变图与宏观延性直接相关.


当你把物理机制真正嵌进模型,事情会不一样:有工作把晶体塑性的本构关系,热力学动力学参数(Thermo-Calc给出)SEM/TEM图像放进同一个框架,做出物理信息贝叶斯CNN;它的价值不只是预测蠕变寿命,而是给出带置信区间的预测--这对高温材料设计是刚需,因为设计者需要知道"这个数有多可信".


,逆向设计:给定性能,反推组织与工艺


正向映射解决"这张图对应什么性能",逆向设计要解决的是更难的一半--"我要这个性能,该造什么样的组织".综述把设计策略的演进说得很清楚:从宏观尺度参数优化,走向组织形貌生成,再到合金成分与工艺路线的逆向设计.


双相钢上的一个例子很有说服力:研究者用VAE把组织图像压到隐空间,再在隐空间里用贝叶斯优化搜索高屈服强度,低损伤敏感性的设计.优化后的组织屈服强度接近600MPa,损伤热点面积减少超过30%,而且揭示出一条设计规律--耐损伤的组织偏好"不连续马氏体网络加沿加载方向的连续铁素体通道".这类从模型里""出来的机理,恰好是纯实验很难快速给出的.


再往前一步是同时反推成分与热处理参数.有工作把组织图像编码成连接视觉特征与材料行为的隐表示,再用并行网络在冶金约束下预测力学性能并反推成分与工艺,最终在UniDP钢上做了实验验证--通过优化工艺达到了目标强塑性组合,同时降低了材料成本.


辐照方向则完成了从"静态定量""动态预测"再到"成分设计"的三级跳.Mask R-CNNFeCrAl合金的黑点缺陷,C111DC100D位错环分类定量后,再接弥散障碍强化模型(DBH),就能把缺陷参数和硬化表现连起来:硬化增量由各类缺陷的强化系数,面密度和平均尺寸共同决定,C100D位错环因为强化系数最高,对硬化的贡献最大.Fe-Cr合金的辐照空洞上,Mask R-CNN实例分割把空洞密度的相对误差做到了0.3%,平均半径误差约5%,并进一步揭示铬含量与温度主导空洞形貌与肿胀行为.更动态的例子来自原位TEM:随着辐照剂量增加,缺陷演化可分成快速生长与饱和两个阶段,快速生长期密度与尺寸同时上升,硬化增量陡增;饱和期尺寸趋稳,密度增速放缓,硬化增量增速随之回落--并且缺陷生长速率与硬化增量呈正相关,意味着动态量化出来的缺陷参数可以直接用来预测性能退化的速率.


当图像能变成参数,参数能连到性能,性能又能反推工艺,材料研发的闭环才算真正合上.


,还有四道坎没迈过去


第一道,不确定性量化与物理因果.目前的CV框架很少做系统性的不确定性分析.像素级分割精度是上去了,但残余的组织误差如何传导到本构建模和性能预测,几乎没被量化.晶粒尺寸或缺陷密度的微小偏差,可能因为非线性缩放关系被放大成强度的显著波动;如果不做概率化处理,就等于默认这些描述符是确定性的,会高估预测的可靠性.出路是把贝叶斯推断,蒙特卡洛采样,敏感性分析纳入全流程,并把位错演化规律,热力学原理这些物理约束直接写进损失函数.


第二道,跨材料的域泛化.域偏移是落地部署的首要障碍:在特定合金体系或成像条件下训练的模型,换到相拓扑,成分空间或衬度机制不同的材料上,性能往往明显下降;制样和电镜设置的差异还会再叠一层分布偏差.而大多数迁移学习研究是在相近合金体系或可比成像配置之间做的,真正跨越成分域和相架构的适应还只在有限场景中被检验过.综述建议把成分多样性与相复杂度显式写进表示学习框架,并建立标准化的跨合金基准来标定实用的泛化边界.


第三道,多尺度图像关联建模.力学响应和辐照行为源于跨尺度的层级相互作用,但当前研究大多只分析单一尺度.缺少统一的跨尺度描述符,就没法建模介观形貌与纳米缺陷分布之间的耦合;视野与分辨率的差异还让跨尺度的统计对齐变得困难.未来的方向是发展多尺度图像关联方法,把不同尺度的特征对齐并联合编码.


第四道,多模态数据融合.现在基本还是只看图像,但组织演化和材料性能同样受成分变量,工艺参数和具有物理意义的状态量影响,这些并不直接编码在图像里.把图像特征当成孤立预测因子,在复杂合金体系里会限制精度.可跨越维度与尺度差异做异质数据融合,技术上仍然很难.可行路径是让视觉特征与结构化材料数据在共享表示空间里联合编码,用热力学计算或位错模型提供的物理先验去正则化多模态学习,并以跨模态注意力,图结构整合来建模异质变量之间的相互作用.


,小结


这篇综述的价值在于它没有把CV当成一个"更快的测量工具",而是把它放在材料研发范式转换的位置上:一端是多尺度成像与数据治理,中间是语义分割与目标检测两套互补的视觉范式,另一端是性能映射与逆向设计.语义分割一路从CNN,U-Net变体,Transformer走到SAM,逐步降低标注依赖;目标检测一路从早期CNN,Faster R-CNN走到YOLO,把裂纹,夹杂,辐照缺陷的识别与跟踪做成了自动化流水线.


对做金属材料的人而言,几个可操作的经验很实在:数据端先解决RVE和批次一致性,别急着堆模型;方法端按组织复杂度和目标粒度选架构,不必迷信最新;应用端如果要跨合金部署,提前把域泛化和不确定性摆上桌面.归根到底,从经验和试错走向数据与知识驱动,这条路上真正稀缺的不是模型,而是高质量,可复用,带物理语义的数据与描述符.


感谢你读到这里.17页的综述,说到底是在回答一件事:怎么让机器真正"看懂"一块金属.


显微组织图像识别的终点不是分割精度,而是把"看见的形貌"翻译成"可设计的性能".



原文链接:https://mp.weixin.qq.com/s/ArgUqnbwD5yp6rN2jhhFNg


79
0
0
0
关于作者
相关文章
  • 利用条件生成对抗神经网络加速密度泛函理论计算 ...
    了解详情 
  • Nature_Materials必读综述:AI材料设计路线全景
    了解详情 
  • 从基因到完整细胞:AI虚拟细胞正在走向多尺度“数字孪生” ...
    了解详情 
  • Buchwald-Hartwig反应的鲁棒性分布外预测
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas