基于扩散合成与特征挖掘的工业图像异常检测
Industrial image anomaly detection via diffusion synthesis and feature mining
通讯作者:
收稿日期: 2025-10-18
| 基金资助: |
|
Received: 2025-10-18
| Fund supported: | 浙江省重点研发计划资助项目(2024C01108);杭州市重大科技创新项目(2024SZD1A09;宁波市重点技术研发项目(2024Z114). |
作者简介 About authors
卜玉真(2001—),女,硕士生,从事工业图像异常检测研究.orcid.org/0009-0006-3268-578X.E-mail:
现有工业图像异常检测方法普遍存在对异常样本依赖度高、合成样本真实性不足以及对复杂缺陷的感知能力有限等问题. 为此,提出基于扩散合成与特征挖掘的工业图像异常检测方法. 设计类别敏感选择性扩散异常合成模块,通过可控扰动与类别敏感损失生成强度可调、类别自适应的伪异常样本,以有效缓解数据稀缺问题. 构建多阶段特征挖掘框架,包括对比驱动的特征选择、多维感知注意力重建及残差细化选择模块,实现异常敏感特征的动态筛选与结构细节增强. 实验结果表明,本研究方法在MVTec AD与MPDD数据集上分别取得图像级AUROC为99.7%与98.4%、像素级AUROC为99.0%与98.7%的优异性能,验证了方法的有效性与鲁棒性.
关键词:
Current industrial image anomaly detection methods generally face challenges such as high dependency on anomalous samples, insufficient realism of synthetic samples, and limited perception capability for complex defects. To An industrial image anomaly detection method based on diffusion synthesis and feature mining was proposed to address these issues. Accordingly, a category-sensitive selective diffusion anomaly synthesis module was designed to generate pseudo-anomaly samples with adjustable intensity and category adaptability through controllable perturbation and category-sensitive loss, which could effectively alleviate data scarcity. Meanwhile, a multi-stage feature mining framework was constructed, including contrast-driven feature selection, multi-dimensional perception attention reconstruction, and residual refinement selection modules, enabling dynamic screening of anomaly-sensitive features and enhancement of structural details. Experimental results demonstrated that the proposed method achieved outstanding performance on the MVTec AD and MPDD datasets, with image-level AUROC scores of 99.7% and 98.4%, and pixel-level AUROC scores of 99.0% and 98.7%, respectively, validating its effectiveness and robustness.
Keywords:
本文引用格式
卜玉真, 余家斌, 马道滨, 陈梁宇, 孙龙, 杨力, 章东平.
BU Yuzhen, YU Jiabin, MA Daobin, CHEN Liangyu, SUN Long, YANG Li, ZHANG Dongping.
针对上述不足,本研究提出结合扩散合成与特征挖掘的工业图像异常检测方法,从数据与特征2个层面协同提升检测性能. 主要贡献如下. 1)提出类别敏感选择性扩散异常合成模块,基于去噪扩散模型(denoising diffusion probabilistic models,DDPM)构建强度可控、类别适应性强的伪异常样本,有效缓解异常数据稀缺问题. 2)提出多阶段特征挖掘框架,包括对比驱动的特征选择模块、多维感知注意力重建模块与残差细化选择模块,分别从特征提取、重建响应与残差增强3个维度提升模型对异常区域的识别能力.
1. 相关工作
在工业图像异常检测任务中,如何在缺乏真实异常样本的条件下有效建模异常分布,一直是研究的重点方向. 近年来,研究者从异常样本合成与特征建模2个角度提出了多种解决方案,本研究主要围绕与本方法密切相关的研究展开讨论.
为了缓解异常样本稀缺问题,异常数据合成策略被广泛应用于工业视觉检测. 早期方法多通过随机遮挡、形变或纹理插入等图像编辑手段生成伪异常样本,如CutPaste[12]、f-AnoGAN[13],但受限于人工规则,往往缺乏真实感与多样性,难以覆盖复杂缺陷形态[14]. 随着生成模型的发展,扩散模型(diffusion models)为异常合成提供了更强的建模能力. DDPM[15] 在图像生成任务中表现优异,后续研究将其用于异常检测,通过学习正常数据分布实现重建或伪异常生成[16],如 AnoDDPM[17] 与 DiffusionAD[18] 能有效进行异常定位. 在实际工业场景中,扩散模型已用于生成多位置、多形态的伪缺陷样本,以提升模型泛化能力[19]. 近年来,扩散模型出现多种改进范式,包括基于评分匹配的 Score-based 模型(如 NCSN、ScoreSDE[20- 21])和潜空间扩散模型(LDMs). 前者通过学习数据分布梯度场实现更平滑的异常生成,如 MadSGM[22];后者借助潜空间建模降低计算成本,被应用于高分辨率工业图像的合成与重建,如 LafitE[23] 和 AdaBLDM[24]. 尽管这些方法能生成结构一致、纹理逼真的伪缺陷,但在异常强度调控、类别适应性及局部形态控制方面仍存在不足,难以满足多类别、多尺度缺陷场景的精细需求. 为此,本研究提出类别敏感选择性扩散异常合成模块,通过可控扰动机制与类别敏感损失,实现异常强度调节、局部空间嵌入与类别动态调节的有效融合,从而克服现有方法依赖人工规则、控制粒度不足及语义一致性欠佳等局限.
早期的异常检测方法多直接利用ResNet、EfficientNet、VGG等预训练分类模型的中高层特征进行表示[25],虽具备不错的语义能力,但在工业场景下面临显著局限:完整特征中含有大量冗余,难以突出关键异常区域;特征维度高、推理开销大,也不适于部署在资源受限设备上. 针对这些问题,后续研究转向特征选择和压缩策略以提升效率和异常敏感性. 例如,CS-Flow[26]人工选取合适的中间层特征,实现局部与全局语义兼顾;PatchCore[27]通过特征压缩与记忆机制,结合最近邻匹配,有效减少冗余;PaDiM[28]采用高斯建模提升空间异常评分的精准性,FastFlow[29]利用正态流进一步提高建模与推理效率. 此外,重建与对比范式的研究也带来优化,如DRAEM[30]采用重建-判别器组合,通过重建偏差区分异常,SPADE[31]利用编码器-解码器残差进行异常定位,均在MVTec AD数据集上取得了优异表现. 自监督与跨模态方法如Reverse Distillation[32]、UniAD也展现出更强的识别能力,推动了该领域发展. 然而,现有方法大多采用静态的特征层或通道配置,缺乏针对不同任务和异常类型的自适应调整,难以动态聚焦关键异常特征,对多样化工业缺陷的感受野和尺度需求契合度不足. 同时,异常区域响应性的主动建模也较为欠缺,影响了整体检测精度. 为此,本研究提出的多阶段特征挖掘框架结合对比驱动动态特征选择、多维注意力重建与残差细化优化,兼顾效率与检测性能,有效提升了对复杂异常的响应能力.
2. 本研究方法
本研究方法分为异常合成与异常检测2个阶段. 如图1所示,首先,利用类别敏感选择性扩散异常合成模块生成强度可调、类别适应性的伪异常样本,缓解异常样本不足问题. 随后,在检测阶段,主要包括对比驱动的特征选择模块、多维感知注意力重建模块和残差细化选择模块,分别用于筛选敏感特征、增强异常重建能力和聚焦异常通道,从而实现高效准确的异常检测.
图 1
2.1. 类别敏感选择性扩散异常合成模块
为了生成真实可信、强度可调、类别适应性强的合成异常样本,提出类别敏感选择性扩散异常合成(class-aware selective diffusion-based anomaly synthesis, SDAS-C)模块,如图2所示. 该模块基于DDPM,通过引入可控扰动机制和类别敏感损失机制,实现了异常强度调节、局部空间嵌入与类别动态调节的有效融合,从而克服了传统异常合成方法依赖人工规则或异常数据稀缺的局限性.
图 2
图 2 类别敏感选择性扩散异常合成模块框架图
Fig.2 Framework diagram of class-aware selective diffusion-based anomaly synthesis module
首先,本研究利用正常图像训练扩散模型,建模潜在分布. 通过前向扩散过程逐步添加高斯噪声,将正常图像
式中:
在生成阶段,为了合成具有不同强度的异常样本,在反向扩散的每一步引入可调节扰动. 具体来说,模型预测的均值保持不变,而方差按比例扩大. 扩散合成模块在反向扩散过程中生成异常图像的条件概率分布表达式如下:
式中:
为了实现更真实的局部异常生成,借助 Perlin 噪声构建空间掩码,用于标记图像中的异常区域. 在此基础上,合成图像
式中:
为了缓解不同类别样本在训练过程中的响应不均衡问题,引入类别敏感损失机制. 该机制动态调整每类样本的损失权重或扰动强度
式中:
通过扩散过程建模正常图像的潜在分布,训练神经网络逐步去噪恢复图像,从而为后续基于生成残差的异常检测提供可控且高质量的图像重建能力.
2.2. 对比驱动的特征选择模块
为了进一步提升特征对异常区域的响应能力,提出对比驱动的特征筛选(contrastive-driven feature selection, CDFS)模块,旨在从多层次图像特征中自动筛选对异常更敏感的通道,以增强整体检测性能,如图3所示. 该模块在训练阶段利用预生成的正常与伪异常图像样本对,以对比学习方式在弱监督范式下完成通道选择的初始化,并在训练与推理过程中共享该筛选结果,从而有效压缩特征维度、提升模型鲁棒性.
图 3
图 3 对比驱动的特征选择模块结构图
Fig.3 Structure of contrast-driven feature selection module
具体而言,CDFS模块以ResNet网络提取的多层特征为输入,根据预设结构配置将若干层特征划分为若干“特征块(feature block)”,每个特征块由若干指定层组成. 对每个块中的每一层,CDFS会从所有通道中选择一组对异常响应最敏感的通道,组合形成新的精简特征. 为了实现这一筛选过程,CDFS设计了基于像素级均方误差损失(MSE)和图像级对比损失(contrastive loss)联合驱动的通道评估机制.
在初始化阶段,CDFS利用一定数量的训练样本对每个通道进行敏感度评估. 具体地,首先分别计算正常样本与带有异常的样本在同一位置上的特征差异,获得每个通道的像素级均方误差:
式中:
为了进一步增强通道评分的判别性,CDFS将每个通道的全局特征通过自适应平均池化操作形成特征向量:
式中:
同时,构建正负对进行图像级对比损失计算,其采用对比学习中的 InfoNCE 形式,定义如下:
式中:
最终,将2种损失加权相加,得到每个通道的综合敏感度评分:
式中:
初始化完成后,CDFS在前向传播过程中将筛选结果用于每个样本的特征筛选与对齐操作,具体来说,所选通道特征通过双线性插值方式上采样至统一分辨率,并在每个特征块内进行通道维度的拼接,构建最终的融合特征:
式中:
随后,该特征输入给多维感知注意力重建模块.
2.3. 多维感知注意力重建模块
为了更精准地刻画图像中的结构性异常与细粒度缺陷,构建多维感知注意力重建模块(multi-dimensional perception attention guided reconstruction module, MPA-GRM). 该模块融合了通道注意力、空间注意力与位置提示引导机制,如图4所示. 在重建特征的同时增强对异常区域的响应能力,适配无监督工业视觉检测任务对局部结构敏感性的强需求.
图 4
图 4 多维感知注意力模块结构图
Fig.4 Structure of multi-dimensional perception attention module
该模块整体以UNet为骨干结构,由对称的编码器与解码器组成,并在多层次嵌入注意力增强模块. 输入图像特征首先经过多个卷积与下采样操作逐步抽象成低分辨语义特征,随后通过解码路径进行逐层上采样与特征恢复. 在每一层解码阶段,引入多维感知注意力机制(multi-dimensional perception attention),用于引导特征聚焦于潜在异常区域,提升重建输出的精准度与结构一致性.
具体地,在每一尺度的特征还原过程中,注意力模块由以下3部分组成:
1)通道注意力分支. 借鉴Squeeze-and-Excitation结构,通过全局平均池化提取通道级语义重要性,生成通道注意力图
式中:GAP为全局平均池化,
2)空间注意力分支(spatial attention). 通过深度可分离卷积提取边缘与纹理响应,并生成空间注意力图
式中:
3)位置感知提示(positional encoding). 设计轻量位置感知分支,通过卷积引导模型关注空间结构信息,学习隐式位置结构作为辅助提示
最终融合方式:
式中:
在网络整体结构中,本研究将不同层级的编码器输出特征
上述每层
该模块不仅提升了模型对异常区域的响应能力,还能充分保留多尺度结构信息,对微小形变或材质缺陷具有更高敏感性.
2.4. 残差细化选择模块
为了增强模型对异常区域的聚焦能力,利用残差细化选择模块(residual refinement selection module,RRS),如图5所示. 其主要目的是从多尺度残差信息中自适应筛选出对异常最敏感的特征通道,并进一步构建像素级的异常响应图. 该模块是构建在前置的多维感知注意力模块基础之上的,后者使用多个并行的 U-Net 网络对不同层级的特征块进行自监督重建,并计算其重建残差.
图 5
由于不同特征层的分辨率存在差异,为了实现统一处理,RRS首先对所有残差图进行上采样对齐,具体使用双线性插值将所有残差图统一至最小 stride 对应的空间尺度:
式中:
随后将所有上采样后的残差图在通道维度上拼接,得到统一对齐后的残差特征:
式中:
为了增强数值稳定性与分布一致性,拼接后的残差图将经过批归一化处理:
为了进一步突出异常区域响应最强的通道,RRS引入多种通道筛选策略,包括全局最大池化(GMP)和全局平均池化(GAP),分别表示对通道响应的局部极值和全局统计:
式中:
针对每种策略,选择得分最高的k 个通道(即 Top-k 选择),最终将不同策略下选中的残差通道拼接,形成稀疏而异常敏感的残差表示.
该稀疏表示随后送入三阶段解码模块:Decoder1(残差堆叠与通道降维)、Decoder2(进一步压缩)、Decoder3(生成异常概率图). 最终通过 Softmax 得到像素级异常概率图.
3. 实验方法与分析
3.1. 实验设置
采用2个公开的工业异常检测基准数据集:MVTec AD和MPDD. MVTec AD是一个广泛使用的工业异常检测数据集,包含15个类别,超过
为了全面评估所提出方法在异常检测任务中的性能,采用多种常用的评价指标进行度量. 在图像级别的异常检测任务中,使用受试者操作特征曲线下的面积(area under the receiver operating characteristic curve, AUROC)作为主要指标,以下简称图像级AUROC(Image AUROC),用于衡量模型对异常图像与正常图像的区分能力. 在像素级的异常定位任务中,同样使用像素级的 AUROC(pixel-wise area under the receiver operating characteristic curve,Pixel AUROC)来评估模型在像素层面对缺陷区域与正常区域的区分能力. 此外,为了更准确地反映模型对完整缺陷区域的覆盖能力,还引入了每个区域的重叠率(per-region overlap, PRO)指标. PRO 能够更精细地衡量模型在实际缺陷区域上的响应情况,特别适用于对小型或局部缺陷的检测效果进行评价. 通过这些指标的综合评估,可以更全面、客观地验证模型在工业图像异常检测中的检测精度与定位能力.
实验在一台搭载Intel Core i9-12900K处理器、64 GB内存及NVIDIA L40 GPU的服务器上完成. 在实验过程中,输入图像统一缩放至256×256分辨率,批大小(batch_size)设置为16. 模型采用预训练的Wide-ResNet50作为主干网络,提取layer1至layer4的多层级特征. 重建模块隐藏通道比例设置为1.0,残差模块融合全局最大池化与平均池化2种筛选策略,每种策略保留256维特征. 训练使用Adam优化器,初始学习率为
对模型的复杂度与推理效率进行定量分析. 结果显示,模型总参数量为590.94×106,其主干网络(WideResNet50)前向传播一次的计算量为59.84×109. 在256×256的输入分辨率下,平均单图推理时间为42.78 ms,峰值GPU显存占用为
3.2. 数据集MVTec AD上的异常检测结果分析
在模型训练中,使用自主设计的异常合成数据集,并结合多种主流异常生成方法,以全面评估模型在检测与定位任务上的性能. 其中,SIA 方法基于扩散模型,通过在反向过程加入可控扰动生成多样且逼真的伪异常;NSA方法利用泊松图像编辑,将随机缩放与位移的补丁无缝融合至正常图像中;CutPaste 方法则通过裁剪并重新粘贴局部区域制造结构不一致性,从而构建伪异常样本.
表 1 不同异常合成方法在MVTec AD数据集上的性能对比
Tab.1
| 方法 | Image AUROC/% | Pixel AUROC/% | PRO/% |
| SIA | 98.80 | 98.37 | 76.99 |
| NSA | 99.49 | 98.50 | 93.31 |
| Cutpaste | 99.50 | 98.46 | 92.73 |
| 本研究算法 | 99.70 | 99.05 | 93.36 |
图 6
图 6 不同异常合成方法可视化结果对比
Fig.6 Visual comparison of different anomaly synthesis methods
为了进一步验证方法的有效性,与多种代表性的扩散生成式异常检测模型进行对比,包括 MDPS、AnoDDPM、RAN等. 实验结果如表2所示,本方法在图像级 AUROC与像素级AUROC 指标上均取得最优表现,分别达到 99.7% 与 99.0%. 与当前性能较强的 DiffusionAD 相比,本方法在图像级保持一致的高精度,同时在像素级进一步提升了 0.3 个百分点;相较于 AnoDDPM 和 AutoDDPM,本方法在2项指标上均取得显著优势,提升幅度可达 10~25 个百分点,表明所提出模型具备更强的异常识别与定位能力. 整体来看,本方法在与最新扩散生成式方法的直接对比中展现出明显的性能优势,进一步验证了其在工业视觉异常检测任务中的有效性与鲁棒性.
表 2 扩散生成式异常检测方法与本方法的性能对比
Tab.2
| 方法 | Image AUROC/% | Pixel AUROC/% |
| MDPS | 98.8 | 97.3 |
| AnoDDPM | 75.7 | 73.6 |
| AutoDDPM | 86.8 | 89.6 |
| RAN | 93.1 | 96.7 |
| 本研究算法 | 99.7 | 99.0 |
将所提出的方法与多种主流异常检测方法进行对比,结果如表3所示. 可以看出,本方法在Image AUROC指标上取得 99.7% 的最佳成绩,并在 Pixel AUROC 指标上与 RealNet 并列达到 99.0%,显著优于 PatchCore、FastFlow以及 DRAEM+SSP 等方法,究其原因,本方法在异常样本合成的真实性与特征筛选的自适应性方面具有明显优势. 部分方法(如 UniAD、DiffAD、DeSTSeg)表现相对较弱,可能受其生成策略或特征设计的限制. 如图7所示展示了本方法在 MVTec AD 数据集上的可视化结果,可见模型能够准确定位异常区域并清晰描绘边界. 整体而言,本方法在检测准确性与定位能力上均表现出明显优势,验证了其在复杂工业场景下的有效性和稳定性.
表 3 不同异常检测方法在MVTec AD数据集上的整体性能对比
Tab.3
| 方法 | Image AUROC/% | Pixel AUROC/% |
| PatchCore | 99.1 | 98.1 |
| SimpleNet | 99.6 | 98.1 |
| FastFlow | 99.3 | 98.1 |
| DRAEM+SSPCAB | 98.9 | 97.2 |
| UniAD | 96.6 | 96.6 |
| RD++ | 99.4 | 98.3 |
| DeSTSeg | 98.6 | 97.9 |
| DiffAD | 98.7 | 98.3 |
| RealNet | 99.6 | 99.0 |
| 本研究算法 | 99.7 | 99.0 |
图 7
图 7 本研究方法在MVTec AD数据集上的异常检测与定位可视化结果
Fig.7 Visualization results of anomaly detection and localization by proposed method on MVTec AD dataset
3.3. 数据集MPDD上的异常检测结果分析
在MPDD数据集上的实验结果从2个维度充分验证了本研究方法的有效性. 实验结果如表4、5所示. 首先,从类别维度的对比结果来看,本研究方法在多个类别中均表现出稳定且优越的性能,整体平均指标如下: Image AUROC 为 98.44%、Pixel AUROC 为 98.76%、PRO 为 89.61%,相较于SIA和NSA方法保持了领先优势,同时在与CutPaste的对比中也展现出更高的鲁棒性与一致性. 这说明本研究方法不仅在图像级异常检测中能够保持较高的准确性,同时在像素级定位上也具备良好的泛化能力. 其次,从与主流方法的整体对比来看,本研究方法在Image AUROC和Pixel AUROC上分别达到98.4%和98.7%,显著优于PatchCore、CFlow、PaDiM等方法. 这一结果不仅体现了本研究方法在异常图像判别上的强大能力,也表明在像素级异常区域定位方面具备更高的精度与稳定性.
表 4 不同异常合成方法在MPDD数据集上的性能对比
Tab.4
| 方法 | Image AUROC/% | Pixel AUROC/% | PRO/% |
| SIA | 97.16 | 98.51 | 89.29 |
| NSA | 98.26 | 98.40 | 91.81 |
| Cutpaste | 98.43 | 97.67 | 93.09 |
| 本研究算法 | 98.44 | 98.76 | 89.61 |
表 5 不同异常检测方法在MPDD数据集上的整体性能对比
Tab.5
| 方法 | Image AUROC/% | Pixel AUROC/% |
| PatchCore | 82.1 | 95.7 |
| CFlow | 86.1 | 97.7 |
| PaDiM | 74.8 | 96.7 |
| SPADE | 77.1 | 95.9 |
| DAGAN | 72.5 | 83.3 |
| Skip-GANomaly | 64.8 | 82.2 |
| RealNet | 96.3 | 98.2 |
| 本研究算法 | 98.4 | 98.7 |
3.4. 消融实验结果
进一步研究生成样本中异常强度 s 的影响,其结果如表6所示. 当 s=0 时,生成的样本更倾向于落在正常数据分布的高概率密度区域,此时图像融合可能引入伪异常区域,从而降低重建难度并干扰判别器,导致性能未能达到最优. 虽然在 PRO 指标上取得了最高值,但在 AUROC 上表现略逊. 当 s 过大时,合成的异常图像会过度偏离真实异常分布,造成模型在异常区域定位上出现一定退化,限制了整体性能. 值得注意的是,当在一定范围内(如 [0.1, 0.2])均匀采样异常强度时,模型在 Image AUROC和 Pixel AUROC上均取得了最佳表现,PRO 指标也保持在较高水平. 这表明,相较于固定单一强度,从范围中采样能够生成更加多样化的异常模式,使本方法在覆盖更广泛异常形态的同时,进一步提升异常检测的稳定性与泛化能力. 此外,对不同强度生成的样本进行可视化,如图8所示,可以直观观察到异常从轻微扰动逐渐过渡到显著缺陷的过程,更清晰地验证了异常强度对模型性能的影响.
表 6 不同异常强度设置下的消融实验结果
Tab.6
| 异常强度 | Image AUROC/% | Pixel AUROC/% | PRO/% |
| s=0 | 99.58 | 98.76 | 94.83 |
| s=0.1 | 99.55 | 98.54 | 91.37 |
| s=0.2 | 99.57 | 98.76 | 92.49 |
| s=[0.1,0.2] | 99.70 | 99.05 | 93.36 |
图 8
图 8 不同异常强度生成的样本对比可视化结果
Fig.8 Visual comparison of samples generated with different anomaly intensities
为了探究不同主干网络及重建特征维度设置对本研究方法在MVTec AD数据集上性能的影响,对比多种网络架构与特征维度配置,实验结果如表7所示. 结果表明,在采用WideResNet50并结合较高重建特征维度时,本研究方法在图像级与像素级异常检测及区域重叠指标上均达到最优,显著优于其他配置. 即便对重建特征维度进行适当压缩,模型性能仅出现轻微下降,仍保持较强竞争力. 此外,在其他主干网络上的实验结果也一致表明,本研究方法在不同网络结构下均能保持稳定且优异的异常检测能力,展现出良好的架构适应性与特征鲁棒性.
表 7 不同主干网络与特征维度设置下的异常检测性能对比
Tab.7
| Backbone{m1,···,mK} | Image AUROC/% | Pixel AUROC/% | PRO/% |
| EfficientNetB4 {24,32,56,160} | 93.91 | 92.18 | 78.95 |
| ResNet34 {64,128,256,128} | 97.02 | 94.41 | 73.59 |
| WideResNet50 {128,256,256,128} | 99.18 | 98.38 | 90.34 |
| WideResNet50 {256,512,512,256} | 99.70 | 99.05 | 93.36 |
为了验证模型中各独立模块的必要性,开展模块级消融实验,依次评估不同模块组合在各项指标上的表现. 实验结果如表8所示,完整模型在所有评价指标上均达到最优或接近最优性能,充分证明了整体架构的有效性;当仅使用CDFS与MPA-GRM模块时,图像级与像素级异常检测性能仍较优,但PRO指标略有下降,说明RRS模块对提升区域一致性具有积极作用;而在仅保留CDFS与RRS模块时,图像级检测性能出现明显降低,反映出MPA-GRM在图像级判别中的关键作用;单独使用CDFS基础模块时,所有指标均显著下降,进一步印证了MPA-GRM与RRS模块的不可或缺性. 综上,各模块在图像级异常感知、像素级定位质量与区域一致性方面各具重要作用,协同构建了模型整体性能优势.
表 8 不同模块配置下的异常检测性能
Tab.8
| CDFS | MPA-GRM | RRS | Image AUROC/% | Pixel AUROC/% | PRO/% |
| √ | — | √ | 99.5 | 98.8 | 93.2 |
| √ | √ | — | 95.1 | 97.7 | 93.0 |
| √ | — | — | 92.7 | 97.6 | 92.1 |
| — | √ | √ | 98.5 | 97.3 | 92.8 |
| — | √ | — | 93.2 | 97.1 | 93.1 |
| — | — | √ | 92.8 | 96.9 | 92.6 |
| — | — | — | 92.5 | 97.5 | 91.9 |
| √ | √ | √ | 99.7 | 99.0 | 93.3 |
4. 结 语
本研究提出基于扩散合成与特征挖掘的工业图像异常检测方法,通过类别敏感选择性扩散模块生成高质量伪异常样本,并结合对比驱动特征筛选、多维感知注意力重建及残差细化选择的多阶段框架,实现对异常区域的有效识别与增强. 实验结果表明,该方法在 MVTec AD 与 MPDD 上均取得了领先的图像级与像素级检测性能,验证了其有效性与应用潜力. 尽管本方法表现优越,但扩散生成与多阶段挖掘带来了较高的计算开销,限制其在资源受限场景中的部署. 未来将从2个方向展开研究:其一,进一步探索多模态融合与视频时序建模,以增强对复杂缺陷的感知能力;其二,通过模型轻量化与自适应异常强度调节机制提升效率与部署灵活性,以更好适配实际工业应用需求.
参考文献
A comprehensive survey for real-world industrial surface defect detection: challenges, approaches, and prospects
[J].DOI:10.1016/j.jmsy.2025.11.022 [本文引用: 1]
A survey on unsupervised anomaly detection algorithms for industrial images
[J].DOI:10.1109/ACCESS.2023.3282993
Surface defect detection methods for industrial products: a review
[J].DOI:10.3390/app11167657 [本文引用: 1]
A survey of deep learning for industrial visual anomaly detection
[J].DOI:10.1007/s10462-025-11287-7 [本文引用: 1]
基于无监督学习的工业图像异常检测研究综述
[J].
A review of industrial image anomaly detection based on unsupervised deep learning
[J].
AnomalyControl: few-shot anomaly generation by ControlNet inpainting
[J].DOI:10.1109/ACCESS.2024.3520002 [本文引用: 1]
基于多记忆增强模块及图像轮廓重建的工业表面异常检测
[J].DOI:10.3778/j.issn.1002-8331.2406-0293 [本文引用: 1]
Industrial surface anomaly detection based on reconstruction with multiple memory enhancement modules and image edge
[J].DOI:10.3778/j.issn.1002-8331.2406-0293 [本文引用: 1]
Deep autoencoder neural networks: a comprehensive review and new perspectives
[J].DOI:10.1007/s11831-025-10260-5 [本文引用: 1]
Promoting accurate image reconstruction via synthetic noise for unsupervised screw anomaly detection and location
[J].DOI:10.1109/tim.2025.3548207 [本文引用: 1]
F-AnoGAN: fast unsupervised anomaly detection with generative adversarial networks
[J].DOI:10.1016/j.media.2019.01.010 [本文引用: 1]
基于ODE扩散模型的多类异常检测和定位
[J].DOI:10.11992/tis.202402022 [本文引用: 1]
ODE diffusion model for multiclass anomaly detection and localization
[J].DOI:10.11992/tis.202402022 [本文引用: 1]
DiffDD: a surface defect detection framework with diffusion probabilistic model
[J].DOI:10.1016/j.aei.2024.102637 [本文引用: 1]
/
| 〈 |
|
〉 |

