浙江大学学报(工学版), 2026, 60(10): 2186-2195 doi: 10.3785/j.issn.1008-973X.2026.10.011

计算机技术与控制工程

基于扩散合成与特征挖掘的工业图像异常检测

卜玉真,, 余家斌, 马道滨, 陈梁宇, 孙龙, 杨力, 章东平,

中国计量大学 信息工程学院,浙江 杭州 310018

Industrial image anomaly detection via diffusion synthesis and feature mining

BU Yuzhen,, YU Jiabin, MA Daobin, CHEN Liangyu, SUN Long, YANG Li, ZHANG Dongping,

School of Information Engineering, China Jiliang University, Hangzhou 310018, China

通讯作者: 章东平,男,教授,博士. orcid.org/0000-0001-6743-8945. E-mail:06a0303103@cjlu.cn

收稿日期: 2025-10-18  

基金资助: 浙江省重点研发计划资助项目(2024C01108);杭州市重大科技创新项目(2024SZD1A09;宁波市重点技术研发项目(2024Z114).

Received: 2025-10-18  

Fund supported: 浙江省重点研发计划资助项目(2024C01108);杭州市重大科技创新项目(2024SZD1A09;宁波市重点技术研发项目(2024Z114).

作者简介 About authors

卜玉真(2001—),女,硕士生,从事工业图像异常检测研究.orcid.org/0009-0006-3268-578X.E-mail:byzwsl@163.com , E-mail:byzwsl@163.com

摘要

现有工业图像异常检测方法普遍存在对异常样本依赖度高、合成样本真实性不足以及对复杂缺陷的感知能力有限等问题. 为此,提出基于扩散合成与特征挖掘的工业图像异常检测方法. 设计类别敏感选择性扩散异常合成模块,通过可控扰动与类别敏感损失生成强度可调、类别自适应的伪异常样本,以有效缓解数据稀缺问题. 构建多阶段特征挖掘框架,包括对比驱动的特征选择、多维感知注意力重建及残差细化选择模块,实现异常敏感特征的动态筛选与结构细节增强. 实验结果表明,本研究方法在MVTec AD与MPDD数据集上分别取得图像级AUROC为99.7%与98.4%、像素级AUROC为99.0%与98.7%的优异性能,验证了方法的有效性与鲁棒性.

关键词: 异常检测 ; 异常合成 ; 特征选择 ; 扩散模型 ; 缺陷定位

Abstract

Current industrial image anomaly detection methods generally face challenges such as high dependency on anomalous samples, insufficient realism of synthetic samples, and limited perception capability for complex defects. To An industrial image anomaly detection method based on diffusion synthesis and feature mining was proposed to address these issues. Accordingly, a category-sensitive selective diffusion anomaly synthesis module was designed to generate pseudo-anomaly samples with adjustable intensity and category adaptability through controllable perturbation and category-sensitive loss, which could effectively alleviate data scarcity. Meanwhile, a multi-stage feature mining framework was constructed, including contrast-driven feature selection, multi-dimensional perception attention reconstruction, and residual refinement selection modules, enabling dynamic screening of anomaly-sensitive features and enhancement of structural details. Experimental results demonstrated that the proposed method achieved outstanding performance on the MVTec AD and MPDD datasets, with image-level AUROC scores of 99.7% and 98.4%, and pixel-level AUROC scores of 99.0% and 98.7%, respectively, validating its effectiveness and robustness.

Keywords: anomaly detection ; anomaly synthesis ; feature selection ; diffusion model ; defect localization

PDF (4463KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

卜玉真, 余家斌, 马道滨, 陈梁宇, 孙龙, 杨力, 章东平. 基于扩散合成与特征挖掘的工业图像异常检测. 浙江大学学报(工学版)[J], 2026, 60(10): 2186-2195 doi:10.3785/j.issn.1008-973X.2026.10.011

BU Yuzhen, YU Jiabin, MA Daobin, CHEN Liangyu, SUN Long, YANG Li, ZHANG Dongping. Industrial image anomaly detection via diffusion synthesis and feature mining. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(10): 2186-2195 doi:10.3785/j.issn.1008-973X.2026.10.011

在现代工业制造中,视觉检测技术在产品质量监控与缺陷筛查中发挥关键作用. 然而,工业图像异常检测仍面临缺陷样本稀缺、异常模式多样以及缺陷形态局部复杂等挑战[1-3]. 传统监督方法依赖大量标注异常样本,难以满足实际需求,因此近年来无监督与弱监督方法备受关注[4-5].

为了缓解异常样本不足,研究者提出多种异常数据合成策略,包括图像重构、特征扰动、图像编辑及生成式建模等[6-7]. 其中,基于重构的方法(如 AutoEncoder、UNet)通过学习正常分布并利用重建残差定位异常,具有实现简单的优势[8-9],但存在计算量大、特征筛选能力弱问题[10-11],易受冗余特征干扰.

针对上述不足,本研究提出结合扩散合成与特征挖掘的工业图像异常检测方法,从数据与特征2个层面协同提升检测性能. 主要贡献如下. 1)提出类别敏感选择性扩散异常合成模块,基于去噪扩散模型(denoising diffusion probabilistic models,DDPM)构建强度可控、类别适应性强的伪异常样本,有效缓解异常数据稀缺问题. 2)提出多阶段特征挖掘框架,包括对比驱动的特征选择模块、多维感知注意力重建模块与残差细化选择模块,分别从特征提取、重建响应与残差增强3个维度提升模型对异常区域的识别能力.

1. 相关工作

在工业图像异常检测任务中,如何在缺乏真实异常样本的条件下有效建模异常分布,一直是研究的重点方向. 近年来,研究者从异常样本合成与特征建模2个角度提出了多种解决方案,本研究主要围绕与本方法密切相关的研究展开讨论.

为了缓解异常样本稀缺问题,异常数据合成策略被广泛应用于工业视觉检测. 早期方法多通过随机遮挡、形变或纹理插入等图像编辑手段生成伪异常样本,如CutPaste[12]、f-AnoGAN[13],但受限于人工规则,往往缺乏真实感与多样性,难以覆盖复杂缺陷形态[14]. 随着生成模型的发展,扩散模型(diffusion models)为异常合成提供了更强的建模能力. DDPM[15] 在图像生成任务中表现优异,后续研究将其用于异常检测,通过学习正常数据分布实现重建或伪异常生成[16],如 AnoDDPM[17] 与 DiffusionAD[18] 能有效进行异常定位. 在实际工业场景中,扩散模型已用于生成多位置、多形态的伪缺陷样本,以提升模型泛化能力[19]. 近年来,扩散模型出现多种改进范式,包括基于评分匹配的 Score-based 模型(如 NCSN、ScoreSDE[20- 21])和潜空间扩散模型(LDMs). 前者通过学习数据分布梯度场实现更平滑的异常生成,如 MadSGM[22];后者借助潜空间建模降低计算成本,被应用于高分辨率工业图像的合成与重建,如 LafitE[23] 和 AdaBLDM[24]. 尽管这些方法能生成结构一致、纹理逼真的伪缺陷,但在异常强度调控、类别适应性及局部形态控制方面仍存在不足,难以满足多类别、多尺度缺陷场景的精细需求. 为此,本研究提出类别敏感选择性扩散异常合成模块,通过可控扰动机制与类别敏感损失,实现异常强度调节、局部空间嵌入与类别动态调节的有效融合,从而克服现有方法依赖人工规则、控制粒度不足及语义一致性欠佳等局限.

早期的异常检测方法多直接利用ResNet、EfficientNet、VGG等预训练分类模型的中高层特征进行表示[25],虽具备不错的语义能力,但在工业场景下面临显著局限:完整特征中含有大量冗余,难以突出关键异常区域;特征维度高、推理开销大,也不适于部署在资源受限设备上. 针对这些问题,后续研究转向特征选择和压缩策略以提升效率和异常敏感性. 例如,CS-Flow[26]人工选取合适的中间层特征,实现局部与全局语义兼顾;PatchCore[27]通过特征压缩与记忆机制,结合最近邻匹配,有效减少冗余;PaDiM[28]采用高斯建模提升空间异常评分的精准性,FastFlow[29]利用正态流进一步提高建模与推理效率. 此外,重建与对比范式的研究也带来优化,如DRAEM[30]采用重建-判别器组合,通过重建偏差区分异常,SPADE[31]利用编码器-解码器残差进行异常定位,均在MVTec AD数据集上取得了优异表现. 自监督与跨模态方法如Reverse Distillation[32]、UniAD也展现出更强的识别能力,推动了该领域发展. 然而,现有方法大多采用静态的特征层或通道配置,缺乏针对不同任务和异常类型的自适应调整,难以动态聚焦关键异常特征,对多样化工业缺陷的感受野和尺度需求契合度不足. 同时,异常区域响应性的主动建模也较为欠缺,影响了整体检测精度. 为此,本研究提出的多阶段特征挖掘框架结合对比驱动动态特征选择、多维注意力重建与残差细化优化,兼顾效率与检测性能,有效提升了对复杂异常的响应能力.

2. 本研究方法

本研究方法分为异常合成与异常检测2个阶段. 如图1所示,首先,利用类别敏感选择性扩散异常合成模块生成强度可调、类别适应性的伪异常样本,缓解异常样本不足问题. 随后,在检测阶段,主要包括对比驱动的特征选择模块、多维感知注意力重建模块和残差细化选择模块,分别用于筛选敏感特征、增强异常重建能力和聚焦异常通道,从而实现高效准确的异常检测.

图 1

图 1   异常检测方法整体框架图

Fig.1   Overall framework of anomaly detection method


2.1. 类别敏感选择性扩散异常合成模块

为了生成真实可信、强度可调、类别适应性强的合成异常样本,提出类别敏感选择性扩散异常合成(class-aware selective diffusion-based anomaly synthesis, SDAS-C)模块,如图2所示. 该模块基于DDPM,通过引入可控扰动机制和类别敏感损失机制,实现了异常强度调节、局部空间嵌入与类别动态调节的有效融合,从而克服了传统异常合成方法依赖人工规则或异常数据稀缺的局限性.

图 2

图 2   类别敏感选择性扩散异常合成模块框架图

Fig.2   Framework diagram of class-aware selective diffusion-based anomaly synthesis module


首先,本研究利用正常图像训练扩散模型,建模潜在分布. 通过前向扩散过程逐步添加高斯噪声,将正常图像$ \boldsymbol{x}{\text{}}_{0} $转化为纯噪声$ \boldsymbol{x}_{{t}} $,而反向过程由神经网络参数化$ p_\theta ({{\boldsymbol{x}}}_{t-1}\mid {{\boldsymbol{x}}}_{t}) $逐步去噪恢复图像. 扩散模型训练时所有的简化噪声预测损失函数表达式如下:

$ L_{\text {simple }}={E}_{t, \boldsymbol{x}_{0,} \varepsilon}\left[\left\|\boldsymbol{\varepsilon}-\boldsymbol{\varepsilon}_\theta\left(\boldsymbol{x}_t, t\right)\right\|_2^2\right] . $

式中:$ {{\boldsymbol{\varepsilon}} }_{\theta } $表示网络对噪声的预测,$ \boldsymbol{\varepsilon } $为实际加入的高斯噪声,$ \boldsymbol{x}_{{t}} $表示第$ t $步的带噪图像,$ {E} $表示对所有$ t $和图像样本的期望.

在生成阶段,为了合成具有不同强度的异常样本,在反向扩散的每一步引入可调节扰动. 具体来说,模型预测的均值保持不变,而方差按比例扩大. 扩散合成模块在反向扩散过程中生成异常图像的条件概率分布表达式如下:

$ p_\theta\left(\boldsymbol{x}_{t-1}^{\prime} \mid \boldsymbol{x}_t\right)={N}\left(\boldsymbol{\mu}_\theta\left(\boldsymbol{x}_t, t\right),(1+s) {\varSigma}_\theta\left(\boldsymbol{x}_t, t\right)\right) . $

式中:$ {\boldsymbol{x}}^{\prime}_{t-1} $为加入扰动后的下一步图像;$ {\varSigma _\theta }({{\boldsymbol{x}}_t},{\mkern 1mu} t) $表示模型预测的协方差;$ s \geqslant $0为异常强度控制因子,当$ s $=0时,生成的图像接近正常样本,且随着$ s $增大,图像偏离正常分布,逐步呈现异常特征.

为了实现更真实的局部异常生成,借助 Perlin 噪声构建空间掩码,用于标记图像中的异常区域. 在此基础上,合成图像$ {\boldsymbol{A}} $由正常图像$ {\boldsymbol{I}} $和全局异常图像$ {\boldsymbol{P}} $进行线性混合:

$ \boldsymbol{A}=\overline{\boldsymbol{M}} \odot \boldsymbol{I}+(1-\delta)(\boldsymbol{M} \odot \boldsymbol{I})+\delta(\boldsymbol{M} \odot \boldsymbol{P}). $

式中:$ \odot $表示逐像素乘法,$ \delta $表示异常区域的不透明度,$ \boldsymbol{M} $为异常区域掩码. 该策略支持生成局部结构缺陷、纹理异常、语义不一致等多样化模式,并保持异常区域与背景的自然融合.

为了缓解不同类别样本在训练过程中的响应不均衡问题,引入类别敏感损失机制. 该机制动态调整每类样本的损失权重或扰动强度 $ s $,以适配不同类别在异常合成过程中的敏感度差异. 首先,统计每个类别在训练过程中的平均重构误差或模型置信度,其次根据类别误差动态调整扰动强度,为不同类别引入损失权重$ {\lambda }_{c} $,对总损失函数进行修正:

$ L_{\text {class0aware }}=\sum_{c=1}^C \lambda_c L_{\text {simple}}^c. $

式中:$L_{\text {simple}}^c $表示类别$ c$对应的基本损失,$ {\lambda }_{c} $表示类别$ c $的动态权重.

通过扩散过程建模正常图像的潜在分布,训练神经网络逐步去噪恢复图像,从而为后续基于生成残差的异常检测提供可控且高质量的图像重建能力.

2.2. 对比驱动的特征选择模块

为了进一步提升特征对异常区域的响应能力,提出对比驱动的特征筛选(contrastive-driven feature selection, CDFS)模块,旨在从多层次图像特征中自动筛选对异常更敏感的通道,以增强整体检测性能,如图3所示. 该模块在训练阶段利用预生成的正常与伪异常图像样本对,以对比学习方式在弱监督范式下完成通道选择的初始化,并在训练与推理过程中共享该筛选结果,从而有效压缩特征维度、提升模型鲁棒性.

图 3

图 3   对比驱动的特征选择模块结构图

Fig.3   Structure of contrast-driven feature selection module


具体而言,CDFS模块以ResNet网络提取的多层特征为输入,根据预设结构配置将若干层特征划分为若干“特征块(feature block)”,每个特征块由若干指定层组成. 对每个块中的每一层,CDFS会从所有通道中选择一组对异常响应最敏感的通道,组合形成新的精简特征. 为了实现这一筛选过程,CDFS设计了基于像素级均方误差损失(MSE)和图像级对比损失(contrastive loss)联合驱动的通道评估机制.

在初始化阶段,CDFS利用一定数量的训练样本对每个通道进行敏感度评估. 具体地,首先分别计算正常样本与带有异常的样本在同一位置上的特征差异,获得每个通道的像素级均方误差:

${L}_{\text{MSE}}^{c}=\frac{1}{N}\sum \limits_{i=1}^{N}{\left(a_{i}^{c}-o_{i}^{c}\right)}^{2}. $

式中:$ a_{i}^{c} $$ o_{i}^{c} $分别表示异常样本和正常样本在第$ i $个位置上的第$ c $通道特征值,$ N $表示样本数与空间位置总数之积.

为了进一步增强通道评分的判别性,CDFS将每个通道的全局特征通过自适应平均池化操作形成特征向量:

$ {\boldsymbol{v}}_{\mathrm{ano}}=\text{AvgPool}({\boldsymbol{F}}_{\mathrm{ano}}),{\boldsymbol{v}}_{\rm{ori}}=\text{AvgPool}({\boldsymbol{F}}_{\mathrm{ori}}). $

式中:$ {\boldsymbol{F}}_{\mathrm{ano}} $$ {\boldsymbol{F}}_{\mathrm{ori}} $分别代表异常图像和正常图像在某一层提取的特征图,通过自适应平均池化操作,可得到其通道级全局向量$ {\boldsymbol{v}}_{\mathrm{ano}} $$ {\boldsymbol{v}}_{\rm{ori}} $,分别用于表示异常与正常样本在该层的全局语义分布.

同时,构建正负对进行图像级对比损失计算,其采用对比学习中的 InfoNCE 形式,定义如下:

$ {{L}}_{\text{con}}=-\text{log}\;\frac{\exp\; (\langle {\boldsymbol{v}}_{\text{ano}},{\boldsymbol{v}}_{\text{ori}}\rangle /\tau )}{{\Sigma }_{j}\exp \;\left(\langle {\boldsymbol{v}}_{\text{ano}},{\boldsymbol{v}}_{j}\rangle /\tau \right)}. $

式中:$ \tau $表示温度系数,用于控制对比学习中相似度分布的敏感性;$ {\boldsymbol{v}}_{j} $表示负样本的通道向量,用于构成负对比对.

最终,将2种损失加权相加,得到每个通道的综合敏感度评分:

$ {{S}}^{c}={L}_{\text{MSE}}^{c}+\alpha {{L}}_{\text{con}}. $

式中:$ \alpha $为权重因子,控制像素差异与全局语义差异的平衡关系,根据评分,从每一层中选择评分最低的k个通道构建通道索引表.

初始化完成后,CDFS在前向传播过程中将筛选结果用于每个样本的特征筛选与对齐操作,具体来说,所选通道特征通过双线性插值方式上采样至统一分辨率,并在每个特征块内进行通道维度的拼接,构建最终的融合特征:

$ {\boldsymbol{F}}_{\text{block}}=\text{Concat}\left({\{\text{Upsample}({\boldsymbol{F}_{{l}}^{\rm{selected}}})\}}_{l\in {{{L}}_{b}}}\right). $

式中:$L_b $表示第b个“特征块”中包含的网络层索引集合.

随后,该特征输入给多维感知注意力重建模块.

2.3. 多维感知注意力重建模块

为了更精准地刻画图像中的结构性异常与细粒度缺陷,构建多维感知注意力重建模块(multi-dimensional perception attention guided reconstruction module, MPA-GRM). 该模块融合了通道注意力、空间注意力与位置提示引导机制,如图4所示. 在重建特征的同时增强对异常区域的响应能力,适配无监督工业视觉检测任务对局部结构敏感性的强需求.

图 4

图 4   多维感知注意力模块结构图

Fig.4   Structure of multi-dimensional perception attention module


该模块整体以UNet为骨干结构,由对称的编码器与解码器组成,并在多层次嵌入注意力增强模块. 输入图像特征首先经过多个卷积与下采样操作逐步抽象成低分辨语义特征,随后通过解码路径进行逐层上采样与特征恢复. 在每一层解码阶段,引入多维感知注意力机制(multi-dimensional perception attention),用于引导特征聚焦于潜在异常区域,提升重建输出的精准度与结构一致性.

具体地,在每一尺度的特征还原过程中,注意力模块由以下3部分组成:

1)通道注意力分支. 借鉴Squeeze-and-Excitation结构,通过全局平均池化提取通道级语义重要性,生成通道注意力图$ {\boldsymbol{A}}_{\mathrm{c}} $,用于强调具有较强表达能力的通道,即

$ {\boldsymbol{A}}_{\mathrm{c}}=\sigma \text{​}\left({\text{Conv}}_{1\times 1}\text{​}\left(\text{ReLU​}\left({\text{Conv}}_{1\times 1}(\text{GAP}(\boldsymbol{x}))\right)\right)\right). $

式中:GAP为全局平均池化,$ \sigma $为Sigmoid函数.

2)空间注意力分支(spatial attention). 通过深度可分离卷积提取边缘与纹理响应,并生成空间注意力图$ {\boldsymbol{A}}_{\mathrm{s}} $,突出异常可能发生的空间位置,即

$ {\boldsymbol{A}}_{\mathrm{s}}=\sigma \text{​}\left({\text{Conv}}_{1\times 1}\text{​}\left(\text{ReLU​}\left(\text{BN​}\left({\text{DWConv}}_{3\times 3}(\boldsymbol{x})\right)\right)\right)\right). $

式中:$ \text{DWConv} $表示深度卷积.

3)位置感知提示(positional encoding). 设计轻量位置感知分支,通过卷积引导模型关注空间结构信息,学习隐式位置结构作为辅助提示$ \boldsymbol{P} $.

最终融合方式:

$ \hat{\boldsymbol{x}}={\text{Conv}}_{1\times 1}\text{​}\left(\boldsymbol{x}\cdot {\boldsymbol{A}}_{\mathrm{c}}\cdot {\boldsymbol{A}}_{\mathrm{s}}+\boldsymbol{P}\right)+\boldsymbol{x}. $

式中:$ \boldsymbol{x} $ 为输入特征图,$ {\boldsymbol{A}}_{\mathrm{c}} $$ {\boldsymbol{A}}_{\mathrm{s}} $ 分别为通道与空间注意力图,$ \boldsymbol{P} $ 为位置提示,$ {\text{Conv}}_{1\times 1} $ 为特征压缩卷积.

在网络整体结构中,本研究将不同层级的编码器输出特征$ {{\boldsymbol{x}}}_{l} $作为残差重建的输入,分别输入至多层独立的MPA-GRM模块进行还原,得到重建特征$ {\hat{\boldsymbol{x}}}_{{b}} $,残差图(即异常图)通过逐元素平方差计算,表达式如下:

$ {{\boldsymbol{R}}}_{b}={({{\boldsymbol{x}}_{{b}}}-{{\hat{\boldsymbol{x}}}_{{b}}})}^{2}. $

上述每层 $ {\boldsymbol{x}}_{{b}} $ 反映当前尺度下的重建误差,越大的区域通常对应结构不一致、难还原的异常区域.

该模块不仅提升了模型对异常区域的响应能力,还能充分保留多尺度结构信息,对微小形变或材质缺陷具有更高敏感性.

2.4. 残差细化选择模块

为了增强模型对异常区域的聚焦能力,利用残差细化选择模块(residual refinement selection module,RRS),如图5所示. 其主要目的是从多尺度残差信息中自适应筛选出对异常最敏感的特征通道,并进一步构建像素级的异常响应图. 该模块是构建在前置的多维感知注意力模块基础之上的,后者使用多个并行的 U-Net 网络对不同层级的特征块进行自监督重建,并计算其重建残差.

图 5

图 5   残差细化选择模块结构图

Fig.5   Structure of residual refinement selection module


由于不同特征层的分辨率存在差异,为了实现统一处理,RRS首先对所有残差图进行上采样对齐,具体使用双线性插值将所有残差图统一至最小 stride 对应的空间尺度:

$ {\boldsymbol{R}}^{\prime}_{b}=\text{Upsample}\left({{\boldsymbol{R}}}_{b},\text{scale}\_ \text{factor=}{{s}_{b}}/{{s}_{\min }}\right). $

式中:$ {s}_{\min } $表示所有参与残差对齐层中的最小stride.

随后将所有上采样后的残差图在通道维度上拼接,得到统一对齐后的残差特征:

$ {\boldsymbol{R}}_{\mathrm{cat}}=\text{Concat}(\boldsymbol{R}_{b}^{\prime})\in {\bf{R}}^{{{C}_{\mathrm{cat}}}\times H\times W}. $

式中:$ {C}_{\mathrm{cat}} $表示拼接后残差特征的通道数,$ H $$ W $分别表示空间高度与宽度.

为了增强数值稳定性与分布一致性,拼接后的残差图将经过批归一化处理:

$ {\boldsymbol{R}}_{\mathrm{norm}}=\text{BN}({\boldsymbol{R}}_{\mathrm{cat}}). $

为了进一步突出异常区域响应最强的通道,RRS引入多种通道筛选策略,包括全局最大池化(GMP)和全局平均池化(GAP),分别表示对通道响应的局部极值和全局统计:

$ \begin{split} &{s}_{c}(\text{mode})=\\&\begin{cases} \mathrm{max}\;{\boldsymbol{R}}_{\text{norm}}(c,i,j),& \text{mode=max} ;\\\dfrac{1}{HW}\sum \limits_{i,j}{\boldsymbol{R}}_{\text{norm}}(c,i,j),& \text{mode=mean} .\end{cases}\end{split}$

式中:$ {\boldsymbol{R}}_{\text{norm}}(c,i,j) $表示第$ c $个通道在位置$ (i,j) $的值,$ {s}_{c}(\cdot) $表示通道$ c $的响应强度评分,max表示全局最大池化,mean表示全局平均池化.

针对每种策略,选择得分最高的k 个通道(即 Top-k 选择),最终将不同策略下选中的残差通道拼接,形成稀疏而异常敏感的残差表示.

该稀疏表示随后送入三阶段解码模块:Decoder1(残差堆叠与通道降维)、Decoder2(进一步压缩)、Decoder3(生成异常概率图). 最终通过 Softmax 得到像素级异常概率图.

3. 实验方法与分析

3.1. 实验设置

采用2个公开的工业异常检测基准数据集:MVTec AD和MPDD. MVTec AD是一个广泛使用的工业异常检测数据集,包含15个类别,超过5000张高分辨率图像,涵盖纹理(如织物、皮革)和目标(如瓶子、晶体管)2大类,每类提供正常的训练样本和带有多种异常类型的测试样本,异常形式包括结构缺陷、污染和表面损伤等. MPDD是专门用于工业金属零件视觉缺陷检测的基准数据集,包含1346张图像,涵盖6种工业金属产品,在拍摄过程中引入了多种真实制造场景下的干扰因素,如变化的光照条件、不均匀背景、图像中多个目标的同时存在,以及产品的放置朝向、拍摄距离与位置的变化. 此外,MPDD 提供像素级精度的缺陷掩码,有助于实现更精细的检测与定位.

为了全面评估所提出方法在异常检测任务中的性能,采用多种常用的评价指标进行度量. 在图像级别的异常检测任务中,使用受试者操作特征曲线下的面积(area under the receiver operating characteristic curve, AUROC)作为主要指标,以下简称图像级AUROC(Image AUROC),用于衡量模型对异常图像与正常图像的区分能力. 在像素级的异常定位任务中,同样使用像素级的 AUROC(pixel-wise area under the receiver operating characteristic curve,Pixel AUROC)来评估模型在像素层面对缺陷区域与正常区域的区分能力. 此外,为了更准确地反映模型对完整缺陷区域的覆盖能力,还引入了每个区域的重叠率(per-region overlap, PRO)指标. PRO 能够更精细地衡量模型在实际缺陷区域上的响应情况,特别适用于对小型或局部缺陷的检测效果进行评价. 通过这些指标的综合评估,可以更全面、客观地验证模型在工业图像异常检测中的检测精度与定位能力.

实验在一台搭载Intel Core i9-12900K处理器、64 GB内存及NVIDIA L40 GPU的服务器上完成. 在实验过程中,输入图像统一缩放至256×256分辨率,批大小(batch_size)设置为16. 模型采用预训练的Wide-ResNet50作为主干网络,提取layer1至layer4的多层级特征. 重建模块隐藏通道比例设置为1.0,残差模块融合全局最大池化与平均池化2种筛选策略,每种策略保留256维特征. 训练使用Adam优化器,初始学习率为0.0001,总训练轮次为1000轮,每5轮进行一次验证评估.

对模型的复杂度与推理效率进行定量分析. 结果显示,模型总参数量为590.94×106,其主干网络(WideResNet50)前向传播一次的计算量为59.84×109. 在256×256的输入分辨率下,平均单图推理时间为42.78 ms,峰值GPU显存占用为4735.65 MB. 这些指标反映出模型具有较高的表达能力,这可能是其取得优异检测性能的基础.

3.2. 数据集MVTec AD上的异常检测结果分析

在模型训练中,使用自主设计的异常合成数据集,并结合多种主流异常生成方法,以全面评估模型在检测与定位任务上的性能. 其中,SIA 方法基于扩散模型,通过在反向过程加入可控扰动生成多样且逼真的伪异常;NSA方法利用泊松图像编辑,将随机缩放与位移的补丁无缝融合至正常图像中;CutPaste 方法则通过裁剪并重新粘贴局部区域制造结构不一致性,从而构建伪异常样本.

表1所示为不同异常合成方法在MVTec AD数据集上的性能对比. 可以看出,使用本研究自主合成数据集训练的模型的性能优于SIA、NSA和CutPaste等方法,尤其是在Image AUROC和Pixel AUROC这2个指标上表现突出,同时在PRO指标上也保持了较高水平. 无论是纹理类还是目标类数据,本研究方法在检测与定位精度上都能稳定接近或达到最优,充分体现了其在捕捉纹理变化与细微结构缺陷方面的鲁棒性与敏感性. 如图6所示,展示了由不同异常合成方法生成的异常图像示例,可以直观地看出本研究方法在生成异常形态的多样性和真实性方面的优势,这也为后续检测性能的提升奠定了数据基础.

表 1   不同异常合成方法在MVTec AD数据集上的性能对比

Tab.1  Performance comparison of different anomaly synthesis methods on MVTec AD dataset

方法Image AUROC/%Pixel AUROC/%PRO/%
SIA98.8098.3776.99
NSA99.4998.5093.31
Cutpaste99.5098.4692.73
本研究算法99.7099.0593.36

新窗口打开| 下载CSV


图 6

图 6   不同异常合成方法可视化结果对比

Fig.6   Visual comparison of different anomaly synthesis methods


为了进一步验证方法的有效性,与多种代表性的扩散生成式异常检测模型进行对比,包括 MDPS、AnoDDPM、RAN等. 实验结果如表2所示,本方法在图像级 AUROC与像素级AUROC 指标上均取得最优表现,分别达到 99.7% 与 99.0%. 与当前性能较强的 DiffusionAD 相比,本方法在图像级保持一致的高精度,同时在像素级进一步提升了 0.3 个百分点;相较于 AnoDDPM 和 AutoDDPM,本方法在2项指标上均取得显著优势,提升幅度可达 10~25 个百分点,表明所提出模型具备更强的异常识别与定位能力. 整体来看,本方法在与最新扩散生成式方法的直接对比中展现出明显的性能优势,进一步验证了其在工业视觉异常检测任务中的有效性与鲁棒性.

表 2   扩散生成式异常检测方法与本方法的性能对比

Tab.2  Performance comparison between diffusion-based anomaly detection methods and proposed method

方法Image AUROC/%Pixel AUROC/%
MDPS98.897.3
AnoDDPM75.773.6
AutoDDPM86.889.6
RAN93.196.7
本研究算法99.799.0

新窗口打开| 下载CSV


将所提出的方法与多种主流异常检测方法进行对比,结果如表3所示. 可以看出,本方法在Image AUROC指标上取得 99.7% 的最佳成绩,并在 Pixel AUROC 指标上与 RealNet 并列达到 99.0%,显著优于 PatchCore、FastFlow以及 DRAEM+SSP 等方法,究其原因,本方法在异常样本合成的真实性与特征筛选的自适应性方面具有明显优势. 部分方法(如 UniAD、DiffAD、DeSTSeg)表现相对较弱,可能受其生成策略或特征设计的限制. 如图7所示展示了本方法在 MVTec AD 数据集上的可视化结果,可见模型能够准确定位异常区域并清晰描绘边界. 整体而言,本方法在检测准确性与定位能力上均表现出明显优势,验证了其在复杂工业场景下的有效性和稳定性.

表 3   不同异常检测方法在MVTec AD数据集上的整体性能对比

Tab.3  Overall performance comparison of different anomaly detection methods on MVTec AD dataset

方法Image AUROC/%Pixel AUROC/%
PatchCore99.198.1
SimpleNet99.698.1
FastFlow99.398.1
DRAEM+SSPCAB98.997.2
UniAD96.696.6
RD++99.498.3
DeSTSeg98.697.9
DiffAD98.798.3
RealNet99.699.0
本研究算法99.799.0

新窗口打开| 下载CSV


图 7

图 7   本研究方法在MVTec AD数据集上的异常检测与定位可视化结果

Fig.7   Visualization results of anomaly detection and localization by proposed method on MVTec AD dataset


3.3. 数据集MPDD上的异常检测结果分析

在MPDD数据集上的实验结果从2个维度充分验证了本研究方法的有效性. 实验结果如表45所示. 首先,从类别维度的对比结果来看,本研究方法在多个类别中均表现出稳定且优越的性能,整体平均指标如下: Image AUROC 为 98.44%、Pixel AUROC 为 98.76%、PRO 为 89.61%,相较于SIA和NSA方法保持了领先优势,同时在与CutPaste的对比中也展现出更高的鲁棒性与一致性. 这说明本研究方法不仅在图像级异常检测中能够保持较高的准确性,同时在像素级定位上也具备良好的泛化能力. 其次,从与主流方法的整体对比来看,本研究方法在Image AUROC和Pixel AUROC上分别达到98.4%和98.7%,显著优于PatchCore、CFlow、PaDiM等方法. 这一结果不仅体现了本研究方法在异常图像判别上的强大能力,也表明在像素级异常区域定位方面具备更高的精度与稳定性.

表 4   不同异常合成方法在MPDD数据集上的性能对比

Tab.4  Performance comparison of different anomaly synthesis methods on MPDD dataset

方法Image AUROC/%Pixel AUROC/%PRO/%
SIA97.1698.5189.29
NSA98.2698.4091.81
Cutpaste98.4397.6793.09
本研究算法98.4498.7689.61

新窗口打开| 下载CSV


表 5   不同异常检测方法在MPDD数据集上的整体性能对比

Tab.5  Overall performance comparison of different anomaly detection methods on MPDD dataset

方法Image AUROC/%Pixel AUROC/%
PatchCore82.195.7
CFlow86.197.7
PaDiM74.896.7
SPADE77.195.9
DAGAN72.583.3
Skip-GANomaly64.882.2
RealNet96.398.2
本研究算法98.498.7

新窗口打开| 下载CSV


3.4. 消融实验结果

进一步研究生成样本中异常强度 s 的影响,其结果如表6所示. 当 s=0 时,生成的样本更倾向于落在正常数据分布的高概率密度区域,此时图像融合可能引入伪异常区域,从而降低重建难度并干扰判别器,导致性能未能达到最优. 虽然在 PRO 指标上取得了最高值,但在 AUROC 上表现略逊. 当 s 过大时,合成的异常图像会过度偏离真实异常分布,造成模型在异常区域定位上出现一定退化,限制了整体性能. 值得注意的是,当在一定范围内(如 [0.1, 0.2])均匀采样异常强度时,模型在 Image AUROC和 Pixel AUROC上均取得了最佳表现,PRO 指标也保持在较高水平. 这表明,相较于固定单一强度,从范围中采样能够生成更加多样化的异常模式,使本方法在覆盖更广泛异常形态的同时,进一步提升异常检测的稳定性与泛化能力. 此外,对不同强度生成的样本进行可视化,如图8所示,可以直观观察到异常从轻微扰动逐渐过渡到显著缺陷的过程,更清晰地验证了异常强度对模型性能的影响.

表 6   不同异常强度设置下的消融实验结果

Tab.6  Ablation study results under different anomaly intensity settings

异常强度Image AUROC/%Pixel AUROC/%PRO/%
s=099.5898.7694.83
s=0.199.5598.5491.37
s=0.299.5798.7692.49
s=[0.1,0.2]99.7099.0593.36

新窗口打开| 下载CSV


图 8

图 8   不同异常强度生成的样本对比可视化结果

Fig.8   Visual comparison of samples generated with different anomaly intensities


为了探究不同主干网络及重建特征维度设置对本研究方法在MVTec AD数据集上性能的影响,对比多种网络架构与特征维度配置,实验结果如表7所示. 结果表明,在采用WideResNet50并结合较高重建特征维度时,本研究方法在图像级与像素级异常检测及区域重叠指标上均达到最优,显著优于其他配置. 即便对重建特征维度进行适当压缩,模型性能仅出现轻微下降,仍保持较强竞争力. 此外,在其他主干网络上的实验结果也一致表明,本研究方法在不同网络结构下均能保持稳定且优异的异常检测能力,展现出良好的架构适应性与特征鲁棒性.

表 7   不同主干网络与特征维度设置下的异常检测性能对比

Tab.7  Performance comparison of anomaly detection under different backbone networks and feature dimension settings

Backbone{m1,···,mK}Image AUROC/%Pixel AUROC/%PRO/%
EfficientNetB4
{24,32,56,160}
93.9192.1878.95
ResNet34
{64,128,256,128}
97.0294.4173.59
WideResNet50
{128,256,256,128}
99.1898.3890.34
WideResNet50
{256,512,512,256}
99.7099.0593.36

新窗口打开| 下载CSV


为了验证模型中各独立模块的必要性,开展模块级消融实验,依次评估不同模块组合在各项指标上的表现. 实验结果如表8所示,完整模型在所有评价指标上均达到最优或接近最优性能,充分证明了整体架构的有效性;当仅使用CDFS与MPA-GRM模块时,图像级与像素级异常检测性能仍较优,但PRO指标略有下降,说明RRS模块对提升区域一致性具有积极作用;而在仅保留CDFS与RRS模块时,图像级检测性能出现明显降低,反映出MPA-GRM在图像级判别中的关键作用;单独使用CDFS基础模块时,所有指标均显著下降,进一步印证了MPA-GRM与RRS模块的不可或缺性. 综上,各模块在图像级异常感知、像素级定位质量与区域一致性方面各具重要作用,协同构建了模型整体性能优势.

表 8   不同模块配置下的异常检测性能

Tab.8  Anomaly detection performance under different module configurations

CDFSMPA-GRMRRSImage AUROC/%Pixel AUROC/%PRO/%
99.598.893.2
95.197.793.0
92.797.692.1
98.597.392.8
93.297.193.1
92.896.992.6
92.597.591.9
99.799.093.3

新窗口打开| 下载CSV


4. 结 语

本研究提出基于扩散合成与特征挖掘的工业图像异常检测方法,通过类别敏感选择性扩散模块生成高质量伪异常样本,并结合对比驱动特征筛选、多维感知注意力重建及残差细化选择的多阶段框架,实现对异常区域的有效识别与增强. 实验结果表明,该方法在 MVTec AD 与 MPDD 上均取得了领先的图像级与像素级检测性能,验证了其有效性与应用潜力. 尽管本方法表现优越,但扩散生成与多阶段挖掘带来了较高的计算开销,限制其在资源受限场景中的部署. 未来将从2个方向展开研究:其一,进一步探索多模态融合与视频时序建模,以增强对复杂缺陷的感知能力;其二,通过模型轻量化与自适应异常强度调节机制提升效率与部署灵活性,以更好适配实际工业应用需求.

参考文献

CHENG Y, CAO Y, YAO H, et al

A comprehensive survey for real-world industrial surface defect detection: challenges, approaches, and prospects

[J]. Journal of Manufacturing Systems, 2026, 84: 152- 172

DOI:10.1016/j.jmsy.2025.11.022      [本文引用: 1]

CUI Y, LIU Z, LIAN S

A survey on unsupervised anomaly detection algorithms for industrial images

[J]. IEEE Access, 2023, 11: 55297- 55315

DOI:10.1109/ACCESS.2023.3282993     

CHEN Y, DING Y, ZHAO F, et al

Surface defect detection methods for industrial products: a review

[J]. Applied Sciences, 2021, 11 (16): 7657

DOI:10.3390/app11167657      [本文引用: 1]

LI Z, YAN Y, WANG X, et al

A survey of deep learning for industrial visual anomaly detection

[J]. Artificial Intelligence Review, 2025, 58 (9): 279

DOI:10.1007/s10462-025-11287-7      [本文引用: 1]

白云鹍, 张昊宇, 邢宇翔

基于无监督学习的工业图像异常检测研究综述

[J]. 中国体视学与图像分析, 2025, 30 (1): 102- 125

[本文引用: 1]

BAI Yunkun, ZHANG Haoyu, XING Yuxiang

A review of industrial image anomaly detection based on unsupervised deep learning

[J]. Chinese Journal of Stereology and Image Analysis, 2025, 30 (1): 102- 125

[本文引用: 1]

KA Ji, SHI Zuo, SATOSHI Kida. Overview of image-to-image translation by use of deep neural networks: denoising, super-resolution, modality conversion, and reconstruction in medical imaging [EB/OL]. [2025–09–03]. https://arxiv.org/pdf/1905.08603.

[本文引用: 1]

ALI M, FIORAIO N, SALTI S, et al

AnomalyControl: few-shot anomaly generation by ControlNet inpainting

[J]. IEEE Access, 2024, 12: 192903- 192914

DOI:10.1109/ACCESS.2024.3520002      [本文引用: 1]

XU R, WANG Y, DU B. MAEDiff: masked autoencoder-enhanced diffusion models for unsupervised anomaly detection in brain images [EB/OL]. [2025–09–05]. https://arxiv.org/abs/2401.10561.

[本文引用: 1]

杨曜, 许湘云, 张琳娜, 等

基于多记忆增强模块及图像轮廓重建的工业表面异常检测

[J]. 计算机工程与应用, 2025, 61 (20): 248- 259

DOI:10.3778/j.issn.1002-8331.2406-0293      [本文引用: 1]

YANG Yao, XU Xiangyun, ZHANG Linna, et al

Industrial surface anomaly detection based on reconstruction with multiple memory enhancement modules and image edge

[J]. Computer Engineering and Applications, 2025, 61 (20): 248- 259

DOI:10.3778/j.issn.1002-8331.2406-0293      [本文引用: 1]

MIENYE I D, SWART T G

Deep autoencoder neural networks: a comprehensive review and new perspectives

[J]. Archives of Computational Methods in Engineering, 2025, 32 (7): 3981- 4000

DOI:10.1007/s11831-025-10260-5      [本文引用: 1]

CHEN J W, LIN W J, LI K M, et al

Promoting accurate image reconstruction via synthetic noise for unsupervised screw anomaly detection and location

[J]. IEEE Transactions on Instrumentation and Measurement, 2025, 74: 2528816

DOI:10.1109/tim.2025.3548207      [本文引用: 1]

LI C L, SOHN K, YOON J, et al. CutPaste: self-supervised learning for anomaly detection and localization [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 9659–9669.

[本文引用: 1]

SCHLEGL T, SEEBÖCK P, WALDSTEIN S M, et al

F-AnoGAN: fast unsupervised anomaly detection with generative adversarial networks

[J]. Medical Image Analysis, 2019, 54: 30- 44

DOI:10.1016/j.media.2019.01.010      [本文引用: 1]

ROMBACH R, BLATTMANN A, LORENZ D, et al. High-resolution image synthesis with latent diffusion models [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 10674–10685.

[本文引用: 1]

HO J, JAIN A, ABBEEL P. Denoising diffusion probabilistic models [EB/OL]. [2025–09–07]. https://arxiv.org/abs/2006.11239.

[本文引用: 1]

蒋世杰, 夏秀山, 翟伟, 等

基于ODE扩散模型的多类异常检测和定位

[J]. 智能系统学报, 2025, 20 (2): 376- 388

DOI:10.11992/tis.202402022      [本文引用: 1]

JIANG Shijie, XIA Xiushan, ZHAI Wei, et al

ODE diffusion model for multiclass anomaly detection and localization

[J]. CAAI Transactions on Intelligent Systems, 2025, 20 (2): 376- 388

DOI:10.11992/tis.202402022      [本文引用: 1]

WYATT J, LEACH A, SCHMON S M, et al. AnoDDPM: anomaly detection with denoising diffusion probabilistic models using simplex noise [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. New Orleans: IEEE, 2022: 649–655.

[本文引用: 1]

WOLLEB J, BIEDER F, SANDKÜHLER R, et al. Diffusion models forMedical anomaly detection [C]// Medical Image Computing and Computer Assisted Intervention – MICCAI 2022. Cham: Springer, 2022: 35–45.

[本文引用: 1]

ZHOU X, ZHANG Y, REN Z, et al

DiffDD: a surface defect detection framework with diffusion probabilistic model

[J]. Advanced Engineering Informatics, 2024, 62: 102637

DOI:10.1016/j.aei.2024.102637      [本文引用: 1]

SONG Y, ERMON S. Generative modeling by estimating gradients of the data distribution [EB/OL]. [2025–09–08]. https://arxiv.org/abs/1907.05600.

[本文引用: 1]

SONG Y, SOHL-DICKSTEIN J, KINGMA D P, et al. Score-based generative modeling through stochastic differential equations [EB/OL]. [2025–09–08]. https://arxiv.org/abs/2011.13456.

[本文引用: 1]

LIM H, PARK S, KIM M, et al. MadSGM: multivariate anomaly detection with score-based generative models [C]// Proceedings of the 32nd ACM International Conference on Information and Knowledge Management. Birmingham United Kingdom: ACM, 2023: 1411–1420.

[本文引用: 1]

YIN H, JIAO G, WU Q, et al. LafitE: latent diffusion model with feature editing for unsupervised multi-class anomaly detection [EB/OL]. [2025–09–06]. https://arxiv.org/abs/2307.08059.

[本文引用: 1]

LI H, ZHANG Z, CHEN H, et al. A novel approach to industrial defect generation through blended latent diffusion model with online adaptation [EB/OL]. [2025–09–07]. https://arxiv.org/abs/2402.19330.

[本文引用: 1]

BERGMANN P, FAUSER M, SATTLEGGER D, et al. Uninformed students: student-teacher anomaly detection with discriminative latent embeddings [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 4182–4191.

[本文引用: 1]

RUDOLPH M, WANDT B, ROSENHAHN B. Same same but DifferNet: semi-supervised defect detection with normalizing flows [C]// Proceedings of the IEEE Winter Conference on Applications of Computer Vision. Waikoloa: IEEE, 2021: 1906–1915.

[本文引用: 1]

ROTH K, PEMULA L, ZEPEDA J, et al. Towards total recall in industrial anomaly detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 14298–14308.

[本文引用: 1]

DEFARD T, SETKOV A, LOESCH A, et al. PaDiM: a patch distribution modeling framework for anomaly detection and localization [C]// Pattern Recognition. ICPR International Workshops and Challenges. Cham: Springer, 2021: 475–489.

[本文引用: 1]

YU J, ZHENG Y, WANG X, et al. FastFlow: unsupervised anomaly detection and localization via 2D normalizing flows [EB/OL]. [2025–09–07]. https://arxiv.org/abs/2111.07677.

[本文引用: 1]

BERGMANN P, LÖWE S, FAUSER M, et al. Improving unsupervised defect segmentation by applying structural similarity to autoencoders [EB/OL]. [2025–09–08]. https://arxiv.org/abs/1807.02011.

[本文引用: 1]

COHEN N, HOSHEN Y. Sub-image anomaly detection with deep pyramid correspondences [EB/OL]. [2025–09–09]. https://arxiv.org/abs/2005.02357.

[本文引用: 1]

TIEN T D, NGUYEN A T, TRAN N H, et al. Revisiting reverse distillation for anomaly detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 24511–24520.

[本文引用: 1]

/