浙江大学学报(工学版), 2026, 60(10): 2176-2185 doi: 10.3785/j.issn.1008-973X.2026.10.010

计算机技术与控制工程

基于上下文增强与多目标语义感知的电力缺陷检测算法

胡欣,, 阎希玥, 常娅姝, 程鸿亮, 肖剑,, 罗诗伟, 马亮

1. 长安大学 能源与电气工程学院,陕西 西安 710018

2. 长安大学 电子与控制工程学院,陕西 西安 710064

3. 陕西核昌机电装备有限公司,陕西 咸阳 712000

Context-enhanced multi-target semantic perception algorithm for power defect detection

HU Xin,, YAN Xiyue, CHANG Yashu, CHENG Hongliang, XIAO Jian,, LUO Shiwei, MA Liang

1. School of Energy and Electrical Engineering, Chang’an University, Xi’an 710018, China

2. School of Electronic and Control Engineering, Chang’an University, Xi’an 710064, China

3. Shaanxi Hechang Electromechanical Equipment Co. Ltd, Xianyang 712000, China

通讯作者: 肖剑,男,副教授. orcid.org/0000-0003-0650-6099. E-mail:xiaojian@chd.edu.cn

收稿日期: 2025-08-26  

基金资助: 陕西省秦创原“科学家+工程师”队伍建设项目(2024QCY-KXJ-161);咸阳市重大科技创新专项(人工智能)(L2025-ZDKJ-ZDGG-RGZN-005).

Received: 2025-08-26  

Fund supported: 陕西省秦创原“科学家+工程师”队伍建设项目(2024QCY-KXJ-161);咸阳市重大科技创新专项(人工智能)(L2025-ZDKJ-ZDGG-RGZN-005).

作者简介 About authors

胡欣(1975—),女,教授,博士,从事智慧巡检、人工智能和多模态数据融合研究.orcid.org/0009-0006-2066-5490.E-mail:huxin@chd.edu.cn , E-mail:huxin@chd.edu.cn

摘要

为了提升复杂变电站巡检场景下多类别电力缺陷的检测精度,构建电力缺陷巡检数据集Electric_Data,并基于RT-DETR框架提出基于上下文信息增强与多目标语义感知的PDD-SPCIE算法. 设计LDDM-ResNet网络,通过多核并行卷积提取高低频细节特征;设计DA-Encoder模块,通过可变形注意力和动态采样增强多尺度、形态不规则目标的特征表达;设计LGCA模块,通过空洞卷积和空间深度转换卷积实现全局-局部特征融合. 上述模块分别从特征表达、上下文建模与特征融合3方面对原框架进行改进,增强了模型对多类别缺陷的统一检测能力. 实验结果表明,该模型在自建数据集上的精确度、召回率和mAP50分别为0.819、0.681和0.704,在VOC数据集上的精确度、召回率和mAP50分别为0.719、0.642和0.712.

关键词: 变电站电力缺陷巡检 ; 深度学习 ; DETR目标检测算法 ; 上下文信息增强 ; 多目标语义感知

Abstract

The Electric_Data inspection dataset was constructed, and a PDD-SPCIE algorithm based on context information enhancement and multi-target semantic perception was proposed within the RT-DETR framework, in order to improve the detection accuracy of multi-category power defects in complex substation inspection scenarios. The LDDM-ResNet module was designed to extract high- and low-frequency detailed features through multi-kernel parallel convolution. The DA-Encoder module was constructed to enhance the representation of multi-scale and irregularly shaped targets by incorporating deformable attention and dynamic sampling. The LGCA module was introduced to fuse global and local features using atrous convolution and spatial depth transformation convolution. The original framework was improved from the aspects of feature representation, context modeling, and feature fusion, thus enhancing the unified detection ability for multiple defect categories. Experimental results showed that the proposed model achieved a precision of 0.819, a recall of 0.681, and an mAP50 of 0.704 on the self-built dataset, and a precision of 0.719, a recall of 0.642, and an mAP50 of 0.712 on the VOC dataset.

Keywords: substation power defect inspection ; deep learning ; DETR object detection algorithm ; context information enhancement ; multi-target semantic perception

PDF (3207KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

胡欣, 阎希玥, 常娅姝, 程鸿亮, 肖剑, 罗诗伟, 马亮. 基于上下文增强与多目标语义感知的电力缺陷检测算法. 浙江大学学报(工学版)[J], 2026, 60(10): 2176-2185 doi:10.3785/j.issn.1008-973X.2026.10.010

HU Xin, YAN Xiyue, CHANG Yashu, CHENG Hongliang, XIAO Jian, LUO Shiwei, MA Liang. Context-enhanced multi-target semantic perception algorithm for power defect detection. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(10): 2176-2185 doi:10.3785/j.issn.1008-973X.2026.10.010

随着智能电网和特高压工程的持续推进,电力系统的规模和复杂性显著提升,传统依赖人工巡检的变电站运维模式已难以满足当前电网安全、实时、高效的运行需求[1]. 变电站作为电力传输的重要枢纽,其各类设备的例行巡视是保障电力系统稳定运行和安全供电的重要手段,国内传统变电站多采用辅助设备监控结合人力分析,层级环节多,系统故障率高[2-3]. 为此,基于深度学习的电力缺陷检测成为研究热点,其核心是在复杂环境中精准识别缺陷目标,保障电网稳定运行[4].

在通用目标检测算法发展进程中,主流方法经历了从两阶段(如Fast R-CNN[5])到单阶段检测器(如SSD[6]、YOLO[7]系列)的演进. 近年来,Transformer架构[8]的逐渐兴起也开始引领检测范式由卷积向注意力机制转变,以DETR(Detection Transformer)[9]及其改进系列Deformable DETR[10]、RT-DETR(Real-time DETR)[11]为代表,进一步增强了检测器的全局建模与特征表达能力.

在电力缺陷检测领域,YOLO系列因结构简洁、检测速度快而被广泛应用,但与通用目标检测场景不同,电力巡检图像常存在目标尺度差异大、背景干扰强、样本分布不均等问题,单纯使用卷积结构进行特征提取,在复杂场景下容易漏检或误检. 部分研究通过卷积结构改进[12]或层次化设计的检测流程[13]来提升小目标检测精度,同时,也有研究尝试将受到Vision Transformer(ViT)[14]启发的ConvNeXt骨干[15]引入YOLO架构,在保持卷积效率的同时增强全局特征建模能力[16]. 上述改进虽一定程度缓解YOLO在小目标特征提取与局部语义表达方面的局限,但因依赖卷积局部建模,在跨区域语义关联、复杂背景鲁棒性及全局上下文理解上仍有不足.

为了增强全局特征提取能力,DETR及其改进模型被引入电力缺陷检测任务. 尽管其在复杂背景下的全局关系建模上具有优势,但在应对电力图像中小目标缺陷、样本稀缺场景以及训练收敛较慢等问题时仍显不足. 为了应对这些问题,现有研究聚焦于注意力机制的优化和特征融合策略的改进:如在DETR中引入混合注意力模块CBAM[17]以增强特征选择能力,但其处理过程中易丢失对小目标相关的空间细节[18];或引入跨模态语义信息,如视觉-语言模型FLAVA[19]以提升小目标检测与抑制背景噪声,但其模型针对单一绝缘子缺陷,泛化能力有限[20];还有研究尝试通过解码器适配器模块优化预训练权重以提升训练效率[21]. 尽管这些方法在特定检测目标上取得一定进展,但其在对局部细节特征的感知上仍有提升空间.

综上,现有变电站缺陷巡检技术仍存在共性问题:一是研究多聚焦于绝缘子破损、绝缘子污闪、变压器漏油等单一类型缺陷,缺乏对多类缺陷的统一建模与综合检测;二是部分模型对语义与细节感知能力不足,难以应对实际巡检中设备形态多变、背景复杂的情况,易导致漏检或误检. 针对上述问题,本研究以DETR为基础设计了PDD-SPCIE算法,包含长距离依赖多核残差网络LDDM-ResNet、可变形注意力机制DA-Encoder模块和融合局部-周围-全局语义信息的LGCA模块,并在自建电力缺陷数据集Electric_Data上进行系统消融实验,验证各个改进模块的有效性,在公共数据集VOC上与其他类型目标检测算法进行对比以评估整体性能. 与现有DETR改进方法相比,PDD-SPCIE通过上述3个模块的优化,旨在兼顾推理效率与检测性能,协同增强语义表达、特征融合与检测精度,以适配复杂电力巡检场景对多类缺陷统一检测的需求.

1. 变电站电力缺陷巡检数据集构建

针对现有变电站电力缺陷巡检数据集样本有限、获取途径单一的问题,构建了电力缺陷巡检数据集Electric_Data. 其中,电力缺陷指在巡检中可能影响设备安全或功能的异常情况,包括结构损坏、表面异常、异物侵入及作业行为不规范等. 数据集共收集正样本图像3 931张,涵盖电力设备与非电力设备2大类包含17种缺陷类型;另收集2 504张负样本图像(正常图像). 电力设备缺陷可分为结构性异常与外观性异常2类:前者涉及部件破损或局部损伤,通常缺陷区域较小,边缘模糊且形态不规则,特征提取易出现细节丢失;后者表现为颜色、部件状态或装配完整性变化,检测时须结合上下文信息,对模型全局特征理解能力要求高. 非电力设备缺陷主要由作业人员安全防护不规范引起,外观多样,姿态变化大,要求模型具备一定语义理解能力.

正负样本数据主要来源于西安市某330 kV变电站、天水市某330 kV变电站、上海交通大学电网缺陷样本仿真数据库(绝缘子缺陷数据集)以及PP飞桨AI Studio数据库等平台. 为了增强数据多样性并模拟巡检中可能的特殊场景,数据集应用离线数据增强库Albumentations[22]进行扩充,包括裁剪、镜像、旋转等像素级变换,以及曝光、太阳光斑、随机亮度、雨天等空间级变换. 最终得到电力缺陷样本8 602张、正常样本7 244张,各类别增强前、后数量对比见表1,经扩充后,数据集样本分布均匀,能有效提升模型训练稳定性. 其中,Nraw为原始数据量,Nfinal为最终数据量.

表 1   Electric_Data数据集缺陷类型及样本分布

Tab.1  Defect types and sample distribution of Electric_Data

属性类别样本类别具体缺陷类型NrawNfinal
电力设备缺陷正样本表计破损236471
正样本表盘模糊遮挡330495
正样本表盘外壳生锈244488
正样本绝缘子龟裂或断裂50482
正样本绝缘子破损161482
正样本绝缘子污闪40495
正样本绝缘子自爆221581
正样本硅胶变色500500
正样本硅胶体破损85505
正样本箱门闭合异常178524
正样本盖板破损或缺失268536
正样本鸟巢503503
正样本挂空悬浮物432512
正样本油污541541
非电力设备缺陷正样本未穿工装96480
正样本未戴安全帽73493
正样本吸烟120514
正常状态负样本表计正常3721116
负样本绝缘子正常5512204
负样本呼吸器正常462924
负样本箱门和盖板正常357714
负样本变电站环境正常4551365
负样本人员行为正常307921

新窗口打开| 下载CSV


2. PDD-SPCIE算法基本结构

本章方法围绕引言部分的2个问题展开. 1)针对现有研究多聚焦于单一类型缺陷,缺乏统一建模和综合检测能力的问题,基于RT-DETR框架设计了面向多类电力缺陷和非电力缺陷的综合检测的电力缺陷目标检测算法PDD-SPCIE(power defect detection-multi object semantic effective perception object detection network based on context information enhancement). 2)为了解决因模型在语义与细节信息感知方面的不足而导致的误检、漏检问题,设计了3个核心模块,分别对应不同层次的难点:LDDM-ResNet网络(long distance dependent multi-core residual network)面向特征表达层,提升对形态、纹理相似类目标的特征感知能力;DA-Encoder模块(deformable attention-encoder module)面向特征建模层,增强对多尺度、形态不规则目标的感知能力;LGCA模块(local-global context aggregation module)面向特征融合层,缓解下采样导致的小目标细节缺失,同时增强特征的语义表达与抑制背景干扰.

2.1. LDDM-ResNet长距离依赖多核残差网络

基于ResNet-18网络结构,借鉴PKI模块[23],设计了LDDM-ResNet骨干网络,其具体结构如图1所示. 网络通过多核卷积进行特征提取,以捕捉到更丰富的语义和细节信息,提升模型对形态、纹理相似目标特征的表征能力.

图 1

图 1   LDDM-ResNet模型框架

Fig.1   LDDM-ResNet model framework


LDDM-ResNet共包括3个模块,分别为卷积归一化层(ConvNormlayer)、最大池化层(Maxpool)以及核心模块LDDM-Res. 首先,对输入图像进行卷积、ReLU激活函数、最大池化等操作,将得到$ \left(\frac{H}{4}\times \frac{W}{4}\times 64\right) $的特征图,送入LDDM-Res模块进行后续处理.

核心模块LDDM-Res共包括2个分支. 主分支首先通过一个3×3卷积提取初步特征,接着通过高低频卷积(H_L frequency Conv)进行高频特征和低频特征提取. 然后,引入一组深度可分离卷积,以实现轻量化的特征提取与增强;辅助分支通过一个1×1卷积来实现通道维度调整和特征映射. 最后将2个分支的输出进行残差连接,得到整个模块的输出. 经5次下采样后,主干网络最终输出3个尺度的特征图,记为S3、S4和S5. 其中,最高层S5特征图大小为$ \left(\frac{H}{32}\times \frac{W}{32}\times 512\right) $.

高低频卷积模块的具体结构如图2所示. 该模块基于高低频分解思想进行优化,提出了更高效的高低频卷积模块. out_channels为设定总通道数,通过设置参数$ \alpha $来控制高低频卷积的输入通道比例.

图 2

图 2   高低频卷积模块结构图

Fig.2   Structure of high-low frequency convolution module


1)高频分支:负责提取图像的细节和边缘信息. 通过对所指定的$ 1-\alpha $通道进行3×3卷积操作,得到高频特征.

2)低频分支:首先对输入进行平均池化,进行下采样操作,捕捉图像的全局信息和大范围的上下文特征. 然后将剩余的$ \alpha $个通道通过3×3卷积进行特征提取,最后经过Attention_upsample模块进行上采样操作.

最终,对2个分支的特征图进行拼接,即可得到该模块最终输出的特征图. 借助这种分频处理,高频特征能够更好地捕捉细节和边缘信息,而低频特征则可以强化图像的全局上下文信息理解,提升模型在多尺度目标检测中的性能. 通过这种设计,LDDM-Res模块能够有效融合多尺度特征,并利用残差连接增强信息流动,从而提升网络的性能和稳定性.

2.2. DA-Encoder可变形的尺度间特征交互模块

所设计的DA-Encoder模块,如图3所示,由可变形注意力机制DA-Attention[24](deformable attention)和Transformer Encoder的基础编码模块组成. 该模块通过动态位置采样与自适应注意力计算,实现对多尺度与不同空间位置特征的精确建模,从而提升对上下文信息的表达与融合能力.

图 3

图 3   DA-Encoder模块流程示意图

Fig.3   Flowchart of DA-Encoder module


将图像输入到DA-Encoder模块中后,首先分成2个分支:一个分支进行特征投影,将$ \boldsymbol{x} $投影到查询(Query)空间,得到对应的查询权重$ {\boldsymbol{W}}_{q} $,并对其进行卷积操作得到对应的偏移量$ \Delta \boldsymbol{p} $;另一个分支则结合参考点和偏移量,生成更精确的采样点,以更好地贴合目标物体的空间位置.

对于给定的输入特征$ \boldsymbol{x}\in {{R}}^{H\times W\times C} $,定义一组均匀分布于特征图上的参考点集合,记作$ \boldsymbol{p}\in {\mathbf{R}}^{{{\textit{H}}_{\rm{G}}}\times {{\textit{W}}_{\rm{G}}}\times \textit{2}} $,用以引导后续的可变形注意力计算,获得对应的投影矩阵,表达式如下:

$\boldsymbol{q}=\boldsymbol{x}{\boldsymbol{W}}_{q},{\tilde{{\boldsymbol{k}}}}=\boldsymbol{x}{\boldsymbol{W}}_{k},{\tilde{{\boldsymbol{v}}}}=\boldsymbol{x}{\boldsymbol{W}}_{v}\;, $

$ \Delta \boldsymbol{p}={{\theta }}_{\text{offset}}({\boldsymbol{q}}),\boldsymbol{x}={\phi }(\boldsymbol{x};\boldsymbol{p}+\Delta \boldsymbol{p}). $

式中:q为经过输入特征x线性投影得到的查询向量;θ为偏移量预测模块,其以q为输入,学习得到采样位置的偏移量,用于动态调整空间采样位置;$ \widetilde{{\boldsymbol{k}}} $$ \widetilde{{\boldsymbol{v}}} $分别表示变形后的kv$ {\boldsymbol{W}}_{q} $$ {\boldsymbol{W}}_{k} $$ {\boldsymbol{W}}_{v} $为投影矩阵;$ \Delta \boldsymbol{p} $$ {{\theta }}_{\text{offset}} $生成的偏移量;$ {\phi }(\cdot ) $为采样函数.

在注意力机制计算阶段,执行以下流程:首先将查询得到的$ {\boldsymbol{W}}_{q} $$ {\boldsymbol{W}}_{k} $$ {\boldsymbol{W}}_{v} $值映射到适当空间以计算注意力得分,并将注意力得分与位置编码相加后通过归一化层进行标准化处理;然后将该结果与上一层输出进行残差连接,再送入全连接层处理;最后再次通过残差连接和归一化层处理,得到最终的注意力权重并输出.

对于第m个注意力头,其注意力计算公式如下:

$ {{\boldsymbol{z}}}^{(m)}={\sigma }\left({{\boldsymbol{q}}}^{(m)}{\tilde{{\boldsymbol{k}}}}^{(m){\mathrm{T}} }/\sqrt{d}+{\phi }(\hat{B};R)\right){\tilde{{\boldsymbol{v}}}}^{(m)}. $

式中:$ {\phi }(\hat{B};R)\in {\mathbf{R}}^{HW\times {{H}_{{\mathrm{G}}}}{{W}_{{\mathrm{G}}}}} $为第m个注意力图的位置编码;${\sigma }(\cdot ) $为Softmax激活函数;$ {{\boldsymbol{z}}}^{(m)} $表示第m个头的位置编码输出;$ \hat{B}$为可学习的相对位置偏置参数,R表示参考采样网格,两者共同用于构建空间位置偏置,参与后续注意力计算.

DA-Attention能够通过动态位置采样适应特征图中不同空间位置的特征和尺度信息,从而帮助编码器更好地理解图中不同区域之间的关系,强化对空间和上下文信息的建模,有效针对同一物体不同尺度、形状带来的检测问题进行优化.

2.3. LGCA局部-全局特征增强的上下文感知模块

基于ContextGuideDown模块[25]的结构设计了LGCA模块,如图4所示. 该模块通过在不同特征层之间进行局部与全局语义的特征融合,实现小目标细节信息补充,提升模型在复杂背景下的检测精度.

图 4

图 4   LGCA模块结构示意图

Fig.4   Structure of LGCA module


LGCA模块通过设置3个特征提取分支更全面地提取特征信息:局部特征提取分支、周围特征提取分支和全局特征提取分支. 特征图输入模块后,首先经过分支处理:一个分支通过3×3卷积提取局部特征;另一个分支依次进行膨胀率为1、2、3的空洞卷积,并通过1×1卷积进一步处理,得到周围特征. 然后,将2个分支的特征图拼接,并通过空间深度转换卷积(SPDConv,space-to-depth convolution)[26]实现下采样. 最后,拼接后的特征图经全局平均池化后,得到最终的下采样结果. 其中,SPDConv经过4个平行的切片(Split)操作进行下采样,具体操作如下:$ x\left[\cdots,\colon \colon 2,\colon \colon 2\right] $选择输入特征图中偶数行和偶数列的像素;$ x\left[\cdots,1\colon \colon 2,\colon \colon 2\right] $选择输入特征图中奇数行和偶数列的像素;$ x\left[\cdots,\colon \colon 2,1\colon \colon 2\right] $选择输入特征图中偶数行和奇数列的像素;$ x\left[\cdots,1\colon \colon 2,1\colon \colon 2\right] $选择输入特征图中奇数行和奇数列的像素. 将得到的4个下采样特征图在通道维度上进行拼接,后续经过通道变换从而获得对应的下采样输出. 通过这种跨行跨列的特征融合,实现对空间特征的多样表达,从而使网络能够关注到图像的不同部分.

2.4. PDD-SPCIE算法整体框架

图5所示为PDD-SPCIE算法的整体框架. 以表盘外壳生锈为例,整个检测流程可划分为特征提取、特征增强与融合、目标解码3个阶段. 首先,输入图像经LDDM-ResNet骨干网络进行特征提取,得到多尺度特征图(S3、S4、S5). 其中,最高层的S5特征图结合位置编码信息后,作为DA-Encoder模块的输入. 随后,该模块的输出经逐层上采样后,与特征图S3、S4进行特征融合,融合过程中引入LGCA模块加强细节信息学习. 最终,将融合后的特征图输入Transformer Decoder中进行解码,并通过全连接层输出,实现目标类别与边界框的端到端预测.

图 5

图 5   PDD-SPCIE算法整体框架

Fig.5   Overall framework of PDD-SPCIE


与现有DETR改进模型Deformable DETR不同,本研究提出的DA-Encoder模块中,可变形注意力机制仅在单尺度高层特征图(S5)中使用,以提升目标语义表达能力并抑制背景干扰. 同时,为了弥补单尺度特征在细节层面的不足,本研究在后续网络中引入LGCA模块,对S3、S4这类低层特征进行细节补充与多层特征融合,兼顾语义理解与细节感知. 相较于本研究后续实验中所选基线模型RT-DETR的基础骨干网络,LDDM-ResNet骨干网络通过多核卷积和高低频卷积模块增强自身的多尺度特征表达,通过高低频分支提取全局-局部特征信息,在保持与RT-DETR相近的实时推理速度的同时,提升了模型在电力缺陷检测场景中的性能. 综合上述3个模块,本研究所提出的PDD-SPCIE算法实现了局部细节感知与全局语义信息理解的协同优化.

3. 实验结果与分析

3.1. 实验环境配置

本章实验具体环境配置如表2所示. 以PyTorch作为深度学习框架,训练过程中设置Batch_size为16;验证过程中设置Batch_size为64;workers设置为1;训练轮数(epochs)为100;初始学习率(lr0)为0.0001;权重衰减(weight decay)为0.0001;动量(momentum)为0.9(适用于SGD优化器,AdamW使用其内部默认动量参数). 将收集图像按照8∶1∶1的比例划分为训练集、验证集、测试集后进行离线数据扩充,得到最终用于训练的电力缺陷巡检数据集Electric_Data,共计15 846张图片.

表 2   实验环境配置

Tab.2  Experimental environment configuration

名称实验配置
操作系统Ubuntu 22.04.5 LTS
编程语言Python 3.8
深度学习框架PyTorch 1.13.4
CPUIntel® Core™ i7-10700 CPU
GPUNVIDIA GeForce RTX 3090×2
CUDA11.6
平台Pycharm 2022

新窗口打开| 下载CSV


3.2. 参数选择实验

参数选择实验在公共数据集VOC和自建数据集Electric_Data上分别进行,综合2个数据集的实验结果选择对应参数,确保参数优化与实际任务的一致性.

3.2.1. 高低频卷积模块

在LDDM-ResNet网络中,高低频卷积通道占比$ \alpha $的最优取值须通过实验得出,实验结果如表3所示. 在保证mAP、精确度P和召回率R基本持平的同时,结合计算效率,最终选择$ \alpha =0.25 $作为低频通道的占比.

表 3   高低频卷积模块通道占比取值实验

Tab.3  Channel-ratio experiment of high-low frequency convolution module

数据集$ \alpha $PRmAP50mAP50-95
VOC00.6710.5680.5960.451
0.1250.7030.5700.6110.466
0.2500.7010.5780.6160.466
0.5000.6970.5730.6150.464
0.7500.6850.5690.6010.456
Electric_Data00.8160.6600.6910.393
0.1250.8140.6930.7010.389
0.2500.8560.6950.7040.395
0.5000.8110.6660.7060.395
0.7500.8270.6660.6910.386

新窗口打开| 下载CSV


3.2.2. 多核卷积组合

在LDDM-ResNet网络中,不同卷积核的大小及组合方式会影响模型对多尺度目标的特征提取能力,从而影响最终检测性能. 为了确定本任务的最优卷积核组合,在公共数据集和自建数据集上分别进行了系统实验. 实验结果如表4所示,当卷积核组合为(3,5,7,9)时,模型检测效果最优.

表 4   LDDM-ResNet多核卷积组合参数实验

Tab.4  Multi-kernel combination experiment(LDDM-ResNet)

数据集卷积核组合PRmAP50mAP50-95
VOC(3, 3, 3, 3)0.6950.5690.6150.465
(3, 5, 7, 9)0.7010.5780.6160.466
(3, 5, 7, 11)0.6880.5780.6150.467
(3, 5, 5, 7)0.6890.5670.6050.457
(5, 7, 9, 11)0.6770.5570.5930.447
Electric_Data(3, 3, 3, 3)0.8190.6830.7020.391
(3, 5, 7, 9)0.8560.6760.7030.399
(3, 5, 7, 11)0.8280.6750.6940.390
(3, 5, 5, 7)0.8210.6830.7010.395
(5, 7, 9, 11)0.8050.6750.6970.398

新窗口打开| 下载CSV


3.2.3. 膨胀率设计

在LGCA模块中,周围特征的获取须采用3个不同膨胀率的空洞卷积进行拼接处理,因此,须通过实验获取膨胀率的最优取值以选取特征表达最优的参数配置,实验结果如表5所示. 综合公共数据集与自建数据集的实验结果,当空洞卷积的膨胀率依次为1、2、3时,模型检测效果最优.

表 5   LGCA模块空洞卷积膨胀率参数实验

Tab.5  Dilation rate parameter experiment of atrous convolution for LGCA module

数据集膨胀率PRmAP50mAP50-95
VOC1、2、30.7020.5750.6280.482
2、3、40.6910.5730.6140.471
1、3、50.6930.5810.6270.478
2、4、60.6920.5860.6220.475
Electric_Data1、2、30.8060.6890.7050.393
2、3、40.7810.6670.680.383
1、3、50.7960.6660.6790.384
2、4、60.8010.6750.6910.386

新窗口打开| 下载CSV


3.3. 消融实验

以RT-DETR为基准模型,在自建电力缺陷数据集Electric_Data上进行消融实验:在基线模型上分别用LDDM-ResNet取代原骨干网络结构、用DA-Encoder取代原基线模型中编码器模块、用LGCA取代原基线模型中特征融合部分,实验结果如表6所示. 结果表明,LDDM-ResNet精确度P提升最高,较基线提升0.135,综合3个模块的PDD-SPCIE精确度P为0.819,稍低于LDDM-ResNet,但仍明显优于基线模型. 多核卷积的引入增强了模型对正负样本的判别能力,有效抑制了背景区域和错误检测带来的干扰.

表 6   Electric_Data数据集上的消融实验结果

Tab.6  Ablation experiment results on Electric_Data

算法
类型
PRmAP50mAP50-95FLOPs/
109
Parameters/
106
FPS/
(帧·s−1)
RT-DETR0.6960.5710.6870.379103.532.010108.695
LDDM-
ResNet
0.8310.6610.7030.39164.524.850144.927
DA-
Encoder
0.7880.6530.7000.386114.944.200131.578
LGCA0.8030.670.6700.37257.219.897149.253
PDD-
SPCIE
0.8190.6810.7040.395122.749.170112.359

新窗口打开| 下载CSV


3个改进模块在召回率R上均有所提升,LDDM-ResNet、DA-Encoder、LGCA分别较基线模型提升了0.090、0.082、0.099,即本研究设计的3个模块能更全面地捕捉目标信息,准确识别各类型电力缺陷.

对比基线模型与3个模块的mAP50和mAP50-95指标:LDDM-ResNet模块分别提升0.016和0.012;DA-Encoder模块分别提升0.013和0.007;而LGCA模块指标略有下降,可能与其采用的空洞卷积有关. 空洞卷积通过稀疏采样扩大感受野,虽然获取了更大范围的上下文信息,但会破坏局部像素连续性,削弱模型对边缘和细节的响应,同时稀疏采样可能引入背景特征混叠,使小目标或细长结构的边界定位精度下降,进而造成mAP指标的轻微降低. 然而,空洞卷积的引入帮助平衡了DA-Encoder中可变形卷积模块引入的参数计算量,使综合3个模块的PDD-SPCIE算法实现了更优的性能与效率的平衡.

对于实用性评价指标计算复杂度FLOPs、参数量Parameters、推理速度FPS:LDDM-ResNet网络通过将标准卷积分解为逐通道卷积和逐点卷积,显著减少通道间冗余计算与参数量,将参数量由32.01×106降至24.85×106(下降约22.4%),FLOPs从103.5×109减少至64.5×109(下降约37.7%);同时,LGCA模块通过卷积层的轻量化设计和空间深度转换卷积SPDConv进一步减少参数量和计算复杂度. 综合3模块的PDD-SPCIE算法在模型大小以及实时性方面与基线模型基本持平,实现了精度和效率间的良好平衡.

3.4. 算法对比实验
3.4.1. 网络模型对比

为了全面验证本研究所提算法的有效性,在公共数据集VOC上,将PDD-SPCIE算法分别与参数规模相近的YOLOv8(l)、YOLOv6(l)、RT-DETR、YOLOv9(c)和YOLOv10(l)目标检测算法进行对比实验,结果如表7所示. 实验结果表明,本研究提出的PDD-SPCIE算法在精确度P和mAP50上均高于其他对比算法,整体检测表现更平衡且稳定. 与基线模型RT-DETR相比,PDD-SPCIE在全部评价指标上均实现了明显提升;同时,其召回率R与先进YOLO系列模型持平甚至略有优势.

表 7   网络模型对比实验

Tab.7  Comparison experiments of network models

算法PRmAP50mAP50-95FLOPs/
109
Parameters/
106
FPS/
(帧·s−1)
YOLOv6(l)0.6570.5790.6280.484391.2110.80070.422
YOLOv8(l)0.7050.6550.7060.526164.943.62253.763
RT-DETR0.6960.5710.6070.449114.944.220116.279
YOLOv9(c)0.7150.6260.6920.53778.725.850163.930
YOLOv10(l)0.6670.6000.6480.501282.3103.70079.365
PDD-SPCIE0.7190.6420.7120.538122.749.10078.740

新窗口打开| 下载CSV


3.4.2. 网络结构对比

表8所示分别为本研究提出的3个模块LDDM-ResNet、DA-Encoder和LGCA模块与其他类似的先进骨干网络、注意力机制和下采样模块的对比结果. 结果表明,尽管PKINet和c2f-PKI骨干网络同样引入了PKI模块,但LDDM-ResNet在PR、mAP50、mAP50-95等关键指标上均展现出系统性的优势. DA-Encoder模块在PR、mAP50、mAP50-95等指标上均表现出色,但因其更聚焦于位置信息及目标形状的学习,相较于分类能力更擅长于目标定位,因此P较其他注意力机制稍低. LGCA模块在PR、mAP50、mAP50-95等指标上也均较其他下采样方法有所提升.

表 8   核心模块与其他主流方法对比

Tab.8  Comparison of core modules and mainstream methods

模型PRmAP50mAP50-95
先进骨干
网络
StartNet0.6820.5480.5870.438
Efficient Formerv20.6380.5280.5580.412
HGnetV20.6960.5690.6070.449
Ghost HGNetV20.6760.5650.6000.446
PKINet0.6320.5260.5580.414
c2f-PKI0.6870.5410.5910.448
LDDM-ResNet0.7010.5780.6160.466
先进注意力
机制
Efficient Additive0.6890.5490.6050.457
Cascaded Group0.6790.5640.6150.468
HilO0.6890.5490.6010.460
LPE0.6900.5580.6060.466
DA-Encoder0.6870.5750.6160.474
先进下采样
模块
CG-Down0.6650.5920.6130.470
HSFPN0.6760.5760.6080.459
HSPAN0.6590.5380.5760.438
Waveletpool0.5840.4630.4850.364
slimneck0.6860.5680.6010.451
LGCA0.7020.5750.6280.482

新窗口打开| 下载CSV


3.5. 可视化效果对比

图6所示为RT-DETR算法与本研究提出的PDD-SPCIE的可视化检测效果对比图. 由图可知,在置信度方面,PDD-SPCIE对典型缺陷的检测置信度均高于基线算法.

图 6

图 6   可视化效果对比

Fig.6   Comparison of visual effects


对于挂空悬浮物(形状不规则的待检测物体),如图6(a)所示,本研究所提算法较基线模型置信度提高0.19,验证了DA-Encoder模块的有效性;对于黑夜环境下盖板缺失的问题,如图6(b)所示,置信度提高0.07;对于曝光条件下的表盘模糊遮挡以及绝缘子破损缺陷,如图6(f)所示,较基线模型置信度分别提高了0.12和0.20,验证了LDDM-ResNet对于不同尺寸特征的学习能力.

在小目标检测方面,如图6(c)、(d)、(e)所示,基线算法在避雷器电流表模糊度较低或轻微生锈时,未能检测出其对应的缺陷,但本研究所提算法正确检测到了对应缺陷;基线算法对于颜色较淡的油渍存在漏检现象,而本研究所提算法可以有效解决这一问题. 整体来看,基线算法对于一些小目标、细节信息存在一定的漏检、多检,而本研究所提算法不仅在检测精度上有所提升,且检测置信度均高于基线算法.

4. 结 语

针对变电站复杂巡检场景中缺陷检测存在的难点,提出改进的目标检测算法PDD-SPCIE. 首先,针对现有变电站缺陷检测中缺陷类型单一、样本不均衡的问题,构建了变电站电力缺陷巡检数据集Electric_Data;同时,针对语义信息理解与细节信息感知不足的问题,分别提出LDDM-ResNet骨干网络、DA-Encoder编码器和LGCA这3个模块,搭建统一框架检测多类别缺陷,并优化检测效果. 最后,通过消融实验和对比实验验证了所设计各模块的有效性. 综合实验验证表明,该算法在保持模型参数量与基线接近的前提下,能够稳步提升检测精度与模型鲁棒性,在实际巡检任务中具有良好的适应性与推广价值. 此外,该模型在公共数据集VOC上的综合性能优于RT-DETR、YOLO系列模型. 然而,本研究所提算法更关注检测效果的提升,在模型复杂度、参数量及检测速度上仍有一定优化空间.

参考文献

李鹏, 刘念, 胡秦然, 等

“新型电力系统数字化关键技术综述”专辑评述

[J]. 电力系统自动化, 2024, 48 (6): 1- 12

DOI:10.7500/AEPS20240201001      [本文引用: 1]

LI Peng, LIU Nian, HU Qinran, et al

Commentary on special issue of reviews on key technologies for digitalization of new power system

[J]. Automation of Electric Power Systems, 2024, 48 (6): 1- 12

DOI:10.7500/AEPS20240201001      [本文引用: 1]

李运堂, 李恒杰, 张坤, 等

基于新型编码解码网络的复杂输电线识别

[J]. 浙江大学学报: 工学版, 2024, 58 (6): 1133- 1141

[本文引用: 1]

LI Yuntang, LI Hengjie, ZHANG Kun, et al

Recognition of complex power lines based on novel encoder-decoder network

[J]. Journal of Zhejiang University: Engineering Science, 2024, 58 (6): 1133- 1141

[本文引用: 1]

周远翔, 陈健宁, 赵亮, 等

电力设备数智化发展历程与大语言模型智能体应用展望

[J]. 高电压技术, 2025, 51 (8): 4089- 4109

[本文引用: 1]

ZHOU Yuanxiang, CHEN Jianning, ZHAO Liang, et al

Evolution of digitization and intelligence of power equipment and prospects for application of large language model based agent

[J]. High Voltage Engineering, 2025, 51 (8): 4089- 4109

[本文引用: 1]

刘传洋, 吴一全

基于深度学习的输电线路视觉检测方法研究进展

[J]. 中国电机工程学报, 2023, 43 (19): 7423- 7445

DOI:10.13334/j.0258-8013.pcsee.221139      [本文引用: 1]

LIU Chuanyang, WU Yiquan

Research progress of vision detection methods based on deep learning for transmission lines

[J]. Proceedings of the CSEE, 2023, 43 (19): 7423- 7445

DOI:10.13334/j.0258-8013.pcsee.221139      [本文引用: 1]

GIRSHICK R. Fast R-CNN [C]// Proceedings of the IEEE International Conference on Computer Vision. Santiago: IEEE, 2016: 1440–1448.

[本文引用: 1]

LIU W, ANGUELOV D, ERHAN D, et al. SSD: single shot MultiBox detector [C]// Computer Vision – ECCV 2016. Cham: Springer, 2016: 21–37.

[本文引用: 1]

REDMON J, DIVVALA S, GIRSHICK R, et al. You only look once: unified, real-time object detection [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 779–788.

[本文引用: 1]

VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need [C]// Advances in Neural Information Processing Systems 30. Long Beach: Curran Associates, 2017: 5998−6008.

[本文引用: 1]

CARION N, MASSA F, SYNNAEVE G, et al. End-to-end object detection with transformers [C]// Computer Vision – ECCV 2020. Cham: Springer, 2020: 213–229.

[本文引用: 1]

ZHU X, SU W, LU L, et al. Deformable DETR: deformable transformers for end-to-end object detection [EB/OL]. [ 2025−07−01]. https://arxiv.org/abs/2010.04159.

[本文引用: 1]

ZHAO Y, LV W, XU S, et al. DETRs beat YOLOs on real-time object detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 16965–16974.

[本文引用: 1]

ZHANG Q, ZHANG J, LI Y, et al

ID-YOLO: a multimodule optimized algorithm for insulator defect detection in power transmission lines

[J]. IEEE Transactions on Instrumentation and Measurement, 2025, 74: 3505611

DOI:10.1109/tim.2025.3527530      [本文引用: 1]

HOEFLER M A, MUELLER K, SAMEK W. XAI-guided insulator anomaly detection for imbalanced datasets [C]// Computer Vision – ECCV 2024 Workshops. Cham: Springer, 2025: 65–81.

[本文引用: 1]

LIU Z, LIN Y, CAO Y, et al. Swin transformer: hierarchical vision transformer using shifted windows [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2022: 9992–10002.

[本文引用: 1]

LIU Z, MAO H, WU C Y, et al. A ConvNet for the 2020s [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 11966–11976.

[本文引用: 1]

WU K, ZUO Y, GE J, et al. Insulator defect detection in power grids based on improved YOLOv8 [C]// Proceedings of the IEEE 26th China Conference on System Simulation Technology and its Applications. Shenzhen: IEEE, 2025: 540–545.

[本文引用: 1]

WOO S, PARK J, LEE J Y, et al. CBAM: convolutional block attention module [C]// Computer Vision – ECCV 2018. Cham: Springer, 2018: 3–19.

[本文引用: 1]

TANG S, ZHU R, JI C, et al. Intelligent detection of insulator defects on transmission lines in complex backgrounds based on improved DETR visual perception model [C]// Proceedings of the International Conference on Artificial Intelligence and Power Systems. Chengdu: IEEE, 2024: 83–89.

[本文引用: 1]

SINGH A, HU R, GOSWAMI V, et al. FLAVA: a foundational language and vision alignment model [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 15617–15629.

[本文引用: 1]

ZHANG K, YANG J, WANG J, et al

VLF-DETR: integrating vision-language and high-frequency features for transmission line defect detection

[J]. IEEE Transactions on Instrumentation and Measurement, 2025, 74: 5506115

DOI:10.1109/tim.2025.3586346      [本文引用: 1]

CHENG Y, LIU D

AdIn-DETR: adapting detection transformer for end-to-end real-time power line insulator defect detection

[J]. IEEE Transactions on Instrumentation and Measurement, 2024, 73: 3528511

[本文引用: 1]

BUSLAEV A, IGLOVIKOV V I, KHVEDCHENYA E, et al

Albumentations: fast and flexible image augmentations

[J]. Information, 2020, 11 (2): 125

DOI:10.3390/info11020125      [本文引用: 1]

CAI X, LAI Q, WANG Y, et al. Poly kernel inception network for remote sensing detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 27706–27716.

[本文引用: 1]

XIA Z, PAN X, SONG S, et al. Vision transformer with deformable attention [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 4784–4793.

[本文引用: 1]

WU T, TANG S, ZHANG R, et al

CGNet: a light-weight context guided network for semantic segmentation

[J]. IEEE Transactions on Image Processing, 2021, 30: 1169- 1179

DOI:10.1109/TIP.2020.3042065      [本文引用: 1]

SUNKARA R, LUO T. No more strided convolutions orPooling: a new CNN building block forLow-Resolution images andSmall objects [C]// Machine Learning and Knowledge Discovery in Databases. Cham: Springer, 2023: 443–459.

[本文引用: 1]

/