基于上下文增强与多目标语义感知的电力缺陷检测算法
Context-enhanced multi-target semantic perception algorithm for power defect detection
通讯作者:
收稿日期: 2025-08-26
| 基金资助: |
|
Received: 2025-08-26
| Fund supported: | 陕西省秦创原“科学家+工程师”队伍建设项目(2024QCY-KXJ-161);咸阳市重大科技创新专项(人工智能)(L2025-ZDKJ-ZDGG-RGZN-005). |
作者简介 About authors
胡欣(1975—),女,教授,博士,从事智慧巡检、人工智能和多模态数据融合研究.orcid.org/0009-0006-2066-5490.E-mail:
为了提升复杂变电站巡检场景下多类别电力缺陷的检测精度,构建电力缺陷巡检数据集Electric_Data,并基于RT-DETR框架提出基于上下文信息增强与多目标语义感知的PDD-SPCIE算法. 设计LDDM-ResNet网络,通过多核并行卷积提取高低频细节特征;设计DA-Encoder模块,通过可变形注意力和动态采样增强多尺度、形态不规则目标的特征表达;设计LGCA模块,通过空洞卷积和空间深度转换卷积实现全局-局部特征融合. 上述模块分别从特征表达、上下文建模与特征融合3方面对原框架进行改进,增强了模型对多类别缺陷的统一检测能力. 实验结果表明,该模型在自建数据集上的精确度、召回率和mAP50分别为0.819、0.681和0.704,在VOC数据集上的精确度、召回率和mAP50分别为0.719、0.642和0.712.
关键词:
The Electric_Data inspection dataset was constructed, and a PDD-SPCIE algorithm based on context information enhancement and multi-target semantic perception was proposed within the RT-DETR framework, in order to improve the detection accuracy of multi-category power defects in complex substation inspection scenarios. The LDDM-ResNet module was designed to extract high- and low-frequency detailed features through multi-kernel parallel convolution. The DA-Encoder module was constructed to enhance the representation of multi-scale and irregularly shaped targets by incorporating deformable attention and dynamic sampling. The LGCA module was introduced to fuse global and local features using atrous convolution and spatial depth transformation convolution. The original framework was improved from the aspects of feature representation, context modeling, and feature fusion, thus enhancing the unified detection ability for multiple defect categories. Experimental results showed that the proposed model achieved a precision of 0.819, a recall of 0.681, and an mAP50 of 0.704 on the self-built dataset, and a precision of 0.719, a recall of 0.642, and an mAP50 of 0.712 on the VOC dataset.
Keywords:
本文引用格式
胡欣, 阎希玥, 常娅姝, 程鸿亮, 肖剑, 罗诗伟, 马亮.
HU Xin, YAN Xiyue, CHANG Yashu, CHENG Hongliang, XIAO Jian, LUO Shiwei, MA Liang.
在电力缺陷检测领域,YOLO系列因结构简洁、检测速度快而被广泛应用,但与通用目标检测场景不同,电力巡检图像常存在目标尺度差异大、背景干扰强、样本分布不均等问题,单纯使用卷积结构进行特征提取,在复杂场景下容易漏检或误检. 部分研究通过卷积结构改进[12]或层次化设计的检测流程[13]来提升小目标检测精度,同时,也有研究尝试将受到Vision Transformer(ViT)[14]启发的ConvNeXt骨干[15]引入YOLO架构,在保持卷积效率的同时增强全局特征建模能力[16]. 上述改进虽一定程度缓解YOLO在小目标特征提取与局部语义表达方面的局限,但因依赖卷积局部建模,在跨区域语义关联、复杂背景鲁棒性及全局上下文理解上仍有不足.
为了增强全局特征提取能力,DETR及其改进模型被引入电力缺陷检测任务. 尽管其在复杂背景下的全局关系建模上具有优势,但在应对电力图像中小目标缺陷、样本稀缺场景以及训练收敛较慢等问题时仍显不足. 为了应对这些问题,现有研究聚焦于注意力机制的优化和特征融合策略的改进:如在DETR中引入混合注意力模块CBAM[17]以增强特征选择能力,但其处理过程中易丢失对小目标相关的空间细节[18];或引入跨模态语义信息,如视觉-语言模型FLAVA[19]以提升小目标检测与抑制背景噪声,但其模型针对单一绝缘子缺陷,泛化能力有限[20];还有研究尝试通过解码器适配器模块优化预训练权重以提升训练效率[21]. 尽管这些方法在特定检测目标上取得一定进展,但其在对局部细节特征的感知上仍有提升空间.
综上,现有变电站缺陷巡检技术仍存在共性问题:一是研究多聚焦于绝缘子破损、绝缘子污闪、变压器漏油等单一类型缺陷,缺乏对多类缺陷的统一建模与综合检测;二是部分模型对语义与细节感知能力不足,难以应对实际巡检中设备形态多变、背景复杂的情况,易导致漏检或误检. 针对上述问题,本研究以DETR为基础设计了PDD-SPCIE算法,包含长距离依赖多核残差网络LDDM-ResNet、可变形注意力机制DA-Encoder模块和融合局部-周围-全局语义信息的LGCA模块,并在自建电力缺陷数据集Electric_Data上进行系统消融实验,验证各个改进模块的有效性,在公共数据集VOC上与其他类型目标检测算法进行对比以评估整体性能. 与现有DETR改进方法相比,PDD-SPCIE通过上述3个模块的优化,旨在兼顾推理效率与检测性能,协同增强语义表达、特征融合与检测精度,以适配复杂电力巡检场景对多类缺陷统一检测的需求.
1. 变电站电力缺陷巡检数据集构建
针对现有变电站电力缺陷巡检数据集样本有限、获取途径单一的问题,构建了电力缺陷巡检数据集Electric_Data. 其中,电力缺陷指在巡检中可能影响设备安全或功能的异常情况,包括结构损坏、表面异常、异物侵入及作业行为不规范等. 数据集共收集正样本图像3 931张,涵盖电力设备与非电力设备2大类包含17种缺陷类型;另收集2 504张负样本图像(正常图像). 电力设备缺陷可分为结构性异常与外观性异常2类:前者涉及部件破损或局部损伤,通常缺陷区域较小,边缘模糊且形态不规则,特征提取易出现细节丢失;后者表现为颜色、部件状态或装配完整性变化,检测时须结合上下文信息,对模型全局特征理解能力要求高. 非电力设备缺陷主要由作业人员安全防护不规范引起,外观多样,姿态变化大,要求模型具备一定语义理解能力.
表 1 Electric_Data数据集缺陷类型及样本分布
Tab.1
| 属性类别 | 样本类别 | 具体缺陷类型 | Nraw | Nfinal |
| 电力设备缺陷 | 正样本 | 表计破损 | 236 | 471 |
| 正样本 | 表盘模糊遮挡 | 330 | 495 | |
| 正样本 | 表盘外壳生锈 | 244 | 488 | |
| 正样本 | 绝缘子龟裂或断裂 | 50 | 482 | |
| 正样本 | 绝缘子破损 | 161 | 482 | |
| 正样本 | 绝缘子污闪 | 40 | 495 | |
| 正样本 | 绝缘子自爆 | 221 | 581 | |
| 正样本 | 硅胶变色 | 500 | 500 | |
| 正样本 | 硅胶体破损 | 85 | 505 | |
| 正样本 | 箱门闭合异常 | 178 | 524 | |
| 正样本 | 盖板破损或缺失 | 268 | 536 | |
| 正样本 | 鸟巢 | 503 | 503 | |
| 正样本 | 挂空悬浮物 | 432 | 512 | |
| 正样本 | 油污 | 541 | 541 | |
| 非电力设备缺陷 | 正样本 | 未穿工装 | 96 | 480 |
| 正样本 | 未戴安全帽 | 73 | 493 | |
| 正样本 | 吸烟 | 120 | 514 | |
| 正常状态 | 负样本 | 表计正常 | 372 | |
| 负样本 | 绝缘子正常 | 551 | ||
| 负样本 | 呼吸器正常 | 462 | 924 | |
| 负样本 | 箱门和盖板正常 | 357 | 714 | |
| 负样本 | 变电站环境正常 | 455 | ||
| 负样本 | 人员行为正常 | 307 | 921 |
2. PDD-SPCIE算法基本结构
本章方法围绕引言部分的2个问题展开. 1)针对现有研究多聚焦于单一类型缺陷,缺乏统一建模和综合检测能力的问题,基于RT-DETR框架设计了面向多类电力缺陷和非电力缺陷的综合检测的电力缺陷目标检测算法PDD-SPCIE(power defect detection-multi object semantic effective perception object detection network based on context information enhancement). 2)为了解决因模型在语义与细节信息感知方面的不足而导致的误检、漏检问题,设计了3个核心模块,分别对应不同层次的难点:LDDM-ResNet网络(long distance dependent multi-core residual network)面向特征表达层,提升对形态、纹理相似类目标的特征感知能力;DA-Encoder模块(deformable attention-encoder module)面向特征建模层,增强对多尺度、形态不规则目标的感知能力;LGCA模块(local-global context aggregation module)面向特征融合层,缓解下采样导致的小目标细节缺失,同时增强特征的语义表达与抑制背景干扰.
2.1. LDDM-ResNet长距离依赖多核残差网络
图 1
LDDM-ResNet共包括3个模块,分别为卷积归一化层(ConvNormlayer)、最大池化层(Maxpool)以及核心模块LDDM-Res. 首先,对输入图像进行卷积、ReLU激活函数、最大池化等操作,将得到
核心模块LDDM-Res共包括2个分支. 主分支首先通过一个3×3卷积提取初步特征,接着通过高低频卷积(H_L frequency Conv)进行高频特征和低频特征提取. 然后,引入一组深度可分离卷积,以实现轻量化的特征提取与增强;辅助分支通过一个1×1卷积来实现通道维度调整和特征映射. 最后将2个分支的输出进行残差连接,得到整个模块的输出. 经5次下采样后,主干网络最终输出3个尺度的特征图,记为S3、S4和S5. 其中,最高层S5特征图大小为
高低频卷积模块的具体结构如图2所示. 该模块基于高低频分解思想进行优化,提出了更高效的高低频卷积模块. out_channels为设定总通道数,通过设置参数
图 2
1)高频分支:负责提取图像的细节和边缘信息. 通过对所指定的
2)低频分支:首先对输入进行平均池化,进行下采样操作,捕捉图像的全局信息和大范围的上下文特征. 然后将剩余的
最终,对2个分支的特征图进行拼接,即可得到该模块最终输出的特征图. 借助这种分频处理,高频特征能够更好地捕捉细节和边缘信息,而低频特征则可以强化图像的全局上下文信息理解,提升模型在多尺度目标检测中的性能. 通过这种设计,LDDM-Res模块能够有效融合多尺度特征,并利用残差连接增强信息流动,从而提升网络的性能和稳定性.
2.2. DA-Encoder可变形的尺度间特征交互模块
图 3
将图像输入到DA-Encoder模块中后,首先分成2个分支:一个分支进行特征投影,将
对于给定的输入特征
式中:q为经过输入特征x线性投影得到的查询向量;θ为偏移量预测模块,其以q为输入,学习得到采样位置的偏移量,用于动态调整空间采样位置;
在注意力机制计算阶段,执行以下流程:首先将查询得到的
对于第m个注意力头,其注意力计算公式如下:
式中:
DA-Attention能够通过动态位置采样适应特征图中不同空间位置的特征和尺度信息,从而帮助编码器更好地理解图中不同区域之间的关系,强化对空间和上下文信息的建模,有效针对同一物体不同尺度、形状带来的检测问题进行优化.
2.3. LGCA局部-全局特征增强的上下文感知模块
图 4
LGCA模块通过设置3个特征提取分支更全面地提取特征信息:局部特征提取分支、周围特征提取分支和全局特征提取分支. 特征图输入模块后,首先经过分支处理:一个分支通过3×3卷积提取局部特征;另一个分支依次进行膨胀率为1、2、3的空洞卷积,并通过1×1卷积进一步处理,得到周围特征. 然后,将2个分支的特征图拼接,并通过空间深度转换卷积(SPDConv,space-to-depth convolution)[26]实现下采样. 最后,拼接后的特征图经全局平均池化后,得到最终的下采样结果. 其中,SPDConv经过4个平行的切片(Split)操作进行下采样,具体操作如下:
2.4. PDD-SPCIE算法整体框架
如图5所示为PDD-SPCIE算法的整体框架. 以表盘外壳生锈为例,整个检测流程可划分为特征提取、特征增强与融合、目标解码3个阶段. 首先,输入图像经LDDM-ResNet骨干网络进行特征提取,得到多尺度特征图(S3、S4、S5). 其中,最高层的S5特征图结合位置编码信息后,作为DA-Encoder模块的输入. 随后,该模块的输出经逐层上采样后,与特征图S3、S4进行特征融合,融合过程中引入LGCA模块加强细节信息学习. 最终,将融合后的特征图输入Transformer Decoder中进行解码,并通过全连接层输出,实现目标类别与边界框的端到端预测.
图 5
与现有DETR改进模型Deformable DETR不同,本研究提出的DA-Encoder模块中,可变形注意力机制仅在单尺度高层特征图(S5)中使用,以提升目标语义表达能力并抑制背景干扰. 同时,为了弥补单尺度特征在细节层面的不足,本研究在后续网络中引入LGCA模块,对S3、S4这类低层特征进行细节补充与多层特征融合,兼顾语义理解与细节感知. 相较于本研究后续实验中所选基线模型RT-DETR的基础骨干网络,LDDM-ResNet骨干网络通过多核卷积和高低频卷积模块增强自身的多尺度特征表达,通过高低频分支提取全局-局部特征信息,在保持与RT-DETR相近的实时推理速度的同时,提升了模型在电力缺陷检测场景中的性能. 综合上述3个模块,本研究所提出的PDD-SPCIE算法实现了局部细节感知与全局语义信息理解的协同优化.
3. 实验结果与分析
3.1. 实验环境配置
本章实验具体环境配置如表2所示. 以PyTorch作为深度学习框架,训练过程中设置Batch_size为16;验证过程中设置Batch_size为64;workers设置为1;训练轮数(epochs)为100;初始学习率(lr0)为
表 2 实验环境配置
Tab.2
| 名称 | 实验配置 |
| 操作系统 | Ubuntu 22.04.5 LTS |
| 编程语言 | Python 3.8 |
| 深度学习框架 | PyTorch 1.13.4 |
| CPU | Intel® Core™ i7- |
| GPU | NVIDIA GeForce RTX |
| CUDA | 11.6 |
| 平台 | Pycharm 2022 |
3.2. 参数选择实验
参数选择实验在公共数据集VOC和自建数据集Electric_Data上分别进行,综合2个数据集的实验结果选择对应参数,确保参数优化与实际任务的一致性.
3.2.1. 高低频卷积模块
在LDDM-ResNet网络中,高低频卷积通道占比
表 3 高低频卷积模块通道占比取值实验
Tab.3
| 数据集 | P | R | mAP50 | mAP50-95 | |
| VOC | 0 | 0.671 | 0.568 | 0.596 | 0.451 |
| 0.125 | 0.703 | 0.570 | 0.611 | 0.466 | |
| 0.250 | 0.701 | 0.578 | 0.616 | 0.466 | |
| 0.500 | 0.697 | 0.573 | 0.615 | 0.464 | |
| 0.750 | 0.685 | 0.569 | 0.601 | 0.456 | |
| Electric_Data | 0 | 0.816 | 0.660 | 0.691 | 0.393 |
| 0.125 | 0.814 | 0.693 | 0.701 | 0.389 | |
| 0.250 | 0.856 | 0.695 | 0.704 | 0.395 | |
| 0.500 | 0.811 | 0.666 | 0.706 | 0.395 | |
| 0.750 | 0.827 | 0.666 | 0.691 | 0.386 |
3.2.2. 多核卷积组合
在LDDM-ResNet网络中,不同卷积核的大小及组合方式会影响模型对多尺度目标的特征提取能力,从而影响最终检测性能. 为了确定本任务的最优卷积核组合,在公共数据集和自建数据集上分别进行了系统实验. 实验结果如表4所示,当卷积核组合为(3,5,7,9)时,模型检测效果最优.
表 4 LDDM-ResNet多核卷积组合参数实验
Tab.4
| 数据集 | 卷积核组合 | P | R | mAP50 | mAP50-95 |
| VOC | (3, 3, 3, 3) | 0.695 | 0.569 | 0.615 | 0.465 |
| (3, 5, 7, 9) | 0.701 | 0.578 | 0.616 | 0.466 | |
| (3, 5, 7, 11) | 0.688 | 0.578 | 0.615 | 0.467 | |
| (3, 5, 5, 7) | 0.689 | 0.567 | 0.605 | 0.457 | |
| (5, 7, 9, 11) | 0.677 | 0.557 | 0.593 | 0.447 | |
| Electric_Data | (3, 3, 3, 3) | 0.819 | 0.683 | 0.702 | 0.391 |
| (3, 5, 7, 9) | 0.856 | 0.676 | 0.703 | 0.399 | |
| (3, 5, 7, 11) | 0.828 | 0.675 | 0.694 | 0.390 | |
| (3, 5, 5, 7) | 0.821 | 0.683 | 0.701 | 0.395 | |
| (5, 7, 9, 11) | 0.805 | 0.675 | 0.697 | 0.398 |
3.2.3. 膨胀率设计
在LGCA模块中,周围特征的获取须采用3个不同膨胀率的空洞卷积进行拼接处理,因此,须通过实验获取膨胀率的最优取值以选取特征表达最优的参数配置,实验结果如表5所示. 综合公共数据集与自建数据集的实验结果,当空洞卷积的膨胀率依次为1、2、3时,模型检测效果最优.
表 5 LGCA模块空洞卷积膨胀率参数实验
Tab.5
| 数据集 | 膨胀率 | P | R | mAP50 | mAP50-95 |
| VOC | 1、2、3 | 0.702 | 0.575 | 0.628 | 0.482 |
| 2、3、4 | 0.691 | 0.573 | 0.614 | 0.471 | |
| 1、3、5 | 0.693 | 0.581 | 0.627 | 0.478 | |
| 2、4、6 | 0.692 | 0.586 | 0.622 | 0.475 | |
| Electric_Data | 1、2、3 | 0.806 | 0.689 | 0.705 | 0.393 |
| 2、3、4 | 0.781 | 0.667 | 0.68 | 0.383 | |
| 1、3、5 | 0.796 | 0.666 | 0.679 | 0.384 | |
| 2、4、6 | 0.801 | 0.675 | 0.691 | 0.386 |
3.3. 消融实验
以RT-DETR为基准模型,在自建电力缺陷数据集Electric_Data上进行消融实验:在基线模型上分别用LDDM-ResNet取代原骨干网络结构、用DA-Encoder取代原基线模型中编码器模块、用LGCA取代原基线模型中特征融合部分,实验结果如表6所示. 结果表明,LDDM-ResNet精确度P提升最高,较基线提升0.135,综合3个模块的PDD-SPCIE精确度P为0.819,稍低于LDDM-ResNet,但仍明显优于基线模型. 多核卷积的引入增强了模型对正负样本的判别能力,有效抑制了背景区域和错误检测带来的干扰.
表 6 Electric_Data数据集上的消融实验结果
Tab.6
| 算法 类型 | P | R | mAP50 | mAP50-95 | FLOPs/ 109 | Parameters/ 106 | FPS/ (帧·s−1) |
| RT-DETR | 0.696 | 0.571 | 0.687 | 0.379 | 103.5 | 32.010 | 108.695 |
| LDDM- ResNet | 0.831 | 0.661 | 0.703 | 0.391 | 64.5 | 24.850 | 144.927 |
| DA- Encoder | 0.788 | 0.653 | 0.700 | 0.386 | 114.9 | 44.200 | 131.578 |
| LGCA | 0.803 | 0.67 | 0.670 | 0.372 | 57.2 | 19.897 | 149.253 |
| PDD- SPCIE | 0.819 | 0.681 | 0.704 | 0.395 | 122.7 | 49.170 | 112.359 |
3个改进模块在召回率R上均有所提升,LDDM-ResNet、DA-Encoder、LGCA分别较基线模型提升了0.090、0.082、0.099,即本研究设计的3个模块能更全面地捕捉目标信息,准确识别各类型电力缺陷.
对比基线模型与3个模块的mAP50和mAP50-95指标:LDDM-ResNet模块分别提升0.016和0.012;DA-Encoder模块分别提升0.013和0.007;而LGCA模块指标略有下降,可能与其采用的空洞卷积有关. 空洞卷积通过稀疏采样扩大感受野,虽然获取了更大范围的上下文信息,但会破坏局部像素连续性,削弱模型对边缘和细节的响应,同时稀疏采样可能引入背景特征混叠,使小目标或细长结构的边界定位精度下降,进而造成mAP指标的轻微降低. 然而,空洞卷积的引入帮助平衡了DA-Encoder中可变形卷积模块引入的参数计算量,使综合3个模块的PDD-SPCIE算法实现了更优的性能与效率的平衡.
对于实用性评价指标计算复杂度FLOPs、参数量Parameters、推理速度FPS:LDDM-ResNet网络通过将标准卷积分解为逐通道卷积和逐点卷积,显著减少通道间冗余计算与参数量,将参数量由32.01×106降至24.85×106(下降约22.4%),FLOPs从103.5×109减少至64.5×109(下降约37.7%);同时,LGCA模块通过卷积层的轻量化设计和空间深度转换卷积SPDConv进一步减少参数量和计算复杂度. 综合3模块的PDD-SPCIE算法在模型大小以及实时性方面与基线模型基本持平,实现了精度和效率间的良好平衡.
3.4. 算法对比实验
3.4.1. 网络模型对比
为了全面验证本研究所提算法的有效性,在公共数据集VOC上,将PDD-SPCIE算法分别与参数规模相近的YOLOv8(l)、YOLOv6(l)、RT-DETR、YOLOv9(c)和YOLOv10(l)目标检测算法进行对比实验,结果如表7所示. 实验结果表明,本研究提出的PDD-SPCIE算法在精确度P和mAP50上均高于其他对比算法,整体检测表现更平衡且稳定. 与基线模型RT-DETR相比,PDD-SPCIE在全部评价指标上均实现了明显提升;同时,其召回率R与先进YOLO系列模型持平甚至略有优势.
表 7 网络模型对比实验
Tab.7
| 算法 | P | R | mAP50 | mAP50-95 | FLOPs/ 109 | Parameters/ 106 | FPS/ (帧·s−1) |
| YOLOv6(l) | 0.657 | 0.579 | 0.628 | 0.484 | 391.2 | 110.800 | 70.422 |
| YOLOv8(l) | 0.705 | 0.655 | 0.706 | 0.526 | 164.9 | 43.622 | 53.763 |
| RT-DETR | 0.696 | 0.571 | 0.607 | 0.449 | 114.9 | 44.220 | 116.279 |
| YOLOv9(c) | 0.715 | 0.626 | 0.692 | 0.537 | 78.7 | 25.850 | 163.930 |
| YOLOv10(l) | 0.667 | 0.600 | 0.648 | 0.501 | 282.3 | 103.700 | 79.365 |
| PDD-SPCIE | 0.719 | 0.642 | 0.712 | 0.538 | 122.7 | 49.100 | 78.740 |
3.4.2. 网络结构对比
如表8所示分别为本研究提出的3个模块LDDM-ResNet、DA-Encoder和LGCA模块与其他类似的先进骨干网络、注意力机制和下采样模块的对比结果. 结果表明,尽管PKINet和c2f-PKI骨干网络同样引入了PKI模块,但LDDM-ResNet在P、R、mAP50、mAP50-95等关键指标上均展现出系统性的优势. DA-Encoder模块在P、R、mAP50、mAP50-95等指标上均表现出色,但因其更聚焦于位置信息及目标形状的学习,相较于分类能力更擅长于目标定位,因此P较其他注意力机制稍低. LGCA模块在P、R、mAP50、mAP50-95等指标上也均较其他下采样方法有所提升.
表 8 核心模块与其他主流方法对比
Tab.8
| 模型 | P | R | mAP50 | mAP50-95 | |
| 先进骨干 网络 | StartNet | 0.682 | 0.548 | 0.587 | 0.438 |
| Efficient Formerv2 | 0.638 | 0.528 | 0.558 | 0.412 | |
| HGnetV2 | 0.696 | 0.569 | 0.607 | 0.449 | |
| Ghost HGNetV2 | 0.676 | 0.565 | 0.600 | 0.446 | |
| PKINet | 0.632 | 0.526 | 0.558 | 0.414 | |
| c2f-PKI | 0.687 | 0.541 | 0.591 | 0.448 | |
| LDDM-ResNet | 0.701 | 0.578 | 0.616 | 0.466 | |
| 先进注意力 机制 | Efficient Additive | 0.689 | 0.549 | 0.605 | 0.457 |
| Cascaded Group | 0.679 | 0.564 | 0.615 | 0.468 | |
| HilO | 0.689 | 0.549 | 0.601 | 0.460 | |
| LPE | 0.690 | 0.558 | 0.606 | 0.466 | |
| DA-Encoder | 0.687 | 0.575 | 0.616 | 0.474 | |
| 先进下采样 模块 | CG-Down | 0.665 | 0.592 | 0.613 | 0.470 |
| HSFPN | 0.676 | 0.576 | 0.608 | 0.459 | |
| HSPAN | 0.659 | 0.538 | 0.576 | 0.438 | |
| Waveletpool | 0.584 | 0.463 | 0.485 | 0.364 | |
| slimneck | 0.686 | 0.568 | 0.601 | 0.451 | |
| LGCA | 0.702 | 0.575 | 0.628 | 0.482 |
3.5. 可视化效果对比
如图6所示为RT-DETR算法与本研究提出的PDD-SPCIE的可视化检测效果对比图. 由图可知,在置信度方面,PDD-SPCIE对典型缺陷的检测置信度均高于基线算法.
图 6
在小目标检测方面,如图6(c)、(d)、(e)所示,基线算法在避雷器电流表模糊度较低或轻微生锈时,未能检测出其对应的缺陷,但本研究所提算法正确检测到了对应缺陷;基线算法对于颜色较淡的油渍存在漏检现象,而本研究所提算法可以有效解决这一问题. 整体来看,基线算法对于一些小目标、细节信息存在一定的漏检、多检,而本研究所提算法不仅在检测精度上有所提升,且检测置信度均高于基线算法.
4. 结 语
针对变电站复杂巡检场景中缺陷检测存在的难点,提出改进的目标检测算法PDD-SPCIE. 首先,针对现有变电站缺陷检测中缺陷类型单一、样本不均衡的问题,构建了变电站电力缺陷巡检数据集Electric_Data;同时,针对语义信息理解与细节信息感知不足的问题,分别提出LDDM-ResNet骨干网络、DA-Encoder编码器和LGCA这3个模块,搭建统一框架检测多类别缺陷,并优化检测效果. 最后,通过消融实验和对比实验验证了所设计各模块的有效性. 综合实验验证表明,该算法在保持模型参数量与基线接近的前提下,能够稳步提升检测精度与模型鲁棒性,在实际巡检任务中具有良好的适应性与推广价值. 此外,该模型在公共数据集VOC上的综合性能优于RT-DETR、YOLO系列模型. 然而,本研究所提算法更关注检测效果的提升,在模型复杂度、参数量及检测速度上仍有一定优化空间.
参考文献
“新型电力系统数字化关键技术综述”专辑评述
[J].DOI:10.7500/AEPS20240201001 [本文引用: 1]
Commentary on special issue of reviews on key technologies for digitalization of new power system
[J].DOI:10.7500/AEPS20240201001 [本文引用: 1]
基于新型编码解码网络的复杂输电线识别
[J].
Recognition of complex power lines based on novel encoder-decoder network
[J].
电力设备数智化发展历程与大语言模型智能体应用展望
[J].
Evolution of digitization and intelligence of power equipment and prospects for application of large language model based agent
[J].
基于深度学习的输电线路视觉检测方法研究进展
[J].DOI:10.13334/j.0258-8013.pcsee.221139 [本文引用: 1]
Research progress of vision detection methods based on deep learning for transmission lines
[J].DOI:10.13334/j.0258-8013.pcsee.221139 [本文引用: 1]
ID-YOLO: a multimodule optimized algorithm for insulator defect detection in power transmission lines
[J].DOI:10.1109/tim.2025.3527530 [本文引用: 1]
VLF-DETR: integrating vision-language and high-frequency features for transmission line defect detection
[J].DOI:10.1109/tim.2025.3586346 [本文引用: 1]
AdIn-DETR: adapting detection transformer for end-to-end real-time power line insulator defect detection
[J].
Albumentations: fast and flexible image augmentations
[J].DOI:10.3390/info11020125 [本文引用: 1]
CGNet: a light-weight context guided network for semantic segmentation
[J].DOI:10.1109/TIP.2020.3042065 [本文引用: 1]
/
| 〈 |
|
〉 |

