浙江大学学报(工学版), 2026, 60(10): 2141-2152 doi: 10.3785/j.issn.1008-973X.2026.10.007

计算机技术与控制工程

基于动态核感知的无人机视角路面病害检测方法

张建刚,, 李肖, 冯丹丹

1. 兰州交通大学 数理学院,甘肃 兰州 730070

2. 兰州交通大学 电子与信息工程学院,甘肃 兰州 730070

Dynamic kernel perception for pavement distress detection in UAV inspection

ZHANG Jiangang,, LI Xiao, FENG Dandan

1. School of Mathematics and Physics, Lanzhou Jiaotong University, Lanzhou 730070, China

2. School of Electronic and Information Engineering, Lanzhou Jiaotong University, Lanzhou 730070, China

收稿日期: 2025-12-9  

基金资助: 甘肃省重点研发计划资助项目(25YFGA047);甘肃省基础研究创新群体资助项目(25JRRA805);鄂尔多斯市重点研发计划资助项目(YF20250245).

Received: 2025-12-9  

Fund supported: 甘肃省重点研发计划资助项目(25YFGA047);甘肃省基础研究创新群体资助项目(25JRRA805);鄂尔多斯市重点研发计划资助项目(YF20250245).

作者简介 About authors

张建刚(1978—),男,教授,博士,从事非线性动力系统分析及控制、随机动力系统稳定性分析及控制等研究.orcid.org/0000-0002-8523-6623.E-mail:zhangjg7715776@126.com , E-mail:zhangjg7715776@126.com

摘要

针对无人机视角路面病害检测中上下文信息丢失、多尺度病害共存以及细节还原不足等问题,构建基于动态核感知的路面病害检测模型,DKP-YOLO. 为了缓解复杂场景裂缝形态多变与上下文信息易丢失的问题,提出轻量化裂缝上下文模块,该模块通过异构并行深度可分离卷积与动态特征融合机制增强特征区分度. 针对复杂背景与多尺度病害的挑战,设计路面病害感知模块,利用并行多尺度卷积与双重注意力机制提升多尺度病害感知能力. 为了克服传统卷积难以建模长程依赖和对微小目标响应不足的局限,提出大核感知特征融合模块,通过整合超大感受野卷积与通道-空间注意力捕捉全局上下文关系. 为了减少上采样过程中细节丢失与语义模糊,在颈部网络引入轻量级动态上采样算子. 在UAV-PDD2023数据集上的实验表明,本研究模型在显著提升检测精度的同时,实现了模型复杂度的有效降低. 与基线模型相比,本研究模型在轻量化和检测性能上取得更好的平衡,更适合无人机视角路面病害目标检测.

关键词: 路面病害检测 ; 无人机航拍图像 ; 动态核感知 ; 多尺度特征融合 ; 复杂背景抑制

Abstract

A detection model named dynamic kernel perception YOLO (DKP-YOLO) was constructed to address the problems of contextual information loss, multi-scale distress coexistence, and insufficient detail restoration in pavement distress detection from a UAV perspective. A lightweight crack context module was proposed to mitigate the variability of crack morphology and the loss of contextual information in complex scenes. This module enhanced feature discriminability through heterogeneous parallel depthwise separable convolutions and a dynamic feature fusion mechanism. In order to tackle the challenges of complex backgrounds and multi-scale distress, a pavement distress perception module was designed, which improved the multi-scale distress perception capability using parallel multi-scale convolutions and a dual-attention mechanism. A large-kernel perception feature fusion module was introduced to overcome the limitations of traditional convolutions in modeling long-range dependencies and responding to small targets. This module captured global contextual relationships by integrating extra-large receptive field convolution with channel-spatial attention. Finally, a lightweight dynamic upsampling operator was incorporated into the neck network to reduce detail loss and semantic ambiguity during upsampling. Experiments on the UAV-PDD2023 dataset showed that the proposed model significantly improved detection accuracy while effectively reducing model complexity. Compared with the baseline model, DKP-YOLO achieved a better balance between being lightweight and maintaining high detection performance, making it more suitable for UAV-based pavement distress detection.

Keywords: pavement distress detection ; UAV aerial imagery ; dynamic kernel perception ; multi-scale feature fusion ; complex background suppression

PDF (3699KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

张建刚, 李肖, 冯丹丹. 基于动态核感知的无人机视角路面病害检测方法. 浙江大学学报(工学版)[J], 2026, 60(10): 2141-2152 doi:10.3785/j.issn.1008-973X.2026.10.007

ZHANG Jiangang, LI Xiao, FENG Dandan. Dynamic kernel perception for pavement distress detection in UAV inspection. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(10): 2141-2152 doi:10.3785/j.issn.1008-973X.2026.10.007

截至2024年底,中国公路总里程已超过549万公里,定期检测与养护成为保障交通安全、延长道路使用寿命的关键环节[1]. 然而,传统人工巡检存在效率低下、交通封闭、成本高等问题[2]. 在此背景下,无人机凭借灵活机动和无接触检测的优势,为路面巡检提供了新的技术路径[3]. 但其飞行高度与角度多变导致目标尺度差异大加之背景干扰和机载计算资源有限,对模型轻量化与推理效率提出严苛要求[4-5]. 根据技术路线的差异,现有研究主要围绕轻量化设计与嵌入式部署、复杂场景检测性能提升及系统集成与工程应用3个方向展开.

在轻量化设计与嵌入式部署方面,无人机机载平台在算力和承重方面的限制是模型轻量化设计的主要驱动力. Ma等[6]提出YOLOv5-DE,能有效提取裂缝特征并降低计算量. 杨豪等[7]采用StarNet[8]替换YOLOv8主干网络,降低计算负担并提高检测速度. 然而,模型轻量化往往伴随着细节信息的缺失[9-11]. 对于裂缝这类检测目标,细节特征的缺失往往导致召回率显著下降[12]. 特别是在无人机拍摄的图像中,裂缝可能仅占数个像素,极易造成严重漏误检[13]. 尽管一些研究尝试通过引入注意力机制[14-15]来缓解该问题,但如何在轻量化与特征保持之间取得有效平衡,仍是当前面临的核心挑战.

在提升复杂场景检测性能方面,许多研究致力于提升模型的感知与融合能力. Tan等[16]提出的双向特征金字塔网络(bi-directional feature pyramid network, BiFPN)实现了高效的特征融合. Hou等[17]提出的坐标注意力(coordinate attention, CA)机制能在压缩通道信息时捕获精确的位置信息. Shan等[18]指出的“跨域”与“跨分辨率”是制约模型泛化能力的关键.

在系统集成与工程应用方面,无人机巡检正向自动化、网络化与智能化发展. 如厦门“智慧天眼”系统实现自动巡检与实时数据分析,连云港“蛙跳式长路段巡检”方案结合接续起落技术与AI检测,有效提升了检测效率.

当前研究在轻量化设计或性能提升上均取得可观进展,但仍存在一个核心矛盾:多数轻量化方法以牺牲对微小病害的表征能力为代价,而许多高性能模型又未能充分考虑无人机视角的极端动态性,且计算复杂,难以部署. 为此,本研究提出基于无人机视角的路面病害检测模型DKP-YOLO (dynamic kernel perception YOLO),能在保持轻量化的同时显著提升检测精度. 主要工作包含以下2方面:1)设计多尺度特征增强模块,显著提升模型对极端尺度病害的感知能力. 引入轻量化裂缝上下文模块,提升对微小裂缝的上下文信息捕获能力;采用大核感知特征融合模块扩大感受野,有效识别大型坑洞和分布式裂缝. 2)提出面向复杂背景的双重抑制与重建机制. 通过无人机路面病害感知模块中的双重注意力有效抑制阴影、水渍、遮挡等背景干扰;利用DySample动态上采样方法提升边缘细节还原质量,减少误检漏检.

1. DKP-YOLO

为了应对无人机视角下路面病害检测在上下文、多尺度与微小目标方面面临的挑战,以YOLO12-n[19]为基线模型,构建轻量化检测模型DKP-YOLO. 选择该基线主要基于其2方面优势:一是卓越的轻量化与高效推理特性,其模型体积极为轻巧;二是先进的注意力架构,其区域注意力与残差高效聚合机制为处理多尺度目标提供了良好的特征感知基础.

基于此,DKP-YOLO遵循“分阶段协同增强”的设计理念,系统集成4个功能互补的模块:1) 裂缝上下文模块部署于骨干网络中部,旨在网络早期以低计算成本增强裂缝的局部细节与上下文;2) 无人机路面病害感知模块集成于骨干及颈部网络中部,利用并行多尺度卷积与双重注意力机制,实现复杂背景抑制与多尺度目标判别;3) 大核感知特征融合模块置于颈部网络融合路径,通过超大感受野卷积与小目标特异性注意力,建立长程依赖并提升对微小裂缝的敏感性;4) 动态上采样算子嵌入颈部网络上采样阶段,通过内容感知机制重建特征以减轻细节丢失.

图1所示,这些模块构成了“感知-增强-融合-再精炼”的优化回路. 特征流首先经无人机路面病害感知模块进行背景滤波与初步感知,再由裂缝上下文模块强化局部细节,继而通过大核感知特征融合模块整合全局上下文. 此后,特征经动态上采样算子高保真上采样并与浅层特征融合,最后再经由大核感知特征融合模块与无人机路面病害感知模块进行联合精炼. 该回路可以确保最终特征兼具丰富的局部细节、清晰的语义区分和较强的抗干扰能力,以提升模型在复杂场景下的综合检测性能.

图 1

图 1   DKP-YOLO结构图

Fig.1   Architecture of DKP-YOLO model


1.1. 裂缝上下文模块

针对复杂道路场景中裂缝形态各异、上下文信息易丢失的挑战,提出轻量化的精准裂缝上下文模块(crack context module, CCM). 该模块通过异构并行深度可分离卷积与动态特征融合机制,有效提升特征判别能力. CCM采用多分支结构捕获不同尺度特征,表达式如下:

$ {\boldsymbol{F}}_{k}=\text{GELU}(\text{DWCon}{\text{v}}_{k\times k}(\boldsymbol{X})) .$

式中: X为模块的输入特征张量;$ \text{DWCon}{\text{v}}_{k\times k} $表示核大小为k×k的深度可分离卷积,k$ =3{,}5,7 $$ {\boldsymbol{F}}_{k} $表示核大小为k×k的深度可分离卷积分支输出的特征图. 接着通过如下可学习权重实现动态融合:

$ \left.\begin{split} &{\boldsymbol{F}}_{\text{fused}}=\sum {{w}}_{i}\cdot {\boldsymbol{F}}_{i},\\ &\boldsymbol{w}=\text{softmax}\;({\boldsymbol{\omega}} ).\end{split}\right\} $

式中:$ {\boldsymbol{F}}_{\text{fused}} $为动态融合后的多尺度特征; $ {{w}}_{i} $为第$ i $个分支对应的可学习融合权重,$ i\in \left\{3{,}5,7\right\} $,由权重向量 $ {{\boldsymbol{\omega}} } $ 经softmax函数归一化得到.

为了进一步增强判别性特征,引入轻量化通道注意力机制,表达式如下:

$ {\boldsymbol{F}}_{\text{enhanced}}={\boldsymbol{F}}_{\text{fused}}\otimes (1+\sigma (\text{MLP}(\text{GAP}({\boldsymbol{F}}_{\text{fused}})))) .$

式中:GAP表示全局平均池化操作,MLP表示轻量级的多层感知器,$ \sigma $表示 Sigmoid 激活函数,$ \otimes $表示逐元素相乘,$ {\boldsymbol{F}}_{\text{enhanced}} $为经通道注意力增强后的特征. 最终通过如下参数化残差连接输出:

$ \boldsymbol{Y}=\boldsymbol{X}+\alpha \cdot {\boldsymbol{F}}_{\text{enhanced}} .$

式中:$ \alpha $为可学习的缩放参数,用于控制残差连接的强度; Y为模块的最终输出.

该模块采用深度可分离卷积与轻量化设计,旨在提升裂缝语义上下文建模能力的同时,保持低计算开销与易嵌入的特性.

1.2. 无人机路面病害感知模块

针对无人机低空遥感图像中路面病害检测所面临的复杂背景干扰与多尺度病害共存的挑战,提出无人机路面病害感知模块(UAV pavement distress perception module, UPDPM),该模块通过并行多尺度卷积与双重注意力机制[20]协同工作,能够有效应对复杂背景干扰下的多尺度病害检测问题. UPDPM采用多分支结构,利用不同尺度卷积核提取多尺度特征,表达式如下:

$ {\boldsymbol{F}}_{k}=\text{Con}{\text{v}}_{k\times k}(\boldsymbol{X}). $

式中:$ {\boldsymbol{F}}_{k} $表示输入特征张量$ {\boldsymbol{X}} $经核大小为k×k的标准卷积输出的特征图,k=1,3,5,7.

再对各分支输出沿通道维度拼接,表达式如下:

$ {\boldsymbol{F}}_{\text{fused}}=[{\boldsymbol{F}}_{1},{\boldsymbol{F}}_{3},{\boldsymbol{F}}_{5},{\boldsymbol{F}}_{7}] .$

式中:$ {\boldsymbol{F}}_{\text{fused}} $为沿通道维度拼接后的多尺度融合特征.

进一步引入双重注意力机制. 首先通过如图2所示的通道注意力对特征进行如下通道维度重标定:

图 2

图 2   通道注意力示意图

Fig.2   Schematic diagram of channel attention mechanism


$ {\boldsymbol{M}}_{\rm{c}}=\sigma (\text{MLP}(\text{GAP}({\boldsymbol{F}}_{\text{fused}}))) ,$

$ {\boldsymbol{F}}_{\text{ca}}={\boldsymbol{M}}_{\rm{c}}\otimes {\boldsymbol{F}}_{\text{fused}}. $

式中: $ {\boldsymbol{M}}_{\rm{c}} $为通道注意力图,$ {\boldsymbol{F}}_{\text{ca}} $为经通道注意力重标定后的特征. 继而利用如图3(a)所示的空间注意力增强关键区域特征响应,表达式如下:

图 3

图 3   空间注意力、小目标特异性注意力示意图

Fig.3   Schematic diagrams of spatial attention and small-target specific attention mechanisms


$ {\boldsymbol{M}}_{\rm{s}}=\sigma (\text{Con}{\text{v}}_{7\times 7}([\text{AvgPool}({\boldsymbol{F}}_{\text{ca}});\text{MaxPool}({\boldsymbol{F}}_{\text{ca}})])), $

$ {\boldsymbol{F}}_{\text{sa}}={\boldsymbol{M}}_{\rm{s}}\otimes {\boldsymbol{F}}_{\text{ca}}. $

式中:$ {\boldsymbol{M}}_{\rm{s}} $为空间注意力图;$ {\boldsymbol{F}}_{\text{sa}} $为最终经双重注意力机制处理后的输出特征;AvgPool、MaxPool分别为平均、最大池化操作. 最终输出通过残差连接保持梯度稳定性.

1.3. 大核感知增强型特征融合模块

在无人机视角路面病害检测任务中,如何有效捕捉长程空间依赖并增强对微小裂缝的敏感性是提升语义完整性的关键问题. 然而,传统卷积操作受限于其局部感受野,难以有效捕捉如网状裂缝、坑洞、修补等大范围结构之间的长程依赖关系,且对细长、微小目标响应不足. 为此,本研究提出基于大核空间与通道注意力机制(large kernel attention with spatial and channel attention,LSKA)[21]的大核感知增强型特征融合模块(large kernel perception enhanced feature fusion module, LKP-EFF),通过协同整合超大感受野卷积与目标导向的注意力机制,提升模型对多尺度路面病害的感知与融合能力. LKP-EFF模块采用双分支大核深度可分离卷积结构,分别使用如下5×5和9×9卷积核提取不同尺度特征:

$ \left. \begin{split} &{\boldsymbol{F}}_{\rm{s}}=\sigma (\text{DWCon}{\text{v}}_{5\times 5}(\boldsymbol{X})),\\& {\boldsymbol{F}}_{\rm{m}}=\sigma (\text{DWCon}{\text{v}}_{9\times 9}(\boldsymbol{X})).\end{split}\right\} $

式中:$ {\boldsymbol{F}}_{\rm{s}} $$ {\boldsymbol{F}}_{\rm{m}} $分别表示输入特征张量$ \boldsymbol{X} $经由5×5和 9×9深度可分离卷积提取的特征图.

为了进一步提升对微小裂缝的响应能力,模块引入如图3(b)所示的小目标特异性注意力子网络,通过特征压缩与非线性激励生成空间权重:

$ {\boldsymbol{A}}_{\rm{s}}=\sigma (\text{Con}{\text{v}}_{1\times 1}(\delta (\text{Con}{\text{v}}_{1\times 1}(\text{GAP}(\boldsymbol{X}))))) .$

式中:GAP表示全局平均池化,$ \delta $为ReLU激活函数,$ {\boldsymbol{A}}_{\rm{s}} $为由小目标特异性注意力子网络生成的空间权重图. 并且,该注意力通过残差缩放机制对融合特征进行自适应增强,该过程如下:

$ {\boldsymbol{F}}_{\text{enhanced}}=({\bf{1}}+{\boldsymbol{A}}_{\rm{s}})\cdot (\alpha {\boldsymbol{F}}_{\rm{s}}+\beta {\boldsymbol{F}}_{\rm{m}}). $

式中:$ {\boldsymbol{F}}_{\text{enhanced}} $为经小目标注意力自适应增强后的融合特征,$ \alpha $$ \beta $为可学习的动态权重. $ \alpha $$ \beta $经过Softmax归一化处理:

$ \alpha ,\beta =\text{Softmax}\;([{\omega }_{\rm{s}},{\omega }_{\rm{m}}]). $

式中:$ {\omega }_{\rm{s}} $$ {\omega }_{\rm{m}} $为融合权重$ \alpha $$ \beta $对应的原始可学习参数. 最终通过跳跃连接融合特征,在维持梯度稳定的同时强化语义表达能力. 该模块目的是在有限的计算开销下扩展模型感受野,增强对细长与微小裂缝的感知能力.

1.4. 基于DySample的颈部网络上采样改进

在无人机视角下的路面病害检测任务中,细节特征的还原与语义信息的保持对检测性能至关重要. 在基线模型中,颈部网络采用最近邻插值进行上采样,虽然计算简单,但难以适应复杂背景下的裂缝边缘和细微结构,容易导致细节丢失与语义模糊,从而影响检测精度. 为了克服这一局限,引入轻量级动态上采样算子DySample[22],其工作机制如图4所示,将其嵌入至颈部网络上采样阶段,可以替代原有的最近邻插值方法.

图 4

图 4   动态上采样算子示意图

Fig.4   Schematic diagram of dynamic upsampling operator


动态上采样模块通过内容感知机制动态生成采样位置,依据输入特征自适应地调整采样网格,在无需高分辨率引导特征的前提下实现更精细的特征重建. 其核心结构可表述如下. 1)对输入特征$ \boldsymbol{X}\in {{\bf{R}}}^{B\times C\times H\times W} $进行分组,得到$ {\boldsymbol{X}}'\in {{\bf{R}}}^{B\times G\times (C/G)\times H\times W} $,其中G为分组数. 2)通过2个并行的$ 1\times 1 $卷积层生成偏移量Offset与采样范围Scope参数,表达式如下:

$ \left.\begin{split} &{{\bf{Offset}}}=\theta (\text{Con}{\text{v}}_{1{\mathrm{a}}}(\boldsymbol{X})),\\& {{\bf{Scope}}}=\sigma (\text{Con}{\text{v}}_{\text{1b}}(\boldsymbol{X})).\end{split}\right\} $

式中:$ \theta $表示批归一化操作,$ \text{Con}{\text{v}}_{1{\mathrm{a}}} $$ \text{Con}{\text{v}}_{\text{1b}} $分别为2个独立的1×1卷积层. 采样网格$ P $的动态调整公式如下:

$ \boldsymbol{P}={{\bf{Init}}}\_ {{\bf{Pos}}}+\eta \cdot {{\bf{Offset}}}\otimes {{\bf{Scope}}}. $

式中:Init_Pos为初始采样位置网格,$ \eta $为缩放系数. 最终,通过双线性采样函数T完成实际上采样操作继而输出特征图 Y,表达式如下:

$ \boldsymbol{Y}=T(\boldsymbol{X},\boldsymbol{P}). $

该模块目的是在保持较低计算开销的同时,提升裂缝边缘的还原能力与语义一致性.

2. 实验结果与分析

2.1. 实验环境与参数设置

使用公开数据集UAV-PDD2023[23]进行实验,数据集由拍摄高度为30 m的无人机航拍路面病害图像组成,图像分辨率为2592×1944,该数据集包含11158个标注实例,涵盖6类路面病害: Alligator crack(网状裂缝)、Longitudinal crack(纵向裂缝)、Oblique crack(斜向裂缝)、Pothole(坑洞)、Repair(修补)、Transverse crack(横向裂缝). 类别分布呈现显著长尾特性:横向裂缝与纵向裂缝占据绝对优势,而坑洞与修补极为稀少,比例差距高达27倍. 在目标尺度上,小目标约为5000个,数量最多,且无人机拍摄导致目标尺寸差异明显. 该数据集面临类别极端不平衡与多尺度特征显著并存的双重挑战,少数类易被忽视,小目标检测尤为困难.

为了缓解上述问题,采用差异化过采样与多尺度增强结合的两阶段策略. 对少数类样本通过过采样提升占比,多数类样本仅进行有限增强;同时结合几何变换与光度标定,模拟无人机拍摄的多样化视角与光照条件,并在训练中引入Mosaic和Copy-Paste,以增强小目标检测能力与泛化性能. 为了确保实验结果的可靠性与可比性,所有实验均在统一硬件与软件环境下进行,采用 NVIDIA RTX 4090 (24 GB) GPU,搭配 PyTorch 2.3.0 模型及 CUDA 11.8 加速环境. 实验参数配置如表1所示.

表 1   实验参数配置

Tab.1  Configuration of experimental parameters

参数设置值
优化器AdamW
训练轮次300
初始学习率1×10−3
输入图像尺寸640×640
动量因子0.937
早停轮次50

新窗口打开| 下载CSV


2.2. 评价指标

本研究采用多维度评价指标体系全面评估模型在道路病害检测任务中的性能,所有评价指标均在同样的硬件、软件环境下进行测试,包括参数量Params、计算量GFLOPs、精确率Precision、召回率Recall、平均精确度均值mAP、F1分数以及端到端推理速度FPS. 其中,Precision与Recall是2项核心指标,分别衡量预测结果的准确性与完整性,其定义如下:

$ \left.\begin{split} &\text{Precision}=\text{TP}/(\text{TP+FP}),\\ &\text{Recall}=\text{TP}/(\text{TP+FN}).\end{split}\right\} $

式中:TP表示预测为正样本的正样本个数,FP表示预测为正样本的负样本个数,FN表示预测为负样本的正样本个数. Precision反映在所有被预测为裂缝的样本中,真实裂缝所占比例;Recall则反映在所有真实裂缝中被成功预测的比例. 在此基础上,F1分数作为Precision与Recall的调和平均,能够衡量两者之间的平衡性,其取值范围为[0,1.0],数值越大表示模型在检测精度与覆盖率之间越均衡,定义如下:

$ {{\mathrm{F}}}{1}=\frac{2\cdot \text{Precision}\cdot \text{Recall}}{\text{Precision+Recall}}. $

平均精确度均值mAP是目标检测领域的核心综合指标. 其计算首先须绘制各类别的精确率-召回率曲线(precision-recall curve),并计算曲线下面积,即该类别的平均精确度(average precision, AP). mAP@0.5 表示在判定检测框是否正确的交并比(IoU)阈值设定为0.5时,计算所有类别AP的平均值. mAP@0.5:0.95是更为严格的指标,它表示将IoU阈值从0.50开始以0.05为步长递增至0.95,分别计算每个阈值下的AP,再对所有类别和所有IoU阈值下的AP结果取平均值. 后者对检测框的定位精度要求更高. 端到端推理速度FPS采用每秒处理帧数进行衡量. 其定义为:在固定硬件平台与软件环境下,从输入单张原始图像开始,到完成所有预处理、模型前向计算、后处理并输出最终检测结果为止,单位时间内所能处理的图像数量. 该指标综合反映了检测系统的整体实时处理能力.

2.3. 结果分析

为了评估本研究模型的有效性,在UAV-PDD2023数据集上进行系统实验. 改进前、后模型混淆矩阵如图5所示. 分析发现,基线模型对病害存在明显的漏检,如真实为网状裂缝的样本,有26%被误判为背景. 同时,背景被误判为病害的情况也较严重,如被误判为横向裂缝的比例达45%. 改进后的模型明显缓解了这些问题. 如图5(b)所示,网状裂缝漏检(判为背景)的比例从26%降低至8%,降幅达69.2%;同时,背景被误判为横向裂缝的比例也从45%降至32%. 此外,在主对角线上的正确分类率均有大幅提升. 这些结果表明,本研究模型能有效减少误检和漏检现象,增强其在实际应用中的可靠性.

图 5

图 5   改进前、后模型混淆矩阵

Fig.5   Confusion matrices of original and improved models


此外,由表2 可得,改进后的方法几乎在所有关键指标上均优于基线模型. 整体精确率和召回率较基线分别提升12.4和8.7个百分点,mAP@0.5和mAP@0.5:0.95分别提高8.9和13.6个百分点. 上述结果表明该方法在复杂背景条件下具备更高的定位精度与病害检测召回能力,充分证实了本研究方法在路面病害检测任务中的有效性.

表 2   改进前、后模型各指标数据对比

Tab.2  Performance metrics of original and improved models

病害类别P1/%P2/%R1/%R2/%mAP@0.51/%mAP@0.52/%mAP@0.5:0.951/%mAP@0.5:0.952/%
注:X1表示YOLO12-n相关指标,X2表示DKP-YOLO相关指标
所有类别78.090.4 (+12.4)71.780.4 (+8.7)76.084.9 (+8.9)48.361.9 (+13.6)
网状裂缝82.793.5 (+10.8)71.491.6 (+20.2)79.693.7 (+14.1)51.568.4 (+16.9)
纵向裂缝81.795.0 (+13.3)74.581.4 (+6.9)79.489.9 (+10.5)48.262.9 (+14.7)
斜向裂缝72.592.9 (+20.4)62.974.3 (+11.4)66.482.6 (+16.2)39.656.3 (+16.7)
坑洞74.385.4 (+11.1)60.058.5 (−1.5)57.560.1 (+2.6)33.046.0 (+13.0)
修补72.680.3 (+7.7)82.192.9 (+10.8)88.392.8 (+4.5)63.572.3 (+8.8)
横向裂缝84.695.4 (+10.8)79.583.8 (+4.3)84.990.7 (+5.8)54.165.6 (+11.5)

新窗口打开| 下载CSV


为了深入分析本研究所提模块对模型训练动态的影响,如图6所示展示了基线模型与本研究模型在训练过程中的损失曲线与关键评估指标变化. 从训练损失曲线来看:本研究模型的损失项下降更快、更平滑,且收敛至更低的平台值. 例如,边界框损失Box Loss在训练中期,约100轮次,已明显低于基线模型,并持续下降. 这表明,本研究引入的CCM、UPDPM、LKP-EFF等模块有效增强了模型的特征提取与表征能力,使模型能更快、更稳定地拟合训练数据,优化过程更为高效. 从评估指标曲线来看:本研究模型的优势更为明显. 其精确率和召回率在训练初期便迅速攀升,并很快超越基线模型的最终水平. 在整个训练周期中,本研究模型的这2项指标始终稳定在更高的数值区间,且波动更小. 特别值得注意的是,DKP-YOLO的召回率最终稳定在接近0.8的水平,显著高于基线模型,这表明本模型通过针对性设计,有效缓解了轻量化模型普遍存在的小目标漏检问题. 综上所述,训练过程可视化分析表明,DKP-YOLO不仅收敛速度更快、训练过程更稳定,而且最终达到了更高的精度与召回率平台. 这从模型优化动态的角度,有力地证明了本研究所提改进模块的有效性,它们使模型具备了更优的学习能力与泛化潜力.

图 6

图 6   改进前、后模型训练损失与评估指标曲线对比

Fig.6   Comparison of training loss and evaluation metric curves between original and improved models


2.4. 消融实验

为了验证各模块的有效性及其协同作用,在基线模型上进行了消融实验,实验结果见表3. 其中,A表示CCM模块,B表示UPDPM模块,C表示LKP-EFF模块,D表示DySample模块.

表 3   各改进模块的消融实验结果

Tab.3  Ablation study results of different improved modules

模型P/%R/%mAP@0.5/%mAP@0.5:
0.95/%
F1/%FPS/(帧·s−1)
1)注:加粗字体表示每列中的最优值
YOLO12n
(基线模型)
78.071.776.048.374.7212.7
+A81.769.775.948.575.2217.5
+B91.274.782.155.482.1197.4
+C89.880.184.660.484.6236.1
+A+B89.476.582.355.182.4201.3
+A+C90.378.484.058.583.9239.7
+B+C${{\boldsymbol{92.3}}}^{1)} $78.385.060.784.7189.8
+A+B+C91.980.084.559.685.5197.2
+A+B+C+D90.480.484.961.985.1225.8

新窗口打开| 下载CSV


单独引入CCM模块时,模型精确率提升了3.7个百分点,这表明其异构并行卷积与动态融合机制有效增强了裂缝的局部上下文建模能力,提高了特征的可区分性. 虽然其单独使用时召回率略有波动,但这恰恰反映了CCM作为一个强力的局部特征增强器,其会生成丰富的细节信息,若后续缺乏针对性处理模块,可能会在复杂场景中引入一定的判别难度. 然而,当CCM与UPDPM或LKP-EFF模块结合时,模型的综合性能均获得明显提升,这表明CCM提供的优质底层细节特征,是后续模块进行有效多尺度感知和全局依赖建模的重要基础.

UPDPM模块的引入带来了显著的单项性能跃升,精确率提高13.2个百分点. 这表明该模块通过并行多尺度卷积与双重注意力机制,能有效抑制复杂背景干扰并聚焦多尺度病害目标.

LKP-EFF模块的贡献体现在对检测框定位精度要求极高的指标mAP@0.5:0.95上,其单独使用可在精确率上带来12.1个百分点的提升. 这说明该模块引入的大核卷积能有效扩展感受野,建模长程空间依赖,而小目标特异性注意力则加强对微小裂缝的响应,两者共同作用改善了模型对病害,尤其是细长、网状裂缝的完整性和边界框的回归质量.

动态上采样算子DySample的优化目标直接指向提升特征图的空间还原质量. 实验表明,在已有模块组合(A+B+C)上引入DySample后,模型在mAP@0.5:0.95这一指标上提升2.3个百分点,同时推理速度有所增加. 这一结果确切地证实了DySample通过其内容感知的重建机制,有效减少了上采样过程中的细节丢失与几何失真,从而直接贡献于更精准的边界框预测. 值得注意的是,引入DySample后,模型在提升定位精度(mAP@0.5:0.95)的同时,推理速度也获得了提升. 这得益于该算子高效的并行实现及其生成的高质量特征对后续检测过程的优化作用.

尽管CCM、UPDPM和LKP-EFF模块均采用了多尺度设计,但各模块核心目标与实现机制各有侧重,通过功能分工与动态机制能避免简单的特征冗余堆叠,从而实现效率与性能的兼顾. 最终,当所有模块协同工作时,模型在精确率、召回率、mAP@0.5:0.95以及推理速度上均达到最优或接近最优的平衡,在参数量和计算量几乎未增加的前提下,实现了检测性能的全面飞跃. 这充分验证了本研究所提出的CCM、UPDPM、LKP-EFF和DySample模块构成了一个功能互补、协同增强的有机整体,其设计有效满足了无人机嵌入式平台对高精度、高效率路面病害检测的迫切需求.

模型B+C在mAP@0.5指标上达到85.0%,模型A+C在FPS指标上达到最高的239.7帧/s. 模型A+B+C+D的mAP@0.5为84.9%,FPS为225.8 帧/s,并非各项单项指标最优. 然而,模型设计的目标是在多种关键性能指标间取得最佳平衡,以满足实际应用的需求. 选择A+B+C+D作为最终模型,基于以下考量:1) 综合精度最优:该模型在衡量定位精度的指标mAP@0.5:0.95上达到所有组合最高的61.9%,比次优组合B+C的60.7%高1.2个百分点,证明其具有更精确的边界框回归能力. 2) 保持高召回率与精度:该模型在召回率上达到80.4%,同时保持90.4%的高精确率,在F1分数上也达到85.1%. 这表明其在减少漏检和误检之间取得了最佳平衡. 3) 效率卓越:其225.8帧/s的推理速度虽略低于A+C组合,但相比基线仍有提升,且远高于B+C组合,满足实时性要求. 4) 模块功能的完整性:A+B+C+D集成了所有针对特定问题设计的模块,形成从细节增强、背景抑制、全局感知到细节重建的完整技术链路,这使其在多样化复杂场景展现出更稳定的鲁棒性和泛化能力.

2.5. 对比实验

为了科学评估本研究模型DKP-YOLO的有效性与先进性,在统一实验环境、相同硬件平台及固定数据集条件下,将本研究模型与RT-DETR[24]、YOLOv9[25]、YOLOv10[26]等10个目标检测模型进行对比实验. 统计所有模型的评价指标,如表4所示. 可以看出,DKP-YOLO在检测精度与计算效率之间实现更优的平衡,整体性能优于其他对比模型. 在检测精度方面,DKP-YOLO表现出卓越的性能,其F1分数达到85.1%,mAP@0.5:0.95达到61.9%,均为所有对比模型中最高. 相较于同量级且表现次优的模型,如YOLO11-n,DKP-YOLO在mAP@0.5:0.95上领先5.4个百分点,同时参数量减少0.2×106,实现性能与效率双重提升. 虽然YOLOv9-s、YOLO11-n在精确率方面表现更优,但DKP-YOLO在综合检测性能mAP@0.5:0.95和计算效率方面更具优势. 并且DKP-YOLO在保持精确率为90.4%的同时,仍获得80.4%的召回率,表明该模型能有效减少误检与漏检,具备更强的泛化性与可靠性.

表 4   各模型检测性能评价指标

Tab.4  Evaluation metrics for detection performance of different models

模型P/%R/%mAP@0.5:0.95/%F1/%FPS/(帧·s−1)Params/106GFLOPs/109Weights/MB
1)注:加粗字体表示每列中的最优值
SSD69.254.442.560.940.032.3128.949.1
Faster-RCNN73.959.246.365.714.0136.8370.2108.2
RT-DETR70.356.434.162.677.04.2130.583.0
UAV-YOLO84.369.248.676.078.010.525.319.4
LFDS-YOLO90.475.753.082.495.04.420.28.7
YOLOv5-n82.171.450.076.3257.92.57.25.3
YOLOv6-n72.256.132.663.1253.24.211.98.4
YOLOv8-n90.374.154.381.4263.83.08.26.3
YOLOv9-s90.61)75.157.682.1196.07.327.415.3
YOLOv9-t82.266.044.473.2248.82.17.94.7
YOLOv10-n86.274.155.079.7261.12.78.45.6
YOLO11-n90.677.956.583.7256.32.66.45.3
YOLO12-n78.071.748.374.7212.72.66.25.3
YOLO13-n82.664.744.972.6191.52.56.45.4
DKP-YOLO90.480.461.985.1225.82.45.55.2

新窗口打开| 下载CSV


在模型效率方面,DKP-YOLO同样展现出显著优势. 该模型的计算复杂度GFLOPs较低,仅需5.5×109,参数量Params为2.4×106,模型权重文件大小为5.2 MB,均属于轻量级别,甚至低于大部分对比模型. 尽管与部分对比模型相比,DKP-YOLO的端到端推理速度不具优势,但较基线模型仍提升了13.1 帧/s,为其在实时目标检测场景中的应用奠定了坚实基础.

实验结果表明,DKP-YOLO在多项核心指标上均实现同步优化,尤其能够在提高推理速度的前提下,显著提升检测精度,并压缩模型复杂度与计算开销,充分体现其在无人机视角路面病害检测任务中的综合优越性与工程实用性.

在模型存储开销上,其5.2 MB的权重文件大小在对比模型中最为轻量,甚至低于基线模型,这得益于模块的深度可分离卷积与动态融合设计带来的高参数效率,使其极易嵌入存储受限的机载设备. 其次,在关键的性能-效率权衡上,DKP-YOLO展现出了独特优势:如表4所示,它以225.8 帧/s的推理速度实现了61.9% 的最高mAP@0.5:0.95. 相较于基线模型YOLO12-n,实现了精度跃升13.6个百分点的同时,速度还提升了6.2%. 这种“精度与速度双提升”的现象,打破了轻量化改进往往伴随性能损失的固有模式. 最后,从任务针对性来看,表2中网状裂缝小尺度病害类别召回率大幅提升了20.2个百分点,印证了LKP-EFF与UPDPM模块在抑制背景、增强小目标感知方面的有效性,缓解了轻量化导致小目标漏检的痛点. 综上所述,实验数据从模型尺寸、推理速度到关键检测指标,全面验证了DKP-YOLO不仅是一个轻量化模型,更是一个面向实际部署、在严苛的效率约束下仍能保持高精度,特别是小目标检测精度的可用方案.

2.6. 泛化实验

为了验证本研究改进模型的有效性与鲁棒性,选取无人机沥青路面病害数据集(UAV asphalt pavement distress dataset, UAPD)[27]进行泛化实验,该数据集由无人机对中国南京东济大道上的道路病害拍摄所得. 此数据与本研究数据集UAV-PDD2023有着相同数量和类别的目标,共3151张道路病害数据. 但与UAV-PDD2023相比,UAPD数据集整体分辨率为512×512,且在UAPD数据集中以大尺度目标为主. 这一差异导致这2个数据集在数据分布上存在本质区别,为验证模型能否真正学习到泛化性强的特征表示提供了严格的测试基准.

泛化试验结果如表5所示. 实验结果表明,即便在数据分布迥异的跨域场景下,本研究模型依然展现出良好的鲁棒性. DKP-YOLO取得了最高的召回率与综合精度,其F1分数显著优于对比模型,表明其在平衡误检与漏检方面具有优势. 尽管DKP-YOLO的推理速度略低于YOLOv10-n,但其参数量与计算量均为对比模型中最低的,实现了更高的参数效率. 与基线YOLO12-n相比,DKP-YOLO在速度提升10%的同时,关键指标mAP@0.5:0.95大幅提升了5.1个百分点,这打破了轻量化改进往往伴随性能损失的固有模式.

表 5   泛化试验结果

Tab.5  Results of generalization experiments

模型P/%R/%mAP@0.5/%mAP@0.5:0.95/%F1/%Params/MGFLOPs/109FPS/(帧·s−1)
YOLOv10-n59.957.359.738.058.62.78.4206.1
YOLO11-n64.160.463.238.962.22.66.4197.5
YOLO12-n66.156.762.036.261.02.66.2174.3
DKP-YOLO67.470.773.141.369.02.45.5191.8

新窗口打开| 下载CSV


综上所述,DKP-YOLO不仅成功适应了目标尺度与图像分辨率的跨域变化,更在精度、召回率、模型复杂度与推理速度等多个维度上实现了综合性的领先. 上述结果证实了DKP-YOLO所学习特征表示的有效性与泛化性,为其在多样化的实际无人机巡检场景中的应用奠定了坚实基础.

3. 结果可视化分析

为了清晰评估本研究模型DKP-YOLO在复杂场景下的综合检测能力,选取整体性能较好的3种模型,进行可视化对比分析. 为了充分表现所提方法的优异性,如图7所示的检测效果对比图中用红色方框和箭头标示了YOLOv9-s、YOLOv10-n、YOLO11-n及本研究模型的漏检及错检目标,通过定性可视化方式直观体现DKP-YOLO在多目标共存及小尺度病害检测方面的优势. 如图7第1、4行所示,在阴影干扰且多目标共存的场景中,YOLOv9-s和YOLOv10-n漏检和误检现象较为明显,而YOLO11-n则主要表现为漏检真实裂缝. 相比之下,本研究的DKP-YOLO能够准确地检测出更多的真实裂缝. 这表明传统卷积对前景-背景的判别能力有限,而DKP-YOLO有更优的背景抑制特性,能明显减少漏检和误检现象. 再如图7第3行,面对小尺度、不明显的裂缝目标,YOLOv9-s、YOLOv10-n与YOLO11-n均发生了漏检现象. DKP-YOLO则得益于LKP-EFF模块中的小目标特异性注意力机制,成功捕获了这些易被忽略的微小病害,显著提升了召回率. 由图7可知,尽管所有模型在小目标、多目标、遮挡等复杂条件下均存在部分漏检和误检,但DKP-YOLO性能退化程度最低、稳定性最佳. 这表明其在应对复杂场景时具有更强的泛化能力,进一步验证了其在无人机实时视觉感知任务中的实用潜力.

图 7

图 7   UAV-PDD2023数据集上不同模型检测效果图

Fig.7   Detection results of different models on UAV-PDD2023 dataset


为了验证本研究模型在跨域、跨尺度场景下的鲁棒性与泛化能力,在与UAV-PDD2023数据集分布迥异的UAPD数据集上进行了可视化对比,结果如图8所示. 通过对比分析可见,在目标尺度、纹理及背景环境均发生变化的场景下,DKP-YOLO的表现明显优于其他对比模型. 例如,在图8第1行存在多处细小的纵向与横向裂缝、第2行存在树枝干扰的场景中,YOLOv10-n与YOLO11-n均出现了明显的漏检,仅能识别出部分显著性较高的裂缝,而对对比度低、连续性弱的裂缝响应不足. 相比之下,DKP-YOLO凭借其大核感知特征融合模块对长程依赖的建模能力以及裂缝上下文模块 对局部细节的增强,能够更完整地检出这些细小、模糊的病害目标,表现出更强的特征敏感性与上下文推理能力. 综合多行检测结果来看,DKP-YOLO提供的检测框在数量上更接近真实标注,在空间分布上也更为完整. 这反映了该模型通过多模块协同,实现了从特征提取、上下文感知、多尺度融合到细节重建的全流程优化,从而在面对分布外数据时,仍能保持较高的召回率与精确率平衡.

图 8

图 8   UAPD数据集上不同模型检测效果图

Fig.8   Detection results of different models on UAPD dataset


为了深入探究无人机视角下道路病害检测模型的感知特性,采用GradCAM++(gradient-weighted class activation mapping)[28]技术对不同模型的特征响应区域进行可视化对比分析. GradCAM++通过梯度加权方式保持空间分辨精度,清晰显示模型对裂缝区域的关注强度,其中热力图颜色深度与关注强度呈正相关关系. 如图9所示,该图展示了在相同测试样本及测试条件下,部分表现较好的对比模型与本研究方法所生成的热力图结果. 可以看出,YOLOv9-s、YOLOv10-n与YOLO11-n均表现出明显的局限性:热力图响应区域较为分散,且在非裂缝的背景区域存在明显的激活噪声,尤其在第1行样本中出现显著弥散. 该现象表明这些模型对路面病害的定位能力有限,易受高噪声环境干扰. 这揭示了传统卷积结构在复杂无人机视角下对前景与背景的判别能力不足,难以有效抑制非结构化环境的干扰. 相比之下,本研究提出的DKP-YOLO模型展现出根本性的优势:其热力图更加集中于真实的裂缝轮廓之上,背景激活得到显著抑制. 该可视化结果有力地证明,DKP-YOLO通过其内部结构优化,实现了更优的特征判别能力与背景抑制特性,从而在复杂场景下具有更高的鲁棒性和可靠性,能为基础设施安全评估提供更加可靠的技术支持.

图 9

图 9   不同检测模型热力图对比

Fig.9   Comparison of heatmaps from different detection models


4. 结 语

本研究致力于解决无人机路面病害检测中轻量化与高精度难以兼得的核心矛盾. 通过构建基于动态核感知的DKP-YOLO模型,在架构层面系统地集成了多尺度特征增强与上下文保持机制,实现对路面病害特征更鲁棒的感知与融合. 实验结果表明,所提方法在主流检测模型中取得了精度与效率的更优平衡. 这不仅验证了动态核感知机制在复杂、动态的无人机巡检场景下的有效性,更重要的是,为嵌入式移动平台实现高精度实时病害检测提供了一种新的研究思路和实践方法.

当前工作虽在常规场景下表现良好,但在极端破损或强视觉干扰条件下仍存在局限,这揭示了纯粹基于可见光影像的检测方法存在感知边界. 为此,后续研究将向2个维度深入:一是探索融合多模态传感数据,以突破单一光学信息在物理判别上的瓶颈;二是构建面向极端场景的仿真与增强数据集,利用生成式人工智能技术提升模型在挑战性环境下的泛化与稳健性,从而推动无人机智能巡检技术向全场景、全自动化方向演进.

参考文献

中华人民共和国交通运输部. 2024年交通运输行业发展统计公报[EB/OL]. (2025–06–12) [2025–07–09]. https://xxgk.mot.gov.cn/2020/jigou/zhghs/202506/t20250610_4170228.html.

[本文引用: 1]

《中国公路学报》编辑部

中国路面工程学术研究综述·2024

[J]. 中国公路学报, 2024, 37 (3): 1- 49

DOI:10.19815/j.jace.2025.04061      [本文引用: 1]

Editorial Department of China Journal of Highway and Transport

Review on China’s pavement engineering research: 2024

[J]. China Journal of Highway and Transport, 2024, 37 (3): 1- 49

DOI:10.19815/j.jace.2025.04061      [本文引用: 1]

ALZAHRANI B, OUBBATI O S, BARNAWI A, et al

UAV assistance paradigm: state-of-the-art in applications and challenges

[J]. Journal of Network and Computer Applications, 2020, 166: 102706

DOI:10.1016/j.jnca.2020.102706      [本文引用: 1]

ZHANG Y, ZUO Z, XU X, et al

Road damage detection using UAV images based on multi-level attention mechanism

[J]. Automation in Construction, 2022, 144: 104613

DOI:10.1016/j.autcon.2022.104613      [本文引用: 1]

WANG F, ZOU Y, CHEN X, et al

Rapid in-flight image quality check for UAV-enabled bridge inspection

[J]. ISPRS Journal of Photogrammetry and Remote Sensing, 2024, 212: 230- 250

DOI:10.1016/j.isprsjprs.2024.05.008      [本文引用: 1]

MA X, LI Y, YANG Z, et al

Lightweight network for millimeter-level concrete crack detection with dense feature connection and dual attention

[J]. Journal of Building Engineering, 2024, 94: 109821

DOI:10.1016/j.jobe.2024.109821      [本文引用: 1]

杨豪, 刘李彦, 张军辉, 等

环境适应性优化的轻量化多尺度道路裂缝检测

[J]. 中国公路学报, 2025, 38 (7): 118- 134

[本文引用: 1]

YANG Hao, LIU Liyan, ZHANG Junhui, et al

Environmental adaptability optimization lightweight multi-scale road crack detection

[J]. China Journal of Highway and Transport, 2025, 38 (7): 118- 134

[本文引用: 1]

MA X, DAI X, BAI Y, et al. Rewrite the stars [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 5694–5703.

[本文引用: 1]

YANG F, ZHANG L, YU S, et al

Feature pyramid and hierarchical boosting network for pavement crack detection

[J]. IEEE Transactions on Intelligent Transportation Systems, 2020, 21 (4): 1525- 1535

DOI:10.1109/TITS.2019.2910595      [本文引用: 1]

LIU Z, LIN Y, CAO Y, et al. Swin transformer: hierarchical vision transformer using shifted windows [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2022: 9992–10002.

WANG L, YOON K J

Knowledge distillation and student-teacher learning for visual intelligence: a review and new outlooks

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44 (6): 3048- 3068

DOI:10.1109/TPAMI.2021.3055564      [本文引用: 1]

LIU H, MIAO X, MERTZ C, et al. CrackFormer: transformer network for fine-grained crack detection [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2022: 3763–3772.

[本文引用: 1]

DUNG C V, ANH L D

Autonomous concrete crack detection using deep fully convolutional neural network

[J]. Automation in Construction, 2019, 99: 52- 58

DOI:10.1016/j.autcon.2018.11.028      [本文引用: 1]

QU Z, CHEN W, WANG S Y, et al

A crack detection algorithm for concrete pavement based on attention mechanism and multi-features fusion

[J]. IEEE Transactions on Intelligent Transportation Systems, 2022, 23 (8): 11710- 11719

DOI:10.1109/TITS.2021.3106647      [本文引用: 1]

PAN Y, ZHANG G, ZHANG L

A spatial-channel hierarchical deep learning network for pixel-level automated crack detection

[J]. Automation in Construction, 2020, 119: 103357

DOI:10.1016/j.autcon.2020.103357      [本文引用: 1]

TAN M, PANG R, LE Q V. EfficientDet: scalable and efficient object detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 10778–10787.

[本文引用: 1]

HOU Q, ZHOU D, FENG J. Coordinate attention for efficient mobile network design [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 13708–13717.

[本文引用: 1]

SHAN J, JIANG W, FENG X

Bridging cross-domain and cross-resolution gaps for UAV-based pavement crack segmentation

[J]. Automation in Construction, 2025, 174: 106141

DOI:10.1016/j.autcon.2025.106141      [本文引用: 1]

TIAN Y, YE Q, DOERMANN D. YOLOv12: attention-centric real-time object detectors [EB/OL]. [2025–02–18]. https://arxiv.org/abs/2502.12524.

[本文引用: 1]

ZHAO H, KONG X, HE J, et al. Efficient image super-resolution using pixel attention [C]// Computer Vision – ECCV 2020 Workshops. Cham: Springer, 2020: 56–72.

[本文引用: 1]

LAU K W, PO L M, REHMAN Y A U

Large separable kernel attention: rethinking the large kernel attention design in CNN

[J]. Expert Systems with Applications, 2024, 236: 121352

DOI:10.1016/j.eswa.2023.121352      [本文引用: 1]

LIU W, LU H, FU H, et al. Learning to upsample by learning to sample [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2024: 6004–6014.

[本文引用: 1]

YAN H, ZHANG J

UAV-PDD2023: a benchmark dataset for pavement distress detection based on UAV images

[J]. Data in Brief, 2023, 51: 109692

DOI:10.1016/j.dib.2023.109692      [本文引用: 1]

ZHAO Y, LV W, XU S, et al. DETRs beat YOLOs on real-time object detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 16965–16974.

[本文引用: 1]

WANG C Y, YEH I H, MARK LIAO H Y. YOLOv9: learning what you want toLearn using programmable gradient information [C]//Computer Vision – ECCV 2024. Cham: Springer, 2025: 1–21.

[本文引用: 1]

WANG A, CHEN H, LIU L H, et al. YOLOv10: real-time end-to-end object detection [C]// 38th Conference on Neural Information Processing Systems. Vancouver: Curran Associates, 2024: 107984–108011.

[本文引用: 1]

ZHU J, ZHONG J, MA T, et al

Pavement distress detection using convolutional neural networks with images captured via UAV

[J]. Automation in Construction, 2022, 133: 103991

DOI:10.1016/j.autcon.2021.103991      [本文引用: 1]

CHATTOPADHAY A, SARKAR A, HOWLADER P, et al. Grad-CAM++: generalized gradient-based visual explanations for deep convolutional networks [C]// Proceedings of the IEEE Winter Conference on Applications of Computer Vision. Lake Tahoe: IEEE, 2018: 839–847.

[本文引用: 1]

/