基于多尺度特征聚合的航拍图像检测算法
Aerial image detection algorithm based on multiscale feature aggregation
收稿日期: 2025-07-3
| 基金资助: |
|
Received: 2025-07-3
| Fund supported: | 国家自然科学基金资助项目(62241204). |
作者简介 About authors
李珺(1974—),女,副教授,博士,从事图像处理和智能计算研究.orcid.org/0009-0006-9519-2069.E-mail:
针对无人机(UAV)航拍图像检测任务中存在的密集小目标特征混淆导致漏检率高的问题,在YOLOv11的基础上提出基于多尺度特征聚合的航拍图像检测算法FDL-YOLO. 设计基于频率动态卷积的特征提取模块C3k2-FDCN,通过动态调整卷积核频率响应特性,增强对小目标高频细节特征的敏感度. 使用动态自适应尺度融合模块,重构特征金字塔结构并新增160×160高分辨率特征图,实现跨尺度特征的自适应深度融合. 在网络输入端引入LoG-Stem层,增强输入图像边缘特征和强化目标轮廓信息. 在检测头前端构建浅层细节融合模块,通过通道空间双重注意力机制缓解密集目标场景下的特征混淆. 采用基于依赖图的结构剪枝策略,在保留关键特征通道的前提下优化模型参数,实现检测精度与轻量化部署的平衡. 在VisDrone2019数据集上的实验结果表明,利用改进后的算法,准确率提升5.9%,召回率提升8.2%,mAP50提升8.6%~47.2%,参数量下降了70%. 该算法能够有效应对无人机航拍图像目标检测任务中的挑战.
关键词:
An aerial image detection algorithm named FDL-YOLO based on multi-scale feature aggregation was proposed based on YOLOv11 aiming at the problem of high miss detection rate caused by feature confusion of dense small objects in unmanned aerial vehicle (UAV) aerial image detection task. A feature extraction module C3k2-FDCN based on frequency dynamic convolution was designed. The sensitivity to high-frequency detail features of small objects was enhanced by dynamically adjusting the frequency response characteristic of convolution kernel. A dynamic adaptive scale integration module was adopted to reconstruct the feature pyramid structure and add a new 160×160 high-resolution feature map. Then adaptive deep fusion of cross-scale features was realized. A LoG-Stem layer was introduced at the network input to enhance edge features of input image and strengthen target contour information. A shallow detail fusion module was constructed at the front end of the detection head to alleviate feature confusion in dense object scenario through dual channel-spatial attention mechanism. A dependency graph-based structured pruning strategy was employed to optimize model parameters while retaining key feature channel. Then a balance between detection accuracy and lightweight deployment was achieved. The experimental results on the VisDrone2019 dataset showed that the improved algorithm increased accuracy by 5.9%, recall by 8.2%, and mAP50 by 8.6% to 47.2%, with 70% reduction in parameters. The algorithm can effectively cope with the challenges in UAV aerial image object detection task.
Keywords:
本文引用格式
李珺, 丁彬彬, 史维娟, 杨琳.
LI Jun, DING Binbin, SHI Weijuan, YANG Lin.
随着无人机技术在城市规划、灾害评估及智能交通管理等领域的应用,航拍图像目标检测的研究价值与工程意义显著提升. 航拍场景的独特性带来诸多技术挑战:小目标像素占比低,特征语义匮乏,密集分布和重叠遮挡易引发特征混淆,复杂背景与环境干扰加剧目标与背景边界模糊. 针对这些难题,以YOLO系列为代表的单阶段检测框架凭借高效的推理优势成为主流,研究者从多维度开展改进工作.
针对现有方法在特征提取、特征融合及检测效率方面的挑战,本文提出基于多尺度特征聚合的航拍图像目标检测算法FDL-YOLO,主要工作如下.
(1)设计基于频率动态卷积的特征提取模块C3k2-FDCN,提高对目标高频细节特征的敏感度.
(2)优化输出特征图的尺寸,引入动态自适应尺度融合模块,增强模型上下文信息交互.
(3)在网络输入端使用LoG-Stem层,对输入图像进行边缘特征增强预处理,为后续检测奠定基础.
(4)在检测头前端构建浅层细节融合模块SDFM,通过自适应加权融合机制整合细节信息.
(5)使用基于依赖图的结构剪枝策略,在保留关键特征通道的前提下实现模型参数优化.
1. FDL-YOLO
针对航拍图像检测任务中精度低、误检率高的问题,在YOLOv11的基础上提出FDL-YOLO算法. 该算法的结构如图1所示. 该算法通过以下优化策略提升性能. 在骨干网络中设计C3k2-FDCN特征提取模块,提高对小目标高频细节的敏感度. 调整输出特征图的尺寸并加入DASI自适应尺度融合,强化上下文信息交互能力. 将初始的2个Conv替换为LoG-Stem预处理层,增强输入图像的边缘特征,强化目标轮廓信息. 在检测头之前使用SDFM细节融合模块,通过自适应加权整合浅层细节特征,解决密集场景下的特征混淆问题. 通过依赖图结构剪枝,优化模型参数,平衡检测精度与轻量化. 这些改进共同构建了FDL-YOLO算法,有效提升了无人机航拍场景下的目标检测性能.
图 1
1.1. C3k2-FDCN
图 2
FDW构建频率多样化基础权重:对输入特征图X全局平均池化后,经全连接层与激活函数生成n个权重系数,将傅里叶域系数转为空间域卷积核,与对应的权重逐元素相乘后聚合,得到初始的自适应权重. KSM精细调整核空间响应:从X的AvgPool出发,经FC、Conv1D和Sigmoid生成密集调制矩阵,与FDW输出的初始权重逐元素相乘. FBM动态调控频带贡献:对KSM输出权重作傅里叶变换转至频域,分解为多子带,通过Conv2D和Sigmoid生成调制图,控制各子带的空间贡献,调制后子带经逆傅里叶变换转回空间域并聚合,得到最终的动态卷积核.
利用FDConv,对YOLOv11中的C3k2模块进行优化,提出C3k2-FDCN,结构如图3所示. 具体而言,将瓶颈块内的普通卷积替换为FDConv,构建FD-Bottleneck 模块. 将该优化策略拓展至C3模块,使用FD-Bottleneck替换原始Bottleneck结构,形成C3-FDCN模块. 将C3-FDCN嵌入C3k2架构,构建更高效的特征提取模块C3k2-FDCN.
图 3
由于航拍图像中的小目标信息主要存在于浅层特征图,将骨干网络中前2个C3k2替换为C3k2-FDCN,以突出小目标的特征信息.
1.2. 网络结构的改进
针对YOLOv11在跨尺度特征信息交互中的局限性,提出改进的多尺度特征融合网络架构. 原模型输出20×20、40×40、80×80 3种尺寸特征图,利用多尺度融合机制,虽然能够捕获上下文信息,但在不同层次特征的精细化融合方面存在优化空间.
为了提升特征融合能力与小目标检测性能,对特征金字塔结构进行优化,结构如图4所示. 在 P3、P4、P5阶段引入维度感知选择性集成模块(dimension aware selective integration, DASI),对特征进行聚合,通过卷积调整通道维度后生成40×40的中间特征图. 经2次上采样操作后,对P2、P3、P4阶段特征图实施二次DASI模块处理,以强化全局上下文信息交互. 通过2次下采样输出40×40、80×80、160×160 3种分辨率的特征图,其中新增的160×160高分辨率特征图专门针对航拍场景中的小目标检测任务.
图 4
图 5
相较于原始YOLOv11,改进网络移除低分辨率特征图,新增160×160高分辨率特征图. 结合DASI模块提升跨尺度特征的交互效率,有效降低航拍小目标的漏检、误检率,优化复杂场景的目标检测特征表示.
1.3. LoG-Stem
航拍图像常因噪声导致边缘模糊,而深度网络的特征提取器对边缘的感知能力不足. LoG-Stem作为LEGNet[12]的起始模块,具有LoG噪声抑制和边缘增强的双重能力,在网络早期强化边缘特征,本文用LoG-Stem替换 YOLOv11 起始的2个卷积层,为后续检测奠定基础.
LoG-Stem的结构如图6所示,总体流程如下. 对于输入图像 I∈RH×W×3,通过7×7卷积提取初始特征. 对初始特征应用LoG滤波器增强边缘,先通过高斯核平滑抑制噪声,再用拉普拉斯算子突出边缘信息,弥补深度网络对边缘信息的感知缺陷.
图 6
LoG核的定义为
高斯核为
式中:k = 7,σ = 1.0.
LoG滤波的输出经激活和归一化,与初始7×7卷积结果通过残差连接(Add)融合,可得
残差设计保留了原始图像的细节信息,避免LoG滤波过度抑制背景,同时稳定梯度反向传播.
之后,FLoG会传入2个3×3卷积层,其中第2个卷积层采用步长2进行下采样,过程可以表示为
该步骤将特征图的空间尺寸缩小至(H/2)×(W/2).
F1会经过2个核大小分别为9×9和5×5,且σ = 0.5的高斯滤波器
总体而言,LoG-Stem以LoG为核心增强边缘,残差结构保留细节,多尺度处理覆盖目标变化. 本文将LoG-Stem用在改进网络的起始阶段,输出鲁棒的多尺度边缘特征给后续的检测模块.
1.4. SDFM
图 7
该模块输入浅层特征Fir与深层特征Fvi,先通过卷积统一通道维度实现跨层级模态对齐,再将对齐特征在通道维度拼接,构建多尺度特征融合空间. 通道注意力分支对拼接特征进行全局平均池化,提取全局信息,经逐点卷积生成通道注意力权重Wci,衡量各通道对目标检测的重要性. 空间注意力分支直接对拼接特征卷积生成空间注意力权重Wsi,聚焦目标区域. 2类权重逐元素相乘并经Sigmoid激活,得到自适应融合权重Wi,实现通道与空间的双重加权. 随后用Wi与1−Wi分别加权浅、深层特征,动态分配各层次的特征贡献度,再与原始输入特征残差连接,保留原始信息并增强特征表达.
SDFM有效解决了下采样中小目标特征衰减的问题. 通过通道注意力强化小目标细节关键通道,借助空间注意力定位目标区域,避免深层语义信息淹没浅层细节,提升复杂场景的目标检测精度.
1.5. 基于依赖图的结构剪枝
图 8
图 9
1)网络分解. 传统层级建模难以捕捉复杂依赖,DepGraph将网络分解为输入输出组件对(
2)依赖建模. 整合层间与层内依赖形成对称矩阵D,确保连通路径上的组件统一分组. 层间依赖指
3)参数分组. 构建依赖图后,通过广度优先搜索寻找最大连通分量,生成剪枝组g. 如在残差块中,Conv1的输出通道(
4)稀疏训练与组级剪枝. 针对跨层依赖场景下传统单图层准则的不足,依赖图采用组级稀疏训练. 对参数组g的第k个可剪枝维度,定义正则化项:
5)微调训练:剪枝后须以小学习率微调,优化保留参数组权重,修复精度损耗,确保轻量化结构下的检测精度趋近剪枝前的水平.
2. 实验分析
2.1. 实验数据集、实验环境与参数设置
采用VisDrone2019数据集,该数据集包含从不同城市环境采集的
实验平台配置如下. 操作系统采用Windows 11,编程语言为Python 3.8,深度学习框架选用Pytorch2.0,配套计算加速库为CUDA 11.8及cuDnn 8.9.5.30. 在硬件方面,处理器为Intel (R) Core (TM) i9-13900HX,图形处理器为NVIDIA GeForce RTX4090,内存容量为32 GB,显存容量为24 GB.
在模型训练过程中,采用的关键参数设置如下:输入图像的尺寸设定为640×640 像素,批处理大小(batch size)设为 8,初始学习率配置为0.01,数据加载线程数为8,使用随机梯度下降优化器.
2.2. 评价指标
为了系统验证改进算法的综合性能,选取以下评价指标进行量化分析:准确率P、召回率R、F1分数、平均精度均值mAP、参数量Np、模型体积Sm、计算复杂度FLOPs及推理帧率v. 相关公式如下:
式中:TP表示实际为正样本且预测为正样本的数量,FP表示实际为负样本但预测为正样本的数量,FN表示实际为正样本但预测为负样本的数量.
2.3. 实验结果与分析
2.3.1. 消融实验
YOLOv11提供了5种不同尺寸的模型,分别为 n、s、m、l、x. 每种尺寸在VisDrone2019数据集上的核心评价指标如表1所示,s模型在检测精度和检测效率之间拥有良好的平衡能力,因此选择s模型作为研究的基线模型.
表 1 不同YOLOv11模型的表现结果
Tab.1
| 模型 | P/% | R/% | mAP50/% | mAP50-95/% | Np/106 | FLOPs/109 | v/(帧·s−1) |
| n | 42.7 | 32.7 | 32.3 | 10.7 | 2.6 | 6.3 | 153 |
| s | 49.7 | 37.5 | 38.6 | 23.1 | 9.4 | 21.3 | 148 |
| m | 54.8 | 42.0 | 43.8 | 26.8 | 20.0 | 67.7 | 90 |
| l | 54.5 | 42.6 | 44.0 | 27.1 | 25.3 | 86.6 | 80 |
| x | 56.7 | 44.8 | 46.1 | 28.8 | 56.8 | 194.5 | 56 |
表 2 消融实验的配置
Tab.2
| 方法 | C3k2-FDCN | Net Improve | Log-Stem | SDFM | Prune |
| YOLOv11s | — | — | — | — | — |
| 方法① | √ | — | — | — | — |
| 方法② | — | √ | — | — | — |
| 方法③ | — | — | √ | — | — |
| 方法④ | — | — | — | √ | — |
| 方法⑤ | √ | √ | — | — | — |
| 方法⑥ | √ | √ | √ | — | — |
| 方法⑦ | √ | √ | √ | √ | — |
| 方法⑧ | √ | √ | √ | √ | √ |
表 3 消融实验结果
Tab.3
| 方法 | P/% | R/% | mAP50/% | mAP75/% | mAP50-95/% | Np/106 | F1 | FLOPs/109 | Sm/MB | v/(帧·s−1) |
| YOLOv11s | 49.7 | 37.5 | 38.6 | 23.6 | 23.1 | 9.4 | 42.2 | 21.3 | 18.3 | 148 |
| 方法① | 50.2 | 39.1 | 39.5 | 24.2 | 23.8 | 9.5 | 43.0 | 21.2 | 18.4 | 146 |
| 方法② | 53.3 | 41.6 | 43.1 | 27.0 | 26.3 | 7.7 | 46.2 | 31.9 | 15.5 | 149 |
| 方法③ | 50.1 | 39.0 | 39.8 | 24.8 | 24.1 | 9.4 | 43.6 | 30.2 | 18.5 | 144 |
| 方法④ | 52.4 | 39.5 | 40.7 | 25.1 | 24.5 | 12.1 | 44.5 | 30.8 | 23.6 | 159 |
| 方法⑤ | 54.8 | 41.2 | 44.1 | 27.8 | 27.0 | 7.9 | 46.5 | 34.5 | 15.0 | 141 |
| 方法⑥ | 54.5 | 43.7 | 45.5 | 28.9 | 28.0 | 7.9 | 48.0 | 37.9 | 15.5 | 123 |
| 方法⑦ | 56.1 | 44.9 | 47.0 | 29.8 | 28.9 | 8.3 | 49.8 | 44.9 | 16.3 | 106 |
| 方法⑧ | 55.6 | 45.7 | 47.2 | 30.0 | 29.1 | 2.9 | 49.8 | 28.9 | 12.0 | 122 |
从表3可知,与基线YOLOv11s相比,引入C3k2-FDCN、Net Improve、LoG-Stem 和SDFM模块后,mAP50指标分别提升0.9%、4.5%、1.2% 和2.1%,mAP50-90指标对应提升0.7%、3.2%、1.0%和1.4%. 上述结果表明,各改进模块对航拍图像的小目标检测性能均有正向增益,其中网络结构改进对算法检测精度的提升效果最显著. 方法⑦集成4个改进模块后,推理帧率降至106 帧/s且计算量有所提高. 方法⑧通过基于依赖图的结构剪枝进行优化,得到最终模型. 与YOLOv11s相比,准确率提升5.9%,召回率提升8.2%,mAP50提升了8.6%,达到47.2%,mAP50-95提升6.0%,参数量下降了70%,模型体积缩减了33.3%. 尽管计算量有所增加且帧率略有下降,但改进算法的性能能够满足航拍场景实时监测的需求. 对YOLOv11s施加各项改进后的检测精度提升趋势如图10所示,验证了各策略的有效性. 其中,Ni为迭代次数.
图 10
2.3.2. 不同剪枝比例的对比试验
为了探究剪枝率对FDL-YOLOs模型性能的影响,通过加速比(speed_up)参数设计不同剪枝比例的实验. 每次剪枝后,采用微调训练补偿性能损失,从检测精度与轻量化指标来分析剪枝的规律.
从表4可知,在35%的剪枝比例下,模型的mAP50保持为47.2%,参数量降至2.9×106. 当剪枝比例提升至40%时,mAP50 降至46.7%,说明更高比例的剪枝导致部分特征通道被误剪,精度下降.
表 4 模型剪枝比例的对比
Tab.4
| 剪枝比例/% | P/% | R/% | mAP50/% | mAP50-95/% | Np/106 | FLOPs/109 | Sm/MB | v/(帧·s−1) |
| 0 | 56.1 | 44.9 | 47.0 | 28.9 | 8.3 | 44.9 | 16.3 | 106 |
| 30 | 55.0 | 46.4 | 47.4 | 29.3 | 3.2 | 31.2 | 13.0 | 120 |
| 35 | 55.6 | 45.7 | 47.2 | 29.1 | 2.9 | 28.9 | 12.0 | 122 |
| 40 | 55.5 | 44.5 | 46.7 | 28.7 | 2.7 | 26.7 | 11.1 | 123 |
| 45 | 55.2 | 44.0 | 46.1 | 28.3 | 2.5 | 24.5 | 10.2 | 130 |
| 50 | 54.8 | 43.8 | 45.8 | 28.0 | 2.3 | 22.3 | 9.4 | 133 |
| 55 | 55.3 | 42.5 | 45.3 | 27.8 | 2.2 | 21.1 | 9.1 | 137 |
若仅以轻量化为单一目标,高剪枝比例虽然可实现极致压缩,但会导致检测精度的衰减. 当剪枝比例为35%时,模型在检测精度保留与轻量化之间达到最优平衡:mAP50 为47.2%,mAP50-95维持29.1%,参数量、FLOPs、模型体积较剪枝前分别缩减了65%、35%、27%,推理帧率提升至122帧/s.
2.3.3. 各个类别的精度对比
为了验证改进剪枝后FDL-YOLOs算法在各类别检测中的优势,在VisDrone2019数据集上,与主流及其他改进算法开展对比实验. 评价体系采用10个类别及总体mAP50,结果如表5所示.
表 5 各个类别的精度对比
Tab.5
| 模型 | mAP50/% | ||||||||||
| Pedestrian | People | Bicycle | Motor | Tricycle | Awning-tri | Truck | Car | Bus | Van | 总体值 | |
| SSD | 18.7 | 9.0 | 5.0 | 19.1 | 11.7 | 15.5 | 33.1 | 63.2 | 47.2 | 30.0 | 25.3 |
| Faster R-CNN | 20.9 | 14.8 | 7.3 | 21.2 | 14.0 | 8.8 | 19.5 | 51.0 | 30.5 | 29.7 | 21.8 |
| CenterNet | 22.6 | 20.6 | 14.6 | 23.7 | 20.1 | 17.4 | 21.3 | 59.7 | 37.9 | 24.0 | 26.2 |
| YOLOv5s | 39.2 | 31.4 | 10.6 | 38.4 | 18.2 | 9.8 | 26.2 | 72.6 | 39.9 | 33.7 | 32.0 |
| YOLOv6s | 37.2 | 29.8 | 8.9 | 39.6 | 23.6 | 14.8 | 32.5 | 78.1 | 51.2 | 42.6 | 35.8 |
| YOLOv8s | 42.2 | 31.6 | 12.0 | 43.3 | 26.4 | 14.6 | 36.0 | 79.2 | 56.8 | 43.7 | 38.6 |
| YOLOv9s | 38.4 | 32.8 | 10.3 | 42.2 | 26.9 | 15.0 | 34.3 | 78.0 | 51.5 | 43.2 | 37.3 |
| YOLOv10s | 43.1 | 34.0 | 14.1 | 45.0 | 27.4 | 15.3 | 35.2 | 79.9 | 55.1 | 44.7 | 39.4 |
| YOLOv11s | 42.4 | 31.8 | 11.8 | 43.3 | 26.6 | 14.7 | 35.3 | 79.4 | 56.3 | 44.9 | 38.7 |
| YOLOv12s | 41.0 | 30.6 | 11.3 | 42.5 | 25.6 | 14.2 | 33.4 | 78.7 | 55.6 | 43.2 | 37.6 |
| YOLOv13s | 40.6 | 31.0 | 11.7 | 41.1 | 26.7 | 13.9 | 33.5 | 78.6 | 50.2 | 43.5 | 37.1 |
| Hyper-YOLOs | 43.0 | 32.8 | 13.2 | 43.9 | 29.2 | 15.1 | 36.7 | 79.5 | 61.0 | 44.1 | 39.8 |
| RT-DETR-r18 | 51.1 | 44.2 | 17.5 | 55.5 | 29.2 | 17.1 | 33.5 | 84.7 | 56.6 | 49.0 | 43.8 |
| DMF-YOLO[15] | 54.5 | 43.7 | 18.3 | 53.5 | 33.4 | 19.3 | 40.8 | 85.7 | 61.3 | 51.5 | 46.2 |
| HSF-YOLO[16] | 53.5 | 42.0 | 17.7 | 53.2 | 33.1 | 17.7 | 36.7 | 84.3 | 61.2 | 49.0 | 44.8 |
| YOLO-GAIS[17] | 48.5 | 55.4 | 23.8 | 52.5 | 38.7 | 24.4 | 35.4 | 77.9 | 49.4 | 39.2 | 43.2 |
| FDL-YOLOs | 55.3 | 45.5 | 20.3 | 55.0 | 34.4 | 20.7 | 41.4 | 85.5 | 61.9 | 52.3 | 47.2 |
FDL-YOLOs在多个类别上的表现优异,尤其是Pedestrian与People 2类小目标,mAP50分别达到55.3%和45.5%,较基准YOLOv11s提升了12.9%和13.7%,优于DMF-YOLO和HSF-YOLO改进算法. 这表明传统及部分改进算法存在跨层级通道信息交互薄弱、特征图设计针对性不足的问题,导致细粒度特征流失. FDL-YOLOs通过DASI模块优化网络,实现上下文信息高效交互,有效保留小目标关键特征. 改进算法兼顾大尺寸目标检测,Van与Truck类别的mAP50分别达到52.3%和41.4%,较YOLOv11s提升了7.4%和6.1%,表现最优.
总体而言,FDL-YOLOs总体的mAP50达到47.2%,优于基线模型及其他改进方案,验证了该算法的小目标检测能力显著提升,性能增益源于特征提取与多尺度融合策略的协同优化,为航拍图像目标检测提供了高效、可靠的方案.
2.3.4. 检测性能的对比试验
为了验证FDL-YOLOs的性能优势,在VisDrone2019数据集上与主流YOLO系列及其他改进算法进行对比,对n、s模型与对比方法开展综合评估,结果见表6.
表 6 不同算法的检测性能对比
Tab.6
| 模型 | P/% | R/% | mAP50/% | mAP50- 95/% | Np/ 106 | FLOPs/ 109 |
| YOLOv8n | 42.9 | 32.9 | 32.8 | 19.0 | 3.0 | 8.1 |
| YOLOv8s | 49.6 | 38.1 | 38.6 | 23.1 | 11.1 | 28.5 |
| YOLOv8m | 53.3 | 41.6 | 42.7 | 26.0 | 25.8 | 78.7 |
| YOLOv10n | 43.8 | 33.3 | 33.2 | 19.0 | 2.3 | 6.5 |
| YOLOv10s | 49.9 | 39.0 | 39.4 | 23.3 | 7.2 | 21.4 |
| YOLOv10m | 53.6 | 41.6 | 42.9 | 25.9 | 15.3 | 58.9 |
| YOLOv11n | 42.7 | 32.7 | 32.3 | 10.7 | 2.6 | 6.3 |
| YOLOv11s | 49.7 | 37.5 | 38.6 | 23.1 | 9.4 | 21.3 |
| YOLOv11m | 54.8 | 42.0 | 43.8 | 26.8 | 20.0 | 67.7 |
| YOLOv12n | 41.8 | 32.4 | 31.6 | 18.1 | 25.1 | 5.8 |
| YOLOv12s | 49.5 | 36.5 | 37.6 | 22.5 | 9.1 | 19.3 |
| YOLOv12m | 53.2 | 40.7 | 42.2 | 25.7 | 19.6 | 59.5 |
| YOLOv13n | 42.9 | 31.5 | 31.4 | 18.1 | 2.4 | 6.1 |
| YOLOv13s | 47.6 | 37.2 | 37.1 | 22.1 | 9.0 | 20.1 |
| YOLOv13l | 53.6 | 41.9 | 42.5 | 25.8 | 26.9 | 84.4 |
| Hyper-YOLOn | 44.8 | 35.1 | 35.0 | 20.6 | 3.6 | 9.5 |
| Hyper-YOLOs | 51.2 | 38.9 | 39.8 | 24.0 | 13.5 | 33.8 |
| Hyper-YOLOm | 53.7 | 41.5 | 42.5 | 26.0 | 30.7 | 91.8 |
| RT-DETR-r18 | 58.5 | 41.5 | 43.8 | 26.6 | 19.8 | 57.0 |
| RT-DETR-r34 | 61.5 | 45.5 | 47.2 | 29.0 | 31.1 | 88.8 |
| AAPW-YOLOn[18] | 49.9 | 37.3 | 38.6 | 22.4 | 2.1 | 11.7 |
| PC-YOLOn[19] | 46.8 | 35.4 | 36.1 | 21.5 | 1.9 | — |
| YOLO-S3DTn[20] | 47.4 | 37.9 | 37.9 | 21.1 | 2.9 | 11.0 |
| Eagle-YOLOs[21] | 53.6 | 43.3 | 42.9 | 25.0 | 16.6 | — |
| PARE-YOLOs[22] | 60.6 | 45.4 | 46.3 | 28.4 | — | — |
| RPS-YOLO[2] | 55.3 | 44.3 | 46.3 | 28.1 | 13.3 | 37.7 |
| FDL-YOLOn | 49.2 | 39.3 | 39.9 | 24.1 | 1.1 | 10.2 |
| FDL-YOLOs | 55.6 | 45.7 | 47.2 | 29.1 | 2.9 | 28.9 |
FDL-YOLOs的mAP50由YOLOv11s的38.6%提升至47.2%,mAP95由23.1%提升至29.1%,分别提高了8.6%与6.0%. 各模块的改进与剪枝策略显著增强了模型的特征提取、目标定位与背景抑制能力. 经剪枝后,FDL-YOLOs算法的参数量仅为2.9×106,较YOLOv11s减少了70%;FDL-YOLOn算法的参数量仅为1.1×106,mAP50仍达39.9%.
与其他改进模型相比,FDL-YOLO算法展现出显著的竞争优势,综合检测性能表现突出. n模型中,FDL-YOLOn在mAP50达到39.9%的同时,参数量与计算量最低,较PC-YOLOn、YOLO-S3DTn分别增大了3.8%、2.0%. s模型中,PARE-YOLOs的精度为60.6%,RPS-YOLOs的参数量与计算量偏高,不利于部署;FDL-YOLOs在精度与效率间实现更好的平衡,在航拍目标检测中的优势明显.
2.3.5. SIMD数据集的对比
为了验证FDL-YOLOs模型的适用性,选取SIMD数据集进行泛化性能的测试. SIMD数据集面向遥感图像小目标检测,涵盖汽车、卡车和货车等15个目标类别,总计5 000张图像,其中4 000张用于训练,1 000张用于验证,小目标占比较高. 选取其他YOLO系列算法,与本文方法进行对比,结果如表7所示.
表 7 不同模型在SIMD数据集上的性能指标对比
Tab.7
| 模型 | P/% | R/% | mAP50/% | mAP50-95/% |
| YOLOv8s | 78.6 | 80.9 | 82.4 | 66.7 |
| YOLOv10s | 75.6 | 80.5 | 82.7 | 66.3 |
| YOLOv11s | 76.1 | 81.0 | 82.8 | 66.9 |
| YOLOv12s | 75.2 | 81.7 | 82.6 | 66.3 |
| FDL-YOLOs | 79.3 | 81.6 | 83.7 | 67.3 |
图 11
2.3.6. TinyPerson数据集的对比
为了验证本文算法在小目标检测性能上的提升,选择TinyPerson数据集进行验证. TinyPerson数据集是针对小目标人群检测的专用数据集,图像分辨率跨度大且目标尺寸极小,分为陆地行人和水中行人2类,使用1 224张图像用于训练和152张图像用于验证. 选取其他YOLO系列算法进行对比,结果如表8所示.
表 8 TinyPerson数据集结果的对比
Tab.8
| 模型 | P/% | R/% | mAP50/% | mAP50-95/% |
| YOLOv8s | 41.8 | 28.7 | 25.9 | 8.2 |
| YOLOv10s | 39.3 | 27.9 | 24.2 | 7.7 |
| YOLOv11s | 44.3 | 27.9 | 26.0 | 8.3 |
| YOLOv12s | 43.4 | 27.4 | 25.4 | 8.1 |
| FDL-YOLOs | 46.5 | 34.2 | 29.8 | 9.5 |
图 12
2.3.7. 热力图对比
为了体现FDL-YOLOs对特征感知的优化,设计热力图对比实验. 选取小目标重叠、遮挡目标和夜间的典型场景,通过Grad-CAM算法生成热力图,结果如图13所示. 其中,左侧为YOLOv11s,右侧为FDL-YOLOs,差异区域用曲线标出. YOLOv11s的热力图对小目标边缘、遮挡衔接处的特征响应强度不足,面对多尺度目标存在轮廓刻画不完整的问题. FDL-YOLOs集成的频率动态卷积及浅层细节融合模块有效强化了多尺度信息的融合,热力图更能够精准覆盖待检测区域.
图 13
在小目标重叠场景中,YOLOv11s存在大量的漏检情况,利用FDL-YOLOs输出的特征热力图可以精准地聚焦目标有效区域. 在遮挡目标场景和夜间场景下,FDL-YOLOs检测能力的优化更显著,在很大程度上提升了对遮挡目标和模糊目标的识别能力.
2.3.8. 检测结果对比
表 9 改进算法在不同场景下的检测数量对比
Tab.9
| 场景 | Nd | |
| YOLOv11s | FDL-YOLOs | |
| 目标密集 | 241 | 300 |
| 光线暗淡 | 48 | 61 |
| 大小目标 | 44 | 69 |
| 背景复杂 | 46 | 102 |
图 14
在目标密集场景中,小目标因相互遮挡、尺度微小易发生漏检,FDL-YOLOs通过浅层特征图优化策略增强小目标感知能力,检测目标数达到300,较YOLOv11s多识别59个遗漏目标. 在光线暗淡场景下,光照不足导致目标模糊,FDL-YOLOs通过改进特征融合机制提升模型抗干扰能力,检测数为61,较 YOLOv11s增加13个目标,体现了在低照度场景下的抗干扰优势. 在大小目标共存场景中,FDL-YOLOs所使用的频率动态卷积模块有效强化了细粒度特征提取. 改进算法较YOLOv11s多检测出25个目标,远端小尺度车辆与近端大尺度车辆均被有效识别. 在背景复杂场景中,FDL-YOLOs采用跨层交互的深层特征融合方法,维持特征表达的稳定性. 与YOLOv11s相比,改进算法在各个场景下的目标检测数量大幅提升,验证了特征融合策略的有效性.
实验表明,FDL-YOLOs通过边缘强化结构、频率动态卷积与特征融合方式的协同优化,显著提升了细节信息捕获能力与复杂环境抗干扰性能.
3. 结 语
针对无人机航拍小目标像素占比低、密集遮挡、多尺度融合难及轻量化与精度平衡等挑战,提出FDL-YOLO多尺度特征聚合检测算法,通过优化YOLOv11s提升检测性能.
C3k2-FDCN模块利用频率动态卷积,增强了对小目标细节信息的捕获能力. DASI模块重构特征金字塔并新增高分辨率特征图,实现深浅层特征融合. LoG-Stem层强化初始边缘特征. SDFM通过双重注意力,减少小目标特征衰减. 结构剪枝技术在保留关键通道的同时,压缩模型体积.
综上,FDL-YOLO通过特征提取、融合策略及轻量化优化,为航拍小目标检测提供高效方案. 未来将聚焦极端尺度差异场景,以提升鲁棒性.
参考文献
YOLO-RACE: reassembly and convolutional block attention for enhanced dense object detection
[J].DOI:10.1007/s10044-025-01471-4 [本文引用: 1]
RPS-YOLO: a recursive pyramid structure-based YOLO network for small object detection in unmanned aerial vehicle scenarios
[J].DOI:10.3390/app15042039 [本文引用: 2]
基于改进YOLO11的无人机航拍图像小目标检测算法
[J].
Small object detection algorithm in UAV aerial images based on improved YOLO11
[J].
SPDC-YOLO: an efficient small target detection network based on improved YOLOv8 for drone aerial image
[J].DOI:10.3390/rs17040685 [本文引用: 1]
A UAV perspective based lightweight target detection and tracking algorithm for intelligent transportation
[J].DOI:10.1007/s40747-024-01687-7 [本文引用: 1]
低光照增强和自适应特征融合的小目标检测算法
[J].DOI:10.3788/LOP250914 [本文引用: 1]
Small object detection algorithm based on low-light enhancement and adaptive feature fusion
[J].DOI:10.3788/LOP250914 [本文引用: 1]
A lightweight UAV target detection algorithm based on improved YOLOv8s model
[J].DOI:10.1038/s41598-025-00341-7 [本文引用: 1]
Lightweight small target detection algorithm based on YOLOv8 network improvement
[J].DOI:10.1109/ACCESS.2025.3529835 [本文引用: 1]
YOLOFLY: a consumer-centric framework for efficient object detection in UAV imagery
[J].DOI:10.3390/electronics14030498 [本文引用: 1]
Rethinking the necessity of image fusion in high-level vision tasks: a practical infrared and visible image fusion network based on progressive semantic injection and scene fidelity
[J].DOI:10.1016/j.inffus.2023.101870 [本文引用: 1]
DMF-YOLOv11: 基于改进YOLOv11n的无人机航拍图像目标检测算法
[J].DOI:10.3778/j.issn.1002-8331.2502-0223 [本文引用: 1]
DMF-YOLOv11: target detection algorithm for UAV images based on improved YOLOv11n
[J].DOI:10.3778/j.issn.1002-8331.2502-0223 [本文引用: 1]
基于高阶空间特征提取的无人机航拍小目标检测算法
[J].DOI:10.3778/j.issn.1002-8331.2407-0230 [本文引用: 1]
High-order spatial feature extraction based small target detection for UAV aerial photographs
[J].DOI:10.3778/j.issn.1002-8331.2407-0230 [本文引用: 1]
YOLOv8-GAIS: 一种改进的无人机航拍目标检测算法
[J].
YOLOv8-GAIS: improved object detection algorithm for UAV aerial photography
[J].
An object detection model AAPW-YOLO for UAV remote sensing images based on adaptive convolution and reconstructed feature fusion
[J].DOI:10.1038/s41598-025-00239-4 [本文引用: 1]
PC-YOLO11s: a lightweight and effective feature extraction method for small target image detection
[J].DOI:10.3390/s25020348 [本文引用: 1]
YOLO-S3DT: a small target detection model for UAV images based on YOLOv8
[J].
Eagle-YOLOv8: UAV object detection inspired by the eagle-eye vision system
[J].DOI:10.1109/JSTARS.2025.3554821 [本文引用: 1]
Fusion of multi-scale attention for aerial images small-target detection model based on PARE-YOLO
[J].DOI:10.1038/s41598-025-88857-w [本文引用: 1]
/
| 〈 |
|
〉 |

