浙江大学学报(工学版), 2026, 60(9): 1890-1900 doi: 10.3785/j.issn.1008-973X.2026.09.006

计算机技术、自动控制技术

基于多尺度特征聚合的航拍图像检测算法

李珺,, 丁彬彬, 史维娟, 杨琳

兰州交通大学 电子与信息工程学院,甘肃 兰州 730070

Aerial image detection algorithm based on multiscale feature aggregation

LI Jun,, DING Binbin, SHI Weijuan, YANG Lin

School of Electronic and Information Engineering, Lanzhou Jiaotong University, Lanzhou 730070, China

收稿日期: 2025-07-3  

基金资助: 国家自然科学基金资助项目(62241204).

Received: 2025-07-3  

Fund supported: 国家自然科学基金资助项目(62241204).

作者简介 About authors

李珺(1974—),女,副教授,博士,从事图像处理和智能计算研究.orcid.org/0009-0006-9519-2069.E-mail:lijane@mail.lzjtu.cn , E-mail:lijane@mail.lzjtu.cn

摘要

针对无人机(UAV)航拍图像检测任务中存在的密集小目标特征混淆导致漏检率高的问题,在YOLOv11的基础上提出基于多尺度特征聚合的航拍图像检测算法FDL-YOLO. 设计基于频率动态卷积的特征提取模块C3k2-FDCN,通过动态调整卷积核频率响应特性,增强对小目标高频细节特征的敏感度. 使用动态自适应尺度融合模块,重构特征金字塔结构并新增160×160高分辨率特征图,实现跨尺度特征的自适应深度融合. 在网络输入端引入LoG-Stem层,增强输入图像边缘特征和强化目标轮廓信息. 在检测头前端构建浅层细节融合模块,通过通道空间双重注意力机制缓解密集目标场景下的特征混淆. 采用基于依赖图的结构剪枝策略,在保留关键特征通道的前提下优化模型参数,实现检测精度与轻量化部署的平衡. 在VisDrone2019数据集上的实验结果表明,利用改进后的算法,准确率提升5.9%,召回率提升8.2%,mAP50提升8.6%~47.2%,参数量下降了70%. 该算法能够有效应对无人机航拍图像目标检测任务中的挑战.

关键词: YOLOv11 ; 航拍图像 ; 小目标检测 ; 多尺度特征 ; 结构剪枝 ; 轻量化

Abstract

An aerial image detection algorithm named FDL-YOLO based on multi-scale feature aggregation was proposed based on YOLOv11 aiming at the problem of high miss detection rate caused by feature confusion of dense small objects in unmanned aerial vehicle (UAV) aerial image detection task. A feature extraction module C3k2-FDCN based on frequency dynamic convolution was designed. The sensitivity to high-frequency detail features of small objects was enhanced by dynamically adjusting the frequency response characteristic of convolution kernel. A dynamic adaptive scale integration module was adopted to reconstruct the feature pyramid structure and add a new 160×160 high-resolution feature map. Then adaptive deep fusion of cross-scale features was realized. A LoG-Stem layer was introduced at the network input to enhance edge features of input image and strengthen target contour information. A shallow detail fusion module was constructed at the front end of the detection head to alleviate feature confusion in dense object scenario through dual channel-spatial attention mechanism. A dependency graph-based structured pruning strategy was employed to optimize model parameters while retaining key feature channel. Then a balance between detection accuracy and lightweight deployment was achieved. The experimental results on the VisDrone2019 dataset showed that the improved algorithm increased accuracy by 5.9%, recall by 8.2%, and mAP50 by 8.6% to 47.2%, with 70% reduction in parameters. The algorithm can effectively cope with the challenges in UAV aerial image object detection task.

Keywords: YOLOv11 ; aerial image ; small target detection ; multi-scale feature ; structural pruning ; lightweighting

PDF (3870KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

李珺, 丁彬彬, 史维娟, 杨琳. 基于多尺度特征聚合的航拍图像检测算法. 浙江大学学报(工学版)[J], 2026, 60(9): 1890-1900 doi:10.3785/j.issn.1008-973X.2026.09.006

LI Jun, DING Binbin, SHI Weijuan, YANG Lin. Aerial image detection algorithm based on multiscale feature aggregation. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1890-1900 doi:10.3785/j.issn.1008-973X.2026.09.006

随着无人机技术在城市规划、灾害评估及智能交通管理等领域的应用,航拍图像目标检测的研究价值与工程意义显著提升. 航拍场景的独特性带来诸多技术挑战:小目标像素占比低,特征语义匮乏,密集分布和重叠遮挡易引发特征混淆,复杂背景与环境干扰加剧目标与背景边界模糊. 针对这些难题,以YOLO系列为代表的单阶段检测框架凭借高效的推理优势成为主流,研究者从多维度开展改进工作.

在小目标特征增强方面,Bae等[1]针对上采样过程中细节丢失的问题,在YOLOv8中引入CARAFE上采样,通过自适应特征重组,有效地抑制背景干扰. Lei等[2]提出RPS-YOLO架构,设计递归特征金字塔结构,通过2轮特征提取过程,保留了浅层小目标细节. 张志豪等[3]基于YOLOv11设计跨层信息交互模块,通过注意力机制强化了跨层级的特征关联.

在多尺度特征融合机制的创新中,Bi等[4]提出SPC-FPN结构,利用选择性边界聚合模块,融合浅层边界特征与深层语义特征. Wang等[5]设计跨层稠密连接结构,解决传统特征金字塔的信息损耗问题. 童庆洪等[6]在YOLOv11的基础上构建自适应空间特征融合检测层,通过动态权重分配实现不同层次特征的自适应融合.

在模型轻量化设计领域,Ma等[7]提出参数共享卷积检测头,利用卷积核参数共享策略,减小计算开销与模型复杂度. Hao等[8]在SFD-YOLO中设计膨胀残差注意力模块,在提升检测精度的同时显著降低了参数量. Ma等[9]将YOLOv11的特征提取模块C3k2替换为C4f,采用空间可分离卷积瓶颈块,在保持高特征提取能力的同时降低计算成本.

针对现有方法在特征提取、特征融合及检测效率方面的挑战,本文提出基于多尺度特征聚合的航拍图像目标检测算法FDL-YOLO,主要工作如下.

(1)设计基于频率动态卷积的特征提取模块C3k2-FDCN,提高对目标高频细节特征的敏感度.

(2)优化输出特征图的尺寸,引入动态自适应尺度融合模块,增强模型上下文信息交互.

(3)在网络输入端使用LoG-Stem层,对输入图像进行边缘特征增强预处理,为后续检测奠定基础.

(4)在检测头前端构建浅层细节融合模块SDFM,通过自适应加权融合机制整合细节信息.

(5)使用基于依赖图的结构剪枝策略,在保留关键特征通道的前提下实现模型参数优化.

1. FDL-YOLO

针对航拍图像检测任务中精度低、误检率高的问题,在YOLOv11的基础上提出FDL-YOLO算法. 该算法的结构如图1所示. 该算法通过以下优化策略提升性能. 在骨干网络中设计C3k2-FDCN特征提取模块,提高对小目标高频细节的敏感度. 调整输出特征图的尺寸并加入DASI自适应尺度融合,强化上下文信息交互能力. 将初始的2个Conv替换为LoG-Stem预处理层,增强输入图像的边缘特征,强化目标轮廓信息. 在检测头之前使用SDFM细节融合模块,通过自适应加权整合浅层细节特征,解决密集场景下的特征混淆问题. 通过依赖图结构剪枝,优化模型参数,平衡检测精度与轻量化. 这些改进共同构建了FDL-YOLO算法,有效提升了无人机航拍场景下的目标检测性能.

图 1

图 1   FDL-YOLO的网络结构

Fig.1   Network structure of FDL-YOLO


1.1. C3k2-FDCN

针对航拍图像中目标尺寸微小的特点,引入用于密集图像检测的频率动态卷积(frequency dynamic convolution,FDConv)[10],FDConv的架构如图2所示. FDConv分为3个核心模块:傅里叶不相交权重(FDW)、核空间调制(KSM)、频带调制(FBM).

图 2

图 2   频率动态卷积的结构图

Fig.2   Structure diagram of frequency dynamic convolution


FDW构建频率多样化基础权重:对输入特征图X全局平均池化后,经全连接层与激活函数生成n个权重系数,将傅里叶域系数转为空间域卷积核,与对应的权重逐元素相乘后聚合,得到初始的自适应权重. KSM精细调整核空间响应:从X的AvgPool出发,经FC、Conv1D和Sigmoid生成密集调制矩阵,与FDW输出的初始权重逐元素相乘. FBM动态调控频带贡献:对KSM输出权重作傅里叶变换转至频域,分解为多子带,通过Conv2D和Sigmoid生成调制图,控制各子带的空间贡献,调制后子带经逆傅里叶变换转回空间域并聚合,得到最终的动态卷积核.

利用FDConv,对YOLOv11中的C3k2模块进行优化,提出C3k2-FDCN,结构如图3所示. 具体而言,将瓶颈块内的普通卷积替换为FDConv,构建FD-Bottleneck 模块. 将该优化策略拓展至C3模块,使用FD-Bottleneck替换原始Bottleneck结构,形成C3-FDCN模块. 将C3-FDCN嵌入C3k2架构,构建更高效的特征提取模块C3k2-FDCN.

图 3

图 3   C3k2-FDCN的结构图

Fig.3   Structure diagram of C3k2-FDCN


由于航拍图像中的小目标信息主要存在于浅层特征图,将骨干网络中前2个C3k2替换为C3k2-FDCN,以突出小目标的特征信息.

1.2. 网络结构的改进

针对YOLOv11在跨尺度特征信息交互中的局限性,提出改进的多尺度特征融合网络架构. 原模型输出20×20、40×40、80×80 3种尺寸特征图,利用多尺度融合机制,虽然能够捕获上下文信息,但在不同层次特征的精细化融合方面存在优化空间.

为了提升特征融合能力与小目标检测性能,对特征金字塔结构进行优化,结构如图4所示. 在 P3、P4、P5阶段引入维度感知选择性集成模块(dimension aware selective integration, DASI),对特征进行聚合,通过卷积调整通道维度后生成40×40的中间特征图. 经2次上采样操作后,对P2、P3、P4阶段特征图实施二次DASI模块处理,以强化全局上下文信息交互. 通过2次下采样输出40×40、80×80、160×160 3种分辨率的特征图,其中新增的160×160高分辨率特征图专门针对航拍场景中的小目标检测任务.

图 4

图 4   改进的网络结构

Fig.4   Improved network structure


DASI模块源自HCF-Net[11]架构,该模块的结构如图5所示. 通过通道分组与动态权重机制平衡传统融合中细节与上下文的矛盾,流程如下:先统一高低层特征通道、匹配尺寸并分组;再通过Sigmoid生成空间权重,动态融合对应子组;最后拼接融合结果,并进行后续处理后输出.

图 5

图 5   维度感知选择性集成模块

Fig.5   Dimension aware selective integration module


相较于原始YOLOv11,改进网络移除低分辨率特征图,新增160×160高分辨率特征图. 结合DASI模块提升跨尺度特征的交互效率,有效降低航拍小目标的漏检、误检率,优化复杂场景的目标检测特征表示.

1.3. LoG-Stem

航拍图像常因噪声导致边缘模糊,而深度网络的特征提取器对边缘的感知能力不足. LoG-Stem作为LEGNet[12]的起始模块,具有LoG噪声抑制和边缘增强的双重能力,在网络早期强化边缘特征,本文用LoG-Stem替换 YOLOv11 起始的2个卷积层,为后续检测奠定基础.

LoG-Stem的结构如图6所示,总体流程如下. 对于输入图像 IRH×W×3,通过7×7卷积提取初始特征. 对初始特征应用LoG滤波器增强边缘,先通过高斯核平滑抑制噪声,再用拉普拉斯算子突出边缘信息,弥补深度网络对边缘信息的感知缺陷.

图 6

图 6   拉普拉斯高斯输入预处理模块

Fig.6   Laplacian of Gaussian input preprocessing module


LoG核的定义为

$ {\mathrm{LoG}}_{\sigma }^{k\times k}\left({\boldsymbol{X}}\right)=\frac{1}{{\text{π}} {\sigma }^{4}}\left(1-\frac{{i}^{2}+{j}^{2}}{{\sigma }^{2}}\right){\text{exp}}\left({-\frac{{i}^{2}+{j}^{2}}{2{\sigma }^{2}}}\right) . $

高斯核为

$ G_{\sigma }^{k\times k}\left(\boldsymbol{X}\right)=\frac{1}{2{\text{π}} {\sigma }^{2}}{\text{exp}}\left({-\frac{{i}^{2}+{j}^{2}}{2{\sigma }^{2}}}\right) . $

式中:k = 7,σ = 1.0.

LoG滤波的输出经激活和归一化,与初始7×7卷积结果通过残差连接(Add)融合,可得

$ {{\boldsymbol{F}}}_{{\mathrm{LoG}}}=\text{Norm}\left({\boldsymbol{I}}\text{+AN}\left({\mathrm{LoG}}_{\text{7}\times \text{7}}^{\text{1.0}}\left(\text{Conv}_{\text{7}\times \text{7}}^{\text{2D}}\left(\boldsymbol{I}\right)\right)\right)\right) . $

残差设计保留了原始图像的细节信息,避免LoG滤波过度抑制背景,同时稳定梯度反向传播.

之后,FLoG会传入2个3×3卷积层,其中第2个卷积层采用步长2进行下采样,过程可以表示为

$ {{\boldsymbol{F}}}_{1}=\text{Conv}_{\text{3}\times \text{3}}^{\text{2D}}\left(\text{Conv}_{\text{3}\times \text{3}}^{\text{2D}}\left({{\boldsymbol{F}}}_{{{{\mathrm{LoG}}}}}\right)\right) . $

该步骤将特征图的空间尺寸缩小至(H/2)×(W/2).

F1会经过2个核大小分别为9×9和5×5,且σ = 0.5的高斯滤波器${G}_{0.5}^{9\times 9} $${G}_{0.5}^{5\times 5} $. 首个处理过程为残差连接,经过归一化和第2个滤波器处理后,传入双感受野下采样(DRFD)模块,最终得到分辨率为原始图像1/4的特征图FLoG-Stem,具体过程为

$ {{\boldsymbol{F}}}_{{\text{LoG-Stem}}}=\text{DRFD}\left({G}_{0.5}^{5\times 5}\left(\text{Norm}\left({G}_{0.5}^{9\times 9}\left({{\boldsymbol{F}}}_{1}\right)+{{\boldsymbol{F}}}_{1}\right)\right)\right) . $

总体而言,LoG-Stem以LoG为核心增强边缘,残差结构保留细节,多尺度处理覆盖目标变化. 本文将LoG-Stem用在改进网络的起始阶段,输出鲁棒的多尺度边缘特征给后续的检测模块.

1.4. SDFM

针对YOLOv11中骨干网络下采样导致小目标特征衰减的问题,在检测头前嵌入浅层细节融合模块(superficial detail fusion module, SDFM)[13],实现深浅层特征自适应加权融合,以充分利用浅层细节语义信息. SDFM 的核心是通过通道与空间注意力联合建模,动态调整融合权重,兼顾浅层细节与深层高级语义表达,结构如图7 所示.

图 7

图 7   浅层细节融合模块

Fig.7   Superficial detail fusion module


该模块输入浅层特征Fir与深层特征Fvi,先通过卷积统一通道维度实现跨层级模态对齐,再将对齐特征在通道维度拼接,构建多尺度特征融合空间. 通道注意力分支对拼接特征进行全局平均池化,提取全局信息,经逐点卷积生成通道注意力权重Wci,衡量各通道对目标检测的重要性. 空间注意力分支直接对拼接特征卷积生成空间注意力权重Wsi,聚焦目标区域. 2类权重逐元素相乘并经Sigmoid激活,得到自适应融合权重Wi,实现通道与空间的双重加权. 随后用Wi与1−Wi分别加权浅、深层特征,动态分配各层次的特征贡献度,再与原始输入特征残差连接,保留原始信息并增强特征表达.

SDFM有效解决了下采样中小目标特征衰减的问题. 通过通道注意力强化小目标细节关键通道,借助空间注意力定位目标区域,避免深层语义信息淹没浅层细节,提升复杂场景的目标检测精度.

1.5. 基于依赖图的结构剪枝

上述改进虽然提升了目标检测精度,但增加了计算量,不利于轻量化需求. 为了加速模型推理,引入基于依赖图(DepGraph)的结构剪枝[14],对模型进行压缩优化. 剪枝执行流程如图8所示,核心是网络分解与依赖建模,详细过程见图9,具体步骤如下.

图 8

图 8   依赖剪枝执行框图

Fig.8   DepGraph pruning execution diagram


图 9

图 9   依赖剪枝过程

Fig.9   DepGraph pruning process


1)网络分解. 传统层级建模难以捕捉复杂依赖,DepGraph将网络分解为输入输出组件对(${\boldsymbol{f}}_i^ - ,{\boldsymbol{f}}_i^ + $),各组件对应层的输入或输出特征(如Conv层${\boldsymbol{f}}_i^ - $为输入通道、${\boldsymbol{f}}_i^ + $为输出通道,BN层${\boldsymbol{f}}_i^ - ={\boldsymbol{f}}_i^ + $),将依赖关系细化到特征维度,解决同层不同维度的差异问题.

2)依赖建模. 整合层间与层内依赖形成对称矩阵D,确保连通路径上的组件统一分组. 层间依赖指${\boldsymbol{f}}_i^ + $直接连接${\boldsymbol{f}}_j^ - $时两者须同步剪枝(如残差块中的Conv1输出与Conv2输入);层内依赖指组件输入输出剪枝维度相同时须同步剪枝(如BN层),Conv层因维度不同,无层内依赖.

3)参数分组. 构建依赖图后,通过广度优先搜索寻找最大连通分量,生成剪枝组g. 如在残差块中,Conv1的输出通道(${\boldsymbol{f}}_1^ + $)连接到BN1的输入(${\boldsymbol{f}}_2^ - $),BN1的输出(${\boldsymbol{f}}_2^ + $)连接到ReLU的输入(${\boldsymbol{f}}_3^ - $),依此类推,最终形成包含 Conv1、BN1、ReLU、Conv2、BN2 的连通组. 采用这种分组策略,能够自动捕获残差依赖.

4)稀疏训练与组级剪枝. 针对跨层依赖场景下传统单图层准则的不足,依赖图采用组级稀疏训练. 对参数组g的第k个可剪枝维度,定义正则化项:$R\left( {{\boldsymbol{g}},k} \right) = \displaystyle \sum\nolimits_{{{{\boldsymbol{w}}}} \in {\boldsymbol{g}}} {{\gamma _k}\left\| {{\boldsymbol{w}}\left[ k \right]} \right\|} _2^2 $. 其中, γk由指数策略动态调整,强化组内参数重要性的一致性. 训练后,通过相对分数 Ig,k 识别不重要的组,实现安全剪枝,避免了人工设计的复杂性.

5)微调训练:剪枝后须以小学习率微调,优化保留参数组权重,修复精度损耗,确保轻量化结构下的检测精度趋近剪枝前的水平.

2. 实验分析

2.1. 实验数据集、实验环境与参数设置

采用VisDrone2019数据集,该数据集包含从不同城市环境采集的6471张训练图像、548张验证图像. 数据集涵盖了城市交通中多种典型的无人机监控场景,包含行人、汽车和卡车等10个目标类别,体现了无人机视角下复杂场景的小目标密集特性.

实验平台配置如下. 操作系统采用Windows 11,编程语言为Python 3.8,深度学习框架选用Pytorch2.0,配套计算加速库为CUDA 11.8及cuDnn 8.9.5.30. 在硬件方面,处理器为Intel (R) Core (TM) i9-13900HX,图形处理器为NVIDIA GeForce RTX4090,内存容量为32 GB,显存容量为24 GB.

在模型训练过程中,采用的关键参数设置如下:输入图像的尺寸设定为640×640 像素,批处理大小(batch size)设为 8,初始学习率配置为0.01,数据加载线程数为8,使用随机梯度下降优化器.

2.2. 评价指标

为了系统验证改进算法的综合性能,选取以下评价指标进行量化分析:准确率P、召回率RF1分数、平均精度均值mAP、参数量Np、模型体积Sm、计算复杂度FLOPs及推理帧率v. 相关公式如下:

$ P=\frac{\text{TP}}{\text{TP+FP}} , $

$ R=\frac{\text{TP}}{\text{TP+FN}} , $

$ \text{mAP}=\frac{1}{N}\sum \limits_{i=1}^{N}\int \nolimits_{0}^{1}P\left(R\right){\mathrm{d}}R . $

式中:TP表示实际为正样本且预测为正样本的数量,FP表示实际为负样本但预测为正样本的数量,FN表示实际为正样本但预测为负样本的数量.

2.3. 实验结果与分析

2.3.1. 消融实验

YOLOv11提供了5种不同尺寸的模型,分别为 n、s、m、l、x. 每种尺寸在VisDrone2019数据集上的核心评价指标如表1所示,s模型在检测精度和检测效率之间拥有良好的平衡能力,因此选择s模型作为研究的基线模型.

表 1   不同YOLOv11模型的表现结果

Tab.1  Performance result of different YOLOv11 models

模型P/%R/%mAP50/%mAP50-95/%Np/106FLOPs/109v/(帧·s−1)
n42.732.732.310.72.66.3153
s49.737.538.623.19.421.3148
m54.842.043.826.820.067.790
l54.542.644.027.125.386.680
x56.744.846.128.856.8194.556

新窗口打开| 下载CSV


为了验证FDL‑YOLO各模块的有效性,设计如表2所示的消融实验方案,得到如表3所示的实验结果. 其中,方法①~④为添加单一改进模块的对照实验,方法⑤~⑧为多策略协同,最终通过方法⑧集成多种优化策略构建FDL‑YOLOs模型,实现检测性能的最大提升.

表 2   消融实验的配置

Tab.2  Configuration of ablation experiment

方法C3k2-FDCNNet ImproveLog-StemSDFMPrune
YOLOv11s
方法①
方法②
方法③
方法④
方法⑤
方法⑥
方法⑦
方法⑧

新窗口打开| 下载CSV


表 3   消融实验结果

Tab.3  Result of ablation experiment

方法P/%R/%mAP50/%mAP75/%mAP50-95/%Np/106F1FLOPs/109Sm/MBv/(帧·s−1)
YOLOv11s49.737.538.623.623.19.442.221.318.3148
方法①50.239.139.524.223.89.543.021.218.4146
方法②53.341.643.127.026.37.746.231.915.5149
方法③50.139.039.824.824.19.443.630.218.5144
方法④52.439.540.725.124.512.144.530.823.6159
方法⑤54.841.244.127.827.07.946.534.515.0141
方法⑥54.543.745.528.928.07.948.037.915.5123
方法⑦56.144.947.029.828.98.349.844.916.3106
方法⑧55.645.747.230.029.12.949.828.912.0122

新窗口打开| 下载CSV


表3可知,与基线YOLOv11s相比,引入C3k2-FDCN、Net Improve、LoG-Stem 和SDFM模块后,mAP50指标分别提升0.9%、4.5%、1.2% 和2.1%,mAP50-90指标对应提升0.7%、3.2%、1.0%和1.4%. 上述结果表明,各改进模块对航拍图像的小目标检测性能均有正向增益,其中网络结构改进对算法检测精度的提升效果最显著. 方法⑦集成4个改进模块后,推理帧率降至106 帧/s且计算量有所提高. 方法⑧通过基于依赖图的结构剪枝进行优化,得到最终模型. 与YOLOv11s相比,准确率提升5.9%,召回率提升8.2%,mAP50提升了8.6%,达到47.2%,mAP50-95提升6.0%,参数量下降了70%,模型体积缩减了33.3%. 尽管计算量有所增加且帧率略有下降,但改进算法的性能能够满足航拍场景实时监测的需求. 对YOLOv11s施加各项改进后的检测精度提升趋势如图10所示,验证了各策略的有效性. 其中,Ni为迭代次数.

图 10

图 10   各个模块的精度提升

Fig.10   Improvement in accuracy of each module


2.3.2. 不同剪枝比例的对比试验

为了探究剪枝率对FDL-YOLOs模型性能的影响,通过加速比(speed_up)参数设计不同剪枝比例的实验. 每次剪枝后,采用微调训练补偿性能损失,从检测精度与轻量化指标来分析剪枝的规律.

表4可知,在35%的剪枝比例下,模型的mAP50保持为47.2%,参数量降至2.9×106. 当剪枝比例提升至40%时,mAP50 降至46.7%,说明更高比例的剪枝导致部分特征通道被误剪,精度下降.

表 4   模型剪枝比例的对比

Tab.4  Comparison of model pruning ratio

剪枝比例/%P/%R/%mAP50/%mAP50-95/%Np/106FLOPs/109Sm/MBv/(帧·s−1)
056.144.947.028.98.344.916.3106
3055.046.447.429.33.231.213.0120
3555.645.747.229.12.928.912.0122
4055.544.546.728.72.726.711.1123
4555.244.046.128.32.524.510.2130
5054.843.845.828.02.322.39.4133
5555.342.545.327.82.221.19.1137

新窗口打开| 下载CSV


若仅以轻量化为单一目标,高剪枝比例虽然可实现极致压缩,但会导致检测精度的衰减. 当剪枝比例为35%时,模型在检测精度保留与轻量化之间达到最优平衡:mAP50 为47.2%,mAP50-95维持29.1%,参数量、FLOPs、模型体积较剪枝前分别缩减了65%、35%、27%,推理帧率提升至122帧/s.

2.3.3. 各个类别的精度对比

为了验证改进剪枝后FDL-YOLOs算法在各类别检测中的优势,在VisDrone2019数据集上,与主流及其他改进算法开展对比实验. 评价体系采用10个类别及总体mAP50,结果如表5所示.

表 5   各个类别的精度对比

Tab.5  Comparison of accuracy among various categories

模型mAP50/%
PedestrianPeopleBicycleMotorTricycleAwning-triTruckCarBusVan总体值
SSD18.79.05.019.111.715.533.163.247.230.025.3
Faster R-CNN20.914.87.321.214.08.819.551.030.529.721.8
CenterNet22.620.614.623.720.117.421.359.737.924.026.2
YOLOv5s39.231.410.638.418.29.826.272.639.933.732.0
YOLOv6s37.229.88.939.623.614.832.578.151.242.635.8
YOLOv8s42.231.612.043.326.414.636.079.256.843.738.6
YOLOv9s38.432.810.342.226.915.034.378.051.543.237.3
YOLOv10s43.134.014.145.027.415.335.279.955.144.739.4
YOLOv11s42.431.811.843.326.614.735.379.456.344.938.7
YOLOv12s41.030.611.342.525.614.233.478.755.643.237.6
YOLOv13s40.631.011.741.126.713.933.578.650.243.537.1
Hyper-YOLOs43.032.813.243.929.215.136.779.561.044.139.8
RT-DETR-r1851.144.217.555.529.217.133.584.756.649.043.8
DMF-YOLO[15]54.543.718.353.533.419.340.885.761.351.546.2
HSF-YOLO[16]53.542.017.753.233.117.736.784.361.249.044.8
YOLO-GAIS[17]48.555.423.852.538.724.435.477.949.439.243.2
FDL-YOLOs55.345.520.355.034.420.741.485.561.952.347.2

新窗口打开| 下载CSV


FDL-YOLOs在多个类别上的表现优异,尤其是Pedestrian与People 2类小目标,mAP50分别达到55.3%和45.5%,较基准YOLOv11s提升了12.9%和13.7%,优于DMF-YOLO和HSF-YOLO改进算法. 这表明传统及部分改进算法存在跨层级通道信息交互薄弱、特征图设计针对性不足的问题,导致细粒度特征流失. FDL-YOLOs通过DASI模块优化网络,实现上下文信息高效交互,有效保留小目标关键特征. 改进算法兼顾大尺寸目标检测,Van与Truck类别的mAP50分别达到52.3%和41.4%,较YOLOv11s提升了7.4%和6.1%,表现最优.

总体而言,FDL-YOLOs总体的mAP50达到47.2%,优于基线模型及其他改进方案,验证了该算法的小目标检测能力显著提升,性能增益源于特征提取与多尺度融合策略的协同优化,为航拍图像目标检测提供了高效、可靠的方案.

2.3.4. 检测性能的对比试验

为了验证FDL-YOLOs的性能优势,在VisDrone2019数据集上与主流YOLO系列及其他改进算法进行对比,对n、s模型与对比方法开展综合评估,结果见表6.

表 6   不同算法的检测性能对比

Tab.6  Comparison of detection performance of different algorithms

模型P/%R/%mAP50/%mAP50-
95/%
Np/
106
FLOPs/
109
YOLOv8n42.932.932.819.03.08.1
YOLOv8s49.638.138.623.111.128.5
YOLOv8m53.341.642.726.025.878.7
YOLOv10n43.833.333.219.02.36.5
YOLOv10s49.939.039.423.37.221.4
YOLOv10m53.641.642.925.915.358.9
YOLOv11n42.732.732.310.72.66.3
YOLOv11s49.737.538.623.19.421.3
YOLOv11m54.842.043.826.820.067.7
YOLOv12n41.832.431.618.125.15.8
YOLOv12s49.536.537.622.59.119.3
YOLOv12m53.240.742.225.719.659.5
YOLOv13n42.931.531.418.12.46.1
YOLOv13s47.637.237.122.19.020.1
YOLOv13l53.641.942.525.826.984.4
Hyper-YOLOn44.835.135.020.63.69.5
Hyper-YOLOs51.238.939.824.013.533.8
Hyper-YOLOm53.741.542.526.030.791.8
RT-DETR-r1858.541.543.826.619.857.0
RT-DETR-r3461.545.547.229.031.188.8
AAPW-YOLOn[18]49.937.338.622.42.111.7
PC-YOLOn[19]46.835.436.121.51.9
YOLO-S3DTn[20]47.437.937.921.12.911.0
Eagle-YOLOs[21]53.643.342.925.016.6
PARE-YOLOs[22]60.645.446.328.4
RPS-YOLO[2]55.344.346.328.113.337.7
FDL-YOLOn49.239.339.924.11.110.2
FDL-YOLOs55.645.747.229.12.928.9

新窗口打开| 下载CSV


FDL-YOLOs的mAP50由YOLOv11s的38.6%提升至47.2%,mAP95由23.1%提升至29.1%,分别提高了8.6%与6.0%. 各模块的改进与剪枝策略显著增强了模型的特征提取、目标定位与背景抑制能力. 经剪枝后,FDL-YOLOs算法的参数量仅为2.9×106,较YOLOv11s减少了70%;FDL-YOLOn算法的参数量仅为1.1×106,mAP50仍达39.9%.

与其他改进模型相比,FDL-YOLO算法展现出显著的竞争优势,综合检测性能表现突出. n模型中,FDL-YOLOn在mAP50达到39.9%的同时,参数量与计算量最低,较PC-YOLOn、YOLO-S3DTn分别增大了3.8%、2.0%. s模型中,PARE-YOLOs的精度为60.6%,RPS-YOLOs的参数量与计算量偏高,不利于部署;FDL-YOLOs在精度与效率间实现更好的平衡,在航拍目标检测中的优势明显.

2.3.5. SIMD数据集的对比

为了验证FDL-YOLOs模型的适用性,选取SIMD数据集进行泛化性能的测试. SIMD数据集面向遥感图像小目标检测,涵盖汽车、卡车和货车等15个目标类别,总计5 000张图像,其中4 000张用于训练,1 000张用于验证,小目标占比较高. 选取其他YOLO系列算法,与本文方法进行对比,结果如表7所示.

表 7   不同模型在SIMD数据集上的性能指标对比

Tab.7  Comparison of performance metrics of different models on SIMD dataset

模型P/%R/%mAP50/%mAP50-95/%
YOLOv8s78.680.982.466.7
YOLOv10s75.680.582.766.3
YOLOv11s76.181.082.866.9
YOLOv12s75.281.782.666.3
FDL-YOLOs79.381.683.767.3

新窗口打开| 下载CSV


表7可知,FDL-YOLOs模型在SIMD数据集上展现出更优的检测性能,P、mAP50和mAP50-95均表现最佳,检测精度较YOLOv11s和YOLOv12s分别提升了0.9%和1.1%,优化的特征提取模块和网络结构对小目标的检测精度更具稳定性. 本文与其他YOLO系列算法在SIMD数据集上的mAP50和mAP50-95对比如图11所示. 可以看出,本文算法的检测精度较基线算法有小幅度提升.

图 11

图 11   SIMD数据集的精度对比

Fig.11   Comparison of accuracy of SIMD dataset


2.3.6. TinyPerson数据集的对比

为了验证本文算法在小目标检测性能上的提升,选择TinyPerson数据集进行验证. TinyPerson数据集是针对小目标人群检测的专用数据集,图像分辨率跨度大且目标尺寸极小,分为陆地行人和水中行人2类,使用1 224张图像用于训练和152张图像用于验证. 选取其他YOLO系列算法进行对比,结果如表8所示.

表 8   TinyPerson数据集结果的对比

Tab.8  Comparison of TinyPerson dataset result

模型P/%R/%mAP50/%mAP50-95/%
YOLOv8s41.828.725.98.2
YOLOv10s39.327.924.27.7
YOLOv11s44.327.926.08.3
YOLOv12s43.427.425.48.1
FDL-YOLOs46.534.229.89.5

新窗口打开| 下载CSV


表8可知,相较于在SIMD数据集上的表现,FDL-YOLOs在TinyPerson数据集上的检测精度有较明显的提升. 与YOLOv11s、YOLOv12s相比,mAP50分别提升了3.8%和4.4%,mAP50-95分别提升了1.2%和1.4%. 因为FDL-YOLOs算法对特征图大小进行了优化,该算法更加适用于小目标场景. 在TinyPerson数据集上的mAP50和mAP50-95的对比如图12所示.

图 12

图 12   TinyPerson数据集的精度对比

Fig.12   Comparison of accuracy of TinyPerson dataset


2.3.7. 热力图对比

为了体现FDL-YOLOs对特征感知的优化,设计热力图对比实验. 选取小目标重叠、遮挡目标和夜间的典型场景,通过Grad-CAM算法生成热力图,结果如图13所示. 其中,左侧为YOLOv11s,右侧为FDL-YOLOs,差异区域用曲线标出. YOLOv11s的热力图对小目标边缘、遮挡衔接处的特征响应强度不足,面对多尺度目标存在轮廓刻画不完整的问题. FDL-YOLOs集成的频率动态卷积及浅层细节融合模块有效强化了多尺度信息的融合,热力图更能够精准覆盖待检测区域.

图 13

图 13   热力图结果的对比

Fig.13   Comparison of heat map result


在小目标重叠场景中,YOLOv11s存在大量的漏检情况,利用FDL-YOLOs输出的特征热力图可以精准地聚焦目标有效区域. 在遮挡目标场景和夜间场景下,FDL-YOLOs检测能力的优化更显著,在很大程度上提升了对遮挡目标和模糊目标的识别能力.

2.3.8. 检测结果对比

为了评估FDL-YOLOs算法在航拍图像目标检测任务中的性能提升效果,选取目标密集、光线暗淡、大小目标共存、背景复杂4类复杂场景进行对比. 如表9所示为各场景下检测数量Nd的对比. 如图14所示为检测结果的对比,左侧为YOLOv11s,右侧为FDL-YOLOs.

表 9   改进算法在不同场景下的检测数量对比

Tab.9  Comparison of detection quantity of improved algorithm under different scenario

场景Nd
YOLOv11sFDL-YOLOs
目标密集241300
光线暗淡4861
大小目标4469
背景复杂46102

新窗口打开| 下载CSV


图 14

图 14   改进算法的检测结果对比

Fig.14   Comparison of detection result of improved algorithm


在目标密集场景中,小目标因相互遮挡、尺度微小易发生漏检,FDL-YOLOs通过浅层特征图优化策略增强小目标感知能力,检测目标数达到300,较YOLOv11s多识别59个遗漏目标. 在光线暗淡场景下,光照不足导致目标模糊,FDL-YOLOs通过改进特征融合机制提升模型抗干扰能力,检测数为61,较 YOLOv11s增加13个目标,体现了在低照度场景下的抗干扰优势. 在大小目标共存场景中,FDL-YOLOs所使用的频率动态卷积模块有效强化了细粒度特征提取. 改进算法较YOLOv11s多检测出25个目标,远端小尺度车辆与近端大尺度车辆均被有效识别. 在背景复杂场景中,FDL-YOLOs采用跨层交互的深层特征融合方法,维持特征表达的稳定性. 与YOLOv11s相比,改进算法在各个场景下的目标检测数量大幅提升,验证了特征融合策略的有效性.

实验表明,FDL-YOLOs通过边缘强化结构、频率动态卷积与特征融合方式的协同优化,显著提升了细节信息捕获能力与复杂环境抗干扰性能.

3. 结 语

针对无人机航拍小目标像素占比低、密集遮挡、多尺度融合难及轻量化与精度平衡等挑战,提出FDL-YOLO多尺度特征聚合检测算法,通过优化YOLOv11s提升检测性能.

C3k2-FDCN模块利用频率动态卷积,增强了对小目标细节信息的捕获能力. DASI模块重构特征金字塔并新增高分辨率特征图,实现深浅层特征融合. LoG-Stem层强化初始边缘特征. SDFM通过双重注意力,减少小目标特征衰减. 结构剪枝技术在保留关键通道的同时,压缩模型体积.

综上,FDL-YOLO通过特征提取、融合策略及轻量化优化,为航拍小目标检测提供高效方案. 未来将聚焦极端尺度差异场景,以提升鲁棒性.

参考文献

BAE M H, PARK S W, PARK J, et al

YOLO-RACE: reassembly and convolutional block attention for enhanced dense object detection

[J]. Pattern Analysis and Applications, 2025, 28 (2): 90

DOI:10.1007/s10044-025-01471-4      [本文引用: 1]

LEI P, WANG C, LIU P

RPS-YOLO: a recursive pyramid structure-based YOLO network for small object detection in unmanned aerial vehicle scenarios

[J]. Applied Sciences, 2025, 15 (4): 2039

DOI:10.3390/app15042039      [本文引用: 2]

张志豪, 厉小润, 陈淑涵

基于改进YOLO11的无人机航拍图像小目标检测算法

[J]. 液晶与显示, 2025, 40 (6): 915- 930

[本文引用: 1]

ZHANG Zhihao, LI Xiaorun, CHEN Shuhan

Small object detection algorithm in UAV aerial images based on improved YOLO11

[J]. Chinese Journal of Liquid Crystals and Displays, 2025, 40 (6): 915- 930

[本文引用: 1]

BI J, LI K, ZHENG X, et al

SPDC-YOLO: an efficient small target detection network based on improved YOLOv8 for drone aerial image

[J]. Remote Sensing, 2025, 17 (4): 685

DOI:10.3390/rs17040685      [本文引用: 1]

WANG Q, YE G, CHEN Q, et al

A UAV perspective based lightweight target detection and tracking algorithm for intelligent transportation

[J]. Complex and Intelligent Systems, 2025, 11 (1): 73

DOI:10.1007/s40747-024-01687-7      [本文引用: 1]

童庆洪, 谌海云, 袁杰敏

低光照增强和自适应特征融合的小目标检测算法

[J]. 激光与光电子学进展, 2025, 62 (20): 2028008

DOI:10.3788/LOP250914      [本文引用: 1]

TONG Qinghong, CHEN Haiyun, YUAN Jiemin

Small object detection algorithm based on low-light enhancement and adaptive feature fusion

[J]. Laser and Optoelectronics Progress, 2025, 62 (20): 2028008

DOI:10.3788/LOP250914      [本文引用: 1]

MA F, ZHANG R, ZHU B, et al

A lightweight UAV target detection algorithm based on improved YOLOv8s model

[J]. Scientific Reports, 2025, 15 (1): 15352

DOI:10.1038/s41598-025-00341-7      [本文引用: 1]

HAO X, LI T

Lightweight small target detection algorithm based on YOLOv8 network improvement

[J]. IEEE Access, 2025, 13: 14051- 14062

DOI:10.1109/ACCESS.2025.3529835      [本文引用: 1]

MA P, FEI H, JIA D, et al

YOLOFLY: a consumer-centric framework for efficient object detection in UAV imagery

[J]. Electronics, 2025, 14 (3): 498

DOI:10.3390/electronics14030498      [本文引用: 1]

CHEN L, GU L, LI L, et al. Frequency dynamic convolution for dense image prediction [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2025: 30178–30188.

[本文引用: 1]

XU S, ZHENG S, XU W, et al. HCF-net: hierarchical context fusion network for infrared small object detection [C]//Proceedings of the IEEE International Conference on Multimedia and Expo. Niagara Falls: IEEE, 2024: 1–6.

[本文引用: 1]

LU W, CHEN S B, LI H D, et al. LEGNet: a lightweight edge-Gaussian network for low-quality remote sensing image object detection [EB/OL]. [2026-04-13]. https://arxiv.org/abs/2503.14012.

[本文引用: 1]

TANG L, ZHANG H, XU H, et al

Rethinking the necessity of image fusion in high-level vision tasks: a practical infrared and visible image fusion network based on progressive semantic injection and scene fidelity

[J]. Information Fusion, 2023, 99: 101870

DOI:10.1016/j.inffus.2023.101870      [本文引用: 1]

FANG G, MA X, SONG M, et al. DepGraph: towards any structural pruning [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 16091–16101.

[本文引用: 1]

贺智轩, 陈里里, 王翔, 等

DMF-YOLOv11: 基于改进YOLOv11n的无人机航拍图像目标检测算法

[J]. 计算机工程与应用, 2025, 61 (14): 88- 100

DOI:10.3778/j.issn.1002-8331.2502-0223      [本文引用: 1]

HE Zhixuan, CHEN Lili, WANG Xiang, et al

DMF-YOLOv11: target detection algorithm for UAV images based on improved YOLOv11n

[J]. Computer Engineering and Applications, 2025, 61 (14): 88- 100

DOI:10.3778/j.issn.1002-8331.2502-0223      [本文引用: 1]

张轩宇, 周思航, 黄健, 等

基于高阶空间特征提取的无人机航拍小目标检测算法

[J]. 计算机工程与应用, 2025, 61 (12): 210- 221

DOI:10.3778/j.issn.1002-8331.2407-0230      [本文引用: 1]

ZHANG Xuanyu, ZHOU Sihang, HUANG Jian, et al

High-order spatial feature extraction based small target detection for UAV aerial photographs

[J]. Computer Engineering and Applications, 2025, 61 (12): 210- 221

DOI:10.3778/j.issn.1002-8331.2407-0230      [本文引用: 1]

李凯璇, 刘晓锋, 陈强, 等

YOLOv8-GAIS: 一种改进的无人机航拍目标检测算法

[J]. 光电工程, 2025, 52 (4): 75- 88

[本文引用: 1]

LI Kaixuan, LIU Xiaofeng, CHEN Qiang, et al

YOLOv8-GAIS: improved object detection algorithm for UAV aerial photography

[J]. Opto-Electronic Engineering, 2025, 52 (4): 75- 88

[本文引用: 1]

WU Y, MU X, SHI H, et al

An object detection model AAPW-YOLO for UAV remote sensing images based on adaptive convolution and reconstructed feature fusion

[J]. Scientific Reports, 2025, 15: 16214

DOI:10.1038/s41598-025-00239-4      [本文引用: 1]

WANG Z, SU Y, KANG F, et al

PC-YOLO11s: a lightweight and effective feature extraction method for small target image detection

[J]. Sensors, 2025, 25 (2): 348

DOI:10.3390/s25020348      [本文引用: 1]

GAO P, LI Z

YOLO-S3DT: a small target detection model for UAV images based on YOLOv8

[J]. Computers, Materials and Continua, 2025, 82 (3): 4555- 4572

[本文引用: 1]

WANG D, GAO Z, FANG J, et al

Eagle-YOLOv8: UAV object detection inspired by the eagle-eye vision system

[J]. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 2025, 18: 9432- 9447

DOI:10.1109/JSTARS.2025.3554821      [本文引用: 1]

ZHANG H, XIAO P, YAO F, et al

Fusion of multi-scale attention for aerial images small-target detection model based on PARE-YOLO

[J]. Scientific Reports, 2025, 15 (1): 4753

DOI:10.1038/s41598-025-88857-w      [本文引用: 1]

/