浙江大学学报(工学版), 2026, 60(9): 1912-1923 doi: 10.3785/j.issn.1008-973X.2026.09.008

计算机技术、自动控制技术

基于YOLOv8s的轻量化航拍图像小目标检测算法

邬开俊,, 郑云琦, 魏鼎, 袁海翔

1. 兰州交通大学 数理学院,甘肃 兰州 730070

2. 兰州交通大学 电子与信息工程学院,甘肃 兰州 730070

YOLOv8s based lightweight algorithm for small object detection in aerial imagery

WU Kaijun,, ZHENG Yunqi, WEI Ding, YUAN Haixiang

1. School of Mathematical and Physics, Lanzhou Jiaotong University, Lanzhou 730070, China

2. School of Electronic and Information Engineering, Lanzhou Jiaotong University, Lanzhou 730070, China

收稿日期: 2025-07-20  

基金资助: 甘肃省重点研发计划资助项目(25YFGA047);鄂尔多斯市重点研发计划资助项目(YF20250245).

Received: 2025-07-20  

Fund supported: 甘肃省重点研发计划资助项目(25YFGA047);鄂尔多斯市重点研发计划资助项目(YF20250245).

作者简介 About authors

邬开俊(1978—),男,教授,博士,从事计算机视觉与图像处理研究.orcid.org/0000-0002-8939-1874.E-mail:wkj@mail.lzjtu.cn , E-mail:wkj@mail.lzjtu.cn

摘要

为了解决无人机(UAV)航拍图像目标检测面临的复杂背景干扰、目标尺寸小以及设备资源有限等挑战,提出基于YOLOv8s的轻量化小目标检测方法. 为了增强微小目标检测能力,重建高分辨率检测头. 设计动态多尺度聚合网络,动态调整感受野以适应目标尺度变化. 提出高效多尺度特征深度融合模块,自适应整合无人机图像不同层级提取的特征信息. 将融合后的特征进行双重精炼,建立高效通道-空间注意力模块. 在VisDrone2021公开数据集上的实验结果显示,改进后算法在验证集上的平均精度、不同交并比阈值下精度以及中小尺度目标检测精度均提升5.0%以上. 在保持较低计算量的同时,参数量减少16.25%. 在DOTA数据集上验证模型的泛化性,所提算法在提高检测性能的同时,实现了模型轻量化,可以应用于无人机航拍图像目标检测.

关键词: 目标检测 ; 航拍图像 ; YOLOv8s ; 特征融合 ; 特征提取

Abstract

An improved lightweight small object detection method based on YOLOv8s was proposed to address the challenges of complex background interference, small object sizes, and limited device resources in unmanned aerial vehicle (UAV) image object detection. A high-resolution detection head was reconstructed to improve the sensitivity to tiny objects. A dynamic multi-scale aggregation network was designed to adaptively adjust the receptive field for scale-variant targets, while an efficient multi-scale feature deep fusion module was proposed to integrate features from different semantic levels. An efficient channel-spatial attention module was introduced to further refine fused features. Experiments on the VisDrone2021 dataset demonstrated that the proposed method achieved improvements of over 5.0% in average precision, precision at different intersection over union thresholds, and detection precision for small and medium-sized objects, with a 16.25% reduction in parameters. Tests on the DOTA dataset validated the generalization ability of the proposed model. Results demonstrate that the proposed method improves the detection performance while achieving the model light weighting, indicating its practical value for object detection in UAV aerial images.

Keywords: object detection ; aerial image ; YOLOv8s ; feature fusion ; feature extraction

PDF (3699KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

邬开俊, 郑云琦, 魏鼎, 袁海翔. 基于YOLOv8s的轻量化航拍图像小目标检测算法. 浙江大学学报(工学版)[J], 2026, 60(9): 1912-1923 doi:10.3785/j.issn.1008-973X.2026.09.008

WU Kaijun, ZHENG Yunqi, WEI Ding, YUAN Haixiang. YOLOv8s based lightweight algorithm for small object detection in aerial imagery. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1912-1923 doi:10.3785/j.issn.1008-973X.2026.09.008

目标检测作为计算机视觉领域的核心任务之一,始终是学术研究与应用实践的重点. 在深度学习技术浪潮的推动下,目标检测网络架构与训练范式经历了迅速的演进与迭代. 从算法流程看,现有基于深度学习的检测方法可以分为单阶段与两阶段2类. 单阶段方法直接回归边界框和类别,典型代表包括YOLO系列[1]、单次多框检测器(single shot multi-box detector, SSD)[2]、Retina Net[3]等;两阶段方法先产生候选区域,再进行精细分类与回归,如快速区域卷积神经网络(faster region-based convolutional neural networks, Faster R-CNN)[4]等. 单阶段检测器实时性更强,更适合计算资源受限的无人机平台.

近年来,无人机载荷与边缘计算芯片的融合使得空中实时感知在城市交通监控、灾害救援和农业检测等领域得到广泛应用[5]. 相较于自然场景,无人机视角图像主要存在3个问题:小尺寸目标占比高且易被建筑、树木乃至其他车辆遮挡,严重削弱深度网络的判别特征[6];日照角度快速变化、夜间低光照以及雨雾等恶劣天气造成对比度下降与噪声增多,使得基于纹理和边缘的检测器易产生漏检或误检[7];大视域下的背景干扰同样不可忽视,俯视成像往往覆盖大量无关区域,这些区域的颜色和纹理与目标类别高度相似,易引发模型混淆,导致检测精度与召回率下降[7].

针对无人机视角图像中尺度变化显著、遮挡频发、光照及气象条件复杂、背景干扰突出等挑战,现有研究大致沿2类技术路线对检测器进行改进. 1)第1类侧重于网络架构层面的鲁棒性提升:通过重构骨干-颈部-检测头(Bachbone-Neck-Head)整体结构,强化小目标特征表达并抑制遮挡噪声,从而显著提升模型在小目标与遮挡场景下的检测精度. 尹向雷等[8]采用多尺度空洞注意力机制(multi-scale dilated attention, MSDA),提高算法对遮挡目标的敏感性. Feng等[9]提出深度线索条件检测器(depth-cue conditional detector, DeCoDet),利用深度信息来改善有雾条件下的无人机检测. Ma等[10]提出轻量化多尺度小目标增强网络(lightweight multi-scale small object enhancement network, LMSOE-Net),利用可变空洞卷积和共享卷积核双重策略,在保持模型轻量化的同时,强化了多尺度上下文信息提取能力. 2)另一类则侧重于在维持Backbone-Neck整体拓扑结构基本不变的前提下,引入轻量级注意力模块与重构损失函数,以增强模型跨尺度感知域和鲁棒性. Li等[11]在SOD-YOLO中增设专门面向微尺度实例的检测分支,使模型对低空遥感画面中的小目标保持稳定响应. Li等[12]结合通道与位置注意力机制(channel and position attention mechanism, CPAM)对通道与位置语义进行细粒度重标定,并在预测端引入Focal-EIoU损失,提升尺度不平衡样本的回归精度与收敛稳定性. Gharatappeh等[13]提出感知损失RT-DETR(perceptual loss RT-DETR, PL-RT-DETR),在保持Backbone不变的基础上,引入感知损失进行教师-学生蒸馏,通过领域适应,使学生网络即使输入雾天图像也能够提取出与晴天条件下语义一致的特征表示,从而显著降低恶劣天气条件下的漏检率.

面对无人机航拍图像目标尺寸变化显著、小目标占比高、背景干扰复杂以及计算资源受限等挑战,现有方案大多需要在模型参数量、计算量与检测精度之间取得平衡. 复杂的结构设计通常伴随计算量的激增,若仅采用简单的注意力模块叠加,难以协同解决上述3重困境,这与无人机平台对模型轻量化和高效率的严苛要求相悖[14]. 为在性能与效率之间实现更优权衡,以兼具高精度与高效率的YOLOv8s模型为基线,设计轻量级、高效的动态多尺度聚合网络(dynamic multi-scale aggregation network, DMSA-Net),构建多尺度深度融合模块(tri-scale depthwise fusion module, TDFM)与高效通道-空间注意力模块(efficient channel-spatial attention module, ECSAM),系统提升模型在复杂航拍场景下的检测能力.

1. 方法介绍

YOLOv8系列包含n、s、m、l、x共5种不同规模的模型,其复杂度与检测精度随模型尺寸增大而逐步提升. YOLOv8s作为系列中相对轻量的版本,在保持较高检测速度的同时兼具良好的部署灵活性,因此被选为基础模型进行研究与改进. 基于YOLOv8s模型提出动态多尺度特征增强的YOLO(dynamic tri-scale feature enhanced YOLO, DTE-YOLO)以改进无人机航拍目标检测方法,其核心设计思想是在提升检测精度的同时维持模型轻量化特性,从而更好地适配无人机平台,满足航拍场景下的实时监测需求,整体架构如图1所示. 研究对Backbone、Neck和Head这3个关键部分进行系统性优化. 在Backbone中,为解决原始C2f模块因感受野固定而难以适应目标尺度变化的问题,使用DMSA-Net替换C2f模块,以增强多尺度特征的自适应提取能力. 在Head中,原基于8倍、16倍及32倍下采样特征图,即P3P4P5层级的检测头,在无人机场景下对小目标信息捕捉不足且存在计算资源浪费的问题. 因此,将检测层级调整为包含4倍下采样高分辨率特征的P2P3P4层级的检测头,以强化对微小目标的感知. 在Neck中,为有效融合引入P2层后的高分辨率特征,避免简单拼接带来的巨大计算开销,采用TDFM替换原有的特征拼接操作,实现更高效的多层特征融合. 此外,在Neck的特征融合路径中引入ECSAM,进一步抑制复杂背景噪声,实现对关键特征的双重注意力增强.

图 1

图 1   动态多尺度特征增强目标检测算法整体网络结构

Fig.1   Overall network structure of dynamic tri-scale feature enhancement object detection algorithm


1.1. 动态多尺度聚合网络

在复杂航拍场景中,目标的尺度变化与密集遮挡问题对特征提取模块提出更高要求. YOLOv8中的C2f模块虽然在通用场景下实现了效率与精度的良好平衡,但其固定的感受野结构难以有效应对无人机航拍图像中目标尺度变化显著的问题,导致网络在处理尺寸过大或过小的目标时容易出现特征提取不充分的情况. 为此,提出轻量高效的DMSA-Net,替代C2f模块,整体结构如图2所示. DMSA-Net的核心优势在于具备动态感知与自适应多尺度特征提取能力,能够根据输入特征的内在属性自适应调整不同尺度特征的融合权重,从而在复杂航拍场景下实现更精准、鲁棒的特征表达.

图 2

图 2   动态多尺度聚合网络结构图

Fig.2   Schematic diagram of dynamic multi-scale aggregation network


具体来说,DMSA-Net通过4个并行分支协同工作. 对于高度和宽度分别为$ H $$ W $、通道数为$ {C}_{1} $的输入特征张量$ {\boldsymbol{X}}_{\text{in}}\in {\bf{R}}^{H\times W\times {{C}_{1}}} $,通过1×1卷积降维,得到中间特征$ {\boldsymbol{X}}_{\text{mid}} $. 随后将$ {\boldsymbol{X}}_{\text{mid}} $送入4条并行路径. 第1条分支采用1×1卷积实现通道压缩与初步特征变换$ {\boldsymbol{X}}_{\text{0}} $. 由于无人机航拍场景中目标大小差异极大,常规单一膨胀率卷积难以在捕获细节纹理与获取全局上下文之间取得有效平衡,因此在第2条分支提出动态膨胀深度可分离卷积(dynamic depthwise separable convolution, Dynamic DSConv)模块,使同一层网络能够按需自适应切换不同感受野. 该模块先对输入特征$ {\boldsymbol{X}}_{\text{mid}} $并行执行若干条深度可分离卷积,每条卷积使用不同膨胀率,得到各尺度特征$ {\boldsymbol{F}}_{k} $;同时对同一输入进行全局平均池化获得通道统计,经过卷积映射到K维并通过softmax归一化,产生各分支权重;最后将并行卷积的输出按权重线性融合,并使用SiLU激活函数增强特征的非线性表达能力,得到最终尺度感知特征$ {\boldsymbol{X}}_{\text{1}} $. 具体流程公式为

$ \left.\begin{matrix}{\boldsymbol{F}}_{k}={\text{DSConv}}_{{{{d}}_{k}}}({\boldsymbol{X}}_{\text{mid}}),\quad k=1,2,3;\\\boldsymbol{z}={\text{Conv}}_{\text{1}\times \text{1}}\left(\text{GAP}({\boldsymbol{X}}_{\text{mid}})\right);\\{{{w}}}_{k}=\dfrac{\exp \;({\boldsymbol{z}}_{k})}{\displaystyle \sum \limits_{j=1}^{K}\exp\; ({\boldsymbol{z}}_{j})},\quad\displaystyle \sum \limits_{k=1}^{K}{{{w}}}_{k}=1;\\ {\boldsymbol{X}}_{\text{1}}=\text{SiLU}\left({\text{Conv}}_{\text{1}\times \text{1}}\left(\displaystyle \sum \limits_{k=1}^{K}{{{w}}}_{k}{\boldsymbol{F}}_{k}\right)\right).\\ \end{matrix}\right\} $

式中:dk为第k条卷积的膨胀率;$ {\text{DSConv}}_{{{d}_{k}}}(\cdot ) $表示卷积核大小为$ {d}_{k} $的深度可分离卷积;$ \text{GAP}(\cdot ) $为全局平均池化操作;z为池化后的通道统计向量;$ {{\boldsymbol{w}}}_{k} $为第k个分支的权重;$ \text{SiLU}(\cdot ) $为SiLU激活函数.

为在增强非线性表达能力的同时控制计算量,第3、4条分支对输入通道进行二分拆解,即$ {\boldsymbol{X}}_{2},{\boldsymbol{X}}_{3}=\text{Split}\;({\boldsymbol{X}}_{\text{mid}}) $. 使用Star_Block堆叠模块[15]$ {\boldsymbol{X}}_{3} $进行非线性变换得到$ {\hat{\boldsymbol{X}}}_{3} $,其中,Star_Block模块旨在提升通道交互与空间建模能力,该结构的非线性建模能力对于区分无人机视角下特征细微的小目标与复杂背景具有关键作用. 引入大尺寸深度可分离卷积显著扩展感受野,并利用门控激活机制动态地重新标定通道权重,从而有效抑制背景噪声干扰,增强前景特征表达能力. 具体的堆叠计算过程为

$ \left.\begin{matrix}{\boldsymbol{Y}}_{0}={\boldsymbol{X}}_{3},\\ {\boldsymbol{Y}}_{1}=\text{Star}\_ {\text{Block}}_{1}({\boldsymbol{Y}}_{0})+{\boldsymbol{Y}}_{0},\\ {\boldsymbol{Y}}_{2}=\text{Star}\_ {\text{Block}}_{2}({\boldsymbol{Y}}_{1})+{\boldsymbol{Y}}_{1},\\ \vdots \\ {\boldsymbol{Y}}_{n}=\text{Star}\_ {\text{Block}}_{n}({\boldsymbol{Y}}_{n-1})+{\boldsymbol{Y}}_{n-1}={\hat{\boldsymbol{X}}}_{3}.\\ \end{matrix}\right\} $

式中:$ {\boldsymbol{Y}}_{0} $为输入Star_Block堆叠模块的初始特征,$ {\boldsymbol{Y}}_{1} $$ {\boldsymbol{Y}}_{n-1} $为第1至第n−1个Star_Block模块经残差连接后的中间特征图,$ {\boldsymbol{Y}}_{n} $为经过n层堆叠处理后的最终输出特征.

将所有分支的输出进行拼接并通过最终的1×1卷积整合所有路径的信息,生成高维且具有丰富语义表达的输出特征$ {\boldsymbol{X}}_{\text{out}} $

$ {\boldsymbol{X}}_{\text{out}}=\text{Conv}\;([{\boldsymbol{X}}_{0},{\boldsymbol{X}}_{1},{\boldsymbol{X}}_{2},{\hat{\boldsymbol{X}}}_{3}]). $

1.2. 多尺度深度融合模块

在原始YOLOv8检测头中,从Backbone网络提取的不同尺度特征图仅通过简单拼接操作进行融合. 这种方式虽然易于实现且保留了各层级的原始信息,但难以有效检测被复杂背景淹没的小目标,产生了不必要的计算开销. 为此,本研究提出TDFM模块,该模块的核心设计思想是在保持轻量化的前提下,摒弃原有的简单特征拼接方式,转而采用自适应加权融合机制,使网络能够智能整合多尺度特征. TDFM结构主要包含3个分别针对无人机航拍场景的大、中、小3种尺度特征的平行处理分支和1个最终融合层,整体结构如图3所示.

图 3

图 3   多尺度深度融合模块示意图

Fig.3   Schematic diagram of tri-scale depthwise fusion module


假设从Backbone网络中获得的大、中、小3个尺度的特征图输入为$ {\boldsymbol{F}}_{\text{in}}=\{{\boldsymbol{F}}_{3},{\boldsymbol{F}}_{4},{\boldsymbol{F}}_{5}\} $,对3个分支进行并行处理. 大尺度分支负责处理来自P3层的高分辨率特征图$ {\boldsymbol{F}}_{3} $,其中富含精确的边缘和纹理细节. 为在保留细节特征的同时实现有效的信息提炼,设计参数化池化投票(parameterized pooling voting, PPV)模块. 该模块并行地对输入特征进行最大池化(max pooling, MaxPool)以捕获显著特征,并进行平均池化(average pooling, AvgPool)以捕获全局上下文特征,随后通过小型网络动态学习各空间位置的融合权重,对两者进行加权求和. 该方法能够自适应平衡局部细节与区域信息,有效突出目标的显著特征. 特征图$ {\boldsymbol{F}}_{3} $经过深度可分离卷积[16]进行初步轻量化特征提取,得到$ {\boldsymbol{L}}_{1} $. 随后$ {\boldsymbol{L}}_{1} $被同时输入MaxPool和AvgPool层,分别捕捉最显著特征和全局上下文特征,得到$ {\boldsymbol{L}}_{\text{max}} $$ {\boldsymbol{L}}_{\text{avg}} $. PPV模块的核心在于动态融合上述2类特征,通过一个1×1卷积和softmax函数为2个池化特征图的各空间位置动态生成权重$ {\boldsymbol{\alpha}} $$ {\boldsymbol{\beta}} $,进而进行加权求和.

$ \left. \begin{gathered} {{\boldsymbol{L}}_1} = {\text{SiLU}}({\text{BN}}({\text{PWCon}}{{\text{v}}_{{\text{1}} \times {\text{1}}}}({\text{DWCon}}{{\text{v}}_{{\text{3}} \times {\text{3}}}}({{\boldsymbol{F}}_3})))), \\ {{\boldsymbol{L}}_{{\text{max}}}} = {{\mathrm{MaxPool}}} ({{\boldsymbol{L}}_1}),\quad {{\boldsymbol{L}}_{{\text{avg}}}} = {{\mathrm{AvgPool}}} ({{\boldsymbol{L}}_1}), \\ [{\boldsymbol{\alpha}} ,{\boldsymbol{\beta}} ] = {\mathrm{softmax}}\;({\text{Con}}{{\text{v}}_{{\text{1}} \times {\text{1}}}}({{\boldsymbol{L}}_{{\text{max}}}}+{{\boldsymbol{L}}_{{\text{avg}}}})), \\ {{\boldsymbol{L}}_{\text{f}}} = {\boldsymbol{\alpha}} {\mkern 1mu} \odot {\mkern 1mu} {{\boldsymbol{L}}_{\max }}+{\boldsymbol{\beta}} {\mkern 1mu} \odot {\mkern 1mu} {{\boldsymbol{L}}_{{\text{avg}}}}. \\ \end{gathered} \right\} $

式中:$ \text{softmax}(\cdot ) $为对每个空间位置和每个样本动态分配权重,$ {\boldsymbol{\alpha}} $$ {\boldsymbol{\beta}} $为得到的权重;$ \odot $为逐元素相乘,$ {\boldsymbol{L}}_{\text{f}} $为加权求和后的特征图.

$ {\boldsymbol{L}}_{\text{f}} $依次经过1×1卷积、BN批归一化以及SiLU激活函数完成最终的特征整合,得到该分支的输出$ {\boldsymbol{L}}_{\text{out}} $

$ {\boldsymbol{L}}_{\text{out}}=\text{SiLU}\;(\text{BN}({\text{Conv}}_{\text{1}\times \text{1}}({\boldsymbol{L}}_{\text{f}}))). $

中等尺度分支用于处理来自P4层的特征图$ {\boldsymbol{F}}_{4} $,该层特征在语义信息和空间细节上取得了较好的平衡. 此分支的结构主要通过深度可分离卷积进行高效的特征提取,以在控制计算成本的同时完成通道对齐和信息提炼,生成输出$ {\boldsymbol{M}}_{\text{out}} $,既能够减小计算开销,又能够完成通道对齐.

$ {\boldsymbol{M}}_{\text{out}}=\text{SiLU}\;(\text{BN}({\text{DSConv}}_{\text{1}\times \text{1}}({\boldsymbol{F}}_{4}))). $

式中:$ {\text{DSConv}}_{\text{1}\times \text{1}}\left(\cdot \right) $为卷积核大小为1的深度可分离卷积,$ \text{BN}\left(\cdot \right) $为批归一化.

小尺度分支处理的是高层语义信息较强的P5层特征图$ {\boldsymbol{F}}_{5} $. 为将高层语义信息与其它分支的细节信息对齐,该分支通过卷积对通道数进行压缩以减少计算量. 采用双线性插值进行上采样,将空间分辨率恢复至与中尺度分支相同,而后再通过卷积得到输出$ {\boldsymbol{S}}_{\text{out}} $

$ \left.\begin{matrix}{\boldsymbol{S}}_{\mathrm{u}}={\text{Up}}_{\text{bilinear}}(\text{SiLU}(\text{BN}({\text{Conv}}_{\text{1}\times \text{1}}({\boldsymbol{F}}_{5})))),\\ {\boldsymbol{S}}_{\text{out}}=\text{SiLU}\;(\text{BN}({\text{Conv}}_{\text{1}\times \text{1}}({\boldsymbol{S}}_{\mathrm{u}}))).\\ \end{matrix}\right\} $

式中:$ {\text{Up}}_{\text{bilinear}}\left(\cdot \right) $为双线性插值上采样操作,$ {\boldsymbol{S}}_{\mathrm{u}} $为上采样后的特征图.

在3个分支并行处理完成后,得到3个具有不同侧重信息的特征图. 在通道维度拼接并送入融合卷积层,进行特征融合与通道压缩,计算过程为

${\boldsymbol{F}}_{\text{out}}=\text{SiLU}(\text{BN}({\text{Conv}}_{\text{1}\times \text{1}}(\text{Concat}({\boldsymbol{L}}_{\text{out}},{\boldsymbol{M}}_{\text{out}},{\boldsymbol{S}}_{\text{out}})))). $

1.3. 高分辨率小目标检测层

在原始YOLOv8架构中,模型共设有3层检测头,分别基于P3(80×80)、P4(40×40)和P5(20×20)特征图进行多尺度目标检测. [P3,P4,P5]层级配置旨在通过不同分辨率和感受野的组合,全面覆盖小、中、大3类尺寸的目标. 然而,无人机航拍图像的数据分布与常规自然场景存在显著差异:目标尺度变化范围大,其中微小目标占据绝对主导地位,大尺寸目标相对稀少. 在此背景下,专为大尺寸目标检测而设计的原P5检测头结构效率偏低. 例如,1个像素尺寸本就极小的目标,经过32倍的深度下采样后,在P5特征图上的有效特征信息几乎完全丢失,关键几何轮廓与纹理细节严重损失,这从根本上限制了模型对微小目标的感知能力,导致漏检现象频发. 因此,对于无人机视觉任务而言,P5检测头不仅造成了计算资源的低效利用,更是微小目标检测性能提升的主要瓶颈. 为此,对YOLOv8的检测头结构进行重构与优化,引入高分辨率P2特征层(160×160)以构建新的检测头. 具体而言,在保留P3P4特征层的基础上,将原有的P5检测头替换为P2检测头,保留包含更多小目标特征的浅层特征图,将模型的检测层级从[P3,P4,P5]调整为[P2,P3,P4].

1.4. 高效通道-空间注意力模块

为进一步精炼融合后的特征,抑制复杂背景干扰,提升小目标识别能力,在P3P4融合处加入ECSAM,其结构如图4所示. 该模块针对通道判别性不足与像素显著性模糊2大问题,引入在轻量化特性与互补维度上高度契合的有效通道注意力(efficient channel attention, ECA)[17]和简单无参数注意力模块(simple attention module, SimAM)[18]并加以耦合. ECA在通道维度上以极低参数对全局平均特征进行局部一维卷积重标定,从而突出与目标最相关的判别通道. SimAM在空间维度上通过零参数能量最小化机制为每个像素分配显著性权重,抑制背景噪声并放大目标细节. 两者的互补使ECSAM能够有效增强特征.

图 4

图 4   高效通道-空间注意力模块示意图

Fig.4   Schematic diagram of efficient channel-spatial attention module


在YOLOv8特征金字塔中,将分辨率一致的P3P4进行逐元素相加得到融合特征图$ {\boldsymbol{F}}_{\text{sum}} $,随后置入ECSAM完成双重注意力重标定:通过ECA对$ {\boldsymbol{F}}_{\text{sum}} $施加全局平均池化得到通道向量;再通过一维深度卷积生成权重,将归一化后的权重加权乘以输入特征图得到输出$ {\boldsymbol{F}}_{\text{eca}} $. SimAM以能量最小化方式计算像素显著性$ {\boldsymbol{\alpha }}_{\text{e},i,j} $,为每个特征图上的像素点定义能量函数,评估每个像素点的重要性,使SimAM能够在空间和通道维度上同时进行3D注意力权重分配,有效区分目标与背景区域. 将所得结果经过ECA后得到输出$ {\boldsymbol{F}}_{\text{eca}} $,再加权得到最终特征$ {\boldsymbol{F}}_{\text{out}} $. 这种先通道、后空间的逐元素再权重方式既具通道选择性,又具像素显著性.

$ {\boldsymbol{F}}_{\text{sum}}=\text{SimAM}(\text{ECA}({\boldsymbol{F}}_{{{{\boldsymbol{P}}}_{\text{3}}}}+{\boldsymbol{F}}_{{{{\boldsymbol{P}}}_{\text{4}}}})), $

$ {\boldsymbol{z}}_{c}=\frac{1}{HW}\sum \limits_{i=1}^{H}\sum \limits_{j=1}^{W}{\boldsymbol{F}}_{\text{sum},c}(i,j), $

$ l={\left| \frac{{\log }_{2}C+b}{\gamma }\right| }_{\text{odd}}, $

$ {\boldsymbol{F}}_{\text{eca}}(c,i,j)={\boldsymbol{F}}_{\text{sum},c}(i,j)\sigma ({w}_{c}), $

$ {\boldsymbol{\alpha }}_{\text{e},i,j}=\frac{1}{1+{({{\boldsymbol{F}}_{\text{eca}}}(c,i,j)-{{\mu }_{c}}\cdot {\boldsymbol{1}})}^{2}+\varepsilon \sigma _{c}^{2}}, $

$ {\boldsymbol{F}}_{\text{out}}={\boldsymbol{\alpha}}  \odot  {\boldsymbol{F}}_{\text{eca}}. $

式中:$ {\boldsymbol{F}}_{{{{\boldsymbol{P}}}_{\text{3}}}} $$ {\boldsymbol{F}}_{{{{\boldsymbol{P}}}_{\text{4}}}} $分别为来自P3P4层级的特征图;$ H $$ W $分别为输入特征图的高度和宽度;$ {\boldsymbol{z}}_{c} $为通道向量;$ \gamma $$ b $为超参数,$ b $=1,$ \gamma $=2;$ l $为核长;$ {w}_{c} $为第c个通道的重要性得分;$\sigma( \cdot ) $为Sigmoid函数;C为通道数,$ {\mu }_{c} $$ \sigma _{c}^{2} $分别为输入特征图在第c个通道上的均值和方差;$ \varepsilon $为保证数值稳定性的常数.

2. 实 验

2.1. 数据集与评估指标

采用大规模无人机视觉基准数据集VisDrone2021[19]进行算法的训练、验证与测试,并利用DOTA数据集进行泛化实验[20]. VisDrone2021数据集由天津大学AISKYEYE团队发布,专为复杂航拍场景下的目标检测任务设计. 数据集的划分遵循官方划分标准,使用6 471张图像作为训练集,548张图像作为验证集,以及1 580张图像作为测试集. 该数据集涵盖10个预定义类别,分别为“pedestrian”、“people”、“bicycle”、“car”、“van”、“truck”、“tricycle”、“awning-tricycle”、“bus”、“motor”. 图像分辨率在960×540~2 000×1 500像素,目标尺寸分布以及各类别的分布情况如图5所示. 该数据集的挑战性主要源于目标本身存在的多尺度差异、高密度遮挡、类别不平衡以及小目标占比多等因素,同时复杂的航拍背景进一步加剧了检测难度.

图 5

图 5   目标尺寸分布

Fig.5   Target size distribution


DOTA数据集是2018年由武汉大学发布的专为航拍图像目标检测设计的大规模数据集. 该数据集共包含2 806张航拍图像以及188 282个标注,每张图像尺寸在800×800~4 000×4 000像素,涵盖从小型车辆、船只等小尺度目标到网球场、飞机场等大尺度目标在内的15个类别. 无论从数据规模还是标注质量而言,该数据集在同类型航拍数据集中均具有显著优势,因此被选为泛化实验数据集.

为全面客观地评估所提算法的性能,从检测精度与模型复杂度2个维度进行评估. 在检测精度方面,采用业界公认的COCO数据集评估指标体系,包括:作为核心指标的平均精度(average precision, AP)、交并比(intersection over union, IoU)阈值大于0.5时检测的结果AP50、IoU阈值大于0.75时的检测结果AP75、小尺寸目标检测结果APS、中尺寸目标检测结果APM、大尺寸检测结果APL. 在模型复杂度方面,采用参数量(Params)和每秒浮点运算次数(FLOPs)进行对比分析.

2.2. 实验设置

实验环境为Win10 64位操作系统,使用NVIDIA RTX 5070 GPU进行训练和测试,深度学习框架为Pytorch 2.8.0,编译器为Python 3.10.16,CUDA版本为12.1. 为保证消融实验的公平,所有实验模型均不使用预训练权重. 模型训练轮数为300个epoch,训练至收敛(连续40轮无提升)后提前结束训练. 将输入图片的尺寸统一调整为640×640. 优化器选择随机梯度下降算法SGD,初始学习率为0.01,训练批量大小设置为4,其他训练设置与基线保持一致.

2.3. 消融实验

为科学、严谨地验证本研究提出的模型对无人机航拍场景小目标检测的性能提升效果,在VisDrone2021-DET-val数据集上进行一系列消融实验. 以YOLOv8s为基线模型,分别添加各改进模块再依次加入模块进行性能提升的对比. 实验结果如表1所示.

表 1   VisDrone验证集上的消融实验结果

Tab.1  Results of ablation experiments on VisDrone validation set

方法AP/%AP50/%AP75/%APS/%APM/%APL/%FLOPs/109Params/106
BaselineP2DMSA-NetECSAMTDFM
21.937.222.212.433.441.828.511.14
23.940.124.115.634.541.630.06.60
23.239.123.413.035.044.835.114.67
23.539.624.113.935.745.647.614.35
22.538.022.912.934.242.132.311.56
24.040.424.215.434.838.931.57.14
25.542.826.016.836.542.434.77.95
25.843.126.617.037.141.535.58.19
27.245.027.718.339.043.738.39.33

新窗口打开| 下载CSV


从消融实验表1中的数据可以看出,将P5检测头换为P2检测头后,算法的Params最低. 相较基线模型,AP、AP50、AP75、APS、APM分别提升2.0%、2.9%、1.9%、3.2%、1.1%. 由于去掉了P5检测头,APL下降0.2%,但针对中小尺寸目标的检测性能均有不同程度的提升. 相较于其他模块的作用,该模块Params最少,表明P2检测头的引入是实现模型轻量化和提升小目标检测性能的核心驱动力. 使用DMSA-Net替换原始C2f模块后,尽管算法的Params与FLOPs有所增加,但整体检测性能有所提升. 其中,APS、APM、APL分别提升0.6%、1.6%、3.0%,表明DMSA-Net能有效提升网络对不同尺寸目标的上下文感知能力与特征提取能力. 在基线模型中加入ECSAM后,AP、AP50、AP75、APS、APM、APL分别提升1.6%、2.4%、1.9%、1.5%、2.3%、3.8%,Params增加3.22 M,FLOPs增加19.1×109. 该模块对所有尺度的目标检测性能均有积极影响,说明双重注意力机制能够有效增强全局特征的判别力. 加入TDFM后,Params增量较少且总体精度有所提升,表明该模块能够在保持模型轻量化的同时,通过加权融合机制有效提升检测精度.

表1中的组合实验结果不仅验证了各改进模块相对于基线模型在各项评估指标上均有不同程度提升,还证实了模块间存在协同增强效应. 在P2检测头与TDFM模块的耦合实验中,相较于单独引入TDFM模块,不仅检测精度进一步提高,Params与GFLOPs都有所降低. 这主要是由于TDFM的处理对象从高通道数的[P3,P4,P5]金字塔变为[P2,P3,P4]. 尽管P2特征层分辨率更高,但其通道数远低于P5特征层,此种重构使得TDFM模块的GFLOPs显著下降. 将P2与DMSA-Net组合进行实验,该组合模型的AP达到25.5%,小目标的检测精度提升至16.8%,且Params仅为7.95×106. 这表明在引入P2检测头并移除P5检测头后,原本用于生成和处理的深层特征计算路径被移除,节省的GFLOPs超过新增P2检测头带来的计算增量. 同时,在保留小目标关键细节的P2特征图上应用DMSA-Net自适应感受野,能够提取到信息更丰富的特征,从而进一步提升检测性能. 继续引入ECSAM后,AP与APS分别提升至25.8%和17.0%,表明ECSAM能够有效抑制复杂背景干扰,使小目标更容易被识别.

集成所有4个模块的方法与基线模型相比,Params降低16.25%,且AP、AP50、AP75、APS、APM、APL分别提升5.3%、7.8%、5.0%、5.9%、5.6%、1.9%. 其中,AP、AP50、AP75、APS、APM均达到最优水平. APL虽高于基线模型,但在消融实验中并非最高值,这符合预期的设计权衡. 所提模型架构,特别是用P2检测头替换P5检测头的策略,旨在使模型专注于解决无人机航拍场景中最普遍的小、中尺度目标检测问题. 因此,以少量大目标类别上的性能为代价,换取小目标检测性能的提升,对于模型在实际应用中是合理且必要的. 以上消融实验说明了本研究所提出的方法在无人机视角目标检测任务中具有显著有效性,在合理控制计算量且兼顾参数量的同时,检测性能相较于基线模型得到较大的提升.

基线方法与改进方法混淆矩阵的对比如图6所示. 混淆矩阵的对角线值代表各类别的真阳率,即模型正确识别该类别样本的比例,是衡量模型分类与定位精度的核心指标. 可以发现,提出的改进方法在所有类别上的真阳率较基线模型均有显著提升. 这表明所提方法对于无人机视角下因尺寸小、易与背景或其他类别混淆而难以识别的目标,改善效果尤为突出. 改进方法对于一些关键类别识别能力的提升尤为明显. 例如,对于pedestrian和people这2个极易混淆的类别,识别率分别从34%和21%提升至44%和34%,增幅显著,展现了更强的特征辨别能力. 从混淆矩阵的非对角线元素来看,改进方法有效降低了将目标漏检为background的概率. 基线模型会将大量目标,如76%的bicycle和71%的people错误识别为背景,而改进方法将这一比例分别降低至70%和59%,表明漏检情况得到了一定的抑制. 综上所述,混淆矩阵的量化对比结果表明,所提改进方法能够在YOLOv8s基线模型基础上学习到更具辨别力的深层多尺度特征,有效减少误检漏检情况,在无人机视角图像目标检测任务中表现优异,具备实际应用价值.

图 6

图 6   基线方法与所改进方法在VisDrone验证集上的混淆矩阵结果

Fig.6   Confusion matrix results for baseline method and DTE-YOLO on VisDrone validation set


2.4. 泛化实验

为了验证所提出改进模块的有效性、泛化能力及适用性,进行拓展性实验. 将所提出的各模块集成到YOLOv8系列不同规模的基线模型中,即在YOLOv8的n、m、l、x模型中添加模块,实验结果如表2所示. 尽管为增强特征表达能力使得GFLOPs有所增大,但改进方法在所有模型尺度上均表现出一致效果:与原模型相比所有的检测精度得到有效提升,且模型的Params降低,证明了轻量化设计的有效性,说明所提改进方法在YOLOv8其他系列模型中也具有良好的泛化性和可靠性.

表 2   YOLOv8其他模型改进后在VisDrone验证集上的检测性能对比结果

Tab.2  Comparison results of detection performance of other improved YOLOv8 models on VisDrone validationset

方法AP/%AP50/%AP75/%APS/%APM/%APL/%FLOPs/109Params/106
YOLOv8n17.931.117.99.627.635.76.82.68
YOLOv8n+DMSA-Net+TDFM+P2+ECSAM21.335.821.812.430.937.112.22.51
YOLOv8m24.741.025.215.336.843.579.125.85
YOLOv8m+DMSA-Net+TDFM+P2+ECSAM28.446.929.019.140.145.3101.821.89
YOLOv8l26.543.327.316.239.449.4164.943.6
YOLOv8l+DMSA-Net+TDFM+P2+ECSAM30.149.430.821.042.050.1213.039.2
YOLOv8x27.444.428.417.041.147.5257.468.13
YOLOv8x+DMSA-Net+TDFM+P2+ECSAM30.750.131.521.842.647.8328.761.05

新窗口打开| 下载CSV


为了进一步验证改进算法在航拍图像目标检测任务上的泛化性与适用性,选取相似规模的主流目标检测算法在DOTA数据集上进行检测. 表3展示了在相同条件下,YOLO系列主流算法YOLOv5s、YOLOv8s、YOLOv10s[21]、YOLOv11s[22]、YOLOv12s[23]与本研究算法的检测对比结果. 可以看出,本研究算法相较于其他相似规模的检测算法,展现出较好的检测结果. 在DOTA数据集上精度仍高于基线模型YOLOv8s.

表 3   DOTA数据集上对比实验结果

Tab.3  Comparison experiments results on DOTA dataset

方法AP/%AP50/%AP75/%APS/%APM/%APL/%
YOLOv5s27.742.429.410.923.641.9
YOLOv8s28.142.830.410.424.141.3
YOLOv10s27.642.729.010.724.440.3
YOLOv11s28.043.029.811.124.442.1
YOLOv12s27.742.529.510.023.641.9
本文方法30.846.332.712.428.242.8

新窗口打开| 下载CSV


改进算法在DOTA数据集上的检测效果可视化如图7所示. 图7的左上图港口和右下图沿岸中,展示了算法在水面、陆地以及工业设施交错的复杂背景下对小目标船舶的检测能力;在右上图体育场中,体现了算法对多种类别、结构化目标的准确识别;在左下图的停车场与马路上,展示了模型在小目标、密集排列这一核心挑战场景下良好的检测性能. 可以看出,DTE-YOLO在DOTA数据集上的多个场景下的检测效果均优异,验证了本研究模型在无人机航拍场景中目标检测的泛化性.

图 7

图 7   DOTA数据集检测结果可视化

Fig.7   Visualization of detection results on DOTA dataset


2.5. 对比实验

为验证算法的有效性并评估所提出方法的检测性能,将所改进的方法与其他12种主流的目标检测算法在VisDrone测试集上进行了全面的对比实验. 在VisDrone2021-DET-test数据集上,本研究从多个维度对这些模型进行比较,实验结果如表4 所示.所提出的模型在Params=9.33×106的情况下,AP达到20.9%,相较于Params更大的YOLOv8m和YOLOv10m,分别高出1.9%和1.4%. 在IoU=0.5标准下,改进模型的AP50达到36.9%,高于所有对比模型,显示出优越的检测能力. 当IoU标准提升至0.75,改进模型的AP75达到21.1%,在所有对比模型中表现最佳,表明该方法能够在更严格的标准下实现更精确的目标定位. 在针对不同尺寸目标的检测性能方面,模型同样展现出显著优势. 对于小尺寸目标,改进模型APS达到11.0%,优于其他所有对比方法,有效缓解了小目标检测中的漏检和误检问题. 对于中等尺寸目标,改进模型APM达到31.4%,相较于次优模型提升1.4%,进一步验证了算法的鲁棒性. 对于大尺寸目标,由于去掉了P5检测层,改进模型的APL与TOOD相比略低,但FlOPs和Params均优于TOOD,且其余尺寸目标检测精度都相比较高. 由于无人机航拍场景中大尺寸目标相对较少,以对小部分大尺寸目标检测精度小幅度降低换取其余目标的检测精度大幅度提升,满足性能和效率的平衡. 所提改进模型的Params与FLOPs,相较于YOLOX-Tiny还有较大的提升空间. 综上所述,VisDrone测试集上的综合对比实验表明,所提方法在保持Params与FLOPs较低的同时,在多个关键性能指标上均表现出卓越的性能,特别是在小目标检测和高精度定位方面,证明了算法的有效性和先进性.

表 4   VisDrone测试集上的对比实验结果

Tab.4  Comparative tests results on VisDrone test set

模型Params/106AP/%AP50/%AP75/%APS/%APM/%APL/%FLOPs/109
RetinaNet[3]21.378.015.57.62.113.223.715.9
FasterR-CNN[4]41.7212.823.912.65.221.129.726.8
YOLOXm[24]12.4213.924.514.16.022.023.918.1
TOOD[25]15.6416.928.216.87.924.343.143.8
VFNet[26]9.8417.630.317.98.026.736.410.2
YOLOX-Tiny5.0414.827.814.97.622.127.87.6
YOLOv8m25.8519.033.219.29.029.441.779.1
YOLOv10m15.3219.534.519.69.730.041.458.9
YOLO11s[22]9.4217.631.317.88.027.236.421.3
YOLO12s[23]9.2317.631.217.88.127.435.621.2
RetinaNet-R50-FPN36.5216.427.614.86.027.442.7210
GFL[27]32.2819.132.119.29.130.040.9206
本文方法9.3320.936.921.111.031.442.838.3

新窗口打开| 下载CSV


为评估DTE-YOLO模型在特征提取与目标定位方面的有效性,对不同模型的检测热力图进行可视化对比分析. 通过将模型在进行预测时所依赖的关键图像区域高亮显示,热力图能够直观地揭示模型对目标和背景的辨识能力,其中高响应区域代表模型关注的焦点,低响应区域则代表被忽略的信息. 如图8所示,基线模型YOLOv8s的热力图呈现出较为弥散的状态,其激活区域宽泛且未能精确聚焦于目标实体,表明其定位能力有待提升. 对比模型YOLOv11s存在严重背景干扰问题,在树木等与任务无关的背景上产生显著的错误激活,在复杂场景下会导致错误检测. YOLOv10s的表现也未能达到理想状态,其热区同样存在焦点不集中的问题,且对部分目标的响应较弱,出现漏激活的现象. YOLOv12s虽然在目标定位上比前两者稍好,但在背景抑制方面表现不佳,可以看到其在非目标区域仍存在多处斑驳的弱激活,说明其区分前景与背景的能力依然不足. 相比之下,DTE-YOLO模型展现出卓越的性能,其高激活区域被高度、精准地集中在目标之上,同时背景区域呈现出纯净、一致的低响应状态. 这一鲜明对比有力地证明,提出的改进方法有效增强了模型的特征分辨能力与空间定位精度,使其能够将注意力集中于真正的目标而忽略无关干扰,表示模型在实际应用中将具有更高的检测精度与鲁棒性.

图 8

图 8   检测热力图对比

Fig.8   Comparison of detection heat map


为直观展示所提算法的有效性,将其与先进的YOLOv8s基线模型在多种挑战性场景下进行可视化对比,结果如图9所示. 可视化图中第1行为倾斜视角下低光照的夜晚场景. 通过对比图可以看到YOLOv8s对暗光区域的树木下的大量车辆漏检,而本研究模型则凭借更强的特征提取能力,成功捕捉到低可见度的汽车. 进一步地,在俯视视角下的阴天场景中,目标呈现出尺寸小、密度大以及光照弱的特点,YOLOv8s在此类目标检测上表现不佳,如图中的第2行对比放大区域所示,墙角的自行车以及卡车后的部分行人这些小目标未被检测出. 相比之下,本研究模型得益于P2检测头对高分辨率特征的保留以及Star_Block强大的非线性辨别能力,能够更精细地定位和分辨每个微小目标,并检测出YOLOv8漏检的自行车与行人等小尺寸目标,展现了细节感知能力. 同样,在车流密集的城市主干道上,基线模型存在大量漏检,且出现将多个小目标合并检测为1个的情况. 如图中第3行放大对比区域所示,DTE-YOLO成功检测出远处拥挤的小型车辆目标,并且置信度有所提高;而YOLOv8s难以对这些密集的小目标进行检测. 如图中第4行所示,在存在树木阴影和背景干扰的街道场景中,YOLOv8s漏检了多名行人和摩托车且对已检测出目标的置信度相对较低,而DTE-YOLO通过有效的注意力机制,更好地聚焦于关键目标、抑制复杂背景干扰,实现了更全面的目标检测. 通过可视化结果对比图可以清晰地看出,所提模型在处理无人机视角下常见的小目标、密集分布、严重遮挡和低光照等复杂情况时,其检测性能和鲁棒性均显著优于YOLOv8s基线模型.

图 9

图 9   检测结果可视化对比

Fig.9   Visual comparison of test results


3. 结 语

针对无人机航拍图像面临的尺度变化显著、小目标与遮挡频发、背景干扰复杂等严峻挑战,设计轻量化且高效的多尺度聚合网络检测模型. 通过动态调整感受野以适应显著的目标尺度变化,从而在复杂航拍场景下实现更精准、鲁棒的特征表达. 研究表明,通过重构高分辨率检测层级并引入自适应特征深度融合与注意力精炼机制,能够有效克服航拍图像中微小目标特征易丢失及背景噪声干扰的难题. VisDrone2021与DOTA数据集的实验结果证实,所提方法在参数量大幅降低16.25%的轻量化基础上,提升了模型在遮挡、低光照等复杂场景下的检测精度与鲁棒性,为资源受限的无人机平台提供了实用的精准检测解决方案. 基于本次研究的经验,后续研究将重点关注模型的小目标漏检率,同时保证参数量和计算量控制在合理范围内.

参考文献

REDMON J, DIVVALA S, GIRSHICK R, et al. You only look once: unified, real-time object detection [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 779–788.

[本文引用: 1]

LIU W, ANGUELOV D, ERHAN D, et al. Ssd: single shot multibox detector [C]// Proceedings of the European Conference on Computer Vision. Amsterdam: Springer, 2016: 21–37.

[本文引用: 1]

LIN T Y, GOYAL P, GIRSHICK R, et al. Focal loss for dense object detection [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops. Venice: IEEE, 2017: 2999–3007.

[本文引用: 2]

REN S, HE K, GIRSHICK R, et al. Faster R-CNN: towards real-time object detection with region proposal networks [C]// Conference on Neural Information Processing Systems. Montreal: MIT Press, 2015: 91–99.

[本文引用: 2]

翟亚红, 陈雅玲, 徐龙艳, 等

改进 YOLOv8s 的轻量级无人机航拍小目标检测算法

[J]. 浙江大学学报: 工学版, 2025, 59 (8): 1- 10

[本文引用: 1]

ZHAI Yahong, CHEN Yaling, XU Longyan, et al

Improved YOLOv8s lightweight small target detection algorithm of UAV aerial image

[J]. Journal of Zhejiang University: Engineering Science, 2025, 59 (8): 1- 10

[本文引用: 1]

CAO Y, HE Z, WANG L, et al. VisDrone-DET2021: the vision meets drone object detection challenge results [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops. Montreal: IEEE, 2021: 2847–2854.

[本文引用: 1]

YANG X, YANG J, YAN J, et al. SCRDet: towards more robust detection for small, cluttered and rotated objects [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Seoul: IEEE, 2019: 8231–8240.

[本文引用: 2]

尹向雷, 屈少鹏, 解永芳, 等

基于渐进特征融合及多尺度空洞注意力的遮挡鸟巢检测

[J]. 浙江大学学报: 工学版, 2025, 59 (3): 535- 545

[本文引用: 1]

YIN Xianglei, QU Shaopeng, XIE Yongfang, et al

Occluded bird nest detection based on asymptotic feature fusion and multi-scale dilated attention

[J]. Journal of Zhejiang University: Engineering Science, 2025, 59 (3): 535- 545

[本文引用: 1]

FENG C, CHEN Z, KOU R, et al. HazyDet: open-source benchmark for drone-view object detection with depth-cues in Hazy scenes [J]. Computing Research Repository, 2024, 2409: 19833.

[本文引用: 1]

MA Z, LUO P, SHEN X

LMSOE-Net: lightweight multi-scale small object enhancement network for UAV aerial images

[J]. Complex and Intelligent Systems, 2025, 11 (8): 333

DOI:10.1007/s40747-025-01971-0      [本文引用: 1]

LI Y, LI Q, PAN J, et al

SOD-YOLO: small-object-detection algorithm based on improved YOLOv8 for UAV images

[J]. Remote Sensing, 2024, 16 (16): 3057

DOI:10.3390/rs16163057      [本文引用: 1]

LI H, QU H. DASSF: dynamic-attention scale-sequence fusion for aerial object detection [C]// Conference on Computational Visual Media. Hong Kong: Springer, 2025: 212–227.

[本文引用: 1]

GHARATAPPEH S, SEKEH S, DHIMAN V. Weather-aware object detection transformer for domain adaptation [J]. Computing Research Repository, 2025, 2504: 10877.

[本文引用: 1]

NIKOUEI M, BAROUTIAN B, NABAVI S, et al

Small object detection: a comprehensive survey on challenges, techniques and real-world applications

[J]. Computing Research Repository, 2025, 2503: 20516

[本文引用: 1]

MA X, DAI X, BAI Y, et al. Rewrite the stars [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 5694-5703.

[本文引用: 1]

LI W, CHEN H, LIU Q, et al

Attention mechanism and depthwise separable convolution aided 3DCNN for hyperspectral remote sensing image classification

[J]. Remote Sensing, 2022, 14 (9): 2215

DOI:10.3390/rs14092215      [本文引用: 1]

WANG Q, WU B, ZHU P, et al. ECA-Net: efficient channel attention for deep convolutional neural networks [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 11531–11539.

[本文引用: 1]

YANG L, ZHANG R Y, LI L, et al. SimAM: a simple, parameter-free attention module for convolutional neural networks[C]//Proceedings of the International Conference on Machine Learning. [S.l.]: ACM, 2021: 11863–11874.

[本文引用: 1]

ZHU P, WEN L, DU D, et al

Detection and tracking meet drones challenge

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44 (11): 7380- 7399

DOI:10.1109/TPAMI.2021.3119563      [本文引用: 1]

XIA G S, BAI X, DING J, et al. DOTA: a large-scaledataset for object detection in aerial images[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018: 3974–3983.

[本文引用: 1]

WANG A, CHEN H, LIU L, et al. YOLOv10: real-time end-to-end object detection [C]// Conference on Neural Information Processing Systems. Vancouver: MIT Press, 2024: 107984–108011.

[本文引用: 1]

KHANAM R, HUSSAIN M. YOLOv11: an overview of the key architectural enhancements [EB/OL]. [2026-07-10]. https://arxiv.org/abs/2410.17725.

[本文引用: 2]

TIAN Y, YE Q, DOERMANN D

Yolov12: attention-centric real-time object detectors

[J]. Advances in Neural Information Processing Systems, 2026, 38: 78433- 78457

[本文引用: 2]

GE Z, LIU S, WANG F, et al. YOLOX: exceeding YOLO series in 2021 [EB/OL]. [2026-07-10]. https://arxiv.org/abs/2107.08430.

[本文引用: 1]

FENG C, ZHONG Y, GAO Y, et al. TOOD: task-aligned one-stage object detection [C]// Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 3490–3499.

[本文引用: 1]

ZHANG H, WANG Y, DAYOUB F, et al. VarifocalNet: an iou-aware dense object detector [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. [S.l.]: IEEE, 2021: 8514–8523.

[本文引用: 1]

LI X, WANG W, WU L, et al. Generalized focal loss: learning qualified and distributed bounding boxes for dense object detection [C]// Conference on Neural Information Processing Systems. Vancouver: MIT Press, 2020: 21002–21015.

[本文引用: 1]

/