基于YOLOv11n的改进铁路工人安全穿戴检测模型
Improved railway worker safety wear detection model based on YOLOv11n
收稿日期: 2025-09-26
| 基金资助: |
|
Received: 2025-09-26
| Fund supported: | 国家自然科学基金资助项目(61661027);中央引导地方科技发展资金资助项目(24ZYQA044);甘肃省重点研发计划资助项目(22YF7GA141). |
作者简介 About authors
武晓春(1973—),女,教授,硕士,从事交通信息工程及控制研究.orcid.org/0009-0005-9874-452X.E-mail:
针对铁路作业场景较复杂,安全穿戴远景目标较小及边缘计算设备资源有限等问题,提出VMS-YOLOv11n的铁路安全穿戴检测模型. 设计VABlock特征提取模块,替换主干网络及颈部网络中的C3k2模块,在保留关键特征的同时减少计算冗余. 设计MSF多尺度特征融合结构,通过融合多级特征加权策略与双向特征金字塔网络,提高铁路复杂场景下的小目标检测精度. 构建空间金字塔特征融合结构(SE2SPPF),在增强小目标特征学习能力的同时提高模型检测能力. 实验结果表明,相较于基线YOLOv11n,改进模型的精确率为98%,召回率为92.5%,平均精度均值为97.5%,分别提高了2.9%、2.5%和2.7%. 参数量为2.45×106,与基线模型相比降低了5%. 改进后的模型在铁路安全穿戴检测中的效果良好,有效平衡了检测精度和速度.
关键词:
A VMS-YOLOv11n model for railroad safety wear detection was proposed aiming at the problems of more complex railroad operation scenario, smaller safety wear vision targets and limited resource of edge computing devices. The VABlock feature extraction module was designed to replace the C3k2 module in the backbone network as well as the neck network to reduce computational redundancy while retaining key features. Then the MSF multi-scale feature fusion structure was designed to improve the small target detection accuracy in complex railroad scene by fusing the multilevel feature weighting strategy with the bidirectional feature pyramid network. The spatial pyramid feature fusion structure (SE2SPPF) was constructed to enhance the small target feature learning capability while improving the model detection capability. The experimental results showed that the improved model had precision rate of 98%, recall rate of 92.5%, and average precision mean of 97.5%, which were 2.9%, 2.5% and 2.7% higher, respectively compared with the baseline YOLOv11n. The number of parameters is 2.45×106, which is 5% lower than the baseline. The improved model works well in railroad safety wear detection, effectively balancing detection accuracy and speed.
Keywords:
本文引用格式
武晓春, 李梓宁.
WU Xiaochun, LI Zining.
当前,根据实现流程,主流的目标检测算法可以分为单阶段(one-stage)和双阶段(two-stage)两类. R-CNN、Faster R-CNN[3]、Mask R-CNN[4]等双阶段算法具有高精度和灵活性,但计算成本较高,难以满足实时性需求,适用于对精度要求严格的场景. YOLO[5]、SSD[6]、RT-DETR[7]等单阶段算法将定位与分类合为一步,推理速度快,资源消耗低,更适合算力有限的场景. 大多数专家学者选用单阶段算法进行研究. 近年来,国内外学者对安全帽和反光衣检测开展大量研究,取得了一系列科研进展. 冯勇等[8]基于YOLOv8提出轻量化算法,设计轻量化自适应权重下采样和高效多尺度卷积,浮点计算量下降73%,精确率达到92.6%. Shan等[9]提出增强YOLOv5算法,引入ECA注意力机制和BiFPN结构,精度提高3%. 徐壮等[10]基于YOLOv8n提出GS-C2f模块,引入CBAM注意力和Wise-IoUv3损失函数,参数量下降21.24%,精度提升1%. 冯爽等[11]提出改进RT-DETR,使用轻量级EfficientViT和HWD-ADown下采样模块,检测精度提高2.7%,模型大小降低48.4%.
尽管上述研究在精度或轻量化方面取得了成效,但现有算法在复杂场景下存在漏检、错检的问题,难以满足实际部署需求. 本文选用在检测精度与轻量化之间平衡较优的YOLOv11n作为基线模型,提出VMS-YOLO铁路安全穿戴检测模型,围绕特征提取、多尺度融合与上下文感知进行系统性优化. 设计VABlock轻量化特征提取模块,降低参数量和计算量. 构建融合多级特征加权策略与双向特征金字塔网络的多尺度特征融合结构(MSF),提升小目标检测能力. 引入SaE注意力机制改进SPPF模块,形成SE2SPPF空间金字塔特征融合结构,以应对复杂场景下的多目标与遮挡问题. 该模型具有高精度且能够满足实际工程检测的实时性需求,为铁路施工安全穿戴检测提供技术支持.
1. VMS-YOLO铁路安全穿戴检测模型
YOLOv11[12]由Ultralytics团队研发,在复杂环境实时检测与小目标识别方面表现优异. 该模型延续单阶段回归框架,通过多项架构创新实现精度与效率的平衡. 采用C3K2模块增强多尺度特征融合能力,引入C2PSA部分空间注意力模块动态聚焦关键区域,并在解耦头中使用深度可分离卷积降低计算复杂度. 这些技术协同提升了遮挡、低光照这些复杂场景下的小目标检测鲁棒性,为边缘计算设备提供了高效的解决方案. YOLOv11提供n、s、m、l、x 5种版本,鉴于边缘设备算力和存储有限,选用参数量和计算量最小的YOLOv11n作为基线模型进行改进.
针对铁路作业场景较复杂,远景安全穿戴目标较小易漏检错检,边缘计算设备资源有限的问题,提出基于改进YOLOv11n的铁路安全穿戴检测模型. 设计VABlock轻量化特征提取模块替换主干网络及颈部网络中的C3k2模块,在保留关键特征的同时减少计算冗余. 构建多尺度特征融合结构(MSF),增强多尺度特征融合能力,减小远景小目标漏检率. 设计新的空间金字塔特征融合结构(SE2SPPF),提高铁路复杂场景下的小目标检测精度. 改进后的VMS-YOLO模型结构图如图1所示.
图 1
1.1. VABlock特征提取结构
图 2
图 3
基于VoV-GSCSP模块进行改进,将AKConv紧邻置于VoV-GSCSP模块中Concat后的CBS卷积之后. 该设计使网络在特征融合阶段获得最大收益,利用动态采样机制有效补偿复杂光照条件下的特征损失,通过可变形卷积核适应不同角度的穿戴目标. 改进后的特征提取模块命名为VABlock(VoVGSCSP+AKConv Block),结构如图4所示. 该模块通过跨阶段特征聚合,将浅层细节与深层语义融合,构建多尺度上下文网络,从信息广度上补偿遮挡导致的特征缺失. 动态卷积核依据输入特征自适应调整权重,从信息深度上聚焦关键区域,抑制遮挡噪声. 两者协同工作,使模型在面对遮挡时既能利用更全面的上下文信息,又能对局部特征进行自适应增强,从而显著提升模型对遮挡目标的特征感知能力. 利用VABlock特征提取模块,替换YOLOv11n主干网络及颈部网络中原始的C3k2模块. 该特征提取结构更适合应用在远距离小尺寸安全帽、部分遮挡的反光背心和密集人群中的工人目标检测中.
图 4
为了减少穿戴检测中的通道信息损耗,采用GSConv替换常规的卷积CBS模块,通过通道混合策略保留目标与环境的隐式关联(如反光背心与背景的对比度关系),在3×3深度分离卷积中嵌入特征交换机制,提升helmet类目标的通道间特征交互效率. 具体的改进方式是使用GSConv模块替换主干网络中所有的普通CBS卷积模块,同时替换颈部网络中第20、23层的CBS卷积模块. 实验结果表明,该设计在保持实时性的前提下,有效提升了目标的检测精度. GSConv的结构如图5所示.
图 5
1.2. 多尺度融合模块的特征融合结构
由于传统FPN对小目标(如安全帽、反光背心)特征传递不足,融合多级特征加权策略与双向特征金字塔网络,构建新的颈部网络结构. 通过借鉴ASF-YOLO[15]设计思路集成编码器生成的分层特征图,增强图像中的语义和细节信息. 在对 YOLOv11模型的颈部网络进行改进时,通过组合空间特征与比例特征,提升了穿戴目标的检测精度. 考虑铁路场景中,检测模型需要实时处理复杂背景下的多尺度目标(如近景工人全身和远景小尺寸安全帽),传统卷积运算存在大量的冗余计算. 为了减少内存访问和计算冗余,PConv[16]利用标准卷积从输入通道的一部分中提取空间特征,保持通道的其余部分不变. 该过程显著减少了计算冗余,提高了推理速度. 假设输入特征图的大小为
式中:M为输出通道数. 利用PConv,对ASF-YOLO颈部网络中的SSFF模块进行改进,提出多尺度融合(multi-scale fusion, MSF)结构. 该结构位于Yolov11颈部网络的开端,它直接接收来自主干网络输出的P3、P4和P5 3个尺度的特征图. 该结构不参与颈部网络内部的上采样、下采样或融合流程,而是在这些流程开始之前,先对原始的主干特征进行一次顶层的、跨尺度的序列融合,使模型在保持特征表达能力的同时显著减少计算量. 该模块的结构如图6所示. 其中,f(i, j)为输入二维特征图在(i, j)处的特征值. 具体的改进方式如下:在3D卷积前添加PConv,强化反光背心的特征提取;在3D池化后加入PConv,减少头盔小目标的信息损失;将ReLU激活函数替换为LeakyReLU,解决低光照下的梯度消失问题. 该MSF结构显著提升了小尺寸安全帽的召回率,为铁路安全生产提供了高效、可靠的安全穿戴检测解决方案.
图 6
1.3. SE2SPPF空间金字塔特征融合结构
YOLOv11的SPPF模块虽然具有多尺度特征融合能力,但随着网络层数的加深和反复下采样操作,图像中的小尺寸细节特征容易丢失. 复杂铁路场景中的光照变化、背景干扰及工人姿态多样性都给模型的深层特征提取带来困难. 受文献[17]的启发,该研究通过多粒度融合与跨尺度感知策略,证明了精细特征增强模块对于复杂环境下鲁棒特征提取的有效性. 引入Narayanan[18]提出的SaE(squeeze-and-aggregation excitation)模块,对SPPF模块进行深层改进,提出新的SE2SPPF模块结构. 该模型的结构如图7所示. 其中,k为卷积核或池化核的大小,s为步长,p为填充率. 该模块通过多分支全连接层,对通道、空间和全局特征进行统一处理,能够有效地解决网络深层细节特征丢失的问题.
图 7
在特征提取阶段引入多尺度池化操作,采用5×5大小的池化核,确保从近景工人全身到远景小尺寸安全装备不同尺度目标的特征保留. 通过多分支全连接层实现特征重组,其中每个分支专注于特定类型穿戴目标的特征学习. 在特征融合环节采用LeakyReLU激活函数,保留负梯度信息,以增强低光照条件下的识别能力.
将SE2SPPF的Avg Pool模块之后的特征传递到多分支全连接(fully connected, FC)层中,该层的缩减比例设为16,底数为4,在激励过程中,拆分的输入在最后重新组合以恢复原始尺寸. SE2SPPF模块采用并行多尺度结构捕获上下文特征,引入双重特征校准机制. 其中SaE模块通过通道注意力动态重组特征,增强光照不变性并抑制背景干扰. 多分支全连接结构针对姿态与穿戴多样性,进行自适应特征重加权. 该模块形成了对复杂铁路场景具有强适应性的特征表示,保证了模型检测性能的稳定性.
2. 实验分析
2.1. 数据集
采用公开、可用的铁路工人安全穿戴检测数据集(railroad worker detection dataset)[19]. 该数据集包含约3 222张采集自真实铁路作业场景的RGB图像,覆盖多种光照条件和视角. 数据集的核心价值在于标注的精细程度,使用Labelimg软件对图像中的铁路工人(person)及其关键安全装备,包括安全头盔(helmet)和高可见度反光背心(vest),进行人工标注. 具体的数据分布如下:vest类别的图片数为
在实验设计中,依据8∶1∶1的比例,选取
图 8
图 8 铁路工人安全穿戴检测数据集的示例
Fig.8 Example of railroad worker safety wear detection dataset
2.2. 实验环境及参数设置
实验的软件环境部署为Ubuntu22.04、Python3.10、Pytorch2.1.0. 硬件环境包括 NVIDIA GeForce RTX
表 1 实验环境的参数设置
Tab.1
| 参数 | 说明 |
| 操作系统 | Ubuntu 22.04 |
| 运行内存 | 120 GB |
| 显卡 | GeForce RTX |
| 显存 | 24 GB |
| CPU | 16 vCPU Intel(R) Xeon(R) Gold |
| 深度学习框架 | Pytorch 2.1.0 |
| CUDA版本 | 12.1 |
| Python版本 | 3.10 |
该实验的输入图像大小为640×640像素,选择随机梯度下降(stochastic gradient descent, SGD)优化器,初始学习率为0.01,采用随机梯度下降更新学习率,动量(momentum)是0.937,权重衰减(weight_decay)是0.000 5. 在训练过程中,采用Mosaic数据增强的方式,每次读取数张图片,分别进行翻转、缩放、裁剪等操作后拼接,使检测背景更加丰富. 设置标签平滑,防止模型过拟合,增加模型的泛化性. 模型的训练损失函数曲线如图9所示. 其中,Lbox为边界框损失,Lcls为分类损失,Ni为训练轮次. 从图9可以看出,在模型训练开始后的前50个轮次内,2种损失函数值均不断下降,并在第150个轮次时,损失函数的收敛趋于稳定. 所有的模型都训练150个轮次,批大小设置为16.
图 9
2.3. 实验评价指标
对于铁路安全穿戴检测模型的边缘部署,必须兼顾模型的检测精度和复杂度. 选用精确率P(precision)、召回率R(recall)、平均精度(mAP)、参数量Np、计算量FLOPs、推理速度v作为评价性能的指标. 其中,mAP50为IoU阈 值为0.5时的AP均值,mAP50∶95为IoU阈值为0.5~0.95时以0.05为步长的AP均值. 参数量和计算量用于评估模型的复杂程度. 降低参数量与计算量对于提高目标检测算法的运行效率和资源利用率至关重要. 精确率、召回率、mAP用于评估模型的准确性,具体的计算公式为
式中:TP为模型正确预测的正样本数量,FP为模型错误预测的正样本数量,FN为模型错误预测的负样本数量,N为物体类别总数.
2.4. 不同改进方式下的MSF模块对比实验
为了验证PConv引入SSFF模块的最佳位置,将PConv引入位置A称为MSF1,将PConv引入位置B称为MSF2,将PConv同时引入位置A和B称为MSF. 该结构如图10所示.
图 10
图 10 PConv所引入SSFF结构中的不同位置
Fig.10 Different positions of PConv in SSFF structure
从表2可知,相较于基线模型,3种改进方式对模型的精确率和平均精度均有所改善,当PConv只加在A处时,模型的精确率和mAP50分别提升了1.1%和0.7%. 当PConv只加在B处时,模型的精确率和mAP50分别上升了1.4%和0.6%. 在A、B两处位置同时加上PConv,比单独在A处或单独在B处加PConv的性能更好,改进后模型的精确率和mAP50显著提升,分别提升了2%和1.4%,且相较于其他2种改进方式的MSF模块,mAP50:95最高,达到66.9%. 综上所述,保留MSF结构.
表 2 不同改进方式的MSF模块性能结果对比
Tab.2
| 模块 | 卷积 位置 | P/% | R/% | mAP50/ % | mAP50:95/ % | FLOPs/109 | Np/106 |
| 基线模型 | — | 94.4 | 90.3 | 94.8 | 65.4 | 6.3 | 2.58 |
| MSF1 | A | 95.5 | 90.1 | 95.5 | 66.7 | 6.3 | 2.95 |
| MSF2 | B | 95.8 | 89.9 | 95.4 | 66.4 | 6.3 | 2.95 |
| MSF | A+B | 96.4 | 90.8 | 96.2 | 66.9 | 6.3 | 2.96 |
2.5. 不同颈部网络结构的对比实验
表 3 不同颈部网络结构的性能对比
Tab.3
| 模型 | P/% | R/% | mAP50/ % | mAP50:95/ % | FLOPs/109 | Np/106 |
| 基线模型 | 94.4 | 90.3 | 94.8 | 65.4 | 6.3 | 2.58 |
| BiFPN | 95.1 | 90.1 | 95.3 | 66.9 | 6.3 | 1.92 |
| AFPN | 95.6 | 91.2 | 95.7 | 66.8 | 8.8 | 2.65 |
| GFPN | 95.2 | 90.8 | 95.6 | 67.1 | 8.2 | 3.66 |
| MSF | 96.4 | 90.8 | 96.2 | 66.9 | 6.3 | 2.96 |
从表3可知,MSF结构的综合性能优于其他3种颈部网络结构. 相较于基线模型,在保证参数量和计算量不明显增加的前提下,精确率和平均精度的提升最高. MSF通过融合来自骨干网络不同层级的特征,特别增强了浅层特征的利用,这些浅层特征包含更丰富的细节与位置信息,对检测像素占比较少的小尺度目标具有关键作用. 参数量和计算量适度增长,是由于引入了更多针对小目标设计的浅层特征融合路径及相应的小感受野检测机制,从而在有限的复杂度内显著增强对小目标的敏感度. MSF结构在显著提升小尺寸安全帽召回率的同时,有效平衡了检测效率与模型复杂度.
采用MSF作为YOLOv11模型的颈部网络. 该结构通过高效融合多尺度特征信息,尤其注重浅层细节特征的传递与增强,提升了对小尺度目标的表征能力与识别精度,使模型在复杂背景下能够可靠地捕捉关键目标. 这不但优化了模型的特征表达能力,而且为铁路安全穿戴检测中小目标漏检问题提供了高效、可靠的解决方案,具有良好的实用性与推广价值.
2.6. 不同类型卷积的对比实验
表 4 不同类型卷积的性能对比
Tab.4
| 方法 | P/% | R/% | mAP50/ % | mAP50:95/ % | FLOPs/109 | Np/106 |
| 基线模型 | 94.4 | 90.3 | 94.8 | 65.4 | 6.3 | 2.58 |
| DSConv | 94.4 | 89.3 | 94.8 | 65.3 | 4.3 | 1.99 |
| DWConv | 94.0 | 89.9 | 94.9 | 65.5 | 4.1 | 1.92 |
| GhostConv | 95.6 | 90.4 | 95.1 | 66.3 | 4.8 | 2.25 |
| ODConv | 95.8 | 89.6 | 95.3 | 66.4 | 9.5 | 4.60 |
| GSConv | 95.9 | 89.9 | 95.3 | 66.5 | 4.8 | 2.25 |
从表4可知,GSConv新型卷积的综合性能比其他4种类型的卷积性能更好,相较于基线模型,精确度和平均精度提升最高,参数量和计算量有所下降. 保留GSConv作为YOLOv11模型的卷积模块. GSConv卷积作为YOLOv11网络中的核心模块,平衡了轻量级设计、计算效率和内存使用. 这不仅增强了模型的特征选择能力,而且适合实时性要求高的图像检测. 通过动态调整通道权重,重点关注目标区域并隐藏相关性不大的信息,提高了模型的检测精度和稳健性. 此外,可以在计算资源有限的设备上高效运行,能够更好地适应复杂环境下的检测任务.
2.7. 不同改进方式的VABlock模块对比实验
分别在原有VoVGSCSP结构中的A、B、C和D 4个位置,利用AKConv模块替换原有的CBS模块,以及在E位置处直接新增AKConv模块,分别独立设计5种不同类型的VABlock结构. 该结构如图11所示.
图 11
图 11 AKConv所引入VoVGSCSP结构中的不同位置
Fig.11 Different position of AKConv in VoVGSCSP structure
从表5可知,当AKConv位于 E 位置时,该结构的性能最优. 相较于基线模型,在保证模型参数量和计算量变化很小的同时,模型精确度和mAP50明显上升,分别提升了1.8%和0.8%,且相较于其他几种结构的VABlock,该结构的mAP50:95提升最多,提升了1.3%,因此保留该有效性结构.
表 5 不同结构的VABlock模块性能对比
Tab.5
| 模块 | AKConv位置 | P/% | R/% | mAP50/% | mAP50:95/% | FLOPs/109 | Np/106 |
| 基线模型 | — | 94.4 | 90.3 | 94.8 | 65.4 | 6.3 | 2.58 |
| VABlock1 | A | 95.1 | 86.0 | 94.8 | 62.8 | 5.4 | 2.49 |
| VABlock2 | B | 94.7 | 89.6 | 94.0 | 66.1 | 5.4 | 2.49 |
| VABlock3 | C | 93.6 | 86.2 | 95.6 | 60.3 | 6.0 | 2.93 |
| VABlock4 | D | 95.5 | 89.1 | 92.7 | 60.9 | 5.3 | 2.59 |
| VABlock | E | 96.2 | 89.4 | 95.6 | 66.7 | 4.8 | 2.19 |
2.8. VABlock在遮挡场景下的有效性分析
为了验证VABlock在解决遮挡问题上的有效性,分别生成应用VABlock与原始模型的特征提取热力图进行对比. 如图12所示,相比原始YOLOv11n模型,引入VABlock后的模型更加关注待测物体本身,显著抑制了遮挡物与背景对检测产生的干扰,使模型在遮挡条件下能够保持较高的检测精度.
图 12
图 12 引入VABlock前、后对遮挡图像的特征提取热力图对比
Fig.12 Comparison of feature extraction heatmap for occluded image before and after introducing VABlock
2.9. 消融实验
为了验证VABlock轻量化特征提取模块、MSF特征融合结构、SE2SPPF特征融合模块对改进后的Yolov11n模型检测性能的提升效果及模型轻量化效果,开展消融实验. 消融实验结果如表6所示.
表 6 消融实验结果
Tab.6
| 模型 | VABlock | MSF | SE2SPPF | P/% | R/% | mAP50/% | mAP50:95/% | FLOPs/109 | Np/106 |
| YOLOv11n | — | — | — | 94.4 | 90.3 | 94.8 | 65.4 | 6.3 | 2.58 |
| V-YOLO | √ | — | — | 96.2 | 89.4 | 95.6 | 66.7 | 6.0 | 2.19 |
| M-YOLO | — | √ | — | 96.4 | 90.8 | 96.2 | 66.9 | 7.7 | 2.96 |
| S-YOLO | — | — | √ | 96.3 | 89.3 | 95.9 | 66.7 | 6.3 | 2.62 |
| VM-YOLO | √ | √ | — | 96.6 | 89.5 | 96.3 | 67.1 | 7.1 | 2.41 |
| VS-YOLO | √ | — | √ | 96.4 | 91.6 | 96.5 | 67.3 | 6.0 | 2.22 |
| MS-YOLO | — | √ | √ | 96.8 | 91.4 | 96.7 | 67.5 | 7.7 | 2.99 |
| VMS-YOLO | √ | √ | √ | 98.0 | 92.5 | 97.5 | 67.8 | 7.1 | 2.45 |
从表6可知,当单独引入VABlock时,模型的精确度、mAP50和mAP50:95分别提升了1.8%、0.8%和1.3%,计算量和参数量分别下降了4.7%和15%. 单独引入MSF模块时,模型精确度、mAP50和mAP50:95分别提升了2%、1.4%和1.5%,但模型大小和参数量均有所上升. 当单独引入SE2SPPF结构时,在保持大小和参数量变化不大的同时,模型精确度、mAP50和mAP50:95分别提升了1.9%、1.1%和1.3%. 上述结果表明,3个模块对模型的检测和轻量化效果均有不同程度的提升. 当VABlock模块分别与MSF和SE2SPPF组合时,模型的精确率和平均精度均明显上升,同时相较于单独使用MSF和SE2SPPF模块时,模型计算量和参数量显著下降,证明了VABlock对模型轻量化的有效性. 将3个模块组合在一起得到VMS-YOLO,与基线模型相比,尽管改进后的模型计算量有所上升,但模型参数量下降了5%,精确度、召回率、mAP50和mAP50:95分别上升3.6%、2.2%、2.7%和2.4%. 实验结果表明,提出的3个模块均能从不同角度优化模型性能,并在组合使用时产生协同增强的效果. VABlock通过跨阶段特征融合,为后续的处理环节提供了信息增强的特征表示. MSF通过多级特征加权,强化多尺度信息融合能力. SE2SPPF进一步提取多层次空间特征,对冗余信息进行过滤. 在三者的协同作用下,VMS-YOLO在检测精度与模型效率之间达到良好的平衡,尤其适用于铁路安全穿戴检测这类对小目标识别精度要求高且须兼顾轻量化部署的复杂场景.
2.10. 不同模型的对比实验
表 7 不同模型的检测性能对比结果
Tab.7
| 模型 | P/% | R/% | mAP50/% | mAP50:95/% | FLOPs/109 | Np/106 | v/(帧·s−1) |
| Faster R-CNN | 69.7 | 54.4 | 62.5 | 45.0 | 948.1 | 28.3 | 47 |
| SSD | 85.5 | 84.3 | 90.8 | 59.8 | 6.2 | 3.8 | 131 |
| Mamba-YOLO | 95.5 | 90.8 | 95.7 | 66.9 | 13.6 | 5.98 | 62 |
| GhostNetP2 | 93.4 | 84.9 | 91.8 | 56.9 | 7.3 | 1.45 | 167 |
| YOLO-Worldv2 | 95.3 | 91.7 | 95.6 | 66.9 | 9.6 | 3.53 | 152 |
| RT-DETR | 95.7 | 92.6 | 96.5 | 70.5 | 96.6 | 25.66 | 125 |
| YOLOv5n | 95.8 | 90.2 | 95.4 | 66.8 | 7.8 | 2.18 | 230 |
| YOLOv8n | 94.6 | 85.5 | 91.2 | 57.9 | 8.1 | 3.00 | 278 |
| YOLO11n | 94.4 | 90.3 | 94.8 | 65.4 | 5.5 | 2.58 | 197 |
| VMS-YOLO | 98.0 | 92.5 | 97.5 | 67.8 | 5.4 | 2.45 | 238 |
从表7可以看出,与提出的改进后的VMS-YOLO相比,GhostNetP2模型的参数量偏低,但在检测性能方面,模型的精确率、召回率及mAP50较低,难以满足复杂场景下对小目标检测精度的要求. 提出的VMS-YOLO更适用于铁路复杂场景下的小目标安全穿戴检测. Faster R-CNN、SSD、Mamba-YOLO、RE-DETR和YOLO-Worldv2的参数量和计算量过大,难以满足边缘设备上的轻量化部署需求. YOLOv5n、YOLOv8n和YOLO11n通过结构优化,提供了较优的检测精度,同时在参数量和计算量上有着良好的表现,但与VMS-YOLO相比,在模型边缘设备部署及小目标检测方面存在可提升的空间. 改进的VMS-YOLO模型在多个评价指标上具有明显的优势. VMS-YOLO模型的精确率、召回率、mAP50和mAP50:95分别达到98%、92.5%、97.5%和67.8,相较于YOLOv11n分别提升了3.6%、2.2%、2.7%和2.4%. 此外,VMS-YOLO模型的参数量压缩至2.45×106,与YOLOv11n相比降低了5.03%. VMS-YOLO的计算量低至5.4×109,推理速度达到238帧/s,在保证高精度的前提下,满足工业场景下边缘设备推理速度大于30帧/秒的部署需求. 实验证明,VMS-YOLO通过高效轻量化特征提取结构和多尺度特征融合结构以及空间金字塔特征融合结构设计,在保持模型高效推理的同时,有效解决了远景和复杂背景下的小目标漏检问题. 相较于现有的模型,改进后的模型在计算量、参数量和检测精度方面取得了最佳平衡,为铁路安全穿戴的实时检测提供了兼具鲁棒性与实用性的检测模型.
为了更直观地对比模型改进前、后对铁路复杂场景下小目标检测的效果,开展可视化分析. 如图13所示为模型改进前、后的部分检测结果展示. 与原始的YOLOv11n模型相比,改进后的VMS-YOLO模型在铁路复杂场景下的安全穿戴检测效果更佳. 图13中,第1列检测场景为目标遮挡场景,受背景机械影响,出现了安全帽被遮挡的现象,导致在YOLO11n检测时其中一个工人的安全帽被误检为反光背心,出现误检现象. VMS-YOLO可以更专注于待测物体的特征,提高特征提取能力,准确地检测和定位待测物体. 第2列为多目标的场景,此时待测物体的特征提取易被背景物体所干扰,增大小目标特征提取难度. 从图13可以看出,YOLOv11n存在安全帽漏检问题,利用提出的VMS-YOLO模型,能够正确检测所有待测目标,置信度较高. 第3列场景为雪天,铁路安全穿戴在雪地环境中易受干扰,白色背景与积雪覆盖会降低辨识度,影响视觉对比效果. 由于此时背景噪声较多,YOLOv11n的检测精度不高且出现了安全帽漏检的现象. 改进后的VMS-YOLO能够关注待测物体本身,在提高检测精度的同时,解决了漏检的问题. 第4列为小目标场景. 从图13可以看出,YOLOv11n对远景小目标的检测效果不好,出现了安全帽漏检的现象,而VMS-YOLO能够有效放大远景小目标特征并减少背景噪声干扰,成功检测出3类标签. 综上表明,提出的VMS-YOLO在铁路复杂场景下对远景安全穿戴小目标检测具有明显优势.
图 13
图 13 模型改进前、后的检测效果对比
Fig.13 Comparison of detection performance before and after model improvement
为了进一步验证改进后的VMS-YOLO模型在铁路场景中反光背心、安全帽及铁路工人3类检测目标上的检测性能,在同一数据集上对比改进前、后的模型检测结果,实验结果如表8所示.
表 8 改进前、后的各目标检测结果对比
Tab.8
| 模型 | vest | helmet | worker | FLOPs/109 | Np/106 | ||||||||
| P//% | R//% | mAP50/% | P/% | R/% | mAP50/% | P/% | R/% | mAP50/% | |||||
| YOLOv11n | 93.9 | 97.0 | 98.4 | 95.9 | 76.3 | 87.6 | 93.4 | 97.7 | 98.5 | 6.3 | 2.58 | ||
| VMS-YOLO | 96.8 | 99.5 | 99.8 | 98.5 | 78.2 | 92.8 | 98.5 | 99.8 | 99.8 | 5.4 | 2.45 | ||
从表8可以看出,与YOLOv11n相比,改进后的VMS-YOLO模型对反光背心、安全帽及铁路工人3类检测目标的检测精确率、召回率和平均精度均有显著提升,模型整体的参数量与计算量也均有明显下降.
2.11. 泛化实验
为了进一步验证所提VMS-YOLO在复杂环境下的泛化能力与实用性,选取来自公开数据集SHWD[30](safety-helmet-wearing dataset)的包含黑夜、强光、隧道及遮挡等情形的图片进行测试,结果如表9与图14所示. 定量结果表明,相较于YOLOv11n模型,VMS-YOLO在保持轻量化的同时,提高了检测精度. 在隧道场景和夜间场景中,受光照不足的影响,YOLOv11n存在明显的错检现象,而VMS-YOLO能够正确检测出待测物体. 在遮挡场景中,虽然两者均完成主要目标检测,但VMS-YOLO的检测精度明显优于YOLOv11n,置信度达到0.91. 在强光场景下,YOLOv11n出现了错检的现象,受高亮反射的干扰,漏检部分目标,VMS-YOLO有效抑制光照干扰且精度提高. 上述结果证明,VMS-YOLO在复杂环境下具备更强的特征提取与干扰抑制能力,显著提升了安全穿戴检测的泛化性与鲁棒性.
表 9 泛化实验结果
Tab.9
| 模型 | P/% | R/% | mAP50/% | mAP50:95/% | FLOPs/109 | Np/106 | v/(帧·s−1) |
| YOLOv11n | 90.1 | 83.3 | 87.1 | 58.4 | 6.3 | 2.58 | 198 |
| VMS-YOLO | 93.3 | 90.3 | 92.0 | 63.6 | 5.4 | 2.45 | 236 |
图 14
图 14 泛化实验的可视化结果对比
Fig.14 Comparison of visualization result from generalization experiment
3. 结 语
针对铁路作业场景复杂,安全穿戴目标小易漏检,边缘设备资源有限等问题,围绕特征提取、多尺度融合与上下文感知3个关键环节进行系统优化,提出基于改进YOLOv11n的VMS-YOLO轻量化检测模型. 其中,VABlock模块增强局部特征提取能力,MSF结构通过自适应加权机制实现多层次特征高效对齐与融合,SE2SPPF模块扩展感受野并过滤冗余信息. 三者协同增效,使得模型在精度与效率间取得良好的平衡:平均精度达到97.5%,参数量为2.45×106,计算量为5.4 ×109,在高端GPU上具备良好的实时性潜力. 目前,本研究尚未在真实边缘设备上进行端到端部署验证,后续将在Jetson系列主流边缘硬件上实测推理速度与能效,并设计针对困难样本的专用优化策略,以进一步提升模型在复杂场景下的泛化性与鲁棒性. 该协同优化思路可以为其他须兼顾精度与效率的视觉任务提供参考.
参考文献
《铁路轨道工程施工质量检测技术规程》主要技术标准研究
[J].DOI:10.20262/j.cnki.issn.2097-6186.2025.01.03 [本文引用: 1]
Research on the major technical regulations in technical code for constructional quality detection of railway track
[J].DOI:10.20262/j.cnki.issn.2097-6186.2025.01.03 [本文引用: 1]
基于YOLOv5改进的铁路工人安全帽检测算法研究
[J].DOI:10.16526/j.cnki.11-4762/tp.2024.03.011 [本文引用: 1]
Research on the detection algorithm of railway worker’s hard hat based on YOLOv5 improvement
[J].DOI:10.16526/j.cnki.11-4762/tp.2024.03.011 [本文引用: 1]
Faster R-CNN: towards real-time object detection with region proposal networks
[J].DOI:10.1109/TPAMI.2016.2577031 [本文引用: 1]
Fsd-detr: casting surface defect detection based on improved RT-DETR
[J].DOI:10.1007/s11554-025-01714-x [本文引用: 1]
基于YOLO v8的轻量化安全帽佩戴检测算法
[J].
Lightweight safety helmet wearing detection algorithm based on YOLO v8
[J].
Research on improved algorithm for helmet detection based on YOLOv5
[J].DOI:10.1038/s41598-023-45383-x [本文引用: 1]
GCW-YOLOv8n: 轻量级安全帽佩戴检测算法
[J].
GCW-YOLOv8n: lightweight safety helmet wearing detection algorithm
[J].
基于改进RT-DETR的铁路施工场景下人员安全穿戴检测
[J].DOI:10.3969/j.issn.1001-8360.2025.02.010 [本文引用: 1]
Safety wear detection for personnel in railway construction scenarios based on improved RT-DETR
[J].DOI:10.3969/j.issn.1001-8360.2025.02.010 [本文引用: 1]
ASF-YOLO: a novel YOLO model with attentional scale sequence fusion for cell instance segmentation
[J].DOI:10.1016/j.imavis.2024.105057 [本文引用: 1]
基于多粒度融合和跨尺度感知的跨模态行人重识别
[J].
Cross-modality person re-identification based on multi-granularity fusion and cross-scale perception
[J].
GCL-YOLO: a GhostConv-based lightweight YOLO network for UAV small object detection
[J].DOI:10.3390/rs15204932 [本文引用: 1]
GhostNetv2: enhance cheap operation with long-range attention
[J].DOI:10.52202/068431-0724 [本文引用: 1]
/
| 〈 |
|
〉 |

