浙江大学学报(工学版), 2026, 60(10): 2165-2175 doi: 10.3785/j.issn.1008-973X.2026.10.009

计算机技术与控制工程

基于改进RT-DETR的复杂天气下铁路异物实时检测算法

牛宏侠,, 冯鼎超,, 侯涛

1. 兰州交通大学 自动化与电气工程学院,甘肃 兰州 730070

2. 兰州交通大学 甘肃省高原交通信息工程及控制重点实验室,甘肃 兰州 730070

Real-time detection algorithm for railway foreign objects in complex weather conditions based on improved RT-DETR

NIU Hongxia,, FENG Dingchao,, HOU Tao

1. School of Automation and Electrical Engineering, Lanzhou Jiaotong University, Lanzhou 730070, China

2. Key Laboratory of Plateau Traffic Information Engineering and Control of Gansu Province, Lanzhou Jiaotong University, Lanzhou 730070, China

收稿日期: 2025-08-28  

基金资助: 甘肃省重点研发计划-工业类项目(23YFGA0049);兰州市人才创新创业项目(2023-RC-13);甘肃省科技专员专项(24CXGA020).

Received: 2025-08-28  

Fund supported: 甘肃省重点研发计划-工业类项目(23YFGA0049);兰州市人才创新创业项目(2023-RC-13);甘肃省科技专员专项(24CXGA020).

作者简介 About authors

牛宏侠(1978—),女,副教授,从事计算机视觉与智能控制研究.orcid.org/0009-0001-3837-9752.E-mail:nhx56055@mail.lzjtu.cn , E-mail:nhx56055@mail.lzjtu.cn

摘要

提出基于改进RT-DETR的复杂天气下铁路异物检测算法FRP-DETR. 引入特征互补映射模块(FCM)与Pzconv单元,通过构建浅层空间细节与深层语义信息弥补单一尺度特征表达的局限性,两者协同增强小目标和边缘目标的感知能力;引入铁路感知调制融合模块(RMFM),基于自适应通道注意力与空间调制机制,增强模型对铁路场景关键语义信息的响应能力;以风车状卷积(PSConv)替代原始下采样模块,通过多方向非对称填充与分离卷积强化边缘纹理提取. 基于SaMam风格迁移方法,将晴天铁路异物图像迁移至雨天、雾天、雪天等场景,构建了包含4种天气条件的铁路异物检测数据集. 实验结果表明,相比原RT-DETR-R18模型,所提方法在mAP@0.5和mAP@0.5:0.95上分别提升了1.65个百分点和3.4个百分点,参数量降低63.5%,推理速度达到88 帧/s,实验结果验证了FRP-DETR在复杂天气下的铁路异物检测任务中兼具高精度、轻量化与实时性优势.

关键词: 铁路异物检测 ; 复杂天气 ; 特征融合 ; 实时检测 ; 风格迁移

Abstract

A railway foreign object detection algorithm for complex weather conditions based on an improved RT-DETR, named FRP-DETR, was proposed. A feature complementary mapping module (FCM) and Pzconv units were introduced, which built complementary paths between shallow spatial details and deep semantic information to compensate for the limitations of single-scale feature representation, with the two components working collaboratively to enhance the perception capabilities of small and edge targets. A railway perception modulation fusion module (RMFM) was introduced, which was based on adaptive channel attention and spatial modulation mechanisms to enhance the model’s response to key semantic information in railway scenes. The original downsampling module was replaced with pinwheel-shaped convolution (PSConv), which enhanced edge texture extraction through multi-directional asymmetric padding and separable convolution. A railway foreign object detection dataset containing four weather conditions was constructed based on the SaMam style transfer method, by transferring sunny railway foreign object images to rainy, foggy, and snowy scenes. Experimental results showed that compared to the original RT-DETR-R18 model, this method achieved improvements of 1.65 percentage points and 3.4 percentage points in mAP@0.5 and mAP@0.5:0.95, respectively, with a 63.5% reduction in parameter count and an inference speed of 88 frames per second. The results verified that FRP-DETR achieved high accuracy, lightweight design, and real-time performance in railway foreign object detection under complex weather conditions.

Keywords: railway foreign object detection ; complex weather ; feature fusion ; real-time detection ; style transfer

PDF (7802KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

牛宏侠, 冯鼎超, 侯涛. 基于改进RT-DETR的复杂天气下铁路异物实时检测算法. 浙江大学学报(工学版)[J], 2026, 60(10): 2165-2175 doi:10.3785/j.issn.1008-973X.2026.10.009

NIU Hongxia, FENG Dingchao, HOU Tao. Real-time detection algorithm for railway foreign objects in complex weather conditions based on improved RT-DETR. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(10): 2165-2175 doi:10.3785/j.issn.1008-973X.2026.10.009

随着我国铁路交通网络的快速发展,铁路运输已成为国民经济发展的重要支撑. 然而,铁路沿线环境复杂多变,异物入侵事件时有发生,甚至可能引发重大交通事故,给人民生命财产安全带来巨大威胁[1]. 因此,建立高效、准确的铁路异物入侵检测系统对保障铁路运输安全具有重要意义.

近年来,基于视觉的目标检测方法在铁路异物检测领域展现出巨大潜力[2-6]. 目前,主流的目标检测算法主要分为2类:两阶段方法(如R-CNN系列[7-9])和单阶段方法(如YOLO系列[10-12]、SSD[13]). 两阶段方法虽然检测精度较高,但推理速度慢;单阶段方法推理速度快但在小目标检测和复杂场景下精度有限. 近年来,基于Transformer的目标检测算法DETR[14]及其改进版本[15-17]在精度上取得了显著突破,但其推理速度较慢.

针对铁路异物检测任务,邵磊等[18]基于YOLOv8降低了参数量和计算量,但所提模型在复杂场景下精度不足;高修强等[19]基于改进Mask R-CNN提升了检测精度,但模型复杂度大且难以部署. 百度PaddlePaddle团队提出的RT-DETR[20]在保持高精度的同时大幅提升了推理速度,实现了精度与速度的良好平衡. 然而,在铁路异物检测的实际应用中,RT-DETR仍面临以下挑战:1)复杂天气适应性不足,沙尘、雨天、雪天等天气导致图像退化严重;2)小目标感知能力有限,铁路场景中的异物往往尺寸较小且位于复杂背景中;3)边缘设备部署时参数量和计算开销过大.

针对上述挑战,本研究提出基于改进RT-DETR的复杂天气下铁路异物实时检测算法FRP-DETR. 本研究的主要贡献如下. 1)采用特征互补映射模块(feature complementary mapping module, FCM)[21]与Pzconv特征提取单元,构建层级式空间-语义协同提取的骨干结构,增强对小目标和边缘目标的感知能力. 2)设计铁路感知调制融合模块(railway perception modulation fusion module, RMFM),采用自适应注意力机制对多尺度特征进行加权选择性融合,减少冗余信息干扰,提升网络对关键信息的响应能力. 3)引入风车状卷积模块(pinwheel-shaped convolution, PSConv)[22]替换原始下采样模块,通过多方向非对称填充与分离卷积,增强边缘纹理特征提取能力,扩大模型感受野范围. 4)基于SaMam[23]风格迁移方法构建包含4种天气条件的铁路异物检测数据集,为复杂天气下的模型训练和评估提供了数据支撑.

1. RT-DETR介绍

为了确保模型选择的合理性,选择RT-DETR作为基线模型,主要基于以下考虑:1)RT-DETR通过高效混合编码器和多尺度解码结构实现了Transformer检测器中较优的实时性能;2)其无锚点结构在处理不规则异形目标时更具灵活性;3)自注意力机制能够捕获长距离依赖关系,有助于保持轨道区域的空间一致性特征表达;4)编码器-解码器结构便于集成本研究提出的改进模块. RT-DETR结构如图1所示.

图 1

图 1   RT-DETR结构图

Fig.1   RT-DETR structure diagram


2. 改进RT-DETR模型设计

2.1. 特征互补映射模块与Pzconv特征提取单元

为了应对铁路异物检测中因雨天、雪天、沙尘等复杂天气导致的图像退化问题,在此基础上对 RT-DETR-R18 原有主干网络结构进行改进. 其核心特征提取单元为多个 BasicBlock 残差模块,残差结构具备较强的语义表达和特征提取能力.

在低质量图像(如雨天模糊、沙尘天气)中,BasicBlock 更倾向提取局部纹理,易忽略空间位置信息;模型对小目标、边缘目标的空间感知能力弱,容易出现漏检.

为了解决上述问题,将原始主干网络中的残差模块 BasicBlock 替换为Pzconv和逐层堆叠的特征互补映射模块(feature complementary mapping, FCM),构建了一个层级式空间-语义协同提取的骨干结构. FCM结构图如图2所示.

图 2

图 2   特征互补映射模块(FCM)结构示意图

Fig.2   Structure diagram of feature complementary mapping module (FCM)


在FCM模块中,首先将输入特征$ {\boldsymbol{X}}^{\text{input}} $的通道进行拆分,将通道分为αC通道和(1−αC通道,其中α作为分割比例(0≤α≤1.0),控制空间分支与语义分支的通道分配. 分割操作可以表述为

$ ({\boldsymbol{X}}_{1},{\boldsymbol{X}}_{2})=\text{Split}({\boldsymbol{X}}^{\text{input}}). $

式中:$ {\boldsymbol{X}}_{1}\in {{R}}^{\alpha C\times H\times W} $$ {\boldsymbol{X}}_{2}\in {{R}}^{(1-\alpha )C\times H\times W} $C为通道数;H为高度,W为宽度.

为了分别获得语义和位置信息的空间映射,将得到的语义分支$ {\boldsymbol{X}}_{1} $发送到标准 3×3 卷积组成的分支,得到通道特征$ {\boldsymbol{X}}_{\text{C}} $;空间分支$ {\boldsymbol{X}}_{2} $发送到由逐点卷积组成的分支中,可以保留大部分的浅层空间位置信息,得到空间特征$ {\boldsymbol{X}}_{\text{S}} $. 转换过程表达式如下:

$ ({\boldsymbol{X}}_{\text{C}},{\boldsymbol{X}}_{\text{S}})={{\phi }}_{1}({\boldsymbol{X}}_{1},{\boldsymbol{X}}_{2}). $

式中:$ {{\phi }}_{1} $表示学习空间和语义信息之间的映射关系,$ {\boldsymbol{X}}_{\text{C}}\in {{R}}^{C\times H\times W} $包含丰富的通道信息,$ {\boldsymbol{X}}_{\text{S}}\in {{R}}^{C\times H\times W} $可以保留更多原始的空间位置信息.

首先,使用深度卷积对每个通道进行卷积运算,切断通道之间的信息,表达式如下:

$ \boldsymbol{X}_{\text{D}}^{i}={{\phi }}_{2}({k}_{i},\boldsymbol{X}_{\text{C}}^{i}) .$

式中:${{\phi }}_{2} $表示深度卷积操作,$k_i $为第i个深度卷积核.

接下来进行全局平均池化,获取通道的全局信息,最后通过Sigmoid函数获取通道中的唯一权重,该过程可以表示为

$ {\boldsymbol{\omega }}_{1}={R}\left(\frac{1}{H W}\sum \limits_{i=0}^{H}\sum \limits_{j=0}^{W}{\boldsymbol{X}}_{\text{D}}(i,j)\right). $

式中:${R} $表示激活函数,$ {\boldsymbol{\omega }}_{1}\in {{R}}^{C\times 1\times 1} $.

为了进一步聚合空间信息,由1×1空间卷积层、归一化和Sigmoid函数组成一个类似于通道交互的空间注意力图,并将其映射到经过3×3标准卷积的分支上,使其更加专注于空间信息,生成空间信息权重的过程可以表示为

$ {\boldsymbol{\omega }}_{2}={R}({F}({\boldsymbol{X}}_{\text{S}})) .$

式中:${F} $表示具有空间聚合的卷积映射,$ {\boldsymbol{\omega }}_{2}\in {{R}}^{1\times H\times W} $. 在得到通道信息权重和空间信息权重后,分别映射到包含$ {\boldsymbol{X}}_{\text{S}} $$ {\boldsymbol{X}}_{\text{C}} $的特征上. 然后将2个分支连接在一起得到特征$ {\boldsymbol{X}}_{\text{FCM}} $,其中包含具有空间和语义关系双重映射的特征. $ {\boldsymbol{X}}_{\text{FCM}} $计算公式为

$ {\boldsymbol{X}}_{\text{FCM}}=({\boldsymbol{X}}_{\text{C}}\otimes {\omega }_{2})\oplus ({\boldsymbol{X}}_{\text{S}}\otimes {\omega }_{1}). $

FCM是将更多的空间位置信息整合到丰富语义特征中,增强小物体的表征能力. 而Pzconv是利用不同的卷积核捕获跨多个尺度的目标信息,其结构图如图3所示.

图 3

图 3   Pzconv特征提取单元结构示意图

Fig.3   Structure diagram of Pzconv feature extraction unit


整个过程可以表示为

$ {{\boldsymbol{X}}^{\prime}}={{T}}_{2k+1}({A}(\cdots {A}({{T}}_{k}(\boldsymbol{X}))\cdots )) .$

与原始FCM不同,本研究针对铁路异物检测任务进行结构优化.

首先,在原始单向语义映射机制的基础上,引入空间-语义双向互补结构,使浅层空间特征能够反向增强高层语义表达,从而更好地捕获细粒度的异物边缘信息. 其次,须说明的是,本研究中的 FCM 模块与 Pzconv 单元为协同设计结构,两者共同替换了原 backbone 中的 BasicBlock. 此外,本研究在铁路异物检测数据集上对通道融合系数α进行了重新优化,以平衡不同尺度特征的权重分配.

2.2. RMFM模块

传统特征拼接融合方式(Concat)在复杂天气条件中易引入冗余信息,导致检测误判. 为此,本研究设计并引入铁路感知调制融合模块(railway-aware modulation fusion module, RMFM),用于在多尺度特征融合阶段,对不同来源的特征图进行加权选择性融合. 其结构图如图4所示.

图 4

图 4   铁路感知调制融合模块(RMFM)结构示意图

Fig.4   Structure diagram of railway-aware modulation fusion module (RMFM)


在RMFM中,设输入特征为:$ \{{\boldsymbol{F}}_{i}\}_{i=1}^{n} $,其中$ {\boldsymbol{F}}_{i}\in {{R}}^{{{C}_{i}}\times H\times W} $. 为了将通道数统一,将所有的输入特征映射至相同的维度$ C $,表达式如下:

$\left. \begin{split} \boldsymbol{F}_i^{\prime}=&{\phi}_i\left(\boldsymbol{F}_i\right). \\{\phi}_i=& \begin{cases}\text { Conv }_{1 \times 1}, & C_i \neq C; \\ \text { Identity, } & C_i=C.\end{cases}\end{split}\right\} $

随后将所有对齐后的特征堆叠为四维张量:

$ \boldsymbol{F}=\text{Stack}(\boldsymbol{F}_{1}^{\prime},\boldsymbol{F}_{2}^{\prime},\cdots ,\boldsymbol{F}_{n}^{\prime})\in {{R}}^{n\times C\times H\times W} .$

对每个输入特征求和并执行全局平均池化(GAP)操作,提取其通道级全局描述:

$ \boldsymbol{F}_{\mathrm{sum}}=\sum_{i=1}^n \boldsymbol{F}_i^{\prime}, $

$ \boldsymbol{z}=\text{GAP}({\boldsymbol{F}}_{\text{sum}})\in {{R}}^{C} .$

随后,将${\boldsymbol{z}} $输入一个轻量化多层感知机(MLP),用于捕捉通道间的非线性关系并生成初步注意力权重:

$ \boldsymbol{\alpha }=\text{MLP}(\boldsymbol{z})\in {{R}}^{n\times C} .$

随后,采用通道的 Sigmoid 激活方式获得每一通道的响应度并重塑为注意力权重,该权重在铁路异物检测数据集上训练得到,能自适应捕获轨道区域与异物区域的特征分布模式:

$ {\boldsymbol{A}}_{i}=\sigma ({\boldsymbol{a}}_{i})\in {{R}}^{n\times C}. $

为了防止注意力叠加失衡,进一步对每个通道的权重系数在所有输入分支上进行归一化处理:

$ {{\tilde{\boldsymbol{A}}}}_{i}=\dfrac{{\boldsymbol{A}}_{i}}{\sum \limits_{j=1}^{n}{\boldsymbol{A}}_{j}+\varepsilon \times {\boldsymbol{I}} }. $

式中:$ \varepsilon $为常数(通常取$ {10}^{-6} $),可以防止分母为零;I为单位矩阵.

随后,通过逐通道加权方式对多个输入特征进行融合,得到融合后的输出特征:

$ \boldsymbol{F}_{\text {out }}=\displaystyle\sum_{i=1}^n \tilde{\boldsymbol{A}}_i \cdot \boldsymbol{F}_i^{\prime}. $

在铁路场景中,由于轨道区域在空间上呈长条分布、纹理规律显著,RMFM 模块通过在铁路异物检测数据集上的端到端训练,自适应学习到轨道区域的特征分布规律.

2.3. PSConv模块

为了进一步增强下采样阶段的特征提取能力并扩大模型的感受野范围,PSConv 模块嵌入于特征融合阶段(Neck 部分),用于替代原结构中的3×3卷积层. 其结构图如图5所示.

图 5

图 5   风车状卷积模块(PSConv)结构示意图

Fig.5   Structure diagram of pinwheel-shaped convolutional module (PSConv)


与原PSConv不同,本研究针对铁路图像中轨道与枕木呈纵向分布的特性,将原四方向非对称填充公式调整为纵向偏置形式:

$ \left.\begin{split} & \boldsymbol{X}_0=\operatorname{Pad}_{\left(k, 0, \tfrac{k}{2}, 0\right)}(\boldsymbol{X}) , \\& \boldsymbol{X}_1=\operatorname{Pad}_{\left(0, k, 0, \tfrac{k}{2}\right)}(\boldsymbol{X}), \\& \boldsymbol{X}_2=\operatorname{Pad}_{\left(\tfrac{k}{2}, \tfrac{k}{2}, 0,0\right)}(\boldsymbol{X}) , \\& \boldsymbol{X}_3=\operatorname{Pad}_{\left(0,0, \tfrac{k}{4}, \tfrac{k}{4}\right)}(\boldsymbol{X}) .\end{split}\right\}$

其中,前2项增加上下方向填充量,以扩大纵向感受域,从而增强模型对轨道方向纹理和异物边缘的感知能力. 该纵向偏置填充策略使PSConv更适应铁路场景的几何特征.

随后,PSConv 将4个填充方向的特征图分别送入2个方向的分离式卷积核中:横向采用(1, k)卷积以增强对垂直边界的感知能力,纵向采用(k, 1)卷积以加强对水平边界的表达:

$ \left.\begin{split} &{\boldsymbol{Y}}_{{\mathrm{w}}0}={\phi }\left(\text{BN}\left({\text{Conv}}_{{(1,k),s=2}}({\boldsymbol{X}}_{0})\right)\right),\\&{\boldsymbol{Y}}_{{\mathrm{w}}1}={\phi }\left(\text{BN}\left({\text{Conv}}_{{(1,k),s=2}}({\boldsymbol{X}}_{1})\right)\right),\\&{\boldsymbol{Y}}_{{\mathrm{h}}0}={\phi }\left(\text{BN}\left({\text{Conv}}_{{(k,1),s=2}}({\boldsymbol{X}}_{2})\right)\right),\\&{\boldsymbol{Y}}_{{\mathrm{h}}1}={\phi }\left(\text{BN}\left({\text{Conv}}_{{(k,1),s=2}}({\boldsymbol{X}}_{3})\right)\right).\end{split}\right\}$

其中,每个方向卷积的输出通道数均为C'/4,通过这种分支策略,模型能够分别捕捉水平、垂直、左斜、右斜方向的信息,构建多角度的局部结构感知能力.

为了整合不同方向上捕获的特征,PSConv 将4个子卷积路径的输出在通道维度上进行拼接,如图5所示,形成一个增强后的综合特征图:

$ {\boldsymbol{Y}}_{\text{cat}}=\text{Concat}[{\boldsymbol{Y}}_{\text{w0}},{\boldsymbol{Y}}_{\text{w1}},{\boldsymbol{Y}}_{\text{h0}},{\boldsymbol{Y}}_{\text{h1}}]\in {\bf{R}}^{{{C}^{\prime}}\times \tfrac{H}{2}\times \tfrac{W}{2}}. $

该拼接操作不仅保持了各方向信息的完整性,也为后续的融合操作提供了语义丰富的输入.

最后,为了统一不同方向的语义表征并压缩特征维度,PSConv 使用一个小尺寸卷积核对拼接特征进行融合处理:

$ {\boldsymbol{Y}}_{\text{out}}={\phi }\left(\text{BN}\left({\text{Conv}}_{{(2,2),\;s=1,\;p=0}}({\boldsymbol{Y}}_{\text{cat}})\right)\right). $

引入 PSConv 后可在保持特征图尺寸变化一致的前提下,利用其旋转分块卷积核结构增强方向感知能力,从而使模型在铁路场景中对纵向轨道线特征与横向纹理变化更为敏感. 实验结果表明,这一改进能够在不显著增加计算复杂度的情况下有效提升检测精度和特征表达能力.

2.4. 改进铁路异物实时检测算法FRP-DETR结构

基于RT-DETR改进后的模型结构如图6所示. 在Backbone中部署FCM实现多尺度特征的级联增强和感受野扩展,集成Pzconv通过特征解耦降低深层网络的参数量和计算复杂度,在Neck部分采用RMFM模块进行逆向特征匹配和自适应融合,减少信息损失,使用PSConv对融合特征进行高效精炼. 这些改进协同作用,在保持检测性能的同时显著提升了模型的推理速度和计算效率,使其更适合实时铁路异物入侵检测任务.

图 6

图 6   FRP-DETR改进模型整体架构图

Fig.6   Overall architecture of improved FRP-DETR model


3. 实验结果与分析

3.1. 实验环境与参数配置

实验环境与参数配置如表12所示.

表 1   实验环境配置

Tab.1  Experimental environment configuration

配置版本号
操作系统Win11
CPUIntel Xeon Gold 5218r CPU
GPUNVIDIA RTX A5000
深度学习框架Pytorch2.6.0
编程语言Python3.10.14
CUDA12.4
显存24 GB

新窗口打开| 下载CSV


表 2   实验参数配置

Tab.2  Experimental parameter configuration

参数数值
Batch size(批次数)4
Epoch(迭代次数)200
Lr(学习率)0.0001
Workers(线程数)4
Imgsz(图像尺寸)640×640

新窗口打开| 下载CSV


3.2. 数据集构建

实验所用多天气风格迁移数据集基于自建铁路异物检测原始数据集,图片来源于兰州郊区铁路真实场景拍摄和部分网络铁路异物图片,采集图像覆盖了多种视角与光照条件(包括晴天、夜晚弱光环境、夜晚高光遮挡环境等),图像中包含行人、石头、非机动车、废桶、机动车、卡车、大型垃圾7类典型铁路异物入侵检测类别. 图像原始分辨率为1920×1080,并统一缩放至1280×720作为模型输入,异物类别标注标准基于YOLO格式txt文件,将数据集以7∶2∶1的比例分为训练集、验证集、测试集.

为了合成沙尘、雨天、雪天等复杂天气条件下的图像样本,引入了一种轻量化风格迁移方法 —— SaMam. 该方法具备优良的风格保真度与低计算开销,能够高效实现图像在不同天气风格之间的迁移. 其结构如图7所示.

图 7

图 7   SaMam风格迁移模型结构示意图

Fig.7   Structure diagram of SaMam style transfer model


最终构建的复杂环境下的铁路异物检测数据集共13244张图像. 类别分布如图8所示. 其中,NI表示样本数量.

图 8

图 8   铁路异物检测数据集中7类目标的样本数量分布统计图

Fig.8   Sample quantity distribution statistics for seven target categories in railway foreign object detection dataset


经风格迁移增强后的样本有效提升了数据集在复杂场景下的多样性与挑战性,为模型训练提供了丰富的外部扰动信息. 如图9所示,风格迁移后的图像在保持原始内容结构(如轨道、异物、背景不变)的同时,成功注入了目标天气风格(如雪花覆盖、雨幕模糊、沙尘颗粒感等),具有较高的视觉真实性与一致性.

图 9

图 9   风格迁移后的图像示例

Fig.9   Example of image after style transfer


3.3. 数据质量评估

为了验证基于 SaMam 风格迁移生成的复杂天气图像的质量,采用 Fréchet Inception Distance(FID)指标对生成数据与真实天气数据的分布差异进行量化评估.

评估结果如表3所示,FID 指标用来衡量生成图像的逼真程度,数值越低表示生成结果越接近真实图像,因此,基于风格迁移生成的复杂天气样本具有较好的视觉一致性与数据可用性,为模型提供了更具多样性的训练样本分布.

表 3   基于 SaMam 风格迁移的生成图像质量评估结果

Tab.3  Results of image quality evaluation based on SaMam style transfer

天气类型FID
晴天→雨天25.1
晴天→雪天22.8
晴天→沙尘天气18.4
平均值22.1

新窗口打开| 下载CSV


3.4. 实验评价指标

实验评价指标采用精度(Precision)、召回率(Recall)、所有类别平均精度(mAP)、参数量(parameters)、浮点运算次数(FLOPs)、F1-score、FPS性能评估指标评估本研究所提算法的性能.

$ \text{Precision}=\frac{\text{TP}}{\text{TP}+\text{FP}}, $

$ \text{Recall}=\frac{\text{TP}}{\text{TP}+\text{FN}}, $

$ \text{mAP=}{\frac{1}{N}\sum \limits_{{i=1}}^{{N}}\text{A}{\text{P}}_{{i}}}\times \text{AP=}\int \limits_{0}^{1}{P}({R})\text{d}R ,$

$ \text{FPS}={{N}_{\text{frames}}}/{{T}_{\text{total}}}, $

$ \text{F1-score}=\frac{2\times(\text{Precision} \times \text{Recall})}{\text{Precision}+\text{Recall}} .$

式中:TP为真正例,即正确检测到的目标数量;FP为假正例,即误检测的数量;FN为假负例,即漏检测的数量(目标存在但未检测到);APi为第i个类别的平均精度;P(R)dRP-R曲线下的面积积分;Nframes为处理的帧数总数;Ttotal为处理这些帧所用的总时间.

3.5. 消融实验

采取多种方法在RT-DETR-R18的基础上进行改进. 为了评估独立模块及不同模块之间组合的有效性与对算法性能的优化,在自建的复杂天气下的铁路异物入侵检测数据集上进行消融实验. 为了验证结果的稳定性,在不同随机种子且相同实验环境配置下进行了3次重复实验,FCM与Pzconv构成了同一数据特征单元,在接下来的实验表中对这一数据单元命名统称为FCM. 具体数据如表4所示,其中√代表替换该模块. 表4展示了8组消融实验的结果,用于评估FCM、RMFM与PSConv这3种模块的单独引入及组合引入对模型性能的影响. 相比基准模型(组别1),组别2引入FCM后mAP@0.5提升0.86个百分点,FLOPs下降9.1×109,参数量显著下降至约654万(降低67.1%),FPS提升了22帧/s. RMFM 模块使得 mAP@0.5 从 94.02% 提升至 95.11%,mAP@0.5:0.95 从 76.05% 提升至 78.21%. 组别5组合FCM与RMFM,mAP@0.5提升1.19个百分点,参数量为700万,降低64.8%,FLOPs下降3.1×109. 组别6组合FCM与PSConv,mAP@0.5提升1.41个百分点,参数量下降63.8%,FLOPs下降0.3×109. 组别7组合RMFM与PSConv,mAP@0.5提升1.16个百分点,参数量几乎不变,FLOPs下降0.7×109. 最终的组别8为完整引入3种模块的FRP-DETR模型,相比组别1,mAP@0.5提升1.65个百分点,mAP@0.5:0.95提升3.4个百分点,参数量下降12616116(降低约63.5%),FLOPs减少0.2×109,F1得分提高0.0195,FPS提升13帧/s,综合表现最优.

表 4   改进模型中各模块的消融实验结果对比

Tab.4  Comparison of ablation experiment results for each module in improved model

组别FCMRMFMPSConvmAP@0.5/%mAP@0.5:0.95/%ParametersFLOPs/109F1-scoreFPS/(帧·s−1
194.02(±0.1)76.051988074857.0920875
294.88(±0.5)78.04(±0.5)654168847.9925997
395.11(±0.3)78.21(±0.1)1971690855.0926177
495.09(±0.2)77.70(±0.1)1972622458.2926972
595.2179.01(±0.2)700248853.9935792
695.43(±0.1)79.11718955056.7930191
795.18(±0.1)78.261988758457.7930871
895.670.19)79.45(±0.3)726463256.8940388

新窗口打开| 下载CSV


从整体上看,三者协同优化了“特征提取-特征融合-空间建模”这一完整检测流程,验证了所提模块在多尺度特征表达与复杂天气条件下对铁路异物检测任务的协同提升作用,进一步证明了整体架构的有效性与可部署性.

3.6. 对比实验

3.6.1. 主流算法性能对比

为了进一步验证改进后的模型在自建的多天气条件下的铁路异物入侵检测任务中的优越性,如表5所示,将本研究算法与其原模型RT-DETR-R18,以及其他主流目标检测算法及同类改进算法,置于相同实验环境下进行对比实验. 可以看出,本研究算法在精度方面具有显著优势,mAP@0.5达到95.67%,mAP@0.5:0.95达到79.45%,均高于现有所有对比方法. 在模型复杂度方面,本研究算法的参数量仅为7.26 × 106,远小于其他方法,且计算开销(56.8×109)控制在较低水平,显示出良好的部署友好性. 在推理速度方面,本研究算法达到88 帧/s,满足工业场景对实时性的需求.

表 5   不同目标检测算法对比实验结果

Tab.5  Comparison of results from different object detection algorithms

方法mAP@0.5/%mAP@0.5:0.95/%ParametersFLOPs/109FPS/(帧·s−1)
RT-DETR-r1894.02(±0.3)76.05(±0.3)1988074857.075
SSD81.130.12)64.230.15)26578932.655
Faster R-CNN90.170.11)69.580.14)28304605908.914
Sparse R-CNN89.800.08)67.460.06)7783467723.248
YOLOv8m92.4474.582590874679.3101
YOLOv8l92.87(±0.1)74.84(±0.1)43691578168.068
YOLOv11m92.11(±0.1)76.01(±0.1)2000157967.794
YOLOv11l92.99(±0.1)75.03(±0.1)2541459787.064
TOOD[24]88.08(±0.1)70.64(±0.1)32001587199.023
DEIM[25]93.58(±0.2)76.06(±0.2)1926488756.781
文献[26]92.8874.581984754963.1121
本研究算法95.670.19)79.45(±0.3)726463256.888

新窗口打开| 下载CSV


3.6.2. FCM模块改进验证

为了验证FCM中通道融合系数α的合理性,如表6所示对不同α下(0.3、0.5、0.7、0.9)模型的检测性能进行消融分析. 针对α= 0.3、0.5、0.7、0.9,本研究中所用的α=0.7能较好地权衡两者,取得最优的检测效果.

表 6   不同通道融合权重α分析结果

Tab.6  Analysis results of channel fusion weight α

αmAP@0.5/%mAP@0.5:0.95/%
0.394.6577.70
0.594.8578.14
0.7(本研究)94.8878.04
0.995.7477.41

新窗口打开| 下载CSV


3.6.3. PSConv模块改进验证

为了验证PSConv中四方向非对称填充由均衡分布调整为针对铁路场景的纵向偏置填充的改进有效性,如表7所示为原版PSConv和改进后PSConv的性能分析.

表 7   PSConv 模块纵向偏置改进的有效性验证

Tab.7  Effectiveness verification of longitudinal offset improvement for PSConv module

模型版本mAP@0.5/%mAP@0.5:0.95/%
原版PSConv[22]94.8177.19
改进后(本研究)95.0977.70

新窗口打开| 下载CSV


3.6.4. MFM模块与RMFM对比分析

表8所示为 RMFM 模块相对于 MFM 模块的性能提升. 同时,采用Grad-CAM++技术对2种模块下的特征响应进行热力图可视化分析,结果如图10所示.

表 8   MFM与 RMFM 模块性能对比

Tab.8  MFM vs RMFM module performance comparison

模块名mAP@0.5/%mAP@0.5:0.95/%Parameters
MFM94.2175.9919436504
RMFM(本研究)95.1378.2119716908

新窗口打开| 下载CSV


图 10

图 10   MFM与RMFM模块特征响应热力图对比分析

Fig.10   Comparative analysis of feature response heatmaps between MFM and RMFM modules


3.7. 可视化分析
3.7.1. 定量化指标对比

图11所示,为了进一步验证改进方法在训练过程中的有效性,对比可视化了Baseline模型与改进模型在训练过程中的关键性能指标变化.

图 11

图 11   Baseline模型与改进模型在训练过程中的关键性能指标对比曲线

Fig.11   Comparison curves of key performance metrics during training between Baseline model and improved model


改进模型在检测精度和回归效果方面均优于Baseline,进一步验证了本研究提出方法的有效性与优越性.

3.7.2. 检测结果对比

为了直观对比本研究模型与Baseline的检测效果,从验证集中选取部分图像进行验证,验证结果如图1213所示. 可以看出,本研究方法在强干扰、低能见度、遮挡等极端条件下具有更强的鲁棒性和泛化能力,能有效解决中小目标易丢失和遮挡下定位不准的问题.

图 12

图 12   晴天和雪天条件下Baseline模型与本研究方法的检测结果对比

Fig.12   Detection result comparison between Baseline model and proposed method under clear and snowy weather conditions


图 13

图 13   沙尘和雨天条件下Baseline模型与本研究方法的检测结果对比

Fig.13   Detection result comparison between Baseline model and proposed method under sand and rainy weather conditions


3.7.3. 特征注意力热力图可视化

为了直观验证本研究的FCM、RMFM之类的改进模块是否有效提升了模型对目标区域的关注能力,如图1415所示,采用Grad-CAM++技术生成特征注意力热力图,对基准模型与改进模型的特征响应模式进行对比分析. 热力图可视化结果表明,改进模块有效引导模型将注意力集中到目标区域,减少背景干扰,提升了特征表达的判别性和检测性能的鲁棒性,证明了改进整体的有效性.

图 14

图 14   夜间低照度环境下Baseline模型与改进模型的特征注意力热力图对比

Fig.14   Feature attention heatmap comparison between Baseline model and improved model in night time low-illumination environment


图 15

图 15   密集目标遮挡场景下Baseline模型与改进模型的特征注意力热力图对比

Fig.15   Feature attention heatmap comparison between Baseline model and improved model in dense target occlusion scenarios


3.8. 泛化性验证

为了验证算法的跨场景泛化能力,在VisDrone2019公开数据集上进行测试. 实验采用零样本迁移策略. 模型在自建铁路数据集上训练后,直接在VisDrone2019验证集上测试,不进行任何微调. 为了保证公平性,所有对比算法均采用相同设置.

表9所示展示了本研究算法在VisDrone2019数据集上与基准模型的性能对比.可以看出,相比基准RT-DETR-R18,本研究方法在mAP@0.5上提升1.82个百分点,在mAP@0.5:0.95上提升2.36个百分点,同时参数量减少约63.5%,验证了改进模块的跨场景适应能力和特征表达的通用性.

表 9   VisDrone2019数据集上的泛化性实验结果

Tab.9  Results of generalizability experiments in VisDrone2019 dataset

模型mAP@0.5/%mAP@0.5:0.95/%Parameters
RT-DETR-r1836.7720.0919880748
本研究算法38.5922.457264632

新窗口打开| 下载CSV


4. 结 语

基于RT-DETR框架,通过引入FCM、RMFM和PSConv这3个关键模块,构建了复杂天气下铁路异物实时检测算法FRP-DETR,能够为复杂天气条件下的铁路安全监控提供有效技术支撑. 消融实验证明了各模块的有效性:FCM模块使参数减少了67.1%;RMFM模块使检测精度提升了0.89个百分点;PSConv模块增强了边缘特征提取能力. 基于SaMam风格迁移构建的多天气条件数据集为模型训练提供了有效支撑,验证了算法在复杂环境下的泛化能力. 相比基准RT-DETR-R18模型,FRP-DETR在mAP@0.5和mAP@0.5:0.95上分别提升1.65个百分点和3.4个百分点,达到95.67%和79.45%;同时实现了显著的轻量化,参数量减少63.5%至726万,计算开销降至56.8×109,推理速度提升至88 帧/s. 与其他主流目标检测算法相比,本研究方法在参数量相对较低的条件下取得了最高的检测精度. 可视化结果显示,改进算法在沙尘、雨天、雪天等恶劣天气下对中小目标具有更强的检测鲁棒性和定位准确性.

未来工作将重点关注模型的进一步轻量化设计和多帧时序融合机制,以提升边缘设备部署效率和动态场景检测稳定性.

参考文献

DONG W, FANG W, JIANG X, et al

Railway safety under increasing speed: train drivers’ hazard perception of foreign object intrusion on railway tracks

[J]. International Journal of Industrial Ergonomics, 2025, 105: 103684

DOI:10.1016/j.ergon.2024.103684      [本文引用: 1]

侯涛, 宝才文, 陈燕楠

基于自适应高斯混合模型的铁轨异物入侵检测研究

[J]. 光电子·激光, 2022, 33 (4): 403- 413

[本文引用: 1]

HOU Tao, BAO Caiwen, CHEN Yannan

Research on detection of foreign object intrusion in railroad tracks based on AGMM

[J]. Journal of OptoElectronics Lasers, 2022, 33 (4): 403- 413

[本文引用: 1]

PAN H, LI Y, WANG H, et al

Railway obstacle intrusion detection based on convolution neural network multitask learning

[J]. Electronics, 2022, 11 (17): 2697

DOI:10.3390/electronics11172697     

何文玉, 杨杰, 张天露

基于深度学习的轨道异物入侵检测算法

[J]. 计算机工程与设计, 2020, 41 (12): 3376- 3383

DOI:10.16208/j.issn1000-7024.2020.12.012     

HE Wenyu, YANG Jie, ZHANG Tianlu

Orbital foreign object intrusion detection algorithm based on deep learning

[J]. Computer Engineering and Design, 2020, 41 (12): 3376- 3383

DOI:10.16208/j.issn1000-7024.2020.12.012     

鞠逸凡. 基于深度学习的铁路周界异物入侵检测方法研究[D]. 青岛: 青岛科技大学, 2024

JU Yifan. Research on railroad perimeter foreign object intrusion detection method based on deep learing [D]. Qingdao: Qingdao University of Science and Technology, 2024.

ZHANG Z, CHEN P, HUANG Y, et al

Railway obstacle intrusion warning mechanism integrating YOLO-based detection and risk assessment

[J]. Journal of Industrial Information Integration, 2024, 38: 100571

DOI:10.1016/j.jii.2024.100571      [本文引用: 1]

REN S, HE K, GIRSHICK R, et al

Faster R-CNN: towards real-time object detection with region proposal networks

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 39 (6): 1137- 1149

DOI:10.1109/TPAMI.2016.2577031      [本文引用: 1]

SUN P, ZHANG R, JIANG Y, et al

Sparse R-CNN: an end-to-end framework for object detection

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2023, 45 (12): 15650- 15664

DOI:10.1109/TPAMI.2023.3292030     

HE K, GKIOXARI G, DOLLAR P, et al

Mask R-CNN

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2020, 42 (2): 386- 397

DOI:10.1109/TPAMI.2018.2844175      [本文引用: 1]

REDMON J, DIVVALA S, GIRSHICK R, et al. You only look once: unified, real-time object detection [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 779–788.

[本文引用: 1]

REDMON J, FARHADI A. YOLOv3: an incremental improvement [EB/OL]. (2018−04−08) [2026−04–16]. https://arxiv.org/abs/1804.02767.

BOCHKOVSKIY A, WANG C Y, LIAO H Y M. YOLOv4: optimal speed and accuracy of object detection [EB/OL]. (2020−04–23) [2026−04–16]. https://arxiv.org/abs/2004.10934.

[本文引用: 1]

LIU W, ANGUELOV D, ERHAN D, et al. SSD: single shot MultiBox detector [C]// Computer Vision – ECCV 2016. Cham: Springer, 2016: 21–37.

[本文引用: 1]

ZHU X, SU W, LU L, et al. Deformable DETR: deformable transformers for end-to-end object detection [EB/OL]. (2020–10−08) [2026−04–16]. https://arxiv.org/abs/2010.04159.

[本文引用: 1]

DAI X, CHEN Y, YANG J, et al. Dynamic DETR: end-to-end object detection with dynamic attention [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 2968–2977.

[本文引用: 1]

LI F, ZHANG H, LIU S, et al. DN-DETR: accelerate DETR training by introducing query denoising [EB/OL]. (2022−03−02) [2026−04–16]. https://arxiv.org/abs/2203.01305.

ZHANG H, LI F, LIU S, et al. DINO: DETR with improved denoising anchor boxes for end-to-end object detection [EB/OL]. (2022−03−07) [2026−04–16]. https://arxiv.org/abs/2203.03605.

[本文引用: 1]

邵磊, 李金钊, 李季, 等. 基于YOLOv8的轻量化高速铁路接触网异物入侵目标检测 [EB/OL]. (2024–12−02) [2026−04–16]. https://link.cnki.net/urlid/12.1374.N.20241130.1122.006.

[本文引用: 1]

高修强, 余星阳, 刘伯鹍, 等. 基于改进Mask R-CNN的轨道交通异物入侵模型研究 [J]. 自动化与仪表, 2025, 40(6): 111–115.

[本文引用: 1]

GAO Xiuqiang, YU Xingyang, LIU Bokun, et al. Research on foreign object intrusion model for rail transit based on improved mask R-CNN [J]. Automation and Instrumentation. 2025, 40(6): 111–115.

[本文引用: 1]

ZHAO Y, LV W, XU S, et al. DETRs beat YOLOs on real-time object detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 16965–16974.

[本文引用: 1]

XIAO Y, XU T, XIN Y, et al

FBRT-YOLO: faster and better for real-time aerial image detection

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39 (8): 8673- 8681

DOI:10.1609/aaai.v39i8.32937      [本文引用: 1]

YANG J, LIU S, WU J, et al

Pinwheel-shaped convolution and scale-based dynamic loss for infrared small target detection

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39 (9): 9202- 9210

DOI:10.1609/aaai.v39i9.32996      [本文引用: 2]

LIU H, WANG L, ZHANG Y, et al. SaMam: style-aware state space model for arbitrary image style transfer [EB/OL]. (2025−03–20) [2026−04–16]. https://arxiv.org/abs/2503.15934.

[本文引用: 1]

FENG C, ZHONG Y, GAO Y, et al. TOOD: task-aligned one-stage object detection [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 3490–3499.

[本文引用: 1]

HUANG S, LU Z, CUN X, et al. DEIM: DETR with improved matching for fast convergence [EB/OL]. (2024–12−05) [2026−04–16]. https://arxiv.org/abs/2412.04234.

[本文引用: 1]

杨文, 胡昊, 李凌志, 等

基于机器视觉的铁路限界入侵检测方法

[J]. 铁道科学与工程学报, 2025, 22 (3): 1328- 1343

[本文引用: 1]

YANG Wen, HU Hao, LI Lingzhi, et al

Railway boundary foreign object intrusion detection method based on machine vision

[J]. Journal of Railway Science and Engineering, 2025, 22 (3): 1328- 1343

[本文引用: 1]

/