浙江大学学报(工学版), 2026, 60(9): 1881-1889 doi: 10.3785/j.issn.1008-973X.2026.09.005

计算机技术、自动控制技术

基于改进EAST的高速公路交通标识文本检测

火久元,, 姜灏, 常琛

兰州交通大学 电子与信息工程学院,甘肃 兰州 730070

Text detection of highway traffic sign based on improved EAST

HUO Jiuyuan,, JIANG Hao, CHANG Chen

School of Electronics and Information Engineering, Lanzhou Jiaotong University, Lanzhou 730070, China

收稿日期: 2025-09-23  

基金资助: 国家自然科学基金资助项目(62262038);甘肃省重点研发计划资助项目(25YFGA045).

Received: 2025-09-23  

Fund supported: 国家自然科学基金资助项目(62262038);甘肃省重点研发计划资助项目(25YFGA045).

作者简介 About authors

火久元(1978—),男,教授,博士,从事计算机软件、物联网、大数据分析与挖掘、智能计算、遥感图像处理等研究.orcid.org/0000-0003-2395-4133.E-mail:huojy@mail.lzjtu.cn , E-mail:huojy@mail.lzjtu.cn

摘要

针对高速公路场景中交通标识文本检测精度与稳定性较差的问题,提出基于高效准确文字检测(EAST)算法思路的交通标识文本检测算法(ETST). 该算法通过引入3类模块,提升高速公路交通标识文本的检测性能. 利用基于颜色阈值分割与形状分析的传统标识预检测模块,快速筛选图像中的潜在标识区域. 融合多尺度注意力增强模块,增强提出算法对不同尺度文本的识别能力. 提出改进型并行补丁感知注意力模块(NPPA),强化所提算法对局部结构特征的感知与表达能力. 通过对多尺度特征图的联合融合,ETST能够有效整合底层纹理与高层语义信息,提升小尺寸与模糊文本的检测效果. 在ICDAR2015、CCTSDB、Total-Text等数据集上的实验证明,ETST在准确率、召回率及F1分数等核心指标上均优于现有算法,对图片的处理速度大于10帧/s,满足准实时应用需求,具有较高的检测精度与计算效率.

关键词: 交通标识文本检测 ; 交通标识文本检测算法 ; 多尺度注意力机制 ; 小目标文本检测 ; 并行补丁感知模块 ; 多尺度特征提取

Abstract

A traffic sign text detection algorithm (efficient traffic sign text detection, ETST) based on the efficient and accurate text detection (EAST) algorithm was proposed in order to address the issue of poor accuracy and stability in traffic sign text detection in highway scenarios. The detection performance of highway traffic sign text was improved by introducing three types of modules. Potential marker regions in an image can be quickly screened by utilizing a traditional marker pre-detection module based on color threshold segmentation and shape analysis. The recognition ability of the proposed algorithm for text at different scales was improved by integrating a multi-scale attention enhancement module. An improved parallel patch-aware attention module (NPPA) was proposed to enhance the ability of the proposed algorithm to perceive and represent local structural features. ETST effectively combined low-level texture cues with high-level semantic information by fusing multi-level feature maps in order to enhance discrimination of challenging text instances. Experiments on datasets such as ICDAR2015, CCTSDB and Total-Text demonstrated that ETST outperformed existing algorithms in key metrics such as accuracy, recall and F1 score, while achieving a processing speed of over 10 frames per second. Then the requirement of near real-time application was satisfied, and decent detection accuracy and computational efficiency were confirmed.

Keywords: traffic sign text detection ; traffic sign text detection algorithm ; multi-scale attention mechanism ; small target text detection ; parallel patch attention module ; multi-scale feature extraction

PDF (2562KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

火久元, 姜灏, 常琛. 基于改进EAST的高速公路交通标识文本检测. 浙江大学学报(工学版)[J], 2026, 60(9): 1881-1889 doi:10.3785/j.issn.1008-973X.2026.09.005

HUO Jiuyuan, JIANG Hao, CHANG Chen. Text detection of highway traffic sign based on improved EAST. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1881-1889 doi:10.3785/j.issn.1008-973X.2026.09.005

随着深度学习技术的快速发展,基于计算机视觉与人工智能实现的文本检测识别技术获得广泛关注,并在多语言翻译、自动驾驶、文献数字化与工业自动化等众多实际工业系统中展现出显著的应用潜力[1-5]. 高速公路交通标识检测作为计算机视觉在真实复杂环境下的典型任务,对于实现智能驾驶辅助、道路安全预警及智慧城市建设具有重要意义[6-8],但是对于文字方面的检测不足. 交通标识常年暴露于户外环境,受各类自然因素的影响,可能出现风化、磨损、模糊等问题,导致文本区域退化. 此外,在高速场景中,为了传递关键信息,标识牌上的字符常呈现小尺寸、密集排布且间距不规则的现象,造成误检与漏检.

传统算法依赖颜色分割、形状分析这类低层视觉特征,如Escalera等[9]提出的高度依赖环境条件的基于颜色阈值与形状识别的检测算法. 随着深度学习技术的迅速发展,两阶段算法如改进型Cascade R-CNN算法[10],通过区域生成网络生成候选区域,对候选区域进行分类与回归优化. 计算复杂度较高,难以满足高速公路场景的实时应用需求. 单阶段算法如YOLO系列[11-13]及改进SSD算法[14],通过直接回归目标位置与类别信息提高检测速度,更适用于实时交通场景,但在小目标检测与复杂场景适应性方面存在不足.

近年来,智能交通场景下的视觉检测技术在持续创新. Hu等[15]利用车道线与交通标志这类稳定的道路语义特征建立几何约束,实现LiDAR与车辆坐标系的实时对齐,具备较强的工程适配性与实时性,但依赖语义要素的可见性与视觉检测质量. Zheng等[16]采用极坐标与可变形多边形表示学习策略,大幅提升了对真实轮廓的拟合能力,减少了背景噪声对文字区域的干扰,但计算复杂度较高,依赖于对中心点的准确预测.

针对上述问题,本文提出基于高效、准确的场景文本检测器(efficient and accurate scene text detector, EAST)[17]的高效交通标识文本检测算法(Efficient Traffic Sign Text Detection,ETST). 由于高速公路交通标识普遍采用矩形背景板,以绿色作为背景底色,以白色作为文字颜色,颜色对比明显,本文结合交通标识颜色特征与多尺度特征融合机制,引入基于颜色信息的预处理模块,用于交通标识区域的初步筛选. 在主干网络设计方面,本文采用融合改进的ResNet-50作为骨干特征提取网络,引入高效多尺度注意力模块(efficient multi-scale attention, EMA)[18],提升特征提取过程中对目标区域的表征能力. 本文引入改进型并行补丁感知(nested parallel patch-aware, NPPA)分支结构,实现多尺度语义信息的并行提取. 该结构在不同网络层级上独立提取特征,显著增强了网络对小尺度目标的检测能力.

1. 技术算法

提出针对高速公路交通标识文字检测的算法ETST. 该算法由4个主要组件组成:基于颜色分割与形状阈值的传统交通标识检测模块、基于EMA-ResNet50的特征提取网络、并行化补丁感知注意力模块与非极大值抑制模块. 该算法的整体结构如图1所示.

图 1

图 1   提出的ETST算法结构

Fig.1   Structure of proposed ETST algorithm


准确检测交通标识是开展交通标识文字检测的前提,针对复杂道路环境中高速公路交通标识与广告牌、商店招牌、建筑文字等内容同时出现的问题,采用基于颜色分割与形状分析的算法对交通标识进行区域初筛,区分目标标识与其他干扰元素. 在特征提取阶段,采用ResNet-50作为主干网络,将高效多尺度注意力模块(EMA)集成到ResNet-50网络中. EMA模块通过并行子结构避免了深度堆叠带来的冗余顺序处理,可以在卷积操作中不进行通道维度减缩的情况下学习有效的通道描述,为高层语义特征生成更具辨别性的像素级注意力. 为了提高对小目标检测的准确性,加入并行化补丁感知注意力模块与最大池化层代替传统卷积神经网络,采用多分支策略捕获目标多尺度特征.

在整体流程中,输入图像经过传统的图像预处理模块,采用颜色分割与形状分析算法对图像进行预处理,为算法后续模块提供预处理图像. 预处理后的图像被送入改进型并行补丁感知模块,从多个尺度提取图像特征. 在完成特征提取后,引入特征融合分支,对各尺度特征图进行逐级整合. 具体而言,融合是由深层向浅层进行融合,将最深层特征上采样2倍后与上一层进行拼接;随后经过1×1卷积进行特征降维,并通过3×3卷积进行局部特征强化;再上采样2倍与更上一层拼接,以相同的方式逐层向上累计融合,共完成4层特征图的整合.

采用3×3卷积层对融合分支输出进行处理,生成语义丰富的最终特征图,并将特征图反馈至后续模块,用于完成文字位置检测任务.

1.1. RGB2HSV

为了提升检测速度并降低模型训练过程中的计算开销,引入传统的图像处理算法,提出基于HSV颜色空间变换与形状分析的技术流程. 考虑到高速公路中常见的带文本内容的交通标识多呈矩形结构且以绿色为主要背景色,通过几何特征约束对输入图像中的疑似矩形区域进行提取,从而在后续处理中集中识别与交通标识相关的候选区域.

由于自然场景下采集的图像容易受到光照变化、遮挡物、阴影等外部因素的干扰,图像的亮度变化往往会显著影响图像质量. RGB颜色空间中的3个分量(红、绿、蓝)均高度依赖于光照强度,一旦亮度变化,各分量值也会发生同步波动,影响图像的对比度和颜色稳定性. 传统方法通常将RGB图像转换为灰度图像以简化处理流程,但该方法会丢失大量的色彩信息,降低图像分割的准确性与鲁棒性.

为了解决上述问题,采用HSV(hue-saturation-value)颜色空间,对输入图像进行转换. HSV颜色模型从色相、饱和度和明度3个维度描述图像色彩特征,更符合人类视觉系统对颜色的感知机制,能够有效保留图像中的关键颜色信息. 与RGB颜色空间相比,HSV空间能够更清晰地区分颜色的色调与饱和度,使得对特定颜色区域的提取更高效. 在高速公路交通标识检测中,采用HSV空间进行颜色分割,不仅能够增强绿色背景区域的显著性,而且能够有效抑制来自复杂环境背景的干扰,为后续的文字检测任务提供更加清晰、纯净的候选区域. 在具体的实现过程中,采用矩形分割算法,对检测图中的矩形交通标识区域进行初步划分,选取HSV阈值为[35, 70, 50]到[130, 255, 255]的部分作为提出算法的背景提取范围.

采用RGB2HSV分割算法的处理效果如图2所示. 其中,图2(a)为未经处理的原始图像,图2(b)为依据设定的HSV阈值范围提取出的绿色区域部分,图2(c)为绿色区域部分与原图叠加后的保留结果. 交通标识牌区域在处理后得到了完整的保留,天空及其他复杂背景区域均被削弱.

图 2

图 2   RGB2HSV转换结果

Fig.2   RGB2HSV conversion result


结果表明,采用基于HSV色彩空间的阈值分割方法,能够有效利用交通标识的颜色信息,该操作显著减少了后续特征提取阶段的冗余干扰. 考虑到实际交通环境中光照强度、色彩饱和度及天气条件等因素会对颜色特征产生影响,通过算法使得所设置的阈值范围能够根据环境变化进行自适应调整. 这一灵活性不仅提升了算法在多场景条件下的鲁棒性与泛化能力,而且为后续的目标检测模块提供了更具判别性的输入特征.

1.2. 主分支EMA增强模块

为了增强算法的文字提取能力,减少背景干扰,并缩短计算时间,将EMA模块融入ResNet-50网络中,EMA模块的结构如图3所示.

图 3

图 3   EMA模块的结构

Fig.3   Structure of EMA module


图3中,G为组数,Avg Pooling表示全局平均池化操作. EMA采用通道注意力[19]模块中的共享1×1卷积分支,后文中描述为1×1分支. 为了聚合多尺度的空间结构信息,在1×1分支的基础上并行放置3×3卷积核,命名为3×3分支. 将输入特征图$ {\boldsymbol{X}} $沿自身通道维度划分为G个子特征,学习不同的语义特征,在数学上可以表示为$ {\boldsymbol{X}}=[{{\boldsymbol{X}}}_{0},\cdots, {{\boldsymbol{X}}}_{i},\cdots, {{\boldsymbol{X}}}_{G-1}],{{\boldsymbol{X}}}_{i}\in {{\bf{R}}}^{G \times H \times W} $.

EMA通过3条并行路径来提取每组特征的注意力权重,其中2条并行路径是1×1分支,第3条是3×3分支.

在1×1分支中,分别在水平方向和垂直方向应用一维全局平均池化操作,以捕获长距离的空间依赖关系与方向性结构信息. 这种跨空间建模方式能够有效挖掘目标区域在不同空间维度上的显著特征,使文字区域在多角度场景下具备良好的辨识度.

通过乘法聚合每条分支中不同通道的注意力图,将2条并行分支的特征进行交互融合. 在3×3分支中,凭借更大的感受野对局部纹理和多尺度结构进行强化表达,捕获多尺度特征表示. EMA通过在不同空间维度方向上提供跨空间信息聚合算法,丰富特征聚合. 具体来说,1×1分支的输出通过二维全局平均池化编码全局空间信息,3×3分支的输出直接转换为相应的维度形状. 通过矩阵点积操作聚合这些输出,生成第1张空间注意力图. 并行1×1和3×3分支获取输出张量后,通过二维全局平均池化,对来自1×1分支的全局空间信息进行编码. 这种二维全局池化可以表示如下:

$ M_{c}^{}=\frac{1}{HW}\sum \limits_{j}^{H}\sum \limits_{i}^{W}{X}_{c}(i,j). $

每个组内的输出特征图通过2个空间注意力权重的Sigmoid函数聚合.

虽然ResNet-50在提取高层语义特征方面表现良好,但ResNet-50网络对多尺度信息的敏感性不足. 为了增强对多尺度目标及复杂背景的感知能力,在ResNet-50主干网络的第3~5层中引入EMA模块. 中高层特征处于低层细节与高层语义的交汇点,能够兼顾空间结构与语义信息,适合执行跨尺度特征关联. 相比于在最底层引入注意力机制,将EMA模块嵌入中高层,可以有效避免梯度消失或语义过度抽象的问题. EMA模块通过联合建模通道注意力与空间注意力,对不同尺度的特征响应进行加权,突出对文字区域更敏感的特征通道. 该设计在不显著增加计算开销的前提下,显著提升了模型对中小尺度文字目标的检测能力.

1.3. 改进型并行化补丁感知模块

改进后的算法在远距离小目标检测中的效果较差. 受并行化补丁感知模块[20]的启发,引入改进型并行化补丁感知模块(NPPA),以增强提出算法对小目标的检测效果.

在小目标的检测任务中,通常采用下采样的方式,对图像进行处理. 小目标在多次下采样的过程中容易丢失结构细节,并行化补丁感知模块的提出替代了编码器和解码器基本组件中的传统卷积. 如图4所示,并行化补丁感知模块有效利用了不同分支提取不同尺度和级别的特征,这种多分支特征提取策略有助于捕获对象的多尺度特征,提升对小目标检测的准确性. 这种算法对模糊目标的检测效果不佳,因此将模块中的卷积模块使用动态卷积模块进行替换,并在2条特征分支中增加拉普拉斯金字塔结构,该结构通过多尺度高斯滤波与差分运算分离信息. 通过对输入特征进行多尺度高斯下采样与差分,分离出不同尺度的高频细节分量,并对这些高频分量进行轻量卷积与通道注意力增强. 采用尺度自适应门控融合策略补偿增强后的细节信息,提高NPPA模块对模糊场景的检测能力.

图 4

图 4   改进型并行化补丁感知模块的结构

Fig.4   Structure of nested parallelized patch-aware module


多分支特征提取策略主要由局部分支、全局分支和串行卷积分支3部分构成,分别侧重细节特征、上下文信息与跨尺度特征交互. 输入特征经逐点卷积调整后,分别通过三分支提取多尺度特征,并在输出端融合求和,从而增强小目标的检测精度. 给定输入特征向量$ {\boldsymbol{F}}\in {\bf{R}}^{{{H}^{\prime}}\times {{W}^{\prime}}\times {{C}^{\prime}}} $,通过逐点卷积进行调整,得到$ {\boldsymbol{F}}'\in {\bf{R}}^{{{H}^{\prime}}\times {{W}^{\prime}}\times {{C}^{\prime}}} $. 通过3个分支,分别计算$ {{\boldsymbol{F}}}_{\text{local}} $$ {{\boldsymbol{F}}}_{\text{global}} $$ {{\boldsymbol{F}}}_{\text{conv}} $. 最后,将3个结果相加.

具体来说,通过控制补丁大小参数p实现局部与全局特征的自适应建模,计算非重叠补丁间的注意力矩阵,以捕获跨区域特征依赖.

考虑到高速公路交通标识的复杂性,将原PPA模块的3个3×3卷积扩展为4个,以保证模型对主要特征的提取能力.

在模块末端引入最大池化操作,以局部区域内的最大响应作为最终输出,保留了图像中最突出、最重要的特征.

1.4. 损失函数

采用深度监督策略,解决NPPA下采样过程中对小目标检测缺失的问题. 每个尺度的损失包括二进制交叉熵损失和交集对联合损失,定义如下:

$ {l}_{i}=\text{Bce}\;({\boldsymbol{y}},\hat{{\boldsymbol{y}}})+\text{Iou}\;({\boldsymbol{y}},\hat{{\boldsymbol{y}}});\tau =\sum \limits_{i=0}^{6}({\lambda }_{i} {l}_{i}). $

式中:$ {l}_{i} $为在不同尺度上的损失,$ \hat{{\boldsymbol{y}}} $为真实值掩码,$ {\boldsymbol{y}} $为预测掩码. $ {\lambda }_{i} $为损失权重.

2. 实验结果及分析

2.1. 数据集与实验环境

为了保证实验结果的准确性与泛用性,选取ICDAR2015数据集[21]、Total-Text数据集[22]、TT100K[23]和CCTSDB[24]等数据集进行实验.

ICDAR2015:ICDAR2015数据集包含1 000张训练图像与500张测试图像,图像由不同用户通过 Google Glass 设备采集. 数据集场景多样,涵盖自然场景、文档扫描及手写文本.

Total-Text数据集:Total-Text数据集[22]旨在推动不同方向与形状文本检测算法的发展. 该数据集包含1 555张图像,覆盖水平文本、多方向文本及曲线文本3种主要排布方式.

TT100K:TT100K(Tsinghua-Tencent 100K)数据集由清华大学与腾讯公司于2016年联合发布,旨在为中国道路环境下的大规模交通标识检测与识别任务提供标准化基准数据. 该数据集共包含约10万张图像,涵盖的交通标识实例超过3万个.

CCTSDB:CCTSDB2021数据集由中南大学研究团队构建,专注于交通标识检测与识别研究. 该数据集包含约2万张真实道路场景图像,该数据集中的数据通过从行车记录仪视频中抽帧获得.

因TT100K与CCTSDB数据集属于完整交通标识数据集,不仅包含高速公路交通标识,而且含有其他各类交通标识,因此从TT100K中提取高速公路部分的交通标识数据,结合从网络图片中随机选取的包含高速公路交通标识的图像,共同构建为新的数据集. 在TT100K数据集与网络图像中选取部分带有小目标样本(目标尺寸小于或等于32×32像素)的图像,用以检验模型对远距离及低分辨率标识的检测能力. 经过筛选与整合后,小目标样本约占全部数据的20%. 将该数据集命名为GS数据集,将该数据集用于后续的对比实验.

所有实验均在相同的硬件与软件环境下进行,实验平台配置为NVIDIA GeForce RTX 3090,搭载8核GPU计算单元. 软件采用Windows 10系统,搭配Python3.10与Cuda11.8.

为了保证输入图像尺寸的一致性,便于模型训练,训练和测试的样本图像大小均被设置为512×512,训练批次设定为24;总迭代次数为300,以保证模型参数充分优化并避免欠拟合. 将初始学习率设为0.001,采用自适应调整策略,在训练过程中根据验证集性能动态调整学习率,提高模型的收敛稳定性与训练效率. 在推理阶段,置信度阈值与NMS阈值分别设为0.25与0.45. 为了增强模型的泛化能力,在训练阶段加入随机缩放、旋转及光照变化等数据增强操作.

2.2. 评价指标

在目标检测任务中,通常使用的评价指标包括精确率、召回率、F1值、平均精度均值.

1)精确率P为评估模型预测正确的正样本比例. 在目标检测中,若模型预测的边界框与真实的边界框重合,则认为预测正确. P的计算公式为

$ {P}=\frac{\text{TP}}{\text{TP}+\text{FP}}. $

2)召回率R为评估模型能够找出所有真实正样本的比例. 在目标检测中,若真实的边界框与预测的边界框重合,则认为该样本被正确召回. R的计算公式为

$ {R}=\frac{\text{TP}}{\text{TP}+\text{FN}}. $

3)F1值(F1-score)为准确率与召回率的调和平均,用于综合评价模型的性能,尤其在数据分布不平衡的场景下更具参考意义. F1的定义为

$ {F_1=}2\times \frac{{P} {R}}{{P}+{R}}. $

4)平均精度均值mAP (mean average precision)为在多个类别上的平均精度. mAP50为在50%的IOU阈值下的mAP,mAP50-95为在50%~95%的IOU下的mAP平均值,能够更准确地评估模型在不同IOU阈值下的性能. mAP的计算公式如下:

$ \text{AP}=\int \nolimits_{0}^{1}P(r){\mathrm{d}}r, $

$ \text{mAP}=\frac{1}{n}\sum \limits_{i=1}^{n}\text{AP}(i). $

式中:n为类别数.

检测速度v为每秒内可以处理的图片数量,以此来评估检测速度,时间越短,速度越快.

2.3. 对比实验

与当前的文字检测模型进行比较. 为了全面评估所提算法的性能,在ICDAR2015与Total-Text数据集上,与EAST、DBNet、SegLink和PSENet模型进行系统性对比实验. 实验采用标准化评估指标,以保证评估的客观性与可比性. 为了增强实验结果的可信度与稳定性,所有实验在每个数据集上均对各模型进行多次独立重复实验. 所有实验均在相同的模型架构与训练参数设置下进行,统一采用相同的训练与测试流程,对测试集进行检测并计算各项性能指标. 实验结果如表1所示.

表 1   在ICDAR2015与Total-text数据集上使用不同算法的检测结果

Tab.1  Detection result of different algorithms on ICDAR2015 and Total-text dataset

方法ICDAR2015Total-text
P/%R/%F1/%v/(帧·s−1)P/%R/%F1/%v/(帧·s−1)
EAST83.278.680.813.280.976.278.511.6
DBNet84.082.783.322.081.279.980.620.3
SegLink86.979.583.05.986.182.684.44.9
PSENet84.384.584.48.087.682.384.87.3
ETST(本文算法)87.483.185.112.486.584.985.710.3

新窗口打开| 下载CSV


表1可以看出,提出的算法在2个数据集上均取得了优于对比算法的整体检测性能,具体表现为F值在不同数据集下均取得最高值,准确率和召回率也较高,表明本文算法在复杂背景和不同文本表现形态下具备较强的泛化能力,能够有效应对不同场景下的文本检测任务. 尽管总体性能表现优异,本文算法在部分指标上的提升幅度仍较有限,对图像的处理速度较低.

与交通标识检测模型进行比较. 为了验证测试本文算法在高速公路交通标识文本检测方面的性能,在CCTSDB数据集与GS数据集上对所提算法与各类经典交通标识检测模型进行对比实验. 实验结果如表2所示.

表 2   在CCTSDB与GS高速公路标识数据集上使用不同算法的检测结果

Tab.2  Detection result of different algorithms on CCTSDB and GS highway sign dataset

方法CCTSDBGS highway sign
P/%R/%mAP@0.5 /%v/(帧·s−1)P/%R/%mAP@0.5 /%v/(帧·s−1)
YOLOv587.384.586.158.284.982.083.752.4
YOLOv889.586.288.365.187.884.686.560.3
Faster R-CNN85.182.784.49.282.780.281.98.7
RetinaNet86.083.285.032.584.280.982.428.7
ETST(本文算法)88.687.989.218.591.188.491.816.8

新窗口打开| 下载CSV


实验结果表明,提出的ETST算法在CCTSDB数据集与自定义交通标识文字数据集GS上均表现出优异的检测性能,尤其在自定义数据集上展现出显著优势. 这种差异可以归因于2个方面. 自定义数据集和基准数据集在数据分布和任务难度方面存在显著差异,自定义数据集更加贴合特定高速公路的应用场景,具有独特的挑战和特点. ETST在模型架构方面进行了创新,以更好地适应自定义数据集.

表2可以看出,虽然ETST算法的准确率略低于YOLOv8模型,但其余检测各项性能指标均表现优越,展现了本文算法在小目标检测与复杂背景处理中的鲁棒性与稳定性. 在如表2所示的自定义数据集实验中,ETST算法的表现更加突出,验证了本文模型在特定交通环境下的场景适应能力和实际应用潜力. 实验结果验证了ETST算法在不同类型的数据集下均具有良好的检测效果与泛化能力,尤其在面向真实高速公路复杂场景的交通标识文字检测任务中,展现出较高的实用性和稳定性. 与其他方法相比,ETST的推理速度较小,应进行轻量化改进,提升推理速度.

为了验证所提方法在小目标检测方面的性能,单独使用GS数据集中的小目标部分数据,对所提方法与交通标识检测模型进行系统对比实验. 实验采用标准化评估指标,以保证评估的客观性. 实验结果如表3所示.

表 3   在GS高速公路标识小目标数据集上使用不同算法的检测结果

Tab.3  Detection result of different algorithms on GS highway sign small target dataset

方法P/%R/%F1/%v/(帧·s−1)
YOLOv580.675.477.947.5
YOLOv884.979.281.954.6
Faster R-CNN77.273.175.16.3
RetinaNet79.874.877.224.7
ETST(本文算法)86.381.483.812.5

新窗口打开| 下载CSV


表3可以看出,提出的ETST方法在针对小目标检测的精确率、召回率及F1值上均优于其他对比模型,其中F1值较YOLOv8提高约2%,验证了所提方法在小目标检测任务中的有效性. 通过引入多尺度注意机制与改进后的并行补丁感知模块(NPPA),有效增强了对小尺寸文字与远距离标识的特征表达能力,从而减少了误检与漏检现象.

2.4. 消融实验

为了系统评估ETST算法的稳定性与各模块的有效性,逐步引入EMA、NPPA、Loss模块进行消融实验. 在CCTSDB数据集上选取部分图片,开展实验. 最终的实验结果如表4所示.

表 4   在ETST模块上的消融实验结果

Tab.4  Result of ablation experiment on ETST module

方法EMANPPALossP/%R/%F1/%
M176.176.876.5
M280.479.680
M384.280.582.1
M486.381.283.7
M585.280.782.8
M688.283.585.8

新窗口打开| 下载CSV


将未添加其他模块的基础模型定义为M1,准确率与召回率分别为76.1%与76.8%. 在M2中,引入EMA模块后,模型参数量增加约13%,但准确率与召回率分别提高了4.3%与2.8%,模型精度显著增强. 在加入NPPA模块后,模型M3的参数量约增加14%,准确值提高至84.2%,较模型M2提高了3.8%,表明重构后的NPPA模块能够有效地从多尺度方向提取图像特征,增强了模型对场景中小文字的提取能力. 多模块的组合取得了较好的效果,如M4~M6所示,但同时加入NPPA与EMA模块导致模型的整体参数量增加约27%,推理时间也逐渐增加,影响了轻量化与实时性.

为了进一步验证提出的改进模块(引入拉普拉斯金字塔结构并调整卷积网络架构的并行化补丁感知模块(NPPA))的有效性,设计并开展对比消融实验. 实验分别基于原始的PPA模块、修改卷积构成模块的PPA模块(表中名为本文算法(PPA1))与NPPA模块开展特征提取与预测任务,在GS高速公路标识数据集上进行系统评估. 实验结果如表5所示.

表 5   改进型并行化补丁感知模块的消融实验结果

Tab.5  Result of ablation experiment of nested parallelized patch-aware module

方法P/%R/%F1/%
基础算法EAST76.176.876.5
本文算法(PPA)82.778.880.7
本文算法(PPA1)83.279.581.3
本文算法(NPPA)84.280.582.1

新窗口打开| 下载CSV


在修改卷积结构后,模型的检测性能得到了一定程度的提升. 具体来说,PRF1分别提高了0.5%、0.7%、0.6%. 当未引入拉普拉斯金字塔结构时,模型的检测性能明显下降. 具体来说,在引入拉普拉斯金字塔结构之后,PRF1分别提高了1.5%、1.7%、1.4%. 该结果表明,在PPA模块中融合拉普拉斯金字塔并调整卷积结构,能够增强模型在低清晰度图像中的判别能力,有效提升模糊目标的检测精度,从而进一步改善整体检测性能.

2.5. 实验可视化

图5所示为基础算法和改进算法的检测结果对比图. 其中,矩形区域表示检测到的区域. 从图5可以看出,本文算法能够在保留交通标识区域的同时,有效抑制背景干扰,为文本检测提供更精准的目标范围.

图 5

图 5   通用文字检测器与本文算法的部分可视化结果

Fig.5   Partial visualization result of general text detector and proposed algorithm


3. 结 语

提出ETST算法,这是主要针对高速公路交通标识文字检测的算法. 该算法以ResNet-50集成EMA模块的改进型主干网络作为特征提取基础,通过增强网络对关键语义信息的关注,提高特征表达的判别性与稳健性. 为了强化对小尺度目标的检测性能,设计对并行化补丁感知模块的改进,通过主分支和辅助信息分支的并行学习,获取额外的特征信息,为算法提供更丰富的上下文信息. ETST算法结合了改进骨干网络、多尺度特征提取和辅助信息分支,在交通标识文字检测中表现出较高的准确率和稳定性.

在多个公开数据集上的对比实验结果表明,提出的算法在多项与检测精度相关的评价指标上均优于现有方法,验证了该算法在高速公路交通标识文字检测任务中的有效性与先进性.

未来的研究可以进一步从轻量化与实用化两方面展开. 1)可以尝试设计更加高效的多尺度特征融合与注意力机制,以在保证检测精度的同时降低计算复杂度与模型运行开销. 2)应关注模型在实际部署中的适配性问题,如模型压缩、加速推理与边缘设备部署等,以推动该方法在实时智能交通与车载系统中的落地应用.

参考文献

林泓, 卢瑶瑶

聚焦难样本的区分尺度的文字检测方法

[J]. 浙江大学学报: 工学版, 2019, 53 (8): 1506- 1516

DOI:10.3785/j.issn.1008-973X.2019.08.009      [本文引用: 1]

LIN Hong, LU Yaoyao

Scale differentiated text detection method focusing on hard examples

[J]. Journal of Zhejiang University: Engineering Science, 2019, 53 (8): 1506- 1516

DOI:10.3785/j.issn.1008-973X.2019.08.009      [本文引用: 1]

TANG J, ZHANG W, LIU H, et al. Few could be better than all: feature sampling and grouping for scene text detection [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 4553–4562.

ZHU B, LIU F, CHEN X, et al. EK-net: real-time scene text detection with expand kernel distance [C]//2024 IEEE International Conference on Acoustics, Speech and Signal Processing. Seoul: IEEE, 2024: 6380–6384.

YAO L, TANG C, WAN Y

Advanced text detection of container numbers via dual-branch adaptive multi-scale network

[J]. Applied Sciences, 2025, 15 (3): 1492

DOI:10.3390/app15031492     

DU Y, CHEN Z, JIA C, et al

Context perception parallel decoder for scene text recognition

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025, 47 (6): 4668- 4683

DOI:10.1109/TPAMI.2025.3545453      [本文引用: 1]

WANG J, CHEN Y, DONG Z, et al

Improved YOLOv5 network for real-time multi-scale traffic sign detection

[J]. Neural Computing and Applications, 2023, 35 (10): 7853- 7865

DOI:10.1007/s00521-022-08077-5      [本文引用: 1]

LU E H C, GOZDZIKIEWICZ M, CHANG K H, et al

A hierarchical approach for traffic sign recognition based on shape detection and image classification

[J]. Sensors, 2022, 22 (13): 4768

DOI:10.3390/s22134768     

董红召, 林少轩, 佘翊妮

交通目标YOLO检测技术的研究进展

[J]. 浙江大学学报: 工学版, 2025, 59 (2): 249- 260

DOI:10.3785/j.issn.1008-973X.2025.02.003      [本文引用: 1]

DONG Hongzhao, LIN Shaoxuan, SHE Yini

Research progress of YOLO detection technology for traffic object

[J]. Journal of Zhejiang University: Engineering Science, 2025, 59 (2): 249- 260

DOI:10.3785/j.issn.1008-973X.2025.02.003      [本文引用: 1]

DE LA ESCALERA A, MORENO L E, SALICHS M A, et al

Road traffic sign detection and classification

[J]. IEEE Transactions on Industrial Electronics, 1997, 44 (6): 848- 859

DOI:10.1109/41.649946      [本文引用: 1]

CAI Z, VASCONCELOS N

Cascade R-CNN: high quality object detection and instance segmentation

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2019, 43 (5): 1483- 1498

[本文引用: 1]

REDMON J, DIVVALA S, GIRSHICK R, et al. You only look once: unified, real-time object detection [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 779–788.

[本文引用: 1]

REDMON J, FARHADI A. YOLO9000: better, faster, stronger [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Honolulu: IEEE, 2017: 6517–6525.

WANG C Y, BOCHKOVSKIY A, LIAO H Y M. Scaled-YOLOv4: scaling cross stage partial network [C]//Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Piscataway: IEEE, 2021: 13029–13038.

[本文引用: 1]

孙超, 温蜜, 景俐娜

改进SSD算法在交通标志检测中的应用

[J]. 计算机工程与应用, 2023, 59 (4): 147- 155

DOI:10.3778/j.issn.1002-8331.2108-0389      [本文引用: 1]

SUN Chao, WEN Mi, JING Lina

Application of improved SSD algorithm in traffic sign detection

[J]. Computer Engineering and Applications, 2023, 59 (4): 147- 155

DOI:10.3778/j.issn.1002-8331.2108-0389      [本文引用: 1]

HU Y, DU X, JIANG S. Online LiDAR-to-vehicle alignment using lane markings and traffic signs [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. Vancouver: IEEE, 2023: 3348–3357.

[本文引用: 1]

ZHENG Y, ANDRIENKO O, ZHAO Y, et al. DPPD: deformable polar polygon object detection [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. Vancouver: IEEE, 2023: 78–87.

[本文引用: 1]

ZHOU X, YAO C, WEN H, et al. EAST: an efficient and accurate scene text detector [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Honolulu: IEEE, 2017: 2642–2651.

[本文引用: 1]

OUYANG D, HE S, ZHANG G, et al. Efficient multi-scale attention module with cross-spatial learning [C]//2023 IEEE International Conference on Acoustics, Speech and Signal Processing. Rhodes Island: IEEE, 2023: 1–5.

[本文引用: 1]

HOU Q, ZHOU D, FENG J. Coordinate attention for efficient mobile network design [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 13708–13717.

[本文引用: 1]

XU S, ZHENG S, XU W, et al. HCF-net: hierarchical context fusion network for infrared small object detection [C]//Proceedings of the IEEE International Conference on Multimedia and Expo. Niagara Falls: IEEE, 2024: 1–6.

[本文引用: 1]

KARATZAS D, GOMEZ-BIGORDA L, NICOLAOU A, et al. ICDAR 2015 competition on robust reading [C]//Proceedings of the 13th International Conference on Document Analysis and Recognition. Tunis: IEEE, 2015: 1156–1160.

[本文引用: 1]

CH’NG C K, CHAN C S. Total-text: a comprehensive dataset for scene text detection and recognition [C]//Proceedings of the 14th IAPR International Conference on Document Analysis and Recognition. Kyoto: IEEE, 2018: 935–942.

[本文引用: 2]

ZHU Z, LIANG D, ZHANG S, et al. Traffic-sign detection and classification in the wild [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 2110–2118.

[本文引用: 1]

ZHANG J, ZOU X, KUANG L D, et al

CCTSDB 2021: a more comprehensive traffic sign detection benchmark

[J]. Human-centric Computing and Information Sciences, 2022, 12: 23

[本文引用: 1]

/