基于改进EAST的高速公路交通标识文本检测
Text detection of highway traffic sign based on improved EAST
收稿日期: 2025-09-23
| 基金资助: |
|
Received: 2025-09-23
| Fund supported: | 国家自然科学基金资助项目(62262038);甘肃省重点研发计划资助项目(25YFGA045). |
作者简介 About authors
火久元(1978—),男,教授,博士,从事计算机软件、物联网、大数据分析与挖掘、智能计算、遥感图像处理等研究.orcid.org/0000-0003-2395-4133.E-mail:
针对高速公路场景中交通标识文本检测精度与稳定性较差的问题,提出基于高效准确文字检测(EAST)算法思路的交通标识文本检测算法(ETST). 该算法通过引入3类模块,提升高速公路交通标识文本的检测性能. 利用基于颜色阈值分割与形状分析的传统标识预检测模块,快速筛选图像中的潜在标识区域. 融合多尺度注意力增强模块,增强提出算法对不同尺度文本的识别能力. 提出改进型并行补丁感知注意力模块(NPPA),强化所提算法对局部结构特征的感知与表达能力. 通过对多尺度特征图的联合融合,ETST能够有效整合底层纹理与高层语义信息,提升小尺寸与模糊文本的检测效果. 在ICDAR2015、CCTSDB、Total-Text等数据集上的实验证明,ETST在准确率、召回率及F1分数等核心指标上均优于现有算法,对图片的处理速度大于10帧/s,满足准实时应用需求,具有较高的检测精度与计算效率.
关键词:
A traffic sign text detection algorithm (efficient traffic sign text detection, ETST) based on the efficient and accurate text detection (EAST) algorithm was proposed in order to address the issue of poor accuracy and stability in traffic sign text detection in highway scenarios. The detection performance of highway traffic sign text was improved by introducing three types of modules. Potential marker regions in an image can be quickly screened by utilizing a traditional marker pre-detection module based on color threshold segmentation and shape analysis. The recognition ability of the proposed algorithm for text at different scales was improved by integrating a multi-scale attention enhancement module. An improved parallel patch-aware attention module (NPPA) was proposed to enhance the ability of the proposed algorithm to perceive and represent local structural features. ETST effectively combined low-level texture cues with high-level semantic information by fusing multi-level feature maps in order to enhance discrimination of challenging text instances. Experiments on datasets such as ICDAR2015, CCTSDB and Total-Text demonstrated that ETST outperformed existing algorithms in key metrics such as accuracy, recall and F1 score, while achieving a processing speed of over 10 frames per second. Then the requirement of near real-time application was satisfied, and decent detection accuracy and computational efficiency were confirmed.
Keywords:
本文引用格式
火久元, 姜灏, 常琛.
HUO Jiuyuan, JIANG Hao, CHANG Chen.
针对上述问题,本文提出基于高效、准确的场景文本检测器(efficient and accurate scene text detector, EAST)[17]的高效交通标识文本检测算法(Efficient Traffic Sign Text Detection,ETST). 由于高速公路交通标识普遍采用矩形背景板,以绿色作为背景底色,以白色作为文字颜色,颜色对比明显,本文结合交通标识颜色特征与多尺度特征融合机制,引入基于颜色信息的预处理模块,用于交通标识区域的初步筛选. 在主干网络设计方面,本文采用融合改进的ResNet-50作为骨干特征提取网络,引入高效多尺度注意力模块(efficient multi-scale attention, EMA)[18],提升特征提取过程中对目标区域的表征能力. 本文引入改进型并行补丁感知(nested parallel patch-aware, NPPA)分支结构,实现多尺度语义信息的并行提取. 该结构在不同网络层级上独立提取特征,显著增强了网络对小尺度目标的检测能力.
1. 技术算法
提出针对高速公路交通标识文字检测的算法ETST. 该算法由4个主要组件组成:基于颜色分割与形状阈值的传统交通标识检测模块、基于EMA-ResNet50的特征提取网络、并行化补丁感知注意力模块与非极大值抑制模块. 该算法的整体结构如图1所示.
图 1
准确检测交通标识是开展交通标识文字检测的前提,针对复杂道路环境中高速公路交通标识与广告牌、商店招牌、建筑文字等内容同时出现的问题,采用基于颜色分割与形状分析的算法对交通标识进行区域初筛,区分目标标识与其他干扰元素. 在特征提取阶段,采用ResNet-50作为主干网络,将高效多尺度注意力模块(EMA)集成到ResNet-50网络中. EMA模块通过并行子结构避免了深度堆叠带来的冗余顺序处理,可以在卷积操作中不进行通道维度减缩的情况下学习有效的通道描述,为高层语义特征生成更具辨别性的像素级注意力. 为了提高对小目标检测的准确性,加入并行化补丁感知注意力模块与最大池化层代替传统卷积神经网络,采用多分支策略捕获目标多尺度特征.
在整体流程中,输入图像经过传统的图像预处理模块,采用颜色分割与形状分析算法对图像进行预处理,为算法后续模块提供预处理图像. 预处理后的图像被送入改进型并行补丁感知模块,从多个尺度提取图像特征. 在完成特征提取后,引入特征融合分支,对各尺度特征图进行逐级整合. 具体而言,融合是由深层向浅层进行融合,将最深层特征上采样2倍后与上一层进行拼接;随后经过1×1卷积进行特征降维,并通过3×3卷积进行局部特征强化;再上采样2倍与更上一层拼接,以相同的方式逐层向上累计融合,共完成4层特征图的整合.
采用3×3卷积层对融合分支输出进行处理,生成语义丰富的最终特征图,并将特征图反馈至后续模块,用于完成文字位置检测任务.
1.1. RGB2HSV
为了提升检测速度并降低模型训练过程中的计算开销,引入传统的图像处理算法,提出基于HSV颜色空间变换与形状分析的技术流程. 考虑到高速公路中常见的带文本内容的交通标识多呈矩形结构且以绿色为主要背景色,通过几何特征约束对输入图像中的疑似矩形区域进行提取,从而在后续处理中集中识别与交通标识相关的候选区域.
由于自然场景下采集的图像容易受到光照变化、遮挡物、阴影等外部因素的干扰,图像的亮度变化往往会显著影响图像质量. RGB颜色空间中的3个分量(红、绿、蓝)均高度依赖于光照强度,一旦亮度变化,各分量值也会发生同步波动,影响图像的对比度和颜色稳定性. 传统方法通常将RGB图像转换为灰度图像以简化处理流程,但该方法会丢失大量的色彩信息,降低图像分割的准确性与鲁棒性.
为了解决上述问题,采用HSV(hue-saturation-value)颜色空间,对输入图像进行转换. HSV颜色模型从色相、饱和度和明度3个维度描述图像色彩特征,更符合人类视觉系统对颜色的感知机制,能够有效保留图像中的关键颜色信息. 与RGB颜色空间相比,HSV空间能够更清晰地区分颜色的色调与饱和度,使得对特定颜色区域的提取更高效. 在高速公路交通标识检测中,采用HSV空间进行颜色分割,不仅能够增强绿色背景区域的显著性,而且能够有效抑制来自复杂环境背景的干扰,为后续的文字检测任务提供更加清晰、纯净的候选区域. 在具体的实现过程中,采用矩形分割算法,对检测图中的矩形交通标识区域进行初步划分,选取HSV阈值为[35, 70, 50]到[130, 255, 255]的部分作为提出算法的背景提取范围.
图 2
结果表明,采用基于HSV色彩空间的阈值分割方法,能够有效利用交通标识的颜色信息,该操作显著减少了后续特征提取阶段的冗余干扰. 考虑到实际交通环境中光照强度、色彩饱和度及天气条件等因素会对颜色特征产生影响,通过算法使得所设置的阈值范围能够根据环境变化进行自适应调整. 这一灵活性不仅提升了算法在多场景条件下的鲁棒性与泛化能力,而且为后续的目标检测模块提供了更具判别性的输入特征.
1.2. 主分支EMA增强模块
为了增强算法的文字提取能力,减少背景干扰,并缩短计算时间,将EMA模块融入ResNet-50网络中,EMA模块的结构如图3所示.
图 3
图3中,G为组数,Avg Pooling表示全局平均池化操作. EMA采用通道注意力[19]模块中的共享1×1卷积分支,后文中描述为1×1分支. 为了聚合多尺度的空间结构信息,在1×1分支的基础上并行放置3×3卷积核,命名为3×3分支. 将输入特征图
EMA通过3条并行路径来提取每组特征的注意力权重,其中2条并行路径是1×1分支,第3条是3×3分支.
在1×1分支中,分别在水平方向和垂直方向应用一维全局平均池化操作,以捕获长距离的空间依赖关系与方向性结构信息. 这种跨空间建模方式能够有效挖掘目标区域在不同空间维度上的显著特征,使文字区域在多角度场景下具备良好的辨识度.
通过乘法聚合每条分支中不同通道的注意力图,将2条并行分支的特征进行交互融合. 在3×3分支中,凭借更大的感受野对局部纹理和多尺度结构进行强化表达,捕获多尺度特征表示. EMA通过在不同空间维度方向上提供跨空间信息聚合算法,丰富特征聚合. 具体来说,1×1分支的输出通过二维全局平均池化编码全局空间信息,3×3分支的输出直接转换为相应的维度形状. 通过矩阵点积操作聚合这些输出,生成第1张空间注意力图. 并行1×1和3×3分支获取输出张量后,通过二维全局平均池化,对来自1×1分支的全局空间信息进行编码. 这种二维全局池化可以表示如下:
每个组内的输出特征图通过2个空间注意力权重的Sigmoid函数聚合.
虽然ResNet-50在提取高层语义特征方面表现良好,但ResNet-50网络对多尺度信息的敏感性不足. 为了增强对多尺度目标及复杂背景的感知能力,在ResNet-50主干网络的第3~5层中引入EMA模块. 中高层特征处于低层细节与高层语义的交汇点,能够兼顾空间结构与语义信息,适合执行跨尺度特征关联. 相比于在最底层引入注意力机制,将EMA模块嵌入中高层,可以有效避免梯度消失或语义过度抽象的问题. EMA模块通过联合建模通道注意力与空间注意力,对不同尺度的特征响应进行加权,突出对文字区域更敏感的特征通道. 该设计在不显著增加计算开销的前提下,显著提升了模型对中小尺度文字目标的检测能力.
1.3. 改进型并行化补丁感知模块
改进后的算法在远距离小目标检测中的效果较差. 受并行化补丁感知模块[20]的启发,引入改进型并行化补丁感知模块(NPPA),以增强提出算法对小目标的检测效果.
在小目标的检测任务中,通常采用下采样的方式,对图像进行处理. 小目标在多次下采样的过程中容易丢失结构细节,并行化补丁感知模块的提出替代了编码器和解码器基本组件中的传统卷积. 如图4所示,并行化补丁感知模块有效利用了不同分支提取不同尺度和级别的特征,这种多分支特征提取策略有助于捕获对象的多尺度特征,提升对小目标检测的准确性. 这种算法对模糊目标的检测效果不佳,因此将模块中的卷积模块使用动态卷积模块进行替换,并在2条特征分支中增加拉普拉斯金字塔结构,该结构通过多尺度高斯滤波与差分运算分离信息. 通过对输入特征进行多尺度高斯下采样与差分,分离出不同尺度的高频细节分量,并对这些高频分量进行轻量卷积与通道注意力增强. 采用尺度自适应门控融合策略补偿增强后的细节信息,提高NPPA模块对模糊场景的检测能力.
图 4
多分支特征提取策略主要由局部分支、全局分支和串行卷积分支3部分构成,分别侧重细节特征、上下文信息与跨尺度特征交互. 输入特征经逐点卷积调整后,分别通过三分支提取多尺度特征,并在输出端融合求和,从而增强小目标的检测精度. 给定输入特征向量
具体来说,通过控制补丁大小参数p实现局部与全局特征的自适应建模,计算非重叠补丁间的注意力矩阵,以捕获跨区域特征依赖.
考虑到高速公路交通标识的复杂性,将原PPA模块的3个3×3卷积扩展为4个,以保证模型对主要特征的提取能力.
在模块末端引入最大池化操作,以局部区域内的最大响应作为最终输出,保留了图像中最突出、最重要的特征.
1.4. 损失函数
采用深度监督策略,解决NPPA下采样过程中对小目标检测缺失的问题. 每个尺度的损失包括二进制交叉熵损失和交集对联合损失,定义如下:
式中:
2. 实验结果及分析
2.1. 数据集与实验环境
ICDAR2015:ICDAR2015数据集包含1 000张训练图像与500张测试图像,图像由不同用户通过 Google Glass 设备采集. 数据集场景多样,涵盖自然场景、文档扫描及手写文本.
Total-Text数据集:Total-Text数据集[22]旨在推动不同方向与形状文本检测算法的发展. 该数据集包含1 555张图像,覆盖水平文本、多方向文本及曲线文本3种主要排布方式.
TT100K:TT100K(Tsinghua-Tencent 100K)数据集由清华大学与腾讯公司于2016年联合发布,旨在为中国道路环境下的大规模交通标识检测与识别任务提供标准化基准数据. 该数据集共包含约10万张图像,涵盖的交通标识实例超过3万个.
CCTSDB:CCTSDB2021数据集由中南大学研究团队构建,专注于交通标识检测与识别研究. 该数据集包含约2万张真实道路场景图像,该数据集中的数据通过从行车记录仪视频中抽帧获得.
因TT100K与CCTSDB数据集属于完整交通标识数据集,不仅包含高速公路交通标识,而且含有其他各类交通标识,因此从TT100K中提取高速公路部分的交通标识数据,结合从网络图片中随机选取的包含高速公路交通标识的图像,共同构建为新的数据集. 在TT100K数据集与网络图像中选取部分带有小目标样本(目标尺寸小于或等于32×32像素)的图像,用以检验模型对远距离及低分辨率标识的检测能力. 经过筛选与整合后,小目标样本约占全部数据的20%. 将该数据集命名为GS数据集,将该数据集用于后续的对比实验.
所有实验均在相同的硬件与软件环境下进行,实验平台配置为NVIDIA GeForce RTX
为了保证输入图像尺寸的一致性,便于模型训练,训练和测试的样本图像大小均被设置为512×512,训练批次设定为24;总迭代次数为300,以保证模型参数充分优化并避免欠拟合. 将初始学习率设为0.001,采用自适应调整策略,在训练过程中根据验证集性能动态调整学习率,提高模型的收敛稳定性与训练效率. 在推理阶段,置信度阈值与NMS阈值分别设为0.25与0.45. 为了增强模型的泛化能力,在训练阶段加入随机缩放、旋转及光照变化等数据增强操作.
2.2. 评价指标
在目标检测任务中,通常使用的评价指标包括精确率、召回率、F1值、平均精度均值.
1)精确率P为评估模型预测正确的正样本比例. 在目标检测中,若模型预测的边界框与真实的边界框重合,则认为预测正确. P的计算公式为
2)召回率R为评估模型能够找出所有真实正样本的比例. 在目标检测中,若真实的边界框与预测的边界框重合,则认为该样本被正确召回. R的计算公式为
3)F1值(F1-score)为准确率与召回率的调和平均,用于综合评价模型的性能,尤其在数据分布不平衡的场景下更具参考意义. F1的定义为
4)平均精度均值mAP (mean average precision)为在多个类别上的平均精度. mAP50为在50%的IOU阈值下的mAP,mAP50-95为在50%~95%的IOU下的mAP平均值,能够更准确地评估模型在不同IOU阈值下的性能. mAP的计算公式如下:
式中:n为类别数.
检测速度v为每秒内可以处理的图片数量,以此来评估检测速度,时间越短,速度越快.
2.3. 对比实验
与当前的文字检测模型进行比较. 为了全面评估所提算法的性能,在ICDAR2015与Total-Text数据集上,与EAST、DBNet、SegLink和PSENet模型进行系统性对比实验. 实验采用标准化评估指标,以保证评估的客观性与可比性. 为了增强实验结果的可信度与稳定性,所有实验在每个数据集上均对各模型进行多次独立重复实验. 所有实验均在相同的模型架构与训练参数设置下进行,统一采用相同的训练与测试流程,对测试集进行检测并计算各项性能指标. 实验结果如表1所示.
表 1 在ICDAR2015与Total-text数据集上使用不同算法的检测结果
Tab.1
| 方法 | ICDAR2015 | Total-text | |||||||
| P/% | R/% | F1/% | v/(帧·s−1) | P/% | R/% | F1/% | v/(帧·s−1) | ||
| EAST | 83.2 | 78.6 | 80.8 | 13.2 | 80.9 | 76.2 | 78.5 | 11.6 | |
| DBNet | 84.0 | 82.7 | 83.3 | 22.0 | 81.2 | 79.9 | 80.6 | 20.3 | |
| SegLink | 86.9 | 79.5 | 83.0 | 5.9 | 86.1 | 82.6 | 84.4 | 4.9 | |
| PSENet | 84.3 | 84.5 | 84.4 | 8.0 | 87.6 | 82.3 | 84.8 | 7.3 | |
| ETST(本文算法) | 87.4 | 83.1 | 85.1 | 12.4 | 86.5 | 84.9 | 85.7 | 10.3 | |
从表1可以看出,提出的算法在2个数据集上均取得了优于对比算法的整体检测性能,具体表现为F值在不同数据集下均取得最高值,准确率和召回率也较高,表明本文算法在复杂背景和不同文本表现形态下具备较强的泛化能力,能够有效应对不同场景下的文本检测任务. 尽管总体性能表现优异,本文算法在部分指标上的提升幅度仍较有限,对图像的处理速度较低.
与交通标识检测模型进行比较. 为了验证测试本文算法在高速公路交通标识文本检测方面的性能,在CCTSDB数据集与GS数据集上对所提算法与各类经典交通标识检测模型进行对比实验. 实验结果如表2所示.
表 2 在CCTSDB与GS高速公路标识数据集上使用不同算法的检测结果
Tab.2
| 方法 | CCTSDB | GS highway sign | |||||||
| P/% | R/% | mAP@0.5 /% | v/(帧·s−1) | P/% | R/% | mAP@0.5 /% | v/(帧·s−1) | ||
| YOLOv5 | 87.3 | 84.5 | 86.1 | 58.2 | 84.9 | 82.0 | 83.7 | 52.4 | |
| YOLOv8 | 89.5 | 86.2 | 88.3 | 65.1 | 87.8 | 84.6 | 86.5 | 60.3 | |
| Faster R-CNN | 85.1 | 82.7 | 84.4 | 9.2 | 82.7 | 80.2 | 81.9 | 8.7 | |
| RetinaNet | 86.0 | 83.2 | 85.0 | 32.5 | 84.2 | 80.9 | 82.4 | 28.7 | |
| ETST(本文算法) | 88.6 | 87.9 | 89.2 | 18.5 | 91.1 | 88.4 | 91.8 | 16.8 | |
实验结果表明,提出的ETST算法在CCTSDB数据集与自定义交通标识文字数据集GS上均表现出优异的检测性能,尤其在自定义数据集上展现出显著优势. 这种差异可以归因于2个方面. 自定义数据集和基准数据集在数据分布和任务难度方面存在显著差异,自定义数据集更加贴合特定高速公路的应用场景,具有独特的挑战和特点. ETST在模型架构方面进行了创新,以更好地适应自定义数据集.
为了验证所提方法在小目标检测方面的性能,单独使用GS数据集中的小目标部分数据,对所提方法与交通标识检测模型进行系统对比实验. 实验采用标准化评估指标,以保证评估的客观性. 实验结果如表3所示.
表 3 在GS高速公路标识小目标数据集上使用不同算法的检测结果
Tab.3
| 方法 | P/% | R/% | F1/% | v/(帧·s−1) |
| YOLOv5 | 80.6 | 75.4 | 77.9 | 47.5 |
| YOLOv8 | 84.9 | 79.2 | 81.9 | 54.6 |
| Faster R-CNN | 77.2 | 73.1 | 75.1 | 6.3 |
| RetinaNet | 79.8 | 74.8 | 77.2 | 24.7 |
| ETST(本文算法) | 86.3 | 81.4 | 83.8 | 12.5 |
从表3可以看出,提出的ETST方法在针对小目标检测的精确率、召回率及F1值上均优于其他对比模型,其中F1值较YOLOv8提高约2%,验证了所提方法在小目标检测任务中的有效性. 通过引入多尺度注意机制与改进后的并行补丁感知模块(NPPA),有效增强了对小尺寸文字与远距离标识的特征表达能力,从而减少了误检与漏检现象.
2.4. 消融实验
为了系统评估ETST算法的稳定性与各模块的有效性,逐步引入EMA、NPPA、Loss模块进行消融实验. 在CCTSDB数据集上选取部分图片,开展实验. 最终的实验结果如表4所示.
表 4 在ETST模块上的消融实验结果
Tab.4
| 方法 | EMA | NPPA | Loss | P/% | R/% | F1/% |
| M1 | — | — | — | 76.1 | 76.8 | 76.5 |
| M2 | √ | — | — | 80.4 | 79.6 | 80 |
| M3 | — | √ | — | 84.2 | 80.5 | 82.1 |
| M4 | √ | √ | — | 86.3 | 81.2 | 83.7 |
| M5 | √ | — | √ | 85.2 | 80.7 | 82.8 |
| M6 | √ | √ | √ | 88.2 | 83.5 | 85.8 |
将未添加其他模块的基础模型定义为M1,准确率与召回率分别为76.1%与76.8%. 在M2中,引入EMA模块后,模型参数量增加约13%,但准确率与召回率分别提高了4.3%与2.8%,模型精度显著增强. 在加入NPPA模块后,模型M3的参数量约增加14%,准确值提高至84.2%,较模型M2提高了3.8%,表明重构后的NPPA模块能够有效地从多尺度方向提取图像特征,增强了模型对场景中小文字的提取能力. 多模块的组合取得了较好的效果,如M4~M6所示,但同时加入NPPA与EMA模块导致模型的整体参数量增加约27%,推理时间也逐渐增加,影响了轻量化与实时性.
为了进一步验证提出的改进模块(引入拉普拉斯金字塔结构并调整卷积网络架构的并行化补丁感知模块(NPPA))的有效性,设计并开展对比消融实验. 实验分别基于原始的PPA模块、修改卷积构成模块的PPA模块(表中名为本文算法(PPA1))与NPPA模块开展特征提取与预测任务,在GS高速公路标识数据集上进行系统评估. 实验结果如表5所示.
表 5 改进型并行化补丁感知模块的消融实验结果
Tab.5
| 方法 | P/% | R/% | F1/% |
| 基础算法EAST | 76.1 | 76.8 | 76.5 |
| 本文算法(PPA) | 82.7 | 78.8 | 80.7 |
| 本文算法(PPA1) | 83.2 | 79.5 | 81.3 |
| 本文算法(NPPA) | 84.2 | 80.5 | 82.1 |
在修改卷积结构后,模型的检测性能得到了一定程度的提升. 具体来说,P、R和F1分别提高了0.5%、0.7%、0.6%. 当未引入拉普拉斯金字塔结构时,模型的检测性能明显下降. 具体来说,在引入拉普拉斯金字塔结构之后,P、R和F1分别提高了1.5%、1.7%、1.4%. 该结果表明,在PPA模块中融合拉普拉斯金字塔并调整卷积结构,能够增强模型在低清晰度图像中的判别能力,有效提升模糊目标的检测精度,从而进一步改善整体检测性能.
2.5. 实验可视化
图 5
图 5 通用文字检测器与本文算法的部分可视化结果
Fig.5 Partial visualization result of general text detector and proposed algorithm
3. 结 语
提出ETST算法,这是主要针对高速公路交通标识文字检测的算法. 该算法以ResNet-50集成EMA模块的改进型主干网络作为特征提取基础,通过增强网络对关键语义信息的关注,提高特征表达的判别性与稳健性. 为了强化对小尺度目标的检测性能,设计对并行化补丁感知模块的改进,通过主分支和辅助信息分支的并行学习,获取额外的特征信息,为算法提供更丰富的上下文信息. ETST算法结合了改进骨干网络、多尺度特征提取和辅助信息分支,在交通标识文字检测中表现出较高的准确率和稳定性.
在多个公开数据集上的对比实验结果表明,提出的算法在多项与检测精度相关的评价指标上均优于现有方法,验证了该算法在高速公路交通标识文字检测任务中的有效性与先进性.
未来的研究可以进一步从轻量化与实用化两方面展开. 1)可以尝试设计更加高效的多尺度特征融合与注意力机制,以在保证检测精度的同时降低计算复杂度与模型运行开销. 2)应关注模型在实际部署中的适配性问题,如模型压缩、加速推理与边缘设备部署等,以推动该方法在实时智能交通与车载系统中的落地应用.
参考文献
聚焦难样本的区分尺度的文字检测方法
[J].DOI:10.3785/j.issn.1008-973X.2019.08.009 [本文引用: 1]
Scale differentiated text detection method focusing on hard examples
[J].DOI:10.3785/j.issn.1008-973X.2019.08.009 [本文引用: 1]
Advanced text detection of container numbers via dual-branch adaptive multi-scale network
[J].
Context perception parallel decoder for scene text recognition
[J].DOI:10.1109/TPAMI.2025.3545453 [本文引用: 1]
Improved YOLOv5 network for real-time multi-scale traffic sign detection
[J].DOI:10.1007/s00521-022-08077-5 [本文引用: 1]
A hierarchical approach for traffic sign recognition based on shape detection and image classification
[J].
交通目标YOLO检测技术的研究进展
[J].DOI:10.3785/j.issn.1008-973X.2025.02.003 [本文引用: 1]
Research progress of YOLO detection technology for traffic object
[J].DOI:10.3785/j.issn.1008-973X.2025.02.003 [本文引用: 1]
Road traffic sign detection and classification
[J].DOI:10.1109/41.649946 [本文引用: 1]
Cascade R-CNN: high quality object detection and instance segmentation
[J].
改进SSD算法在交通标志检测中的应用
[J].DOI:10.3778/j.issn.1002-8331.2108-0389 [本文引用: 1]
Application of improved SSD algorithm in traffic sign detection
[J].DOI:10.3778/j.issn.1002-8331.2108-0389 [本文引用: 1]
CCTSDB 2021: a more comprehensive traffic sign detection benchmark
[J].
/
| 〈 |
|
〉 |

