浙江大学学报(工学版), 2026, 60(8): 1678-1685 doi: 10.3785/j.issn.1008-973X.2026.08.007

计算机技术

面向自动驾驶的轻量化交警手势识别方法

柳长源,, 赵海健, 吴海滨, 刘佳伟

1. 哈尔滨理工大学 测控技术与通信工程学院,黑龙江 哈尔滨 150080

2. 黑龙江省公路建设中心,黑龙江 哈尔滨 150001

Lightweight traffic police gesture recognition method for autonomous driving

LIU Changyuan,, ZHAO Haijian, WU Haibin, LIU Jiawei

1. College of Measurement and Control Technology and Communication Engineering, Harbin University of Science and Technology, Harbin 150080, China

2. Heilongjiang Province Highway Construction Center, Harbin 150001, China

收稿日期: 2025-07-11  

基金资助: 黑龙江省交通运输厅科技资助项目(HJK2024B002).

Received: 2025-07-11  

Fund supported: 黑龙江省交通运输厅科技资助项目(HJK2024B002).

作者简介 About authors

柳长源(1970—),男,副教授,从事模式识别、图像处理研究.orcid.org/0000-0003-2204-0612.E-mail:liuchangyuan@hrbust.edu.cn , E-mail:liuchangyuan@hrbust.edu.cn

摘要

现阶段的交警手势识别方法难以在保持高识别准确率的同时实现轻量化部署,且交警手势具有变化细微、使用场景复杂的特点,为此提出面向自动驾驶的轻量化交警手势识别方法. 基于YOLOv8n算法,设计高效自适应权重下采样模块,取代主干网络部分标准卷积,捕捉位置差异,减少参数量与计算量. 设计C2f-G模块,充分利用局部和上下文特征,提高复杂背景下的识别准确率. 在颈部网络引入三重注意力机制,全面捕捉细粒度特征信息. 在中国交警手势数据集上进行验证,与基线模型相比,所提方法的参数量减少44.0%,平均精度均值提升3个百分点,检测速度达294帧/s. 所提方法有效解决了复杂环境下交警手势动态识别的问题,在快速、高精度识别的同时,实现模型轻量化,显著减小了部署难度.

关键词: 自动驾驶 ; 交警手势识别 ; YOLOv8n ; 自适应权重 ; 目标检测

Abstract

A lightweight traffic police gesture recognition method for autonomous driving was proposed to address the challenge of maintaining high recognition accuracy while achieving lightweight deployment, particularly given the subtle variations in gestures and complex application scenarios. An efficient adaptive weight downsampling module was designed on the basis of the YOLOv8n algorithm. This module replaced the standard convolutions in the backbone network to capture spatial differences, reducing both parameter count and computational complexity. Additionally, a C2f-G module was introduced to better leverage local and contextual features, improving the recognition accuracy in complex backgrounds. A triplet attention mechanism was incorporated into the neck network to comprehensively capture fine-grained feature details. Experimental validation on the Chinese traffic police gesture dataset showed that compared to the baseline model, the proposed method reduced the parameter count by 44.0%, increased the mean average precision by 3 percentage points, and achieved a detection speed of 294 frames/s. The proposed method effectively addresses the challenge of dynamic traffic police gesture recognition in complex environments, achieves fast and high-precision recognition, realizes a lightweight architecture, and significantly reduces the deployment complexity.

Keywords: autonomous driving ; traffic police gesture recognition ; YOLOv8n ; adaptive weight ; object detection

PDF (3419KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

柳长源, 赵海健, 吴海滨, 刘佳伟. 面向自动驾驶的轻量化交警手势识别方法. 浙江大学学报(工学版)[J], 2026, 60(8): 1678-1685 doi:10.3785/j.issn.1008-973X.2026.08.007

LIU Changyuan, ZHAO Haijian, WU Haibin, LIU Jiawei. Lightweight traffic police gesture recognition method for autonomous driving. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1678-1685 doi:10.3785/j.issn.1008-973X.2026.08.007

在“双碳”目标和“新四化”双重驱动下,中国汽车产业正经历深刻变革. 自动驾驶作为智能化核心之一,在监管、技术和商业化上不断创新. 2022年3月1日,《汽车驾驶自动化分级》[1]正式实施,声明实现交警手势识别是高度自动驾驶的必要条件,并规定车辆应自动遵循交警指挥,或辅助驾驶员正确识别信号. 快速准确地识别交警手势对自动驾驶普及至关重要.

传统交警手势识别方法主要依赖可穿戴式传感器来实现,通过交警佩戴专门传感器发送手势信号,由车载传感器精确捕获手势信息,具有识别速度快、精度高的优势,但成本高昂、使用条件严苛且限制交警指挥自由[2-3]. 随着深度学习技术的持续发展,基于深度学习的交警手势识别已成为主流方法. 交警手势识别方法可分为动态和静态2类方法,动态交警手势识别主要通过划分各手势的起始帧并输入神经网络进行训练,但存在手势起始界定不清、实时性较差、准确性较低的问题,且易受交警所处复杂背景干扰,难以满足自动驾驶汽车对交警手势识别的实时性与准确性要求[4-5]. 现行的8种交警手势动作序列中,每种手势均存在能够有效代表整个交警手势序列含义的关键姿态,因此可采用静态手势识别方法实现交警手势识别. 近年来,目标检测算法快速发展,越来越多的研究人员将该算法应用于交警手势识别领域. Miao等[6]针对自动驾驶技术中信息处理速度较慢和路况识别能力不足的问题,设计了一套基于YOLOv5的实时交警手势识别系统,通过交通手势分解实现了64帧/s的检测速度,但平均精度(average precision, AP)仅达80.0%,且动态手势处理能力有限. 针对动态识别问题,动态时序研究将人体关键点提取技术与YOLOv5s相结合,通过FastDTW模板匹配将AP提升至85.0%,但时序计算复杂导致速度降至20帧/s[7]. 徐志平[8]提出的双模态改进方案在静态分支引入注意力机制以抑制反光背心干扰,动态分支采用GRU网络建模时序特征,实现了92.3%的动态准确率,但参数量(Params)达到9.01 M. 2024年轻量化研究突破瓶颈,方吴逸等[9]提出一种改进的YOLOX-tiny交警手势识别算法,通过坐标注意力机制与高效解耦头设计,将Params降至3.63 M,并在保持80帧/s实时检测的同时对交警手势识别的检测AP达到90.6%.

现有研究中部分工作过于追求高准确率,忽略了识别速度与模型复杂度,导致难以在实际场景中应用部署;另一部分虽能适应自动驾驶汽车硬件资源有限的约束,但在识别准确率方面仍有提升空间. 由于上述困难,目前的自动驾驶汽车尚未有采用交警手势识别技术的应用案例. 为此,以YOLOv8n为基础,提出面向自动驾驶的轻量化交警手势识别网络,以兼顾检测精度与模型轻量化需求.

1. 网络设计

1.1. 面向自动驾驶的轻量化交警手势识别网络

YOLOv8采用单阶段端到端架构,根据网络缩放系数,提供n、s、m、l、x共5种尺度大小不同的模型. 因为本研究的交警手势识别面向自动驾驶,须同时考虑检测精度、检测速度以及模型复杂度,所以采用尺度相对较小的YOLOv8n网络模型,并针对交警手势变化细微、使用场景复杂的特点做出改进. 具体改进如下:1)设计高效自适应权重下采样(efficient adaptive-weight downsampling, EAWD)模块取代主干网络中的后3个标准卷积,捕捉数据中不同位置的差异;2)设计C2f-G(C2f with context guided downsampling)模块替换网络中原有的C2f模块,充分利用局部和上下文特征提高复杂度;3)在颈部网络上采样阶段中的Upsample之前以及下采样阶段中的每个CBS前引入三重注意力(triplet attention, TA)机制,借助维度间的依存关系和通道间的交互全面捕捉输入数据的特征信息. 面向自动驾驶的轻量化交警手势识别网络如图1所示.

图 1

图 1   改进YOLOv8n的轻量化交警手势识别网络

Fig.1   Lightweight traffic police gesture recognition network based on improved YOLOv8n


1.2. 高效自适应权重下采样模块

YOLOv8主干网络中的标准卷积具有固定的几何结构,权重在空间上呈均匀分布. 针对交警手势识别这类需要高度空间特征敏感性的任务,该结构难以有效捕捉图像中不同位置的差异,导致对局部变化敏感的交警手势识别缺乏足够区分度,并且存在Params和计算开销较大的问题. 为此,设计EAWD模块以替换主干网络中后3个C2f模块前的标准卷积,其网络结构如图2所示. 注意力机制分支将softmax函数融入到卷积核中,突破标准卷积的固定几何结构,权重根据输入自适应调整;自适应下采样分支通过分组卷积和多尺度特征融合,增大感受野,减少特征冗余. 双分支协同增强,解决了主干网络中标准卷积的缺陷.

图 2

图 2   高效自适应权重下采样模块网络结构

Fig.2   Efficient adaptive-weight downsampling module network structure


图2中EAWD模块由2个分支构成:分支1为注意力机制分支,分支2为自适应下采样分支. 分支1使用平均池化层(average pooling, Avgpool)对输入特征图进行下采样操作,以聚合每个接收域特征的全局信息,该过程可表示为

$ {{\boldsymbol{Y}}_{{\mathrm{pool}}}} = \frac{1}{{k{{ \times }}k}}\sum\limits_{p = 0}^{k - 1} {\sum\limits_{q = 0}^{k - 1} {{\boldsymbol{X}}\left[ {{\text{BS}},C,H \times s+p,W \times s+q} \right]} } . $

式中:Ypool为输出张量,张量形状为(BS,C,2H,2W);X为输入张量;k×k为平均池化窗口大小,设置为3×3;BS为批次大小;C为通道数;H、W分别为输入张量的高度和宽度;s为步幅,设置为1;pq分别为平均池化窗口内的索引,pq的遍历通过高和宽方向上的步幅设置实现,高和宽方向上的步幅设置均为2.

对1×1卷积层进行特征提取,得到注意力权重,使用softmax函数对注意力权重进行归一化,得到每个位置的权重系数. 根据权重系数对特征图进行加权平均,强调接收域特征中每个特征的重要性,表达式为

$ {{\boldsymbol{W}}_{{\mathrm{att}}}} = {\mathrm{softmax}}\left( {{\mathrm{kernel}}\left( {{{\boldsymbol{Y}}_{{\mathrm{pool}}}}} \right)} \right). $

式中:Watt为注意力权重,由平均池化后的输出Ypool应用kernel size=1的kernel变换和softmax函数得到.

分支2中输入张量经过3×3的组卷积操作变为16组形状为(BS,4C,H,W)的张量,通过增加通道数的方式,减小了空间维度,提高了感受野,在提取到更丰富的特征信息的同时,降低了计算负载,表达式为

$ \begin{split} {{\boldsymbol{Y}}_{{\mathrm{group}}}} =& \sum\limits_{g = 0}^{15} {\sum\limits_{C' = 0}^{C/15} {\sum\limits_{{k_H} = 0}^2 {\sum\limits_{{k_H} = 0}^2 {\boldsymbol{X}} } } } \left[ {{\mathrm{BS}},g \times (C/16)+C'{\text{,}}2 \times H'+} \right. \\ &\left. {{k_H},2 \times W'+{k_W}} \right] \times {\boldsymbol{K}} \left[ {g,C',4,{k_{H,}}{k_W}} \right]. \end{split} $

式中:Ygroup为输入张量X经过3×3的组卷积,分为16组后每一组的形状为(BS,4C,H,W)输出张量;H'W'分别为输出张量的高度和宽度;K[g,C',4,kH,kW]为卷积核权重;g为组索引;C'为组内通道索引;kHkW分别为卷积核的高度和宽度.

rearrange函数将2个分支的权重统一重组为形状为(BS,C,H,W,4)的张量,以进行维度匹配,将2个分支的权重进行逐元素相乘,并在最后1个维度上求和,得到加权后的特征表示为

$ \left. \begin{gathered} {{\boldsymbol{Y}}_{{\mathrm{rear}}}} = {\mathrm{rearrange}}\left( {{{\boldsymbol{Y}}_{{\mathrm{group}}}}} \right), \\ {{\boldsymbol{W}}_{{\mathrm{rear}}}} = {\mathrm{rearrange}}\left( {{{\boldsymbol{W}}_{{\mathrm{att}}}}} \right), \\ {{\boldsymbol{Y}}_{{\mathrm{weighted}}}} = {{\boldsymbol{W}}_{{\mathrm{rear}}}} \odot {{\boldsymbol{Y}}_{{\mathrm{rear}}}}, \\ {{\boldsymbol{Y}}_{{\mathrm{output}}}} = \sum { {{{\boldsymbol{Y}}_{{\mathrm{weighted}}}}} } . \\ \end{gathered} \right\} $

式中:YrearWrear分别为YgroupWatt经过rearrange函数变换后的形状为(BS,C,H,W,4)的输出张量;YweightYrearWatt进行逐元素相乘的输出. 通过对加权特征图Yweight进行元素级累加求和获得最终输出Youtput.

EAWD模块通过评估通道间的重要性,筛选出最显著的特征,避免因简单下采样或固定权重所导致的信息丢失问题;采用分组卷积将输入通道均匀分配至多个卷积核,提升模块并行度与运行效率;结合下采样操作减小特征图尺寸,降低Params与计算复杂度.

1.3. C2f-G模块

YOLOv8主干网络中的C2f模块因其局部卷积操作缺乏长距离信息关联,且对所有通道区域采用平等处理,导致对关键手势区域的捕捉能力不足. 受上下文引导网络(context guided network, CG Net)中的上下文引导块(context guided block, CG Block)[10]启发,设计上下文引导下采样(context guided downsampling block, CGD Block),并将其集成至C2f模块,重新构建为C2f-G模块. 该模块通过引入含空洞卷积的周围上下文提取器扩大感受野,建立全身姿态关联模型;借助动态通道压缩与局部特征提取器,减少对背景区域的计算,从而提升检测速度,改善原C2f模块的局限性.

CGD Block网络结构如图3所示,输入特征图XC形状为(BS,H,W,C),经1×1卷积下采样后,分别输入至局部特征提取器与周围上下文提取器. 局部特征提取器采用3×3标准卷积,从周围的8个相邻特征向量中学习局部特征,对应图3(a)中中心目标区域,输出形状为(BS,H/2,W/2,2C)的特征图Xloc;周围上下文提取器采用3×3深度可分离卷积,可有效捕捉特征图中的空间模式并学习周围上下文信息,对应图3(b)中扩展上下文区域,输出形状为(BS,H/2,W/2,2C)的特征图Xsur. 联合特征提取器将局部特征提取器的输出Xloc和周围上下文提取器的输出Xsur进行逐元素的简单相加进行特征的互补融合,从而提取联合特征,得到形状为(BS,H/2,W/2,4C)的特征图Xjoi. 再通过1×1的卷积调整通道数,得到形状为(BS,H/2,W/2,2C)的特征图. 全局上下文提取器中的全局平均池化层(global average pooling, GAP)聚合图3(c)全局背景区域中对应的全局上下文,再由多层感知机进一步提取全局上下文特征. 全连接层(fully connected layer, FC)将全局特征向量映射到最终的输出类别. 全局上下文提取器从输入图像中提取全局上下文信息,最后得到形状为(BS,H/2,W/2,2C)的输出特征图Xfinal.

图 3

图 3   上下文引导下采样模块网络结构图

Fig.3   Network structure diagram of context-guided downsampling module


Bottleneck、C2f与C2f-G的结构如图4所示. 所提出的C2f-G模块将C2f模块中的Bottleneck替换为CGD Block模块. 原C2f模块通过堆叠Bottleneck结构实现特征提取,但易导致通道信息过度冗余;而CGD Block在充分利用局部特征、周围上下文和全局上下文的同时,提升了交警手势识别的准确度,降低了Params.

图 4

图 4   Bottleneck、C2f与C2f-G网络结构

Fig.4   Bottleneck、C2f and C2f-G network structure


1.4. 三重注意力机制

YOLOv8在复杂环境下检测精准度下降的主要原因在于模型难以从复杂环境中精准捕捉关键特征. 为进一步提升交通手势的关键信息提取能力并提升模型在复杂环境中的鲁棒性,将TA机制[11]引入颈部网络,在不涉及任何维数降低的前提下实现轻量化设计与特征提取能力的平衡. TA机制由3个分支组成:1个分支为空间注意力,另外2个分支分别负责通道C与空间W、通道C与空间H之间的跨维交互. 对于输入张量,TA机制中通过旋转操作结合残差变换,建立维度间的依存关系. 独特的跨维度交互可以促进模型深入理解不同特征间的关联,从而提取出更加丰富和更有区分性的特征表示,提升交警手势识别的准确率. 同时,该机制引入的计算开销极小,在增强模型泛化能力的同时保持了较高的计算效率. TA机制结构如图5所示.

图 5

图 5   三重注意力机制结构

Fig.5   Triplet attention mechanism structure


2. 实验与分析

2.1. 实验数据集

由于目前没有公开的中国交警手势图片数据集,将文献[12]中公开的中国交警手势(Chinese traffic police gesture,CTPG)数据集通过Adobe Premiere Pro以5帧/s的速度进行分割,通过人工先挑选出交警穿着制服的图片,作为区分交警和行人的特征;再由人工挑选出每种CTPG关键帧,对得到的8种CTPG关键帧进行数据增强操作. 针对CTPG数据集中复杂环境样本多样性不足的问题,通过网络爬取采集包含实际道路、交叉路口、雨雪天气等复杂环境的图像,并人工筛选对应的8种交警手势进行数据增强操作. 对获取的图片数据集进行统一预处理,调整至640×640像素,采用labelimg工具进行人工标注,最终构建具有8种现行CTPG的数据集,总计16 000张,每种手势对应2 000张,随机抽取训练集、验证集、测试集的比例为6∶2∶2. 部分数据集见图6.

图 6

图 6   部分数据集图片

Fig.6   Images of selected datasets


2.2. 实验环境

实验硬件环境为IntelCore i9-13900K处理器,GeForce RTX 4080 16G显卡;软件环境为CUDA11.8,使用Pytorch 1.13.1深度学习框架. 在训练中使用随机梯度下降(stochastic gradient descent, SGD)优化器进行参数优化,初始学习率设置为0.001,Batchsize设置为32,共训练300轮.

2.3. 实验指标

采用的评价指标包括精确率P、召回率R、AP、平均精度均值mAP,计算公式为

$ P = \frac{{{\text{TP}}}}{{{\text{TP}}+{\text{FP}}}}, $

$ R = \frac{{{\text{TP}}}}{{{\text{TP}}+{\text{FN}}}}, $

$ {\text{AP}} = \int_0^1 {p\left( r \right){\mathrm{d}}r} , $

$ {\text{mAP}} = \dfrac{1}{\;n\;}\sum\limits_{i = 1}^n {{\text{A}}{{\text{P}}_i}} . $

式中:TP为成功预测的正例,FP为被模型误判为正例的负例,FN为被模型错误预测为负例的正例. 检测速度以帧率FR衡量,计算复杂度以10亿次浮点运算量GFLOPs表示,模型的复杂度通过Params进行评估.

2.4. 实验结果分析

表1为本研究网络的消融实验结果. 实验8在集成EAWD模块、C2f-G模块与TA机制后,形成轻量化交警手势识别网络. 实验结果表明,与实验1相比,实验8的GFLOPs下降3 G,Params下降1.4 M,mAP=97.9%,较实验1提升3个百分点,综合性能最优. 系统性的实验设计与验证表明,所提出的轻量化网络在交警手势识别任务中表现出良好性能,验证了该网络改进的有效性.

表 1   消融实验结果

Tab.1  Results of ablation experiments

实验
编号
EAWDC2f-GTAGFLOPs/
109
Params/
106
mAP/
%
实验
编号
EAWDC2f-GTAGFLOPs/
109
Params/
106
mAP/
%
18.73.294.955.71.897.4
28.02.796.168.12.897.5
35.92.195.876.02.197.2
48.33.095.585.71.897.9

新窗口打开| 下载CSV


为验证所提方法在交警手势识别的检测性能,将本研究网络与目前主流的目标检测算法进行对比. 所有实验统一设置输入图像尺寸为640×640像素,总训练轮次为300轮,使用SGD优化器进行参数优化,初始学习率设置为0.001,Batchsize设置为32. 由表2中结果对比可知,本研究所采用的网络在多项指标上均优于对比模型. 本研究网络在轻量化水平方面提升显著的同时,在PR与mAP方面亦达到最优性能. 综上,所提网络在交警手势识别任务中表现优越,且相比其他主流目标检测网络更适用于边缘设备部署.

表 2   各主流目标检测算法性能对比实验结果

Tab.2  Performance comparison experiments of various mainstream target detection algorithms

网络模型GFLOPs/109Params/106FR/(帧∙s−1P/%R/%mAP/%
RT-DETR-R18[13]10.118.718092.891.490.2
Gold-YOLO-N[14]12.15.626596.095.195.2
YOLOv5s[15]16.57.223393.092.794.2
YOLOv8s[16]28.611.220697.596.096.0
YOLOv9s[17]26.77.224396.393.595.1
YOLOv10s[18]21.67.226496.897.396.6
YOLOv11s[19]21.59.425897.898.497.6
本研究网络5.71.829499.298.697.9

新窗口打开| 下载CSV


为验证本研究方法在交警手势识别任务中的轻量化程度,将本研究网络与其他轻量化目标检测网络在同表2对比试验的实验条件下进行对比实验,结果如表3所示.结果表明,本研究网络的GFLOPs=5.7 G,仅略高于YOLOv5n;Params=1.8 M,达最优水平;FR=294帧/s,仅次于YOLO11n(340帧/s)与YOLOv10n(335帧/s). 在检测精度方面,本研究网络的P=99.2%,R=98.6%,mAP=97.9%,3项指标均为最优值. 综合各项评价指标可知,相较于当前主流目标检测算法,所提网络在检测速度、模型规模与识别精度之间实现了最佳平衡,在中国交警手势识别任务中表现卓越,充分体现了其综合性能优势.

表 3   轻量化目标检测网络性能对比实验结果

Tab.3  Comparative experiments on performance of lightweight target detection networks

网络模型GFLOPs/109Params/106FR/(帧∙s−1P/%R/%mAP/%
YOLOv4-tiny[20]6.96.124484.282.584.0
YOLOv5n[15]4.51.926891.492.092.5
YOLOv7-tiny[21]5.86.225092.491.293.0
YOLOv10n[18]6.72.333595.294.494.8
YOLOv11n[19]6.52.634096.697.196.0
本研究网络5.71.829499.298.697.9

新窗口打开| 下载CSV


2.5. 实验可视化分析

为评估改进后网络的有效性,采用Grad-CAM技术进行可视化分析,热力图颜色越深的区域,代表模型在该处的关注度越高,对应交警手势识别的准确度越高. 如图7所示为YOLOv8n与本研究改进网络的热力图可视化对比. 相较于YOLOv8n,改进网络在定位交警手势的手掌、手臂、面部朝向等关键部位时,定位准确度上明显优于YOLOv8n,且热力值更高.

图 7

图 7   热力图可视化结果

Fig.7   Heatmap visualization results


为评估本研究网络在连续帧上的时序稳定性,从交通手势视频中截取完整手势片段并手动选取变道缓行和靠边停车2个手势片段中最具代表性的连续3帧图像进行检测,实验结果如图8所示. 可以看出,本研究网络在变道手势(a)、(b)、(c)和靠边停车手势(d)、(e)、(f)连续帧检测中均能正确识别,证明本研究网络能够有效处理动态手势的连续帧,具有良好的时序稳定性.

图 8

图 8   连续帧的识别结果

Fig.8   Recognition results of consecutive frames


为进一步评估改进网络在复杂环境下的性能,与其他轻量化目标检测网络在6幅测试图像上进行可视化对比实验,结果如图9所示. 图9的实验结果显示,简单场景下(测试图像1),所有网络均能正确识别变道缓行手势,但改进网络在边界框的大小和定位上更为精准;在较为复杂的场景中(测试图像2~5),大部分方法能够识别交警手势,但本研究方法在边界框定位和交警手部细节划分上表现更为精确;在包含2个交警的复杂场景(测试图像6)中,YOLOv4-tiny、YOLOv5n、YOLOv7-tiny和YOLOv8n错误识别手势,而本研究网络对手势识别正确,且定位更加准确. 综上,本研究网络在复杂环境中的交警手势识别具有较高的准确性.

图 9

图 9   本研究网络与其他轻量化目标检测网络在测试图像上检测结果可视化的对比

Fig.9   Comparison of proposed network with other lightweight target detection networks for visualization of detection results on test images


3. 结 语

基于YOLOv8n提出面向自动驾驶的轻量化交警手势识别网络,以应对交警手势细微变化、复杂场景识别困难及现有方法部署难的问题. 通过设计高效自适应权重下采样模块替代主干网络中的标准卷积,捕捉图像不同位置的差异,提升对细微手势变化的识别能力;引入C2f-G模块以优化局部和上下文特征的融合,提升复杂场景下的识别精度;在颈部网络引入三重注意力机制,增强对交警手势细节的关注. 与原算法相比,基于YOLOv8n改进的模型网络参数量为1.8 M,降低44.0%;检测速度为294帧/s;平均精度值达97.9%. 所提方法在自制的中国交警手势数据集上表现优异,有效兼顾检测精度与模型轻量化,能够满足交警手势识别高精度动态实时性要求. 在未来研究与工作中,将致力于更复杂环境下的交警手势识别研究以及设备部署的需求.

参考文献

全国汽车标准化技术委员会. 汽车驾驶自动化分级: GB/T 40429-2021[S]. 北京: 中国标准出版社, 2021: 7–9.

[本文引用: 1]

YUAN T, WANG B

Accelerometer-based Chinese traffic police gesture recognition system

[J]. Chinese Journal of Electronics, 2010, 19 (2): 270- 274

[本文引用: 1]

YOU Z, LIU J, HOU W, et al. A wearable system designed for Chinese traffic police based on gesture recognition [M]// Transdisciplinary Engineering: A Paradigm Shift. IOS Press, 2017: 385–393.

[本文引用: 1]

GUO F, CAI Z, TANG J. Chinese traffic police gesture recognition in complex scene [C]// 2011 IEEE 10th International Conference on Trust, Security and Privacy in Computing and Communications. Changsha: IEEE, 2011: 1505–1511.

[本文引用: 1]

SATHYA R, GEETHA M K

Vision based traffic police hand signal recognition in surveillance video-a survey

[J]. International Journal of Computer Applications, 2013, 81 (9): 1- 10

DOI:10.5120/14037-2192      [本文引用: 1]

MIAO Y, SHI E, LEI M, et al. Vehicle control system based on dynamic traffic gesture recognition [C]// 2022 5th International Conference on Circuits, Systems and Simulation (ICCSS). Piscataway: IEEE, 2022: 196–201.

[本文引用: 1]

马天祥

基于目标检测和模板匹配的交警手势识别研究

[J]. 现代信息科技, 2022, 6 (20): 60- 64

[本文引用: 1]

MA Tianxiang

Research on traffic police gesture recognition based on object detection and template matching

[J]. Modern Information Technology, 2022, 6 (20): 60- 64

[本文引用: 1]

徐志平. 基于深度学习的交通指挥手势识别[D]. 济南: 济南大学, 2023.

[本文引用: 1]

XU Zhiping. Recognition of traffic command gestures based on deep learning [D]. Jinan: University of Jinan, 2023.

[本文引用: 1]

方吴逸, 陈章进, 唐英杰

基于改进YOLOX-tiny算法的交警手势识别

[J]. 电子测量技术, 2024, 47 (8): 100- 109

[本文引用: 1]

FANG Wuyi, CHEN Zhangjin, TANG Yingjie

Traffic police gesture recognition based on improved YOLOX-tiny algorithm

[J]. Electronic Measurement Technology, 2024, 47 (8): 100- 109

[本文引用: 1]

WU T, TANG S, ZHANG R, et al

CGNet: a light-weight context guided network for semantic segmentation

[J]. IEEE Transactions on Image Processing, 2020, 30: 1169- 1179

[本文引用: 1]

MISRA D, NALAMADA T, ARASANIPALAI A U, et al. Rotate to attend: convolutional triplet attention module [C]// Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. [S.l.]: IEEE, 2021: 3139–3148.

[本文引用: 1]

HE J, ZHANG C, HE X, et al

Visual recognition of traffic police gestures with convolutional pose machine and handcrafted features

[J]. Neurocomputing, 2020, 390: 248- 259

DOI:10.1016/j.neucom.2019.07.103      [本文引用: 1]

ZHAO Y, LV W, XU S, et al. Detrs beat YOLOs on real-time object detection [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 16965–16974.

[本文引用: 1]

WANG C, HE W, NIE Y, et al

Gold-YOLO: efficient object detector via gather-and-distribute mechanism

[J]. Advances in Neural Information Processing Systems, 2023, 36: 51094- 51112

[本文引用: 1]

JOCHER G, CHAURASIA A, QIU J. YOLOv5 [EB/OL]. (2021–07–08)[2024–04–09]. https://github.com/ultralytics/yolov5.

[本文引用: 2]

YASEEN M. What is YOLOv8: an in-depth exploration of the internal features of the next-generation object detector [EB/OL]. (2024–08–28)[2026–07–02]. https://arxiv.org/abs/2408.15857.

[本文引用: 1]

WANG C Y, YEH I H, MARK LIAO H Y. YOLOv9: learning what you want to learn using programmable gradient information [C]// European Conference on Computer Vision. Cham: Springer, 2024: 1–21.

[本文引用: 1]

WANG A, CHEN H, LIU L, et al

YOLOv10: real-time end-to-end object detection

[J]. Advances in Neural Information Processing Systems, 2024, 37: 107984- 108011

[本文引用: 2]

KHANAM R, HUSSAIN M. YOLOv11: an overview of the key architectural enhancements [EB/OL]. (2024–10–23)[2026–07–02]. https://doi.org/10.48550/arXiv.2410.17725.

[本文引用: 2]

BOCHKOVSKIY A, WANG C Y, LIAO H Y M. YOLOv4: optimal speed and accuracy of object detection [EB/OL]. (2020–04–23)[2024–11–20]. https://arxiv.org/abs/2004.10934.

[本文引用: 1]

WANG C Y, BOCHKOVSKIY A, LIAO H Y M. YOLOv7: trainable bag-of-freebies sets new state-of-the-art for real-time object detectors [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 7464–7475.

[本文引用: 1]

/