浙江大学学报(工学版), 2026, 60(10): 2196-2206 doi: 10.3785/j.issn.1008-973X.2026.10.012

计算机技术与控制工程

基于姿态诱导的多模态步态识别

高巍,, 于志栋, 常媛媛, 苗旺, 尹永亮, 邓红霞,

1. 太原理工大学 计算机科学与技术学院(大数据学院),山西 太原 030024

2. 太原理工大学 体育与健康工程学院,山西 太原 030024

Multimodal gait recognition based on pose induction

GAO Wei,, YU Zhidong, CHANG Yuanyuan, MIAO Wang, YIN Yongliang, DENG Hongxia,

1. College of Computer Science and Technology (College of Data Science), Taiyuan University of Technology, Taiyuan 030024, China

2. School of Physical Education and Health Engineering, Taiyuan University of Technology, Taiyuan 030024, China

通讯作者: 邓红霞,女,教授. orcid.org/0000-0001-9738-1310. E-mail:denghongxia@tyut.edu.cn

收稿日期: 2025-12-16  

基金资助: 山西省中央引导地方科技发展资金项目(YDZJSX2022A016);山西省重点研发计划资助项目(2022ZDYF128);山西省科技战略项目(202404030401080).

Received: 2025-12-16  

Fund supported: 山西省中央引导地方科技发展资金项目(YDZJSX2022A016);山西省重点研发计划资助项目(2022ZDYF128);山西省科技战略项目(202404030401080).

作者简介 About authors

高巍(1999—),男,硕士生,从事步态识别研究.orcid.org/0009-0004-7603-4909.E-mail:gw190428@163.com , E-mail:gw190428@163.com

摘要

为了实现复杂环境下步态的多视角细粒度识别,提出基于姿态诱导的多模态步态识别方法,并构建包含真实三维姿态的多模态数据集(CASIA-V). 该数据集通过多设备同步采集93名受试者在正常、背包、穿大衣行走下的11视角数据,包含11253个RGB序列及对应动捕姿态与深度图. 在方法层面,提出时空对齐策略实现动捕与视频姿态匹配,设计可独立训练的三维姿态诱导模块(3D-SIM)提取真实姿态语义,并构建双分支模型SIGait融合姿态与轮廓特征. 实验表明,在CASIA-V数据集的跨视角评估协议下(排除相同视角样本对),SIGait在正常行走场景下的Rank-1准确率达97.7%;相较基线方法MSAFF,在背包与穿大衣场景下Rank-1准确率分别提升5.1和7.1个百分点,且推理过程无需动捕数据,验证了真实三维姿态对复杂场景步态识别的有效促进. 结果同时显示,真实三维姿态语义能增强多模态特征表达,使识别系统在视角变化与外观干扰条件下保持稳定识别性能.

关键词: 步态识别 ; 多模态数据集 ; 三维姿态 ; 时空对齐 ; 姿态诱导 ; 特征融合 ; 惯性动捕

Abstract

A pose-induced multimodal gait recognition method was proposed and a new multimodal dataset named CASIA-V containing real 3D human poses was constructed, in order to achieve multi-view fine-grained gait recognition in complex environments. The dataset was collected using multiple synchronized devices, capturing 93 subjects walking under three conditions (normal, carrying a bag, and wearing a coat) from 11 different viewpoints. It contained 11 253 RGB sequences along with corresponding motion-capture poses and depth maps. At the methodological level, a spatiotemporal alignment strategy was introduced to match motion-capture poses with video-based poses. A separately trainable 3D Pose-Induced Module (3D-SIM) was designed to extract real pose semantics, and a dual-branch model named SIGait was constructed to fuse pose and silhouette features. The experiment showed that, under the cross-view evaluation protocol of the CASIA-V dataset (excluding samples from the same view), SIGait achieved a Rank-1 accuracy of 97.7% in the normal walking scenario. Compared with the baseline method MSAFF, SIGait improved the Rank-1 accuracy by 5.1 and 7.1 percentage points in the carrying-bag and wearing-coat scenarios, respectively. Notably, the inference process did not require motion-capture data, validating that real 3D pose effectively enhanced gait recognition in complex scenarios. The results further showed that real 3D pose semantics enhanced multimodal feature representation and maintained stable recognition performance under view variations and appearance interference.

Keywords: gait recognition ; multi-modal dataset ; 3D pose ; spatiotemporal alignment ; pose induction ; feature fusion ; inertial motion capture

PDF (1270KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

高巍, 于志栋, 常媛媛, 苗旺, 尹永亮, 邓红霞. 基于姿态诱导的多模态步态识别. 浙江大学学报(工学版)[J], 2026, 60(10): 2196-2206 doi:10.3785/j.issn.1008-973X.2026.10.012

GAO Wei, YU Zhidong, CHANG Yuanyuan, MIAO Wang, YIN Yongliang, DENG Hongxia. Multimodal gait recognition based on pose induction. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(10): 2196-2206 doi:10.3785/j.issn.1008-973X.2026.10.012

步态识别作为生物识别技术的重要分支,凭借距离识别、非接触式感知及无需目标主动配合等特性,相较于其他生物识别技术[1-3]具有显著优势,在安防监控、智能交通、智慧医疗等实际场景[4]中展现出巨大应用潜力.

现有步态识别方法主要分为2类:基于外观的方法[5-11]以轮廓为输入,虽能提供丰富外观信息,但对服装、视角变化敏感,难以捕捉人体内部结构特征;基于模型的方法[12-16]以骨骼为输入,虽具备稳定的运动结构信息,不易受外界干扰,却缺失关键的外观细节.

单一模态在应对视角变化、服装遮挡和跨条件干扰等复杂场景时鲁棒性不足,多模态融合成为提升性能的重要方向,但现有多模态方法[17-21]往往未能有效利用真实三维姿态信息,导致特征互补性挖掘不充分,在复杂环境下的识别准确性仍有提升空间.

最近研究中,Guo等[16]在工作中引入基于3D 骨骼步态识别的物理增强自动编码器模型,用物理解码器通过动力学约束保证图卷积编码器提取到的物理特征的合理性,对步态识别的准确性有显著提升. 该模型证实了更加真实的三维姿态对步态识别准确性的重要影响. 然而,现有步态基准数据集多以视频数据为核心展开分析,普遍缺乏真实三维姿态信息支撑,导致多视角细粒度特征提取能力受限,难以满足复杂环境下的识别需求. 此外,现有多模态步态识别研究尚缺少对真实三维姿态增益作用的系统验证.

针对上述问题,本研究构建了CASIA-V数据集并提出基于姿态诱导的多模态步态识别方法SIGait. 1)构建CASIA-V数据集,其构建方法可以看作是在CASIA-B数据集[22]的基础上添加与视频数据同步的动捕姿态数据,为探索多视角步态识别中真实三维姿态的增益效果提供了支撑. 2)提出姿态诱导模块3D-SIM,从视频姿态中获取有效特征. 3)构建基于姿态诱导的多模态步态识别模型,模型以轮廓、视频姿态和动捕姿态作为输入进行步态识别. 为了实现3D-SIM模块的通用性与即插即用能力,采用‘单独训练+下游微调’的2阶段训练策略:第1阶段仅通过图卷积损失函数单独训练3D-SIM,使其专注于视频姿态与真实动捕姿态的特征对齐;第2阶段将训练完成的3D-SIM直接插入目标网络,仅微调下游模块即可适配不同识别任务,无须修改3D-SIM内部结构与参数.

1. 相关工作

步态识别是通过分析个体行走姿态特征实现身份识别的技术,随着深度学习发展,其研究场景也逐渐从受限的室内环境如CASIA-B数据集[22]和OU-MVLP数据集[23]扩展至更有挑战性的开放式真实场景,如Gait3D数据集[24]和GREW数据集[25],但现有数据集的三维姿态多为估计值,缺乏真实三维姿态支撑.

当前步态识别方法分为单模态与多模态2类. 单模态方法包含2种类型. 1)基于模型的方法. 如Zhang等[15]提出用于骨骼步态识别的新模型,该模型将空间转换器与时间卷积网络相结合. 随着图卷积神经网络(graph convolutional network, GCN)[26]在动作识别领域的广泛使用,GCN逐渐被引入步态识别领域,Teepe等[13]首次利用基于图神经网络(graph neural network,GNN)的技术,将步态表示为人体骨骼的关键点集合及其之间的关系. Guo等[16]用物理解码器通过动力学约束保证图卷积编码器提取到的物理特征的合理性,提高三维姿态识别精度. 该方法以二维骨骼或三维姿态为输入,借助图卷积神经网络建模人体结构与动作,优势是运动结构信息稳定、抗干扰能力强,不足是缺失外观细节. 2)基于轮廓的方法. 比如Chao等[5]聚焦于人体整体轮廓的动态特征,有效提高了步态识别的鲁棒性. Huang等[7]提出三维局部卷积,针对传统部分建模缺陷,通过自适应三维局部操作精准提取各身体部位时空特征. Li等[27]提出融合卷积与Transformer的混合框架来优化步态的时空表示. 该类方法将二进制轮廓图作为输入,通过卷积网络挖掘判别特征,优势是计算成本低,不足是易忽略人体内部结构信息.

单模态方法在复杂场景下鲁棒性不足,多模态融合成为提升性能的重要方向. 现有多模态方法多融合轮廓与骨骼特征,但三维姿态大多由二维姿态估算得到,与真实三维姿态差距较大,难以提取细粒度特征,同时精准三维姿态估计存在采集要求高、计算成本增加的问题,导致多模态特征互补性挖掘不充分.

2. 数据集CASIA-V

针对现有步态数据集缺乏真实三维姿态、多模态特征互补性挖掘不足的问题,借鉴CASIA-B采集方案,构建含RGB视频、动捕姿态与深度图的多模态数据集CASIA-V,强化真实三维姿态对步态特征提取的引导作用.

2.1. 数据集采集方案

2.1.1. 采集设备选型

采用VDSuit惯性动捕设备、Intel RealSense D455双目深度相机、海康工业RGB摄像头同步采集,获取高精度三维姿态、深度信息与RGB视频.

2.1.2. 采集场景与参数设计

设置0°~180°共11个视角(间隔18°);设计3类行走条件:正常行走(NM)、背包行走(BG)、穿大衣行走(CL). RGB视频与动捕姿态覆盖全视角,深度图聚焦0°视角采集. 采集流程规范如下:1)数据采集场地示意图如图1所示. 受试者须在半室内空旷场地(无明显遮挡、光照均匀)进行自然行走,每视角下重复采集11次有效步态序列,确保数据的重复性与可靠性. 2)所有设备通过硬件同步触发机制或后验对齐,保证RGB视频、深度图、动捕姿态三者的采集时间差小于60 ms,满足时空一致性要求.

图 1

图 1   数据采集场地示意图

Fig.1   Data collection site diagram


2.2. 数据集规模与划分

数据集包含93名受试者的11253个多模态步态序列,单受试者覆盖11 个视角、3 类行走条件,每视角采集11 次有效序列,总计121 个序列. 每个序列均包含RGB视频(30 帧/s,1280×720)、深度图(30 帧/s,1280×720)及动捕姿态序列(60 帧/s,含17 个关键关节三维坐标).

采用受试者独立划分策略:训练集纳入65 名受试者的7865 个序列,用于模型参数学习;测试集纳入28 名受试者的3388 个序列,用于泛化性能评估. 测试集的划分沿用步态识别领域的惯用评估协议“GalleryNM#1-4 Probe”:以正常行走的前4个步态序列(NM#1-4)作为注册集(Gallery),其余步态序列行走数据作为查询集(Probe). 后续所有实验的Rank-1准确率计算均遵循跨视角评估协议,即排除注册集与查询集的相同视角样本对,仅统计不同视角样本对的识别结果.

2.3. 数据集预处理方法

动捕设备骨骼模式须输入真实人体关节长度,该参数由D455双目深度相机采集的正面视角RGB图与深度图,结合HRNet[28]算法获取. 利用HRNet提取RGB图关节像素坐标,经RGB图与深度图配准,结合双目基线计算相机坐标系下人体关节真实三维坐标,进而得到关节长度. 该方法经手动测量验证可行,可规避主观误差.

此外,多设备采集存在帧率、坐标系、采集起点的时空异构性,须通过预处理实现数据对齐,为后续模型输入提供一致性数据,核心步骤如下.

2.3.1. 时间对齐:基于步距最值的时序同步

针对动捕设备无绝对时间戳的问题,通过步态运动的步距变化实现动捕姿态与视频姿态的时间对齐,姿态数据来源说明及具体流程如下.

本研究中涉及3类姿态数据. 1)动捕姿态:由惯性动捕设备(VDSuit)直接提供;2)0°视角视频姿态:基于0°视角下由双目深度相机同步采集的RGB图像与深度图,经HRNet算法结合深度信息提取得到;3)多视角视频姿态:通过VideoPose3D[29]算法对11个视角的RGB视频进行姿态估计得到.

时间对齐策略如下.

1)步距时序序列提取:分别计算动捕姿态序列和0°视角视频姿态序列中每一帧的两脚三维欧氏距离,生成连续的步距时序曲线.

2)对齐基准点确定:选取2条步距曲线中首个局部最大值(双脚分离最远时刻)紧随的局部最小值(双脚并拢时刻)作为时间对齐基准点.

动捕与0°视角视频姿态对齐:将动捕姿态序列与0°视角视频姿态序列在时间轴上对齐,实现帧级一一对应,数学表达如下:

$ {T}_{\text{aligned}}={T}_{\text{min}\_\text{MC}}={T}_{\text{min}\_\text{V}}. $

式中:$ {T}_{\text{aligned}} $为对齐基准时刻,$ {T}_{\text{min}\_\text{MC}} $$ {T}_{\text{min}\_\text{V}} $分别为动捕姿态、0°视角视频姿态序列基准时刻.

3)多视角视频姿态扩展对齐:利用0°视角与其余10 个视角RGB视频的高精度时间戳,将已对齐的动捕姿态映射至全部11 个视角的视频姿态,实现全局时间同步.

通过上述处理,最终获得时空一致的动捕姿态与11 个视角RGB视频姿态序列,构成CASIA-V数据集的时间对齐数据基础. 随机选取一个样本,可视化其处理前、后的对齐结果,如图2所示.

图 2

图 2   时间对齐示意图

Fig.2   Schematic diagram of time alignment


2.3.2. 空间对齐:基于骨盆关节的坐标系适配

动捕设备与RGB摄像头的坐标系原点、方向存在差异,须通过空间变换实现姿态数据坐标系统一. 针对姿态序列,通过逐帧平移使动捕与视频的骨盆位置贴合,结合序列全局旋转消除单帧对齐的整体空间偏差,保障动作序列空间一致性,实现动捕姿态对视频坐标系的适配. 动捕姿态对齐视频姿态的具体实现方法及数学推导如下.

1)确定全局原点:选择人体骨盆关节作为全局坐标系原点(骨盆关节在步态运动中相对稳定,且为肢体运动的中心枢纽);动捕姿态每帧骨盆关节坐标记为$ \left(x_{\text{pelvis}\_\text{gt}}^{t},y_{\rm{pelvis\_gt}}^{{t}},z_{\rm{pelvis\_gt}}^{{t}}\right) $. 对于VideoPose3D数据,须先通过2D检测HRNet定位骨盆关节的2D坐标$ \left(u_{\text{pelvis}\_\text{pred}}^{t},v_{\text{pelvis}\_\text{pred}}^{t}\right) $,再通过弱透视投影模型估计其3D坐标:

$ {\hat{z}}_{\text{peivis}\_\text{pred}}=\dfrac{f H}{{u}_{\text{avg}}}. $

式中:$ {u}_{\text{avg}} $为人体平均宽度,$ {f} $为相机焦距,${H} $为真实身高. 最终得到预测的骨盆3D坐标$ \left(x_{\text{peivis}\_\text{pred}}^{t}, y_{\text{peivis}\_\text{pred}}^{t},z_{\text{peivis}\_\text{pred}}^{t}\right) $,其中 $ t=1,2,\cdots ,T $$ T $为序列帧数.

然后对序列中每帧动捕关节坐标进行平移操作,使动捕骨盆关节与视频骨盆关节坐标对齐.

2)逐帧平移对齐:对每帧动捕姿态数据,计算动捕骨盆关节与视频骨盆关节的坐标差,通过逐帧平移对齐让动捕骨盆贴合视频骨盆. 原始动捕姿态经平移对齐后的变换表达式如下:

$ {{\boldsymbol{S}}}_{\rm{gt\_aligned}}^t={{\boldsymbol{S}}}_{\rm{gt}}^t-\left[\begin{array}{l}x_{\rm{pelvis\_gt}}^t \\y_{\rm{pelvis\_gt}}^t \\z_{\rm{pelvis\_gt}}^t\end{array}\right]+\left[\begin{array}{l}x_{\rm{pelvis\_pred}}^t \\y_{\rm{pelvis\_pred}}^t \\z_{\rm{pelvis\_pred}}^t\end{array}\right] .$

式中:$ \boldsymbol{S}_{\rm{gt}}^{{t}} $为原始动捕姿态,$ t $为帧索引.

3)序列级旋转适配:通过Procrustes分析计算旋转矩阵$ \boldsymbol{R} $,对平移后的动捕姿态序列进行全局旋转,使动捕坐标系与视频坐标系方向一致,消除整体空间偏差.

首先进行去均值处理,对平移后的动捕姿态序列和原始视频姿态序列,计算所有关节的均值,消除平移残留影响:

$ {\boldsymbol{\mu }}_{\text{gt}\_\text{aligned}}=\dfrac{1}{T J}\sum\limits_{t=1}^{T}\sum\limits_{j=1}^{J}\boldsymbol{S}_{\rm{gt\_aligned}}^{{t}}(j), $

$ {\boldsymbol{\mu }}_{\text{pred}}=\dfrac{1}{T J}\sum\limits_{t=1}^{T}\sum\limits_{j=1}^{J}\boldsymbol{S}_{\text{pred}}^{t}(j). $

式中:${\boldsymbol{\mu}}_{\mathrm{gt\_aligned }}$为平移对齐后动捕姿态序列所有关节的均值,${\boldsymbol{\mu}}_{\mathrm{pred}} $为原始视频姿态序列所有关节的均值,$ J $为关节数量,$ \boldsymbol{S}_{\rm{gt\_aligned}}^{{t}}\left(j\right) $表示平移后动捕序列第$ t $帧第$ j $个关节的坐标向量,$ \boldsymbol{S}_{\rm{pred}}^{{t}}\left(j\right) $表示原始视频第t帧第j个关节的坐标向量.

去均值后的姿态序列:

$ \overline{\boldsymbol{S}}_{\rm{gt\_aligned}}^{{t}}=\boldsymbol{S}_{\rm{gt\_aligned}}^{{t}}-{\boldsymbol{\mu }}_{\text{gt}\_\text{aligned}}, $

$ \overline{\boldsymbol{S}}_{\text{pred}}^{t}={\boldsymbol{S}}_{\text{pred}}^{t}-{\boldsymbol{\mu }}_{\text{pred}}. $

然后构建动捕与视频序列的协方差矩阵$ \boldsymbol{H} $

$ \boldsymbol{H}=\sum\limits_{t=1}^{T}\sum\limits_{j=1}^{J}\overline{\boldsymbol{S}}_{\text{gt}\_\text{aligned}}^{t}\left(j\right)\cdot \overline{\boldsymbol{S}}_{\rm{gt\_aligned}}^{{t}}{\left(j\right)}^{\text{T}}. $

$ \boldsymbol{H} $进行奇异值分解(SVD):$ \boldsymbol{H}=\boldsymbol{U}\sum{\boldsymbol{V}}^{\text{T}} $. 旋转矩阵$ \boldsymbol{R} $表达式如下:

$ \boldsymbol{R}=\boldsymbol{U}{\boldsymbol{V}}^{\text{T}}. $

若行列式$ \boldsymbol{R} $为负,存在镜像翻转,则修正$ \boldsymbol{V} $的最后一列符号后重新计算$ \boldsymbol{R} $.

最后,对去均值后的动捕姿态序列,施加旋转矩阵$ \boldsymbol{R} $

$ \overline{\boldsymbol{S}}_{\rm{gt\_rotated}}^{{t}}=\boldsymbol{R}\cdot \overline{\boldsymbol{S}}_{\rm{gt\_aligned}}^{{t}}. $

再恢复均值(视频姿态的均值),得到旋转对齐后的动捕姿态序列:

$ \overline{\boldsymbol{S}}_{\rm{gt\_rotated}}^{{t}}=\overline{\boldsymbol{S}}_{\rm{gt\_rotated}}^{{t}}+{\boldsymbol{\mu }}_{\text{pred}}. $

通过上述操作,动捕姿态序列的整体坐标轴方向与视频姿态序列完全一致. 随机选取一个样本,可视化其处理前、后的对齐结果,如图3所示.

图 3

图 3   空间对齐示意图

Fig.3   Schematic diagram of spatial alignment


2.4. 多步态数据集的提取

本研究提供各种类型的步态数据,包括RGB、轮廓、骨骼和姿态,示例如图4所示.

图 4

图 4   CASIA-V中不同步态数据的示例

Fig.4   Examples of different gait data in CASIA-V


轮廓采用RobustVideoMatting(RVM)[30]算法从RGB视频生成步态轮廓,该算法低背景依赖,可保留步态细微轮廓变化,通过时序平滑确保帧间轮廓连贯无跳变. 骨骼采用HRNet提取2D骨骼,该算法通过高、低分辨率特征融合避免关节偏移,时序提取稳定性强,兼顾识别精度与计算效率. 动捕姿态可直接通过动捕设备VDSuit对应的软件VDMocapStudio直接获取;视频姿态通过VideoPose3D算法将RGB序列转换得到.

2.5. 收集、统计和评估

1)收集流程. 每名受试者在正常行走条件下采集6 次序列,背包、穿大衣条件下各采集2 次,另采集各视角空背景,单视角共11 个步态序列.

2)数据集统计. 如图5所示展示了CASIA-V中年龄、性别和序列长度的分布. 受试者年龄为20~35 岁(均值为26.3 岁),男女比例约为2∶1,身高为155~190 cm(均值为173.5 cm);每个序列平均含110 帧,可覆盖完整步态周期,数据多样性为模型泛化性能评估提供支撑.

图 5

图 5   CASIA-V中年龄、性别和序列长度的分布

Fig.5   Distribution of age, gender and sequence length in CASIA-V


3)评估方案. 受试者从1到93. 受试者1~65进行训练,其余用于测试.

3. 基于姿态诱导的多模态步态识别

针对现有步态识别中真实三维姿态缺失、多模态特征互补性挖掘不足的问题,以多模态融合模型MSAFF为基础框架,提出融合三维姿态与轮廓模态的步态识别网络SIGait. 该网络的核心改进为2点:一是创新性引入独立训练的3D-SIM,利用真实动捕姿态引导视频姿态特征提纯;二是对MSAFF的下游特征融合模块进行轻量化微调,适配诱导姿态特征输入,实现高效的多模态特征判别性表征.

3.1. 整体流程

SIGait网络训练分为2阶段:第1阶段单独训练3D-SIM模块,第2阶段将预训练完成的3D-SIM插入网络,联合训练下游特征融合与分类模块. 本研究提出的步态识别网络整体框架如图6所示. 网络输入包括轮廓序列$ {\boldsymbol{X}}_{\text{img}}\in {\mathbf{R}}^{N\times H\times W} $$ N $为帧数,$ H $为高度,$ W $为宽度)、视频姿态序列$ \mathbf{VPose}\in {\mathbf{R}}^{N\times 3\times Z} $和动捕姿态序列$ \mathbf{MCPose}\in {\mathbf{R}}^{N\times 3\times Z} $$ N $为帧数,$ 3 $为通道数,$ Z $为关节数;通道数对应关节的3D坐标). 多模态步态识别网络的具体流程如下.

图 6

图 6   SIGait网络结构

Fig.6   Structure of SIGait network


3.1.1. 轮廓特征提取

沿用MSAFF的模态特征提取逻辑,轮廓序列通过4 个2D卷积层与1个2D最大池化层组成的特征提取网络$ F $获取帧级空间特征$ {\boldsymbol{S}}_{\text{img}} $

$ {\boldsymbol{S}}_{\text{img}}=F({\boldsymbol{X}}_{\text{img}}). $

式中:$ {\boldsymbol{S}}_{\text{img}}\in {\mathbf{R}}^{N\times C\times H/2\times W/2} $$ C $为特征通道数.

3.1.2. 诱导姿态特征生成

为了获取贴合真实三维语义的姿态特征,将时空对齐后的动捕姿态序列与视频姿态序列输入3D-SIM,以动捕姿态为真实参考,通过反向训练对视频姿态进行特征提纯,输出诱导姿态特征$ {\boldsymbol{S}}_{\text{ske}} $

$ {\boldsymbol{S}}_{\text{ske}}=3\text{D}{\text{-}}\text{SIM}(\bf{VPose},\;\bf{MCPose}). $

式中:$ {\boldsymbol{S}}_{\text{ske}}\in {\mathbf{R}}^{N\times C\times Z} $,与MSAFF直接使用的估计姿态特征相比,该特征具有更准确的三维语义表达,同时保持与视频姿态序列一致的维度规格,为后续部位级特征构建提供标准化输入.

3.1.3. 部位级特征构建

参考MSAFF的部位划分策略,将$ {\boldsymbol{S}}_{\text{img}} $按纵向划分为$ K $ 个部位,通过全局最大池化(GMP)与全局平均池化(GAP)求和生成部位级特征$ {\boldsymbol{P}}_{\text{img}} $;将$ {\boldsymbol{S}}_{\text{ske}} $按CoCo关节排序规则直接构建部位级特征$ {\boldsymbol{P}}_{\text{ske}} $

$ {\boldsymbol{P}}_{\text{img}}=\text{GAP}({\boldsymbol{S}}_{\text{img}})+\text{GMP}({\boldsymbol{S}}_{\text{img}}), $

$ {\boldsymbol{P}}_{\text{ske}}=\text{CoCo}({\boldsymbol{S}}_{\text{ske}}). $

式中:$ {\boldsymbol{P}}_{\text{img}}\in {\mathbf{R}}^{N\times C\times K} $$ {\boldsymbol{P}}_{\text{ske}}\in {\mathbf{R}}^{N\times C\times Z} $.

3.1.4. 多尺度特征融合与表征生成

采用MSAFF的多尺度时空特征提取器(MSSTFE)分别对$ {\boldsymbol{P}}_{\text{img}} $$ {\boldsymbol{P}}_{\text{ske}} $及两者帧级融合特征进行时空关联建模,得到$ \mathbf{S}{\mathbf{T}}_{\text{img}} $$ \mathbf{S}{\mathbf{T}}_{\text{ske}} $$ \mathbf{S}{\mathbf{T}}_{\text{fs}} $;通过自适应特征融合模块(AFFM)实现时空级跨模态融合,生成$ \mathbf{S}{\mathbf{T}}_{\text{fst}} $;最终经全连接层映射与特征维度池化,输出统一步态表征向量用于识别任务.

3.2. 三维姿态诱导模块(3D-SIM)

为了充分挖掘视频姿态的有效信息,设计三维姿态诱导模块,其网络结构如图7所示.

图 7

图 7   3D-SIM 网络结构

Fig.7   Structure of 3D-SIM network


模块整体由3 个级联的“图卷积-卷积式Transformer”stage组成,输入为骨架张量[$ B $$ T $$ C=3 $$ H=1 $$ W=17 $],其中,$ B $为批次大小、$ T $为帧数、$ C $为关节3D坐标维度、$ W $为CoCo定义关节节点个数. 全局通道配置遵循set_channels=[32,64,128],通道演进过程为3、32、64、128. 3 个stage的核心参数配置如下:Stage1~Stage3的depth依次为1、2、2,heads依次为1、2、4,核心维度dim均为32,输出通道对应为32、64、128.

模块以时空对齐后的动捕姿态与VideoPose3D生成的视频姿态为双输入,通过2个并行分支分别提取两者特征:动捕姿态分支提供真实三维姿态语义参考,视频姿态分支经上述3 个stage完成特征提纯,最终输出与真实姿态语义对齐的诱导姿态特征. 为了确保诱导特征的真实性与精准性,设计图卷积特征损失函数监督训练过程,保持动捕姿态特征固定,以其为参考反向优化视频姿态分支参数,使诱导姿态特征在特征空间中逼近真实动捕姿态特征.

3.2.1. 图卷积特征损失函数

为了统一描述,3D-SIM的输入分别为$ \mathbf{VPose}\in {\mathbf{R}}^{N\times 3\times Z} $$ \mathbf{MCPose}\in {\mathbf{R}}^{N\times 3\times Z} $,其中$ \mathbf{VPose} $为VideoPose3D生成的视频姿态序列,$ \mathbf{MCPose} $为时空对齐后的动捕姿态序列,$ N $为帧数,$ 3 $为关节坐标维度(对应3D坐标维度),$ Z $为关节数(Z取17 ).

2个分支经3个“图卷积层+Transformer Encoder”提取姿态特征后,保持动捕姿态分支特征不变,以图卷积特征损失函数为训练损失,通过反向传播迭代更新视频姿态分支的权重参数.图卷积损失函数由特征对齐损失、肢体节点加权损失和时序平滑损失3部分组成,表达式如下:

$ {L}_{\text{GCN}}={L}_{\text{feat}\_\text{align}}+\lambda {L}_{\text{limb}\_\text{weighted}}+\mu {L}_{\text{temp}\_\text{smooth}}. $

式中:$ \lambda $表示肢体节点加权系数,$ \mu $表示时序平滑系数.

对于特征对齐损失,采用均方误差(MSE)对齐真实姿态与预测姿态的图卷积特征,确保两者在特征空间中接近:

$ \begin{split} {L}_{\text{feat}\_\text{align}}=&\frac{1}{T {J}_{\text{limb}} {d}_{\text{s}}} \times \parallel {\mathrm{GCN}}({{\boldsymbol{S}}}_{\text{gt}},{\boldsymbol{A}})-\\&{\mathrm{GCN}}({{\boldsymbol{S}}}_{\text{pred}},{\boldsymbol{A}})\parallel _{{\mathrm{F}}}^{2}.\end{split} $

式中:$ T $表示视频序列的帧数;$ {J}_{\text{limb}} $表示关注肢体节点个数;$ {d}_{\text{s}} $表示图卷积特征维度;$ {{\boldsymbol{S}}}_{\text{gt}} $$ {{\boldsymbol{S}}}_{\text{pred}} $表示GCN输入的图节点特征,分别对应动捕姿态图卷积特征和视频姿态图卷积特征输入,$ [{\mathrm{batch}}\_ {\mathrm{size}}, {\mathrm{num}}\_ {\mathrm{joints}},{\mathrm{feature}}\_ {\mathrm{dim}}] $为输入维度;$ \boldsymbol{A} $表示定义关节链接关系的邻接矩阵;$ \parallel \cdot {\parallel }_{{\mathrm{F}}} $为佛罗贝尼乌斯范数,用于衡量矩阵元素级差异.

对于节点加权损失,对肢体节点的特征误差赋予更高权重(记为$ {\omega }_{j}\geq 1 $$ {j}\in \text{limb}\_\text{joints} $),以强化关键节点的优化. 定义关键节点为人体运动中与步态细节判别强相关的外周关节节点,具体选取CoCo 17节点拓扑中8 个核心关节(左肘、右肘、左腕、右腕、左膝、右膝、左踝、右踝).

$ \begin{split} {L}_{\rm{limb\_weighted}}=&\frac{1}{T {J}_{\text{limb}} {{d}}_{\text{s}}}\times {\sum}_{j\in \text{limb}\_\text{joints}}\\& {\omega }_{j}\parallel {\boldsymbol{Y}}_{\text{gt}}^{j}-{\boldsymbol{Y}}_{\text{pred}}^{j}\parallel _{{\mathrm{F}}}^{2}.\end{split}$

式中:$ {\boldsymbol{Y}}_{\text{gt}}^{j} $$ {\boldsymbol{Y}}_{\text{pred}}^{j} $分别表示动捕姿态和视频姿态对应关节$ j $的特征向量,维度为$ {d}_{\text{s}} $. 时序平滑损失表达式如下:

$ {{L}}_{\text{temp}\_\text{smooth}}=\frac{1}{T J {d}_{\text{s}}}\sum\limits_{t=2}^{T}\parallel {\boldsymbol{Y}}_{\text{gt}}^{j}-{\boldsymbol{Y}}_{\text{pred}}^{j}\parallel _{{\mathrm{F}}}^{2}. $

式中:$ J $表示关注肢体节点的个数.

相比MSAFF的直接姿态输入模式,3D-SIM实现了2点关键改进. 1)特征真实性提升:通过真实动捕姿态校准,诱导姿态特征的三维语义准确性显著优于MSAFF中基于估计姿态的特征;2)模态适配性增强:优化后的姿态特征与轮廓特征的互补性更强,能为后续融合模块提供高质量输入.

3.2.2. 3D-SIM单独训练策略

为了保证3D-SIM的独立性,采用与下游识别任务完全解耦的单独训练模式:训练数据采用CASIA-V数据集的所有视频姿态序列与动捕姿态序列,仅使用图卷积特征损失函数优化核心目标;迭代8 万次,初始学习率为1×10−4,于4000060000次迭代时衰减至原来的0.1,批次规格设为(8, 8)(8 个受试者,每受试者8 个序列). 训练完成后,仅保存3D-SIM的图卷积Transformer层参数,固定输出接口规格以确保下游网络兼容性.

3.3. 基于MSAFF框架的多模态特征融合

3D-SIM经单独训练后直接插入MSAFF框架,训练时冻结3D-SIM所有参数,仅对MSAFF的下游模块(自适应特征融合模块AFFM、多尺度时空特征提取器MSSTFE)微调.

沿用MSAFF的维度压缩策略,将高维输出特征划分为op 个部分,通过池化降低维度以平衡识别精度与计算开销. 设计消融实验对比平均池化、最大池化与全局池化的性能(实验数据见表6),结果表明,在NM、BG、CL这3种行走场景下,平均池化得到的Rank-1准确率均最优,故最终采用平均池化输出步态表征向量.

表 6   不同池化策略的性能对比

Tab.6  Performance comparison of different pooling strategies

池化策略R-1/%
NMBGCL均值
最大池化96.895.189.793.9
全局池化97.295.790.294.4
平均池化97.796.390.994.9

新窗口打开| 下载CSV


4. 实 验

实验采用CASIA-V多模态步态数据集,遵循跨视角评估协议. 网络模型基于PyTorch实现,采用RTX 3090 GPU完成训练与测试.

4.1. 实验设置

4.1.1. 超参数

轮廓分支4层卷积输出通道依次为32、64、128、128,在第2卷积层后设步长为2的最大池化层,各卷积层均接Leaky ReLU激活函数. 参数Outc=256,骨架关节数量Z=17. 对于CASIA-V,时间序列帧数K=32. 在单峰输入可用时,每批次样本数量N=30,在双峰输入可用时,N=60. 此外,对于CASIA-V,训练阶段输出特征维数为339×256,推理阶段输出特征维数为339.

4.1.2. 训练细节

所有步态轮廓图均采用文献[31]中的方法归一化至64×44分辨率;在CASIA-V数据集上,采用VideoPose3D模型完成人体姿态估计,保证轮廓与骨骼序列帧级对应. 训练损失采用BA+三元组损失[32]结合图卷积特征损失,批次采样规格设为(p,k)=(8,8). 在训练时随机截取连续帧输入,在测试时输入完整步态序列;模型训练迭代次数为10 万次,初始学习率设为1×10−4,并在3 万次与6 万次迭代时将学习率衰减至原来的0.1.

4.2. 对比实验

在CASIA-V数据集上,将SIGait与3 种单模态、3 种多模态方法对比,以Rank-1准确率R-1为指标. 实验结果如表1所示,可以得出以下结论:在NM、BG、CL这3类行走条件下,SIGait的性能均优于所有对比方法,验证了所提方法提取的步态特征具有更强稳健性;在复杂的穿大衣(CL)场景中,SIGait性能优势尤为突出,相较于单模态方法GaitSet提升21.0个百分点,相较于多模态方法TransGait、MSAFF和SkeletonGait++分别提升5.6、7.1和6.2个百分点,充分验证了模型在复杂环境下的有效性与跨视角细粒度特征提取能力.

表 1   不同方法在CASIA-V数据集上的跨视角对比结果

Tab.1  Cross-view comparison results of different methods on CASIA-V dataset

方法R-1/%
NMBGCL均值
GaitGraph[13]84.774.866.375.2
PoseGait[12]69.745.137.250.6
GaitSet[5]92.887.269.983.3
TransGait[19]96.494.485.392.0
SkeletonGait++[21]95.990.984.790.5
MSAFF[18]94.691.283.889.8
SIGait(本研究)97.796.390.994.9

新窗口打开| 下载CSV


4.3. 消融实验

为了验证3D-SIM模块的通用性、核心作用机制及模态兼容性,设计三级递进消融实验.

4.3.1. 3D-SIM模块的通用性验证

通用性验证实验旨在验证3D-SIM模块“即插即用”的泛化能力,结果如表2所示. 各模型输入设计如下:GaitGraph(3D)为三维视频姿态适配版,输入为姿态估计的三维视频姿态;GaitGraph(3D)+则在GaitGraph(3D)基础上引入3D-SIM模块,融合真实动捕姿态以诱导提纯三维视频姿态. PoseGait原生输入即为三维视频姿态,MSAFF(3D)输入为姿态估计的三维视频姿态+轮廓. 本实验通过二维骨骼与三维视频姿态的输入对比、相同输入下是否引入3D-SIM的对比,量化姿态诱导机制对模型跨视角识别性能的增益. 结果表明,所有基础模型插入3D-SIM后均实现显著性能提升,其中PoseGait性能提升最为明显,MSAFF保持稳定增益,验证了3D-SIM的即插即用能力与多框架兼容性.

表 2   在CASIA-V数据集上对3D-SIM的跨视角消融实验结果

Tab.2  Cross-view ablation experiment results of 3D-SIM on CASIA-V dataset

方法R-1/%
NMBGCL均值
GaitGraph[13]84.774.866.375.2
GaitGraph(3D)69.059.653.360.6
GaitGraph(3D)+89.484.075.883.0
PoseGait(3D)[12]68.744.536.049.7
PoseGait(3D)+91.184.977.884.6
MSAFF[18]94.691.283.889.8
MSAFF(3D)90.388.580.686.4
SIGait(本研究)97.796.390.994.9

新窗口打开| 下载CSV


4.3.2. 3D-SIM模块的贡献比例量化

以MSAFF(3D)为基准,设计4 组对照实验:基准组(无3D-SIM)、实验组1(完整3D-SIM)、实验组2(伪3D-SIM,随机姿态替代动捕姿态)、实验组3(简化3D-SIM,仅保留特征对齐损失). 3D-SIM模块内部功能拆解的消融实验结果如表3所示.

表 3   3D-SIM模块内部功能拆解的消融实验结果(CASIA-V,单一变量控制)

Tab.3  Ablation study results on internal functional decomposition of 3D-SIM module (CASIA-V, single-variable control)

组别R-1/%
NMBGCL均值
基准组90.388.580.686.4
实验组197.796.390.994.9
实验组296.393.587.292.3
实验组396.894.188.593.1

新窗口打开| 下载CSV


3D-SIM模块各核心功能的性能贡献占比如表4所示,其数据基于单一变量控制的消融实验准确率计算得出. 其中,ΔR为性能提升,η为贡献比例. 贡献类型包含3D-SIM总贡献、真实3D姿态引导的独立贡献、完整特征提纯的独立贡献,以及两者的协同贡献. 具体计算逻辑如下:3D-SIM总贡献为完整3D-SIM模型与基准模型平均准确率的差值;真实3D姿态引导贡献为完整模型与伪3D-SIM模型平均准确率的差值;完整特征提纯贡献为完整模型与简化3D-SIM模型平均准确率的差值;协同贡献为总贡献减去前两项独立贡献. 各功能贡献比例为对应差值与总贡献的比值. 在3D-SIM的总性能增益中,“真实3D姿态引导”占比30.5%,是核心增益来源,证明真实三维语义对复杂场景识别的关键作用;“完整特征提纯逻辑”占比21.1%,表明精细化特征处理能进一步放大真实姿态的价值;两者的协同贡献占比48.2%,验证了真实语义及优质特征的良性互补机制.

表 4   3D-SIM 模块各功能贡献比例量化分析结果

Tab.4  Quantitative analysis results of contribution ratio of each function in 3D-SIM

贡献类型ΔR/百分点η/%
3D-SIM总贡献8.5100
真实3D姿态引导的贡献2.630.5
完整特征提取的贡献1.821.1
协同贡献4.148.2

新窗口打开| 下载CSV


4.3.3. 3D-SIM模块的模态信息保留验证

为了验证3D-SIM模块是否会破坏原有模态有效信息,确保性能提升而非以牺牲原有模态价值为代价. 选取“基准组(无3D-SIM)”与“实验组1(完整3D-SIM)”,分别剥离多模态融合框架中的单一模态,即仅保留轮廓特征或视频姿态特征,单独进行身份识别. 对比单模态判别准确率,实验结果如表5所示. 结果显示,引入3D-SIM后轮廓特征准确率仅轻微波动,视频姿态特征准确率显著提升,证明3D-SIM未破坏原有模态信息,且通过特征提纯实现增量增益. 消融实验结果表明,3D-SIM模块可稳定提升不同步态识别模型的跨视角性能,其核心增益源于真实3D姿态引导与特征提纯的协同作用,同时其具备良好的模态兼容性.

表 5   3D-SIM模块对轮廓与视频姿态特征的模态信息保留验证结果(单模态单独判别)

Tab.5  Verification results of modal information preservation for contour and video pose features of 3D-SIM module (single-modal independent discrimination)

类别组别R-1/%
NMBGCL均值
轮廓特征基准组89.285.178.384.2
实验组189.785.678.784.7
视频姿态特征基准组82.576.469.776.2
实验组185.781.977.581.7

新窗口打开| 下载CSV


4.4. 池化策略分析

为了验证特征维度池化阶段的最优策略,在SIGait模型基础上,仅替换池化方式(平均池化、最大池化、全局池化),其余参数保持一致,在CASIA-V数据集的测试集上进行性能评估,结果如表6所示. 可以看出,在3种行走条件下,平均池化的识别准确率均优于最大池化与全局池化. 这是因为平均池化能够更全面地保留多模态融合特征的全局统计信息,避免最大池化过度聚焦局部极值或全局池化丢失细节特征的问题,从而提升模型对复杂场景的鲁棒性.

4.5. 计算效率与实用性分析

为了验证3D-SIM模块对模型部署效率的影响,从参数量$ {N}_{\text{param}}\text{} $、计算量$ {F}_{\text{flops}}\text{} $、单样本推理时间$ {t}_{\text{inf}}\text{} $及推理速度$ {v}_{\text{inf}}\text{} $这4个维度,量化对比基础模型MSAFF(3D)、3D-SIM模块及最终模型SIGait的计算开销(实验环境与输入规格同4.1节),实验结果如表7所示. 与基础模型 MSAFF(3D) 相比,最终模型SIGait因引入3D-SIM 模块,在参数量、FLOPs和单样本推理时间上仅分别增加1.13%、1.88%和3.88%,推理速度仍保持在51.12 帧/s的高水平,远超实时部署要求(≥20 帧/s). 这表明3D-SIM以极小的计算开销,实现了高增益的性能优化.

表 7   MSAFF(3D)/3D-SIM/SIGait计算效率对比

Tab.7  Computational efficiency comparison of MSAFF(3D)/3D-SIM/SIGait

模型$ {N}_{\text{param}}\text{} $/106$ {F}_{\text{flops}}\text{} $/109$ {t}_{\text{inf}}\text{} $/ms$ {v}_{\text{inf}}\text{} $/(帧·s−1)
MSAFF(3D)23.497.1118.83±0.6253.11
3D-SIM0.260.13
SIGait23.757.2419.56±0.5851.12

新窗口打开| 下载CSV


4.6. 3D-SIM的鲁棒性与适用条件分析

为了深入揭示3D-SIM模块的鲁棒性边界及适用场景,设计输入序列长度、帧采样率、训练ID数这3个关键维度的消融实验. 所有实验均基于SIGait模型,仅改变单一变量,其余参数与4.1节实验设置一致,以Rank-1准确率为评价指标.

4.6.1. 输入序列长度的影响

设置16、24、32、40、48 帧共5组序列长度,实验结果如表8所示. 从16帧到32 帧,平均准确率提升6.0 个百分点(CL场景下提升6.2 个百分点);32 帧后准确率趋于饱和,因该长度已覆盖完整步态周期;16 帧短序列下平均准确率仍达89.0%,验证了模块对运动信息不完备场景的鲁棒性.

表 8   不同输入序列长度下的性能对比

Tab.8  Performance comparison under different input sequence lengths

输入序列长度/帧R-1/%
NMBGCL均值
1692.390.184.789.0
2495.693.888.592.6
3297.796.390.995.0
4097.996.591.295.2
4898.096.691.395.3

新窗口打开| 下载CSV


4.6.2. 帧采样率的影响

基于32 帧基准序列,设置1、2、3、4 帧采样间隔(对应30、15、10、7.5 帧/s),实验结果如表9所示. 从30帧/s到15帧/s,准确率仅下降1.0 个百分点,模块对低帧率有较强容忍度;采样率低于10 帧/s 后性能显著下降,因丢失关节细微动态;7.5 帧/s 下平均准确率仍达87.3%,显著高于无3D-SIM的MSAFF (3D)的准确率(82.5%),体现了特征增强作用.

表 9   不同帧采样率下的性能对比

Tab.9  Performance comparison under different frame sampling rates

采样间隔/帧实际采样率/(帧·s−1)R-1/%
NMBGCL均值
13097.796.390.994.9
21596.895.289.693.9
31094.592.787.391.5
47.590.288.583.187.3

新窗口打开| 下载CSV


4.6.3. 训练ID数的影响

设置20、35、50、65、80共5组训练ID数(测试ID固定为28),实验结果如表10所示. 当训练ID数由20增至65时,平均准确率由86.0%升至94.9%,提高8.9个百分点;训练ID数继续增至80时,平均准确率仅由94.9%升至95.5%,增幅为0.6个百分点. 说明训练样本达到一定规模后,模型性能提升趋于平缓. 综上,3D-SIM通过真实动捕姿态的语义引导,降低了模型对输入数据质量(序列长度、采样率)和训练样本量的依赖,为步态识别在资源受限场景的应用提供了技术支撑.

表 10   不同训练ID数下的性能对比

Tab.10  Performance comparison under different numbers of training IDs

训练ID数R-1/%
NMBGCL均值
2089.587.281.386.0
3593.891.585.790.3
5096.294.188.993.1
6597.796.390.994.9
8098.196.891.595.5

新窗口打开| 下载CSV


5. 结 语

针对复杂环境下多视角步态识别的真实三维姿态缺失、多模态融合不足的问题,构建含真实动捕姿态的多模态数据集CASIA-V,并提出姿态诱导模型SIGait,核心成果如下:1)CASIA-V涵盖93 名受试者的11253 个多模态序列,可为真实三维姿态增益研究提供数据支撑;2)提出“单独训练+下游微调”的3D-SIM模块,实现视频姿态特征提纯且支持即插即用;3)SIGait融合诱导姿态与轮廓特征,在跨视角评估下,正常行走场景Rank-1准确率达97.7%;相较基线方法MSAFF,在背包与穿大衣场景下的Rank-1准确率分别提升5.1和7.1 个百分点,且推理阶段无须输入动捕数据;4)3D-SIM仅使模型参数量、FLOPs及推理时间增加1.13%、1.88%和3.88%,说明其兼具性能与部署潜力.

本研究的局限性在于:SIGait性能增益依赖CASIA-V的时空精准对齐,泛化性需更多设备与大规模数据集验证;多模态融合结构在资源受限设备上的实时性仍须优化.

未来将从3方面推进研究:优化多设备同步采集方案,提升数据对齐鲁棒性并扩充场景;探索轻量化融合结构,适配高实时性应用需求;验证3D-SIM在更多步态识别框架中的通用性,推广真实三维姿态的应用价值.

参考文献

MAHMOUD M, KASEM M S, KANG H S

A comprehensive survey of masked faces: recognition, detection, and unmasking

[J]. Applied Sciences, 2024, 14 (19): 8781

DOI:10.3390/app14198781      [本文引用: 1]

JIA Z, HUANG C, WANG Z, et al

Finger recovery transformer: toward better incomplete fingerprint identification

[J]. IEEE Transactions on Information Forensics and Security, 2024, 19: 8860- 8874

DOI:10.1109/TIFS.2024.3419690     

KUEHLKAMP A, BOYD A, CZAJKA A, et al. Interpretable deep learning-based forensic iris segmentation and recognition [C]// Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision Workshops. Waikoloa: IEEE, 2022: 359–368.

[本文引用: 1]

赵晓东, 刘作军, 陈玲玲, 等

下肢假肢穿戴者跑动步态识别方法

[J]. 浙江大学学报: 工学版, 2018, 52 (10): 1980- 1988

DOI:10.3785/j.issn.1008-973X.2018.10.018      [本文引用: 1]

ZHAO Xiaodong, LIU Zuojun, CHEN Lingling, et al

Approach of running gait recognition for lower limb amputees

[J]. Journal of Zhejiang University: Engineering Science, 2018, 52 (10): 1980- 1988

DOI:10.3785/j.issn.1008-973X.2018.10.018      [本文引用: 1]

CHAO H, WANG K, HE Y, et al

GaitSet: cross-view gait recognition through utilizing gait as a deep set

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44 (7): 3467- 3478

DOI:10.1109/tpami.2021.3057879      [本文引用: 3]

FAN C, PENG Y, CAO C, et al. GaitPart: temporal part-based model for gait recognition [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 14213–14221.

HUANG Z, XUE D, SHEN X, et al. 3D local convolutional neural networks for gait recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2022: 14900–14909.

[本文引用: 1]

LIN B, ZHANG S, YU X. Gait recognition via effective global-local feature representation and local temporal aggregation [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2022: 14628–14636.

WU Z, HUANG Y, WANG L, et al

A comprehensive study on cross-view gait based human identification with deep CNNs

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 39 (2): 209- 226

DOI:10.1109/TPAMI.2016.2545669     

HUANG X, ZHU D, WANG H, et al. Context-sensitive temporal feature learning for gait recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2022: 12889–12898.

WANG M, GUO X, LIN B, et al. DyGait: exploiting dynamic representations for high-performance gait recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2024: 13378–13387.

[本文引用: 1]

LIAO R, YU S, AN W, et al

A model-based gait recognition method with body pose and human prior knowledge

[J]. Pattern Recognition, 2020, 98: 107069

DOI:10.1016/j.patcog.2019.107069      [本文引用: 3]

TEEPE T, KHAN A, GILG J, et al. Gaitgraph: graph convolutional network for skeleton-based gait recognition [C]// Proceedings of the IEEE International Conference on Image Processing. Anchorage: IEEE, 2021: 2314–2318.

[本文引用: 3]

FU Y, MENG S, HOU S, et al. GPGait: generalized pose-based gait recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2024: 19538–19547.

ZHANG C, CHEN X P, HAN G Q, et al

Spatial transformer network on skeleton-based gait recognition

[J]. Expert Systems, 2023, 40 (6): e13244

DOI:10.1111/exsy.13244      [本文引用: 1]

GUO H, JI Q. Physics-augmented autoencoder for 3D skeleton-based gait recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2024: 19570–19581.

[本文引用: 3]

吴越, 梁铮, 高巍, 等

基于SMPL模态分解与嵌入融合的多模态步态识别

[J]. 浙江大学学报: 工学版, 2026, 60 (1): 52- 60

[本文引用: 1]

WU Yue, LIANG Zheng, GAO Wei, et al

Multi-modal gait recognition based on SMPL model decomposition and embedding fusion

[J]. Journal of Zhejiang University: Engineering Science, 2026, 60 (1): 52- 60

[本文引用: 1]

ZOU S, XIONG J, FAN C, et al. A multi-stage adaptive feature fusion neural network for multimodal gait recognition [C]// Proceedings of the IEEE International Joint Conference on Biometrics. Ljubljana: IEEE, 2024: 1–10.

[本文引用: 2]

LI G, GUO L, ZHANG R, et al

TransGait: multimodal-based gait recognition with set transformer

[J]. Applied Intelligence, 2023, 53 (2): 1535- 1547

DOI:10.1007/s10489-022-03543-y      [本文引用: 1]

ZHENG W, ZHU H, ZHENG Z, et al

GaitSTR: gait recognition with sequential two-stream refinement

[J]. IEEE Transactions on Biometrics, Behavior, and Identity Science, 2024, 6 (4): 528- 538

DOI:10.1109/TBIOM.2024.3390626     

FAN C, MA J, JIN D, et al. SkeletonGait: gait recognition using skeleton maps [C]// Proceedings of the AAAI Conference on Artificial Intelligence. Vancouver: AAAI Press, 2024: 1662–1669.

[本文引用: 2]

YU S, TAN D, TAN T. A framework for evaluating the effect of view angle, clothing and carrying condition on gait recognition [C]// Proceedings of the 18th International Conference on Pattern Recognition. Hong Kong: IEEE, 2006: 441–444.

[本文引用: 2]

TAKEMURA N, MAKIHARA Y, MURAMATSU D, et al

Multi-view large population gait dataset and its performance evaluation for cross-view gait recognition

[J]. IPSJ Transactions on Computer Vision and Applications, 2018, 10 (1): 4

DOI:10.1186/s41074-018-0039-6      [本文引用: 1]

ZHENG J, LIU X, LIU W, et al. Gait recognition in the wild with dense 3D representations and a benchmark [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 20196–20205.

[本文引用: 1]

ZHU Z, GUO X, YANG T, et al. Gait recognition in the wild: a benchmark [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 14769–14779.

[本文引用: 1]

KIPF T N, WELLING M. Semi-supervised classification with graph convolutional networks [EB/OL]. [2025–11–23]. https://arxiv.org/abs/1609.02907.

[本文引用: 1]

LI J, ZHANG Y, SHAN H, et al. Gaitcotr: improved spatial-temporal representation for gait recognition with a hybrid convolution-transformer framework [C]// 2023 IEEE International Conference on Acoustics, Speech and Signal Processing. Rhodes Island: IEEE, 2023: 1–5.

[本文引用: 1]

SUN K, XIAO B, LIU D, et al. Deep high-resolution representation learning for human pose estimation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2020: 5686–5696.

[本文引用: 1]

PAVLLO D, FEICHTENHOFER C, GRANGIER D, et al. 3D human pose estimation in video with temporal convolutions and semi-supervised training [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2020: 7745–7754.

[本文引用: 1]

LIN S, RYABTSEV A, SENGUPTA S, et al. Real-time high-resolution background matting [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 8758–8767.

[本文引用: 1]

TAKEMURA N, MAKIHARA Y, MURAMATSU D, et al

Multi-view large population gait dataset and its performance evaluation for cross-view gait recognition

[J]. IPSJ Transactions on Computer Vision and Applications, 2018, 10 (1): 4

DOI:10.1186/s41074-018-0039-6      [本文引用: 1]

HERMANS A, BEYER L, LEIBE B. In defense of the triplet loss for person re-identification [EB/OL]. [2025–11–23]. https://arxiv.org/abs/1703.07737.

[本文引用: 1]

/