基于姿态诱导的多模态步态识别
Multimodal gait recognition based on pose induction
通讯作者:
收稿日期: 2025-12-16
| 基金资助: |
|
Received: 2025-12-16
| Fund supported: | 山西省中央引导地方科技发展资金项目(YDZJSX2022A016);山西省重点研发计划资助项目(2022ZDYF128);山西省科技战略项目(202404030401080). |
作者简介 About authors
高巍(1999—),男,硕士生,从事步态识别研究.orcid.org/0009-0004-7603-4909.E-mail:
为了实现复杂环境下步态的多视角细粒度识别,提出基于姿态诱导的多模态步态识别方法,并构建包含真实三维姿态的多模态数据集(CASIA-V). 该数据集通过多设备同步采集93名受试者在正常、背包、穿大衣行走下的11视角数据,包含
关键词:
A pose-induced multimodal gait recognition method was proposed and a new multimodal dataset named CASIA-V containing real 3D human poses was constructed, in order to achieve multi-view fine-grained gait recognition in complex environments. The dataset was collected using multiple synchronized devices, capturing 93 subjects walking under three conditions (normal, carrying a bag, and wearing a coat) from 11 different viewpoints. It contained 11 253 RGB sequences along with corresponding motion-capture poses and depth maps. At the methodological level, a spatiotemporal alignment strategy was introduced to match motion-capture poses with video-based poses. A separately trainable 3D Pose-Induced Module (3D-SIM) was designed to extract real pose semantics, and a dual-branch model named SIGait was constructed to fuse pose and silhouette features. The experiment showed that, under the cross-view evaluation protocol of the CASIA-V dataset (excluding samples from the same view), SIGait achieved a Rank-1 accuracy of 97.7% in the normal walking scenario. Compared with the baseline method MSAFF, SIGait improved the Rank-1 accuracy by 5.1 and 7.1 percentage points in the carrying-bag and wearing-coat scenarios, respectively. Notably, the inference process did not require motion-capture data, validating that real 3D pose effectively enhanced gait recognition in complex scenarios. The results further showed that real 3D pose semantics enhanced multimodal feature representation and maintained stable recognition performance under view variations and appearance interference.
Keywords:
本文引用格式
高巍, 于志栋, 常媛媛, 苗旺, 尹永亮, 邓红霞.
GAO Wei, YU Zhidong, CHANG Yuanyuan, MIAO Wang, YIN Yongliang, DENG Hongxia.
最近研究中,Guo等[16]在工作中引入基于3D 骨骼步态识别的物理增强自动编码器模型,用物理解码器通过动力学约束保证图卷积编码器提取到的物理特征的合理性,对步态识别的准确性有显著提升. 该模型证实了更加真实的三维姿态对步态识别准确性的重要影响. 然而,现有步态基准数据集多以视频数据为核心展开分析,普遍缺乏真实三维姿态信息支撑,导致多视角细粒度特征提取能力受限,难以满足复杂环境下的识别需求. 此外,现有多模态步态识别研究尚缺少对真实三维姿态增益作用的系统验证.
针对上述问题,本研究构建了CASIA-V数据集并提出基于姿态诱导的多模态步态识别方法SIGait. 1)构建CASIA-V数据集,其构建方法可以看作是在CASIA-B数据集[22]的基础上添加与视频数据同步的动捕姿态数据,为探索多视角步态识别中真实三维姿态的增益效果提供了支撑. 2)提出姿态诱导模块3D-SIM,从视频姿态中获取有效特征. 3)构建基于姿态诱导的多模态步态识别模型,模型以轮廓、视频姿态和动捕姿态作为输入进行步态识别. 为了实现3D-SIM模块的通用性与即插即用能力,采用‘单独训练+下游微调’的2阶段训练策略:第1阶段仅通过图卷积损失函数单独训练3D-SIM,使其专注于视频姿态与真实动捕姿态的特征对齐;第2阶段将训练完成的3D-SIM直接插入目标网络,仅微调下游模块即可适配不同识别任务,无须修改3D-SIM内部结构与参数.
1. 相关工作
当前步态识别方法分为单模态与多模态2类. 单模态方法包含2种类型. 1)基于模型的方法. 如Zhang等[15]提出用于骨骼步态识别的新模型,该模型将空间转换器与时间卷积网络相结合. 随着图卷积神经网络(graph convolutional network, GCN)[26]在动作识别领域的广泛使用,GCN逐渐被引入步态识别领域,Teepe等[13]首次利用基于图神经网络(graph neural network,GNN)的技术,将步态表示为人体骨骼的关键点集合及其之间的关系. Guo等[16]用物理解码器通过动力学约束保证图卷积编码器提取到的物理特征的合理性,提高三维姿态识别精度. 该方法以二维骨骼或三维姿态为输入,借助图卷积神经网络建模人体结构与动作,优势是运动结构信息稳定、抗干扰能力强,不足是缺失外观细节. 2)基于轮廓的方法. 比如Chao等[5]聚焦于人体整体轮廓的动态特征,有效提高了步态识别的鲁棒性. Huang等[7]提出三维局部卷积,针对传统部分建模缺陷,通过自适应三维局部操作精准提取各身体部位时空特征. Li等[27]提出融合卷积与Transformer的混合框架来优化步态的时空表示. 该类方法将二进制轮廓图作为输入,通过卷积网络挖掘判别特征,优势是计算成本低,不足是易忽略人体内部结构信息.
单模态方法在复杂场景下鲁棒性不足,多模态融合成为提升性能的重要方向. 现有多模态方法多融合轮廓与骨骼特征,但三维姿态大多由二维姿态估算得到,与真实三维姿态差距较大,难以提取细粒度特征,同时精准三维姿态估计存在采集要求高、计算成本增加的问题,导致多模态特征互补性挖掘不充分.
2. 数据集CASIA-V
针对现有步态数据集缺乏真实三维姿态、多模态特征互补性挖掘不足的问题,借鉴CASIA-B采集方案,构建含RGB视频、动捕姿态与深度图的多模态数据集CASIA-V,强化真实三维姿态对步态特征提取的引导作用.
2.1. 数据集采集方案
2.1.1. 采集设备选型
采用VDSuit惯性动捕设备、Intel RealSense D455双目深度相机、海康工业RGB摄像头同步采集,获取高精度三维姿态、深度信息与RGB视频.
2.1.2. 采集场景与参数设计
设置0°~180°共11个视角(间隔18°);设计3类行走条件:正常行走(NM)、背包行走(BG)、穿大衣行走(CL). RGB视频与动捕姿态覆盖全视角,深度图聚焦0°视角采集. 采集流程规范如下:1)数据采集场地示意图如图1所示. 受试者须在半室内空旷场地(无明显遮挡、光照均匀)进行自然行走,每视角下重复采集11次有效步态序列,确保数据的重复性与可靠性. 2)所有设备通过硬件同步触发机制或后验对齐,保证RGB视频、深度图、动捕姿态三者的采集时间差小于60 ms,满足时空一致性要求.
图 1
2.2. 数据集规模与划分
数据集包含93名受试者的
采用受试者独立划分策略:训练集纳入65 名受试者的
2.3. 数据集预处理方法
动捕设备骨骼模式须输入真实人体关节长度,该参数由D455双目深度相机采集的正面视角RGB图与深度图,结合HRNet[28]算法获取. 利用HRNet提取RGB图关节像素坐标,经RGB图与深度图配准,结合双目基线计算相机坐标系下人体关节真实三维坐标,进而得到关节长度. 该方法经手动测量验证可行,可规避主观误差.
此外,多设备采集存在帧率、坐标系、采集起点的时空异构性,须通过预处理实现数据对齐,为后续模型输入提供一致性数据,核心步骤如下.
2.3.1. 时间对齐:基于步距最值的时序同步
针对动捕设备无绝对时间戳的问题,通过步态运动的步距变化实现动捕姿态与视频姿态的时间对齐,姿态数据来源说明及具体流程如下.
本研究中涉及3类姿态数据. 1)动捕姿态:由惯性动捕设备(VDSuit)直接提供;2)0°视角视频姿态:基于0°视角下由双目深度相机同步采集的RGB图像与深度图,经HRNet算法结合深度信息提取得到;3)多视角视频姿态:通过VideoPose3D[29]算法对11个视角的RGB视频进行姿态估计得到.
时间对齐策略如下.
1)步距时序序列提取:分别计算动捕姿态序列和0°视角视频姿态序列中每一帧的两脚三维欧氏距离,生成连续的步距时序曲线.
2)对齐基准点确定:选取2条步距曲线中首个局部最大值(双脚分离最远时刻)紧随的局部最小值(双脚并拢时刻)作为时间对齐基准点.
动捕与0°视角视频姿态对齐:将动捕姿态序列与0°视角视频姿态序列在时间轴上对齐,实现帧级一一对应,数学表达如下:
式中:
3)多视角视频姿态扩展对齐:利用0°视角与其余10 个视角RGB视频的高精度时间戳,将已对齐的动捕姿态映射至全部11 个视角的视频姿态,实现全局时间同步.
通过上述处理,最终获得时空一致的动捕姿态与11 个视角RGB视频姿态序列,构成CASIA-V数据集的时间对齐数据基础. 随机选取一个样本,可视化其处理前、后的对齐结果,如图2所示.
图 2
2.3.2. 空间对齐:基于骨盆关节的坐标系适配
动捕设备与RGB摄像头的坐标系原点、方向存在差异,须通过空间变换实现姿态数据坐标系统一. 针对姿态序列,通过逐帧平移使动捕与视频的骨盆位置贴合,结合序列全局旋转消除单帧对齐的整体空间偏差,保障动作序列空间一致性,实现动捕姿态对视频坐标系的适配. 动捕姿态对齐视频姿态的具体实现方法及数学推导如下.
1)确定全局原点:选择人体骨盆关节作为全局坐标系原点(骨盆关节在步态运动中相对稳定,且为肢体运动的中心枢纽);动捕姿态每帧骨盆关节坐标记为
式中:
然后对序列中每帧动捕关节坐标进行平移操作,使动捕骨盆关节与视频骨盆关节坐标对齐.
2)逐帧平移对齐:对每帧动捕姿态数据,计算动捕骨盆关节与视频骨盆关节的坐标差,通过逐帧平移对齐让动捕骨盆贴合视频骨盆. 原始动捕姿态经平移对齐后的变换表达式如下:
式中:
3)序列级旋转适配:通过Procrustes分析计算旋转矩阵
首先进行去均值处理,对平移后的动捕姿态序列和原始视频姿态序列,计算所有关节的均值,消除平移残留影响:
式中:
去均值后的姿态序列:
然后构建动捕与视频序列的协方差矩阵
对
若行列式
最后,对去均值后的动捕姿态序列,施加旋转矩阵
再恢复均值(视频姿态的均值),得到旋转对齐后的动捕姿态序列:
通过上述操作,动捕姿态序列的整体坐标轴方向与视频姿态序列完全一致. 随机选取一个样本,可视化其处理前、后的对齐结果,如图3所示.
图 3
2.4. 多步态数据集的提取
本研究提供各种类型的步态数据,包括RGB、轮廓、骨骼和姿态,示例如图4所示.
图 4
轮廓采用RobustVideoMatting(RVM)[30]算法从RGB视频生成步态轮廓,该算法低背景依赖,可保留步态细微轮廓变化,通过时序平滑确保帧间轮廓连贯无跳变. 骨骼采用HRNet提取2D骨骼,该算法通过高、低分辨率特征融合避免关节偏移,时序提取稳定性强,兼顾识别精度与计算效率. 动捕姿态可直接通过动捕设备VDSuit对应的软件VDMocapStudio直接获取;视频姿态通过VideoPose3D算法将RGB序列转换得到.
2.5. 收集、统计和评估
1)收集流程. 每名受试者在正常行走条件下采集6 次序列,背包、穿大衣条件下各采集2 次,另采集各视角空背景,单视角共11 个步态序列.
2)数据集统计. 如图5所示展示了CASIA-V中年龄、性别和序列长度的分布. 受试者年龄为20~35 岁(均值为26.3 岁),男女比例约为2∶1,身高为155~190 cm(均值为173.5 cm);每个序列平均含110 帧,可覆盖完整步态周期,数据多样性为模型泛化性能评估提供支撑.
图 5
图 5 CASIA-V中年龄、性别和序列长度的分布
Fig.5 Distribution of age, gender and sequence length in CASIA-V
3)评估方案. 受试者从1到93. 受试者1~65进行训练,其余用于测试.
3. 基于姿态诱导的多模态步态识别
针对现有步态识别中真实三维姿态缺失、多模态特征互补性挖掘不足的问题,以多模态融合模型MSAFF为基础框架,提出融合三维姿态与轮廓模态的步态识别网络SIGait. 该网络的核心改进为2点:一是创新性引入独立训练的3D-SIM,利用真实动捕姿态引导视频姿态特征提纯;二是对MSAFF的下游特征融合模块进行轻量化微调,适配诱导姿态特征输入,实现高效的多模态特征判别性表征.
3.1. 整体流程
SIGait网络训练分为2阶段:第1阶段单独训练3D-SIM模块,第2阶段将预训练完成的3D-SIM插入网络,联合训练下游特征融合与分类模块. 本研究提出的步态识别网络整体框架如图6所示. 网络输入包括轮廓序列
图 6
3.1.1. 轮廓特征提取
沿用MSAFF的模态特征提取逻辑,轮廓序列通过4 个2D卷积层与1个2D最大池化层组成的特征提取网络
式中:
3.1.2. 诱导姿态特征生成
为了获取贴合真实三维语义的姿态特征,将时空对齐后的动捕姿态序列与视频姿态序列输入3D-SIM,以动捕姿态为真实参考,通过反向训练对视频姿态进行特征提纯,输出诱导姿态特征
式中:
3.1.3. 部位级特征构建
参考MSAFF的部位划分策略,将
式中:
3.1.4. 多尺度特征融合与表征生成
采用MSAFF的多尺度时空特征提取器(MSSTFE)分别对
3.2. 三维姿态诱导模块(3D-SIM)
为了充分挖掘视频姿态的有效信息,设计三维姿态诱导模块,其网络结构如图7所示.
图 7
模块整体由3 个级联的“图卷积-卷积式Transformer”stage组成,输入为骨架张量[
模块以时空对齐后的动捕姿态与VideoPose3D生成的视频姿态为双输入,通过2个并行分支分别提取两者特征:动捕姿态分支提供真实三维姿态语义参考,视频姿态分支经上述3 个stage完成特征提纯,最终输出与真实姿态语义对齐的诱导姿态特征. 为了确保诱导特征的真实性与精准性,设计图卷积特征损失函数监督训练过程,保持动捕姿态特征固定,以其为参考反向优化视频姿态分支参数,使诱导姿态特征在特征空间中逼近真实动捕姿态特征.
3.2.1. 图卷积特征损失函数
为了统一描述,3D-SIM的输入分别为
2个分支经3个“图卷积层+Transformer Encoder”提取姿态特征后,保持动捕姿态分支特征不变,以图卷积特征损失函数为训练损失,通过反向传播迭代更新视频姿态分支的权重参数.图卷积损失函数由特征对齐损失、肢体节点加权损失和时序平滑损失3部分组成,表达式如下:
式中:
对于特征对齐损失,采用均方误差(MSE)对齐真实姿态与预测姿态的图卷积特征,确保两者在特征空间中接近:
式中:
对于节点加权损失,对肢体节点的特征误差赋予更高权重(记为
式中:
式中:
相比MSAFF的直接姿态输入模式,3D-SIM实现了2点关键改进. 1)特征真实性提升:通过真实动捕姿态校准,诱导姿态特征的三维语义准确性显著优于MSAFF中基于估计姿态的特征;2)模态适配性增强:优化后的姿态特征与轮廓特征的互补性更强,能为后续融合模块提供高质量输入.
3.2.2. 3D-SIM单独训练策略
为了保证3D-SIM的独立性,采用与下游识别任务完全解耦的单独训练模式:训练数据采用CASIA-V数据集的所有视频姿态序列与动捕姿态序列,仅使用图卷积特征损失函数优化核心目标;迭代8 万次,初始学习率为1×10−4,于
3.3. 基于MSAFF框架的多模态特征融合
3D-SIM经单独训练后直接插入MSAFF框架,训练时冻结3D-SIM所有参数,仅对MSAFF的下游模块(自适应特征融合模块AFFM、多尺度时空特征提取器MSSTFE)微调.
沿用MSAFF的维度压缩策略,将高维输出特征划分为op 个部分,通过池化降低维度以平衡识别精度与计算开销. 设计消融实验对比平均池化、最大池化与全局池化的性能(实验数据见表6),结果表明,在NM、BG、CL这3种行走场景下,平均池化得到的Rank-1准确率均最优,故最终采用平均池化输出步态表征向量.
表 6 不同池化策略的性能对比
Tab.6
| 池化策略 | R-1/% | |||
| NM | BG | CL | 均值 | |
| 最大池化 | 96.8 | 95.1 | 89.7 | 93.9 |
| 全局池化 | 97.2 | 95.7 | 90.2 | 94.4 |
| 平均池化 | 97.7 | 96.3 | 90.9 | 94.9 |
4. 实 验
实验采用CASIA-V多模态步态数据集,遵循跨视角评估协议. 网络模型基于PyTorch实现,采用RTX 3090 GPU完成训练与测试.
4.1. 实验设置
4.1.1. 超参数
轮廓分支4层卷积输出通道依次为32、64、128、128,在第2卷积层后设步长为2的最大池化层,各卷积层均接Leaky ReLU激活函数. 参数Outc=256,骨架关节数量Z=17. 对于CASIA-V,时间序列帧数K=32. 在单峰输入可用时,每批次样本数量N=30,在双峰输入可用时,N=60. 此外,对于CASIA-V,训练阶段输出特征维数为339×256,推理阶段输出特征维数为339.
4.1.2. 训练细节
4.2. 对比实验
在CASIA-V数据集上,将SIGait与3 种单模态、3 种多模态方法对比,以Rank-1准确率R-1为指标. 实验结果如表1所示,可以得出以下结论:在NM、BG、CL这3类行走条件下,SIGait的性能均优于所有对比方法,验证了所提方法提取的步态特征具有更强稳健性;在复杂的穿大衣(CL)场景中,SIGait性能优势尤为突出,相较于单模态方法GaitSet提升21.0个百分点,相较于多模态方法TransGait、MSAFF和SkeletonGait++分别提升5.6、7.1和6.2个百分点,充分验证了模型在复杂环境下的有效性与跨视角细粒度特征提取能力.
表 1 不同方法在CASIA-V数据集上的跨视角对比结果
Tab.1
4.3. 消融实验
为了验证3D-SIM模块的通用性、核心作用机制及模态兼容性,设计三级递进消融实验.
4.3.1. 3D-SIM模块的通用性验证
通用性验证实验旨在验证3D-SIM模块“即插即用”的泛化能力,结果如表2所示. 各模型输入设计如下:GaitGraph(3D)为三维视频姿态适配版,输入为姿态估计的三维视频姿态;GaitGraph(3D)+则在GaitGraph(3D)基础上引入3D-SIM模块,融合真实动捕姿态以诱导提纯三维视频姿态. PoseGait原生输入即为三维视频姿态,MSAFF(3D)输入为姿态估计的三维视频姿态+轮廓. 本实验通过二维骨骼与三维视频姿态的输入对比、相同输入下是否引入3D-SIM的对比,量化姿态诱导机制对模型跨视角识别性能的增益. 结果表明,所有基础模型插入3D-SIM后均实现显著性能提升,其中PoseGait性能提升最为明显,MSAFF保持稳定增益,验证了3D-SIM的即插即用能力与多框架兼容性.
表 2 在CASIA-V数据集上对3D-SIM的跨视角消融实验结果
Tab.2
4.3.2. 3D-SIM模块的贡献比例量化
以MSAFF(3D)为基准,设计4 组对照实验:基准组(无3D-SIM)、实验组1(完整3D-SIM)、实验组2(伪3D-SIM,随机姿态替代动捕姿态)、实验组3(简化3D-SIM,仅保留特征对齐损失). 3D-SIM模块内部功能拆解的消融实验结果如表3所示.
表 3 3D-SIM模块内部功能拆解的消融实验结果(CASIA-V,单一变量控制)
Tab.3
| 组别 | R-1/% | |||
| NM | BG | CL | 均值 | |
| 基准组 | 90.3 | 88.5 | 80.6 | 86.4 |
| 实验组1 | 97.7 | 96.3 | 90.9 | 94.9 |
| 实验组2 | 96.3 | 93.5 | 87.2 | 92.3 |
| 实验组3 | 96.8 | 94.1 | 88.5 | 93.1 |
3D-SIM模块各核心功能的性能贡献占比如表4所示,其数据基于单一变量控制的消融实验准确率计算得出. 其中,ΔR为性能提升,η为贡献比例. 贡献类型包含3D-SIM总贡献、真实3D姿态引导的独立贡献、完整特征提纯的独立贡献,以及两者的协同贡献. 具体计算逻辑如下:3D-SIM总贡献为完整3D-SIM模型与基准模型平均准确率的差值;真实3D姿态引导贡献为完整模型与伪3D-SIM模型平均准确率的差值;完整特征提纯贡献为完整模型与简化3D-SIM模型平均准确率的差值;协同贡献为总贡献减去前两项独立贡献. 各功能贡献比例为对应差值与总贡献的比值. 在3D-SIM的总性能增益中,“真实3D姿态引导”占比30.5%,是核心增益来源,证明真实三维语义对复杂场景识别的关键作用;“完整特征提纯逻辑”占比21.1%,表明精细化特征处理能进一步放大真实姿态的价值;两者的协同贡献占比48.2%,验证了真实语义及优质特征的良性互补机制.
表 4 3D-SIM 模块各功能贡献比例量化分析结果
Tab.4
| 贡献类型 | ΔR/百分点 | η/% |
| 3D-SIM总贡献 | 8.5 | 100 |
| 真实3D姿态引导的贡献 | 2.6 | 30.5 |
| 完整特征提取的贡献 | 1.8 | 21.1 |
| 协同贡献 | 4.1 | 48.2 |
4.3.3. 3D-SIM模块的模态信息保留验证
为了验证3D-SIM模块是否会破坏原有模态有效信息,确保性能提升而非以牺牲原有模态价值为代价. 选取“基准组(无3D-SIM)”与“实验组1(完整3D-SIM)”,分别剥离多模态融合框架中的单一模态,即仅保留轮廓特征或视频姿态特征,单独进行身份识别. 对比单模态判别准确率,实验结果如表5所示. 结果显示,引入3D-SIM后轮廓特征准确率仅轻微波动,视频姿态特征准确率显著提升,证明3D-SIM未破坏原有模态信息,且通过特征提纯实现增量增益. 消融实验结果表明,3D-SIM模块可稳定提升不同步态识别模型的跨视角性能,其核心增益源于真实3D姿态引导与特征提纯的协同作用,同时其具备良好的模态兼容性.
表 5 3D-SIM模块对轮廓与视频姿态特征的模态信息保留验证结果(单模态单独判别)
Tab.5
| 类别 | 组别 | R-1/% | |||
| NM | BG | CL | 均值 | ||
| 轮廓特征 | 基准组 | 89.2 | 85.1 | 78.3 | 84.2 |
| 实验组1 | 89.7 | 85.6 | 78.7 | 84.7 | |
| 视频姿态特征 | 基准组 | 82.5 | 76.4 | 69.7 | 76.2 |
| 实验组1 | 85.7 | 81.9 | 77.5 | 81.7 | |
4.4. 池化策略分析
为了验证特征维度池化阶段的最优策略,在SIGait模型基础上,仅替换池化方式(平均池化、最大池化、全局池化),其余参数保持一致,在CASIA-V数据集的测试集上进行性能评估,结果如表6所示. 可以看出,在3种行走条件下,平均池化的识别准确率均优于最大池化与全局池化. 这是因为平均池化能够更全面地保留多模态融合特征的全局统计信息,避免最大池化过度聚焦局部极值或全局池化丢失细节特征的问题,从而提升模型对复杂场景的鲁棒性.
4.5. 计算效率与实用性分析
为了验证3D-SIM模块对模型部署效率的影响,从参数量
表 7 MSAFF(3D)/3D-SIM/SIGait计算效率对比
Tab.7
| 模型 | ||||
| MSAFF(3D) | 23.49 | 7.11 | 18.83±0.62 | 53.11 |
| 3D-SIM | 0.26 | 0.13 | — | — |
| SIGait | 23.75 | 7.24 | 19.56±0.58 | 51.12 |
4.6. 3D-SIM的鲁棒性与适用条件分析
为了深入揭示3D-SIM模块的鲁棒性边界及适用场景,设计输入序列长度、帧采样率、训练ID数这3个关键维度的消融实验. 所有实验均基于SIGait模型,仅改变单一变量,其余参数与4.1节实验设置一致,以Rank-1准确率为评价指标.
4.6.1. 输入序列长度的影响
设置16、24、32、40、48 帧共5组序列长度,实验结果如表8所示. 从16帧到32 帧,平均准确率提升6.0 个百分点(CL场景下提升6.2 个百分点);32 帧后准确率趋于饱和,因该长度已覆盖完整步态周期;16 帧短序列下平均准确率仍达89.0%,验证了模块对运动信息不完备场景的鲁棒性.
表 8 不同输入序列长度下的性能对比
Tab.8
| 输入序列长度/帧 | R-1/% | |||
| NM | BG | CL | 均值 | |
| 16 | 92.3 | 90.1 | 84.7 | 89.0 |
| 24 | 95.6 | 93.8 | 88.5 | 92.6 |
| 32 | 97.7 | 96.3 | 90.9 | 95.0 |
| 40 | 97.9 | 96.5 | 91.2 | 95.2 |
| 48 | 98.0 | 96.6 | 91.3 | 95.3 |
4.6.2. 帧采样率的影响
基于32 帧基准序列,设置1、2、3、4 帧采样间隔(对应30、15、10、7.5 帧/s),实验结果如表9所示. 从30帧/s到15帧/s,准确率仅下降1.0 个百分点,模块对低帧率有较强容忍度;采样率低于10 帧/s 后性能显著下降,因丢失关节细微动态;7.5 帧/s 下平均准确率仍达87.3%,显著高于无3D-SIM的MSAFF (3D)的准确率(82.5%),体现了特征增强作用.
表 9 不同帧采样率下的性能对比
Tab.9
| 采样间隔/帧 | 实际采样率/(帧·s−1) | R-1/% | |||
| NM | BG | CL | 均值 | ||
| 1 | 30 | 97.7 | 96.3 | 90.9 | 94.9 |
| 2 | 15 | 96.8 | 95.2 | 89.6 | 93.9 |
| 3 | 10 | 94.5 | 92.7 | 87.3 | 91.5 |
| 4 | 7.5 | 90.2 | 88.5 | 83.1 | 87.3 |
4.6.3. 训练ID数的影响
设置20、35、50、65、80共5组训练ID数(测试ID固定为28),实验结果如表10所示. 当训练ID数由20增至65时,平均准确率由86.0%升至94.9%,提高8.9个百分点;训练ID数继续增至80时,平均准确率仅由94.9%升至95.5%,增幅为0.6个百分点. 说明训练样本达到一定规模后,模型性能提升趋于平缓. 综上,3D-SIM通过真实动捕姿态的语义引导,降低了模型对输入数据质量(序列长度、采样率)和训练样本量的依赖,为步态识别在资源受限场景的应用提供了技术支撑.
表 10 不同训练ID数下的性能对比
Tab.10
| 训练ID数 | R-1/% | |||
| NM | BG | CL | 均值 | |
| 20 | 89.5 | 87.2 | 81.3 | 86.0 |
| 35 | 93.8 | 91.5 | 85.7 | 90.3 |
| 50 | 96.2 | 94.1 | 88.9 | 93.1 |
| 65 | 97.7 | 96.3 | 90.9 | 94.9 |
| 80 | 98.1 | 96.8 | 91.5 | 95.5 |
5. 结 语
针对复杂环境下多视角步态识别的真实三维姿态缺失、多模态融合不足的问题,构建含真实动捕姿态的多模态数据集CASIA-V,并提出姿态诱导模型SIGait,核心成果如下:1)CASIA-V涵盖93 名受试者的
本研究的局限性在于:SIGait性能增益依赖CASIA-V的时空精准对齐,泛化性需更多设备与大规模数据集验证;多模态融合结构在资源受限设备上的实时性仍须优化.
未来将从3方面推进研究:优化多设备同步采集方案,提升数据对齐鲁棒性并扩充场景;探索轻量化融合结构,适配高实时性应用需求;验证3D-SIM在更多步态识别框架中的通用性,推广真实三维姿态的应用价值.
参考文献
A comprehensive survey of masked faces: recognition, detection, and unmasking
[J].DOI:10.3390/app14198781 [本文引用: 1]
Finger recovery transformer: toward better incomplete fingerprint identification
[J].
下肢假肢穿戴者跑动步态识别方法
[J].DOI:10.3785/j.issn.1008-973X.2018.10.018 [本文引用: 1]
Approach of running gait recognition for lower limb amputees
[J].DOI:10.3785/j.issn.1008-973X.2018.10.018 [本文引用: 1]
GaitSet: cross-view gait recognition through utilizing gait as a deep set
[J].DOI:10.1109/tpami.2021.3057879 [本文引用: 3]
A comprehensive study on cross-view gait based human identification with deep CNNs
[J].DOI:10.1109/TPAMI.2016.2545669
A model-based gait recognition method with body pose and human prior knowledge
[J].DOI:10.1016/j.patcog.2019.107069 [本文引用: 3]
Spatial transformer network on skeleton-based gait recognition
[J].DOI:10.1111/exsy.13244 [本文引用: 1]
基于SMPL模态分解与嵌入融合的多模态步态识别
[J].
Multi-modal gait recognition based on SMPL model decomposition and embedding fusion
[J].
TransGait: multimodal-based gait recognition with set transformer
[J].DOI:10.1007/s10489-022-03543-y [本文引用: 1]
GaitSTR: gait recognition with sequential two-stream refinement
[J].DOI:10.1109/TBIOM.2024.3390626
Multi-view large population gait dataset and its performance evaluation for cross-view gait recognition
[J].DOI:10.1186/s41074-018-0039-6 [本文引用: 1]
Multi-view large population gait dataset and its performance evaluation for cross-view gait recognition
[J].DOI:10.1186/s41074-018-0039-6 [本文引用: 1]
/
| 〈 |
|
〉 |

