[1]
FEI H, WU S, ZHANG M, et al Enhancing video-language representations with structural spatio-temporal alignment
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2024 , 46 (12 ): 7701 - 7719
DOI:10.1109/TPAMI.2024.3393452
[本文引用: 1]
[2]
DONG J, SUN S, LIU Z, et al. Hierarchical contrast for unsupervised skeleton-based action representation learning [C]// Proceedings of the AAAI Conference on Artificial Intelligence . Washington, D. C. : AAAI Press, 2023: 525–533.
[本文引用: 10]
[3]
WANG X, MU Y Localized linear temporal dynamics for self-supervised skeleton action recognition
[J]. IEEE Transactions on Multimedia , 2024 , 26 : 10189 - 10199
DOI:10.1109/TMM.2024.3405712
[本文引用: 4]
[4]
HE Z, LV J, FANG S Representation modeling learning with multi-domain decoupling for unsupervised skeleton-based action recognition
[J]. Neurocomputing , 2024 , 582 : 127495
DOI:10.1016/j.neucom.2024.127495
[本文引用: 5]
[5]
WU W, HUA Y, ZHENG C, et al. Skeletonmae: spatial-temporal masked autoencoders for self-supervised skeleton action recognition [C]// Proceedings of the IEEE International Conference on Multimedia and Expo Workshops . Brisbane: IEEE, 2023: 224–229.
[本文引用: 1]
[6]
ABDELFATTAH M, ALAHI A. S-JEPA: a joint embedding predictive architecture for skeletal action recognition [C]// Proceedings of the European Conference on Computer Vision . Milan: Springer, 2024: 367–384.
[本文引用: 1]
[7]
RAO H, XU S, HU X, et al Augmented skeleton based contrastive action learning with momentum LSTM for unsupervised action recognition
[J]. Information Sciences , 2021 , 569 : 90 - 109
DOI:10.1016/j.ins.2021.04.023
[本文引用: 1]
[8]
QU H, CAI Y, LIU J. LLMs are good action recognizers [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2024: 18395–18406.
[本文引用: 2]
[9]
XIANG W, LI C, ZHOU Y, et al. Generative action description prompts for skeleton-based action recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Paris: IEEE, 2023: 10242–10251.
[本文引用: 1]
[10]
HU E J, SHEN Y, WALLIS P, et al. LoRA: low-rank adaptation of large language models [EB/OL]. (2021-10-16) [2025-07-10]. https://arxiv.org/abs/2106.09685.
[本文引用: 1]
[11]
ZHU A, KE Q, GONG M, et al. Part-aware unified representation of language and skeleton for zero-shot action recognition [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2024: 18761–18770.
[本文引用: 1]
[12]
LIU S, ZENG Z, REN T, et al. Grounding DINO: marrying DINO with grounded pre-training for open-set object detection [C]// Proceedings of the European Conference on Computer Vision . Milan: Springer, 2024: 38–55.
[本文引用: 1]
[13]
LIU H, LI C, WU Q, et al. Visual instruction tuning [C]// Proceedings of the 37th International Conference on Neural Information Processing Systems . New Orleans: Curran Associates Inc, 2023: 34892–34916.
[本文引用: 1]
[14]
CHEN Y, HE T, FU J, et al Vision-language meets the skeleton: progressively distillation with cross-modal knowledge for 3D action representation learning
[J]. IEEE Transactions on Multimedia , 2025 , 27 : 2293 - 2303
DOI:10.1109/TMM.2024.3521718
[本文引用: 3]
[15]
CHEN T, KORNBLITH S, NOROUZI M, et al. A simple framework for contrastive learning of visual representations [EB/OL]. (2020-07-01) [2025-07-10]. https://arxiv.org/abs/2002.05709.
[本文引用: 1]
[16]
ANDONIAN A, CHEN S, HAMID R. Robust cross-modal representation learning with progressive self-distillation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . New Orleans: IEEE, 2022: 16409–16420.
[本文引用: 1]
[17]
CAO W, ZHANG A, HE Z, et al Hierarchical spatial-temporal masked contrast for skeleton action recognition
[J]. IEEE Transactions on Artificial Intelligence , 2024 , 5 (11 ): 5801 - 5814
DOI:10.1109/TAI.2024.3430260
[本文引用: 4]
[18]
SHAHROUDY A, LIU J, NG T T, et al. NTU RGB+D: a large scale dataset for 3D human activity analysis [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition . Las Vegas: IEEE, 2016: 1010–1019.
[本文引用: 1]
[19]
LIU J, SHAHROUDY A, PEREZ M, et al NTU RGB+ D 120: a large-scale benchmark for 3D human activity understanding
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2020 , 42 (10 ): 2684 - 2701
DOI:10.1109/TPAMI.2019.2916873
[本文引用: 1]
[20]
LIU C, HU Y, LI Y, et al. PKU-MMD: a large scale benchmark for continuous multi-modal human action understanding [EB/OL]. (2017-03-28) [2025-07-10]. https://arxiv.org/abs/1703.07475.
[本文引用: 1]
[21]
GUO T, LIU M, LIU H, et al Improving self-supervised action recognition from extremely augmented skeleton sequences
[J]. Pattern Recognition , 2024 , 150 : 110333
DOI:10.1016/j.patcog.2024.110333
[本文引用: 1]
[22]
YANG D, WANG Y, DANTCHEVA A, et al View-invariant skeleton action representation learning via motion retargeting
[J]. International Journal of Computer Vision , 2024 , 132 (7 ): 2351 - 2366
DOI:10.1007/s11263-023-01967-8
[本文引用: 1]
[23]
YANG S, LIU J, LU S, et al Self-supervised 3D action representation learning with skeleton cloud colorization
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2024 , 46 (1 ): 509 - 524
DOI:10.1109/TPAMI.2023.3325463
[本文引用: 3]
[24]
SHAH A, ROY A, SHAH K, et al. HaLP: hallucinating latent positives for skeleton-based self-supervised learning of actions [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Vancouver: IEEE, 2023: 18846–18856.
[本文引用: 3]
[25]
SUN S, LIU D, DONG J, et al. Unified multi-modal unsupervised representation learning for skeleton-based action understanding [C]// Proceedings of the 31st ACM International Conference on Multimedia . Ottawa: ACM, 2023: 2973–2984.
[本文引用: 4]
[26]
HU J, HOU Y, GUO Z, et al Global and local contrastive learning for self-supervised skeleton-based action recognition
[J]. IEEE Transactions on Circuits and Systems for Video Technology , 2024 , 34 (11 ): 10578 - 10589
DOI:10.1109/TCSVT.2024.3410301
[本文引用: 1]
[27]
ZHANG J, LIN L, LIU J. Prompted contrast with masked motion modeling: towards versatile 3D action representation learning [C]// Proceedings of the 31st ACM International Conference on Multimedia . Ottawa: ACM, 2023: 7175–7183.
[本文引用: 2]
[28]
LIN L, ZHANG J, LIU J Mutual information driven equivariant contrastive learning for 3D action representation learning
[J]. IEEE Transactions on Image Processing , 2024 , 33 : 1883 - 1897
DOI:10.1109/TIP.2024.3372451
[本文引用: 3]
[29]
MAO Y, ZHOU W, LU Z, et al. CMD: self-supervised 3D action representation learning with cross-modal mutual distillation [C]// Proceedings of the European Conference on Computer Vision . Tel Aviv: Springer, 2022: 734–752.
[本文引用: 2]
Enhancing video-language representations with structural spatio-temporal alignment
1
2024
... 人体动作识别技术[1 ] 是指计算机算法从原始数据(如图像、视频等)中抽取和分析动作信息,从而识别出人体在三维空间场景中的行为与动作的技术. 基于人体骨架的动作识别算法具备抽象性高、鲁棒性好以及安全性高等天然优势,已成为动作识别领域中重要的研究热点. 其中,无监督的人体骨架动作识别算法[2 -4 ] 无须人工标注即可实现训练,显著降低了成本,近年来受到了广泛关注. ...
10
... 人体动作识别技术[1 ] 是指计算机算法从原始数据(如图像、视频等)中抽取和分析动作信息,从而识别出人体在三维空间场景中的行为与动作的技术. 基于人体骨架的动作识别算法具备抽象性高、鲁棒性好以及安全性高等天然优势,已成为动作识别领域中重要的研究热点. 其中,无监督的人体骨架动作识别算法[2 -4 ] 无须人工标注即可实现训练,显著降低了成本,近年来受到了广泛关注. ...
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
... 基于多模态大模型的噪声鲁棒无监督人体骨架表示学习方法的整体框架如图1 所示. 在先前无监督人体骨架编码器[2 ] 的基础上,利用大模型生成描述骨架动作的文本,以辅助表示学习,并通过联合噪声估计来优化学习目标,从而提升方法的噪声鲁棒性. ...
... 式中:骨架、文本投影层${g_{\text{s}}}{\text{(}} \cdot )$ 、${g_{\text{t}}}( \cdot )$ 均为单线性映射层;${\boldsymbol{s}} \in {{\bf{R}}^{{D_{{\text{dc}}}}}}$ 为投影后的归一化骨架特征表示;${\boldsymbol{l}} \in {{\bf{R}}^{G \times {D_{{\text{dc}}}}}}$ 为投影后归一化的文本特征表示;${\text{Skeleton}}\_ {\text{Encoder}}( \cdot )$ 表示骨架编码器对特征的处理,其编码策略与先前工作[2 ] 相同;${\text{Text}}\_{\text{Encoder}}( \cdot )$ 表示完全冻结的预训练文本编码器对特征的处理. ...
... 参照先前的研究工作[2 ,17 ] ,选用3个被广泛使用的数据集:NTU RGB+D 60[18 ] 、NTU RGB+D 120[19 ] 与PKU-MMD[20 ] . 其中,NTU RGB+D 60数据集提供2种标准评估设置:跨视角(x-view)设置,利用3台呈120度环形布设的摄像机采集数据,其中视角2、3下采集的数据构成训练集,视角1的数据作为测试集;跨受试者(x-sub)设置,将50%受试者的动作样本作为训练数据,剩余受试者的数据用于测试. NTU RGB+D 120数据集将行为类别扩展至120种,涵盖113945 个动作实例,在32种实验配置下对106名受试者完成采集. 该数据集新增了跨配置(x-setup)评估设置,即采用偶数序号的配置样本构建训练集,将奇数配置样本构成测试集. PKU-MMD数据集最初专为动作检测任务构建,现已成为无监督骨架表示学习研究中的主流评估数据集,包含I、II 2个子集. 其中PKU-MMD II涵盖51类行为,共7 000个运动序列,每个动作类别的数据采集自1或2名受试者,因显著的视角多样性而具有更高的挑战性,被广泛应用于相关研究工作. ...
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of skeleton-based action retrieval performance of proposed method and other methods on NTU RGB+D 60 and NTU RGB+D 120 datasets
Tab.2 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup KTCL[3 ] 67.1 84.7 58.9 59.8 HiCo[2 ] 68.3 84.8 56.6 59.1 HSTM-Transformer[17 ] 70.0 88.3 57.7 59.8 RMMD[4 ] 70.9 87.4 58.4 61.8 HaLP[24 ] 65.8 86.3 55.8 59.0 UmURL[25 ] 71.3 88.3 58.5 60.9 本研究方法 73.5 90.2 61.8 65.5
2.2.3. 半监督学习性能比较 针对半监督学习,实验遵循文献[2 ]中的设置,采用NTU RGB+D 60数据集. 为了深入探索不同方法在半监督学习中的性能,随机抽取不同比例(1%、10%)的标注数据参与模型训练. 表3 展示了不同设置下的Top-1准确率,其中r s 、r v 分别为x-sub、x-view设置下的标注数据比例. 可以看出,提出的方法在不同数据集以及标注数据比例下均显著优于对比方法. 值得注意的是,相较于10%的标注数据,当仅使用1%的标注数据时本研究方法相对于其他方法的优势更加显著. 这一现象意味着当资源受限时,多模态大模型提供的动作描述文本可以为训练提供关键的动作信息,有效缓解了标注数据稀缺对模型性能带来的负面影响. ...
... 针对半监督学习,实验遵循文献[2 ]中的设置,采用NTU RGB+D 60数据集. 为了深入探索不同方法在半监督学习中的性能,随机抽取不同比例(1%、10%)的标注数据参与模型训练. 表3 展示了不同设置下的Top-1准确率,其中r s 、r v 分别为x-sub、x-view设置下的标注数据比例. 可以看出,提出的方法在不同数据集以及标注数据比例下均显著优于对比方法. 值得注意的是,相较于10%的标注数据,当仅使用1%的标注数据时本研究方法相对于其他方法的优势更加显著. 这一现象意味着当资源受限时,多模态大模型提供的动作描述文本可以为训练提供关键的动作信息,有效缓解了标注数据稀缺对模型性能带来的负面影响. ...
... Comparison of semi-supervised learning performance
Tab.3 方法 A /%r s =1%r s =10%r v =1%r v =10%3s-C-F[23 ] 52.3 76.5 53.1 81.3 PCM3 [27 ] 53.8 77.7 53.1 82.8 HiCo[2 ] 54.4 73.0 54.8 78.3 Lin等[28 ] 55.2 78.9 54.9 82.9 UmURL[25 ] 58.1 76.5 58.3 81.5 CMD[29 ] 50.6 75.4 53.0 80.2 RMMD[4 ] 58.3 77.1 56.0 81.0 本研究方法 62.1 79.9 63.3 84.5
2.2.4. 迁移学习性能比较 通过迁移学习范式对模型的跨数据集泛化性能展开验证. 在实验过程中,模型首先在源数据集上进行无监督表示学习,随后在目标数据集上进行骨架动作识别性能评估. 所有评估均在x-sub设置下实施. 实验结果详见表4 ,其中N60、N120分别表示以NTU RGB+D 60、NTU RGB+D 120为源数据集. 可以看出,所提方法以明显的性能优势超越了其他方法,充分证实了所提方法即使在跨场景的情况下,也能够更有效地捕获固定的骨架运动模式,并将其应用于骨架动作分类. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...
Localized linear temporal dynamics for self-supervised skeleton action recognition
4
2024
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of skeleton-based action retrieval performance of proposed method and other methods on NTU RGB+D 60 and NTU RGB+D 120 datasets
Tab.2 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup KTCL[3 ] 67.1 84.7 58.9 59.8 HiCo[2 ] 68.3 84.8 56.6 59.1 HSTM-Transformer[17 ] 70.0 88.3 57.7 59.8 RMMD[4 ] 70.9 87.4 58.4 61.8 HaLP[24 ] 65.8 86.3 55.8 59.0 UmURL[25 ] 71.3 88.3 58.5 60.9 本研究方法 73.5 90.2 61.8 65.5
2.2.3. 半监督学习性能比较 针对半监督学习,实验遵循文献[2 ]中的设置,采用NTU RGB+D 60数据集. 为了深入探索不同方法在半监督学习中的性能,随机抽取不同比例(1%、10%)的标注数据参与模型训练. 表3 展示了不同设置下的Top-1准确率,其中r s 、r v 分别为x-sub、x-view设置下的标注数据比例. 可以看出,提出的方法在不同数据集以及标注数据比例下均显著优于对比方法. 值得注意的是,相较于10%的标注数据,当仅使用1%的标注数据时本研究方法相对于其他方法的优势更加显著. 这一现象意味着当资源受限时,多模态大模型提供的动作描述文本可以为训练提供关键的动作信息,有效缓解了标注数据稀缺对模型性能带来的负面影响. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...
Representation modeling learning with multi-domain decoupling for unsupervised skeleton-based action recognition
5
2024
... 人体动作识别技术[1 ] 是指计算机算法从原始数据(如图像、视频等)中抽取和分析动作信息,从而识别出人体在三维空间场景中的行为与动作的技术. 基于人体骨架的动作识别算法具备抽象性高、鲁棒性好以及安全性高等天然优势,已成为动作识别领域中重要的研究热点. 其中,无监督的人体骨架动作识别算法[2 -4 ] 无须人工标注即可实现训练,显著降低了成本,近年来受到了广泛关注. ...
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of skeleton-based action retrieval performance of proposed method and other methods on NTU RGB+D 60 and NTU RGB+D 120 datasets
Tab.2 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup KTCL[3 ] 67.1 84.7 58.9 59.8 HiCo[2 ] 68.3 84.8 56.6 59.1 HSTM-Transformer[17 ] 70.0 88.3 57.7 59.8 RMMD[4 ] 70.9 87.4 58.4 61.8 HaLP[24 ] 65.8 86.3 55.8 59.0 UmURL[25 ] 71.3 88.3 58.5 60.9 本研究方法 73.5 90.2 61.8 65.5
2.2.3. 半监督学习性能比较 针对半监督学习,实验遵循文献[2 ]中的设置,采用NTU RGB+D 60数据集. 为了深入探索不同方法在半监督学习中的性能,随机抽取不同比例(1%、10%)的标注数据参与模型训练. 表3 展示了不同设置下的Top-1准确率,其中r s 、r v 分别为x-sub、x-view设置下的标注数据比例. 可以看出,提出的方法在不同数据集以及标注数据比例下均显著优于对比方法. 值得注意的是,相较于10%的标注数据,当仅使用1%的标注数据时本研究方法相对于其他方法的优势更加显著. 这一现象意味着当资源受限时,多模态大模型提供的动作描述文本可以为训练提供关键的动作信息,有效缓解了标注数据稀缺对模型性能带来的负面影响. ...
... Comparison of semi-supervised learning performance
Tab.3 方法 A /%r s =1%r s =10%r v =1%r v =10%3s-C-F[23 ] 52.3 76.5 53.1 81.3 PCM3 [27 ] 53.8 77.7 53.1 82.8 HiCo[2 ] 54.4 73.0 54.8 78.3 Lin等[28 ] 55.2 78.9 54.9 82.9 UmURL[25 ] 58.1 76.5 58.3 81.5 CMD[29 ] 50.6 75.4 53.0 80.2 RMMD[4 ] 58.3 77.1 56.0 81.0 本研究方法 62.1 79.9 63.3 84.5
2.2.4. 迁移学习性能比较 通过迁移学习范式对模型的跨数据集泛化性能展开验证. 在实验过程中,模型首先在源数据集上进行无监督表示学习,随后在目标数据集上进行骨架动作识别性能评估. 所有评估均在x-sub设置下实施. 实验结果详见表4 ,其中N60、N120分别表示以NTU RGB+D 60、NTU RGB+D 120为源数据集. 可以看出,所提方法以明显的性能优势超越了其他方法,充分证实了所提方法即使在跨场景的情况下,也能够更有效地捕获固定的骨架运动模式,并将其应用于骨架动作分类. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...
1
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
1
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
Augmented skeleton based contrastive action learning with momentum LSTM for unsupervised action recognition
1
2021
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
2
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
... [8 ]将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
1
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
1
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
1
... 基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5 ] 、潜在表示预测[6 ] 以及实例判别[7 ] 等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2 ] 及其改进方法[3 ,8 ] ,让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9 ] 使用动作标签,为骨架样本生成文本描述. Qu等[8 ] 将标签文本作为大语言模型输出的监督信号,使用LoRA[10 ] 微调大语言模型,并将模型应用于下游分类任务. Zhu等[11 ] 结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用. ...
1
... 2)动作描述文本生成. 如图1 中多模态特征编码网络的左下部分所示,对于每个RGB视频,首先采用间隔采样法抽取视频关键帧,再使用Grounding DINO方法[12 ] 进行主体裁剪,并使用多模态大模型LLaVA[13 ] 生成动作描述[14 ] . 对于每1个关键帧,生成1句关键帧的动作描述文本,记为${\boldsymbol{t}}$ ,该动作描述文本可以提供丰富的动作信息. 在此基础上,收集同一个视频生成的动作描述文本,记为文本集合${{T}} = {\{{\boldsymbol{t}}^1}, {{\boldsymbol{t}}^2}, \cdots ,{{\boldsymbol{t}}^G\}}$ ,其包含了$G$ 个不同的动作描述文本. 文本生成模块的参数保持冻结状态,不参与模型训练,以降低模型的训练开销. 此外,所有的描述文本仅用于训练阶段的骨架表示学习;在模型的推理阶段,仅使用骨架模态输入,不依赖于动作描述文本,以保证模型在推理阶段的计算效率. ...
1
... 2)动作描述文本生成. 如图1 中多模态特征编码网络的左下部分所示,对于每个RGB视频,首先采用间隔采样法抽取视频关键帧,再使用Grounding DINO方法[12 ] 进行主体裁剪,并使用多模态大模型LLaVA[13 ] 生成动作描述[14 ] . 对于每1个关键帧,生成1句关键帧的动作描述文本,记为${\boldsymbol{t}}$ ,该动作描述文本可以提供丰富的动作信息. 在此基础上,收集同一个视频生成的动作描述文本,记为文本集合${{T}} = {\{{\boldsymbol{t}}^1}, {{\boldsymbol{t}}^2}, \cdots ,{{\boldsymbol{t}}^G\}}$ ,其包含了$G$ 个不同的动作描述文本. 文本生成模块的参数保持冻结状态,不参与模型训练,以降低模型的训练开销. 此外,所有的描述文本仅用于训练阶段的骨架表示学习;在模型的推理阶段,仅使用骨架模态输入,不依赖于动作描述文本,以保证模型在推理阶段的计算效率. ...
Vision-language meets the skeleton: progressively distillation with cross-modal knowledge for 3D action representation learning
3
2025
... 2)动作描述文本生成. 如图1 中多模态特征编码网络的左下部分所示,对于每个RGB视频,首先采用间隔采样法抽取视频关键帧,再使用Grounding DINO方法[12 ] 进行主体裁剪,并使用多模态大模型LLaVA[13 ] 生成动作描述[14 ] . 对于每1个关键帧,生成1句关键帧的动作描述文本,记为${\boldsymbol{t}}$ ,该动作描述文本可以提供丰富的动作信息. 在此基础上,收集同一个视频生成的动作描述文本,记为文本集合${{T}} = {\{{\boldsymbol{t}}^1}, {{\boldsymbol{t}}^2}, \cdots ,{{\boldsymbol{t}}^G\}}$ ,其包含了$G$ 个不同的动作描述文本. 文本生成模块的参数保持冻结状态,不参与模型训练,以降低模型的训练开销. 此外,所有的描述文本仅用于训练阶段的骨架表示学习;在模型的推理阶段,仅使用骨架模态输入,不依赖于动作描述文本,以保证模型在推理阶段的计算效率. ...
... 表1 总结了不同模型在多个骨架数据集上进行人体骨架动作识别的结果. 其中,A 为Top-1准确率,NTU RGB+D 60、NTU RGB+D 120以及PKU-MMD II数据集分别被简写为N60、N120和P-II,x-sub、x-view和x-setup为不同的评估设置. 在无监督学习的设定下,提出的方法在性能上以显著的优势超越了其他同类工作. 现有方法中性能最优的模型C2 VL[14 ] 也使用了多模态大模型,除人体骨架序列模态外,还额外使用了视觉与文本模态信号,用于无监督表示学习. 所提文本辅助学习方法的Top-1准确率显著超越了C2 VL,证明了噪声评估后的文本模态信号优于C2 VL使用的“视觉+文本”信号. ...
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
1
... 一些细节信息在骨架输入中区分度较低,而在文本输入中具有明显的差异,因此使用额外文本特征作为骨架编码器的监督学习信号. 以实例判别任务为代理任务,利用文本模态特有的辨别性信息指导骨架编码器的表示学习. 经过文本、骨架编码以及公共编码空间映射,可以得到骨架特征${\boldsymbol{S}} \in {{\bf{R}}^{N \times {D_{{\text{dc}}}}}}$ 和文本特征${\boldsymbol{L}} \in {{\bf{R}}^{N \times G \times {D_{{\text{dc}}}}}}$ ,其中$N$ 为1个批次中的骨架样本数目,每个骨架样本特征对应$G$ 个动作文本描述特征. 采用归一化温标交叉熵损失函数[15 ] 进行参数优化,提升骨架与对应动作文本描述之间的相似度,并最小化该骨架与其他骨架的动作文本描述相似性,学习目标为 ...
1
... 骨架与文本在表示学习之初尚未对齐,因而在文本辅助的骨架表示学习过程中,过早地引入联合噪声估计方法不能很好地区分噪声样本与正常样本,反而会影响骨架表示学习的质量. 受Andonian等[16 ] 工作的启发,采用渐进式学习策略来逐步适应来自文本模态的监督信号. 具体来说,在训练时将批次内样本分为2部分,一部分使用原始对应关系${\boldsymbol{I}_{\mathrm{B}}}$ 进行训练,另一部分采用联合噪声估计方法生成的噪声鲁棒的学习目标${\tilde {\boldsymbol{I}}}$ 进行优化,其中使用学习目标${\tilde{\boldsymbol{I}}}$ 的数据比重随着训练轮次的增加不断增大,具体过程如下. ...
Hierarchical spatial-temporal masked contrast for skeleton action recognition
4
2024
... 参照先前的研究工作[2 ,17 ] ,选用3个被广泛使用的数据集:NTU RGB+D 60[18 ] 、NTU RGB+D 120[19 ] 与PKU-MMD[20 ] . 其中,NTU RGB+D 60数据集提供2种标准评估设置:跨视角(x-view)设置,利用3台呈120度环形布设的摄像机采集数据,其中视角2、3下采集的数据构成训练集,视角1的数据作为测试集;跨受试者(x-sub)设置,将50%受试者的动作样本作为训练数据,剩余受试者的数据用于测试. NTU RGB+D 120数据集将行为类别扩展至120种,涵盖113945 个动作实例,在32种实验配置下对106名受试者完成采集. 该数据集新增了跨配置(x-setup)评估设置,即采用偶数序号的配置样本构建训练集,将奇数配置样本构成测试集. PKU-MMD数据集最初专为动作检测任务构建,现已成为无监督骨架表示学习研究中的主流评估数据集,包含I、II 2个子集. 其中PKU-MMD II涵盖51类行为,共7 000个运动序列,每个动作类别的数据采集自1或2名受试者,因显著的视角多样性而具有更高的挑战性,被广泛应用于相关研究工作. ...
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of skeleton-based action retrieval performance of proposed method and other methods on NTU RGB+D 60 and NTU RGB+D 120 datasets
Tab.2 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup KTCL[3 ] 67.1 84.7 58.9 59.8 HiCo[2 ] 68.3 84.8 56.6 59.1 HSTM-Transformer[17 ] 70.0 88.3 57.7 59.8 RMMD[4 ] 70.9 87.4 58.4 61.8 HaLP[24 ] 65.8 86.3 55.8 59.0 UmURL[25 ] 71.3 88.3 58.5 60.9 本研究方法 73.5 90.2 61.8 65.5
2.2.3. 半监督学习性能比较 针对半监督学习,实验遵循文献[2 ]中的设置,采用NTU RGB+D 60数据集. 为了深入探索不同方法在半监督学习中的性能,随机抽取不同比例(1%、10%)的标注数据参与模型训练. 表3 展示了不同设置下的Top-1准确率,其中r s 、r v 分别为x-sub、x-view设置下的标注数据比例. 可以看出,提出的方法在不同数据集以及标注数据比例下均显著优于对比方法. 值得注意的是,相较于10%的标注数据,当仅使用1%的标注数据时本研究方法相对于其他方法的优势更加显著. 这一现象意味着当资源受限时,多模态大模型提供的动作描述文本可以为训练提供关键的动作信息,有效缓解了标注数据稀缺对模型性能带来的负面影响. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...
1
... 参照先前的研究工作[2 ,17 ] ,选用3个被广泛使用的数据集:NTU RGB+D 60[18 ] 、NTU RGB+D 120[19 ] 与PKU-MMD[20 ] . 其中,NTU RGB+D 60数据集提供2种标准评估设置:跨视角(x-view)设置,利用3台呈120度环形布设的摄像机采集数据,其中视角2、3下采集的数据构成训练集,视角1的数据作为测试集;跨受试者(x-sub)设置,将50%受试者的动作样本作为训练数据,剩余受试者的数据用于测试. NTU RGB+D 120数据集将行为类别扩展至120种,涵盖113945 个动作实例,在32种实验配置下对106名受试者完成采集. 该数据集新增了跨配置(x-setup)评估设置,即采用偶数序号的配置样本构建训练集,将奇数配置样本构成测试集. PKU-MMD数据集最初专为动作检测任务构建,现已成为无监督骨架表示学习研究中的主流评估数据集,包含I、II 2个子集. 其中PKU-MMD II涵盖51类行为,共7 000个运动序列,每个动作类别的数据采集自1或2名受试者,因显著的视角多样性而具有更高的挑战性,被广泛应用于相关研究工作. ...
NTU RGB+ D 120: a large-scale benchmark for 3D human activity understanding
1
2020
... 参照先前的研究工作[2 ,17 ] ,选用3个被广泛使用的数据集:NTU RGB+D 60[18 ] 、NTU RGB+D 120[19 ] 与PKU-MMD[20 ] . 其中,NTU RGB+D 60数据集提供2种标准评估设置:跨视角(x-view)设置,利用3台呈120度环形布设的摄像机采集数据,其中视角2、3下采集的数据构成训练集,视角1的数据作为测试集;跨受试者(x-sub)设置,将50%受试者的动作样本作为训练数据,剩余受试者的数据用于测试. NTU RGB+D 120数据集将行为类别扩展至120种,涵盖113945 个动作实例,在32种实验配置下对106名受试者完成采集. 该数据集新增了跨配置(x-setup)评估设置,即采用偶数序号的配置样本构建训练集,将奇数配置样本构成测试集. PKU-MMD数据集最初专为动作检测任务构建,现已成为无监督骨架表示学习研究中的主流评估数据集,包含I、II 2个子集. 其中PKU-MMD II涵盖51类行为,共7 000个运动序列,每个动作类别的数据采集自1或2名受试者,因显著的视角多样性而具有更高的挑战性,被广泛应用于相关研究工作. ...
1
... 参照先前的研究工作[2 ,17 ] ,选用3个被广泛使用的数据集:NTU RGB+D 60[18 ] 、NTU RGB+D 120[19 ] 与PKU-MMD[20 ] . 其中,NTU RGB+D 60数据集提供2种标准评估设置:跨视角(x-view)设置,利用3台呈120度环形布设的摄像机采集数据,其中视角2、3下采集的数据构成训练集,视角1的数据作为测试集;跨受试者(x-sub)设置,将50%受试者的动作样本作为训练数据,剩余受试者的数据用于测试. NTU RGB+D 120数据集将行为类别扩展至120种,涵盖113945 个动作实例,在32种实验配置下对106名受试者完成采集. 该数据集新增了跨配置(x-setup)评估设置,即采用偶数序号的配置样本构建训练集,将奇数配置样本构成测试集. PKU-MMD数据集最初专为动作检测任务构建,现已成为无监督骨架表示学习研究中的主流评估数据集,包含I、II 2个子集. 其中PKU-MMD II涵盖51类行为,共7 000个运动序列,每个动作类别的数据采集自1或2名受试者,因显著的视角多样性而具有更高的挑战性,被广泛应用于相关研究工作. ...
Improving self-supervised action recognition from extremely augmented skeleton sequences
1
2024
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
View-invariant skeleton action representation learning via motion retargeting
1
2024
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
Self-supervised 3D action representation learning with skeleton cloud colorization
3
2024
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of semi-supervised learning performance
Tab.3 方法 A /%r s =1%r s =10%r v =1%r v =10%3s-C-F[23 ] 52.3 76.5 53.1 81.3 PCM3 [27 ] 53.8 77.7 53.1 82.8 HiCo[2 ] 54.4 73.0 54.8 78.3 Lin等[28 ] 55.2 78.9 54.9 82.9 UmURL[25 ] 58.1 76.5 58.3 81.5 CMD[29 ] 50.6 75.4 53.0 80.2 RMMD[4 ] 58.3 77.1 56.0 81.0 本研究方法 62.1 79.9 63.3 84.5
2.2.4. 迁移学习性能比较 通过迁移学习范式对模型的跨数据集泛化性能展开验证. 在实验过程中,模型首先在源数据集上进行无监督表示学习,随后在目标数据集上进行骨架动作识别性能评估. 所有评估均在x-sub设置下实施. 实验结果详见表4 ,其中N60、N120分别表示以NTU RGB+D 60、NTU RGB+D 120为源数据集. 可以看出,所提方法以明显的性能优势超越了其他方法,充分证实了所提方法即使在跨场景的情况下,也能够更有效地捕获固定的骨架运动模式,并将其应用于骨架动作分类. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...
3
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of skeleton-based action retrieval performance of proposed method and other methods on NTU RGB+D 60 and NTU RGB+D 120 datasets
Tab.2 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup KTCL[3 ] 67.1 84.7 58.9 59.8 HiCo[2 ] 68.3 84.8 56.6 59.1 HSTM-Transformer[17 ] 70.0 88.3 57.7 59.8 RMMD[4 ] 70.9 87.4 58.4 61.8 HaLP[24 ] 65.8 86.3 55.8 59.0 UmURL[25 ] 71.3 88.3 58.5 60.9 本研究方法 73.5 90.2 61.8 65.5
2.2.3. 半监督学习性能比较 针对半监督学习,实验遵循文献[2 ]中的设置,采用NTU RGB+D 60数据集. 为了深入探索不同方法在半监督学习中的性能,随机抽取不同比例(1%、10%)的标注数据参与模型训练. 表3 展示了不同设置下的Top-1准确率,其中r s 、r v 分别为x-sub、x-view设置下的标注数据比例. 可以看出,提出的方法在不同数据集以及标注数据比例下均显著优于对比方法. 值得注意的是,相较于10%的标注数据,当仅使用1%的标注数据时本研究方法相对于其他方法的优势更加显著. 这一现象意味着当资源受限时,多模态大模型提供的动作描述文本可以为训练提供关键的动作信息,有效缓解了标注数据稀缺对模型性能带来的负面影响. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...
4
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of skeleton-based action retrieval performance of proposed method and other methods on NTU RGB+D 60 and NTU RGB+D 120 datasets
Tab.2 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup KTCL[3 ] 67.1 84.7 58.9 59.8 HiCo[2 ] 68.3 84.8 56.6 59.1 HSTM-Transformer[17 ] 70.0 88.3 57.7 59.8 RMMD[4 ] 70.9 87.4 58.4 61.8 HaLP[24 ] 65.8 86.3 55.8 59.0 UmURL[25 ] 71.3 88.3 58.5 60.9 本研究方法 73.5 90.2 61.8 65.5
2.2.3. 半监督学习性能比较 针对半监督学习,实验遵循文献[2 ]中的设置,采用NTU RGB+D 60数据集. 为了深入探索不同方法在半监督学习中的性能,随机抽取不同比例(1%、10%)的标注数据参与模型训练. 表3 展示了不同设置下的Top-1准确率,其中r s 、r v 分别为x-sub、x-view设置下的标注数据比例. 可以看出,提出的方法在不同数据集以及标注数据比例下均显著优于对比方法. 值得注意的是,相较于10%的标注数据,当仅使用1%的标注数据时本研究方法相对于其他方法的优势更加显著. 这一现象意味着当资源受限时,多模态大模型提供的动作描述文本可以为训练提供关键的动作信息,有效缓解了标注数据稀缺对模型性能带来的负面影响. ...
... Comparison of semi-supervised learning performance
Tab.3 方法 A /%r s =1%r s =10%r v =1%r v =10%3s-C-F[23 ] 52.3 76.5 53.1 81.3 PCM3 [27 ] 53.8 77.7 53.1 82.8 HiCo[2 ] 54.4 73.0 54.8 78.3 Lin等[28 ] 55.2 78.9 54.9 82.9 UmURL[25 ] 58.1 76.5 58.3 81.5 CMD[29 ] 50.6 75.4 53.0 80.2 RMMD[4 ] 58.3 77.1 56.0 81.0 本研究方法 62.1 79.9 63.3 84.5
2.2.4. 迁移学习性能比较 通过迁移学习范式对模型的跨数据集泛化性能展开验证. 在实验过程中,模型首先在源数据集上进行无监督表示学习,随后在目标数据集上进行骨架动作识别性能评估. 所有评估均在x-sub设置下实施. 实验结果详见表4 ,其中N60、N120分别表示以NTU RGB+D 60、NTU RGB+D 120为源数据集. 可以看出,所提方法以明显的性能优势超越了其他方法,充分证实了所提方法即使在跨场景的情况下,也能够更有效地捕获固定的骨架运动模式,并将其应用于骨架动作分类. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...
Global and local contrastive learning for self-supervised skeleton-based action recognition
1
2024
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
2
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of semi-supervised learning performance
Tab.3 方法 A /%r s =1%r s =10%r v =1%r v =10%3s-C-F[23 ] 52.3 76.5 53.1 81.3 PCM3 [27 ] 53.8 77.7 53.1 82.8 HiCo[2 ] 54.4 73.0 54.8 78.3 Lin等[28 ] 55.2 78.9 54.9 82.9 UmURL[25 ] 58.1 76.5 58.3 81.5 CMD[29 ] 50.6 75.4 53.0 80.2 RMMD[4 ] 58.3 77.1 56.0 81.0 本研究方法 62.1 79.9 63.3 84.5
2.2.4. 迁移学习性能比较 通过迁移学习范式对模型的跨数据集泛化性能展开验证. 在实验过程中,模型首先在源数据集上进行无监督表示学习,随后在目标数据集上进行骨架动作识别性能评估. 所有评估均在x-sub设置下实施. 实验结果详见表4 ,其中N60、N120分别表示以NTU RGB+D 60、NTU RGB+D 120为源数据集. 可以看出,所提方法以明显的性能优势超越了其他方法,充分证实了所提方法即使在跨场景的情况下,也能够更有效地捕获固定的骨架运动模式,并将其应用于骨架动作分类. ...
Mutual information driven equivariant contrastive learning for 3D action representation learning
3
2024
... Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets
Tab.1 方法 A /%N60 x-sub N60 x-view N120 x-sub N120 x-setup P-II x-sub AimCLR++[21 ] 77.2 81.5 65.5 67.8 41.2 ViA[22 ] 78.1 85.8 69.2 66.9 — 3s-C-F[23 ] 79.1 87.2 69.2 70.8 49.8 HaLP[24 ] 79.7 86.8 71.1 72.2 43.5 HiCo[2 ] 81.1 88.6 72.8 74.1 49.4 HSTM-Transformer[17 ] 81.8 90.4 73.5 74.6 46.9 UmURL[25 ] 82.3 89.8 73.5 74.3 52.1 Skeleton-logoCLR[26 ] 82.4 87.2 72.8 73.5 54.7 KTCL[3 ] 82.4 89.4 74.4 74.5 55.5 RMMD[4 ] 83.0 90.5 75.2 75.8 50.6 PCM3[27 ] 83.9 90.4 76.5 77.5 51.5 Lin等[28 ] 83.9 90.3 75.7 77.2 — C2 VL[14 ] 84.4 89.8 76.0 78.7 52.6 本研究方法 85.8 92.5 78.1 79.6 54.2
2.2.2. 骨架动作检索性能比较 表2 总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作. ...
... Comparison of semi-supervised learning performance
Tab.3 方法 A /%r s =1%r s =10%r v =1%r v =10%3s-C-F[23 ] 52.3 76.5 53.1 81.3 PCM3 [27 ] 53.8 77.7 53.1 82.8 HiCo[2 ] 54.4 73.0 54.8 78.3 Lin等[28 ] 55.2 78.9 54.9 82.9 UmURL[25 ] 58.1 76.5 58.3 81.5 CMD[29 ] 50.6 75.4 53.0 80.2 RMMD[4 ] 58.3 77.1 56.0 81.0 本研究方法 62.1 79.9 63.3 84.5
2.2.4. 迁移学习性能比较 通过迁移学习范式对模型的跨数据集泛化性能展开验证. 在实验过程中,模型首先在源数据集上进行无监督表示学习,随后在目标数据集上进行骨架动作识别性能评估. 所有评估均在x-sub设置下实施. 实验结果详见表4 ,其中N60、N120分别表示以NTU RGB+D 60、NTU RGB+D 120为源数据集. 可以看出,所提方法以明显的性能优势超越了其他方法,充分证实了所提方法即使在跨场景的情况下,也能够更有效地捕获固定的骨架运动模式,并将其应用于骨架动作分类. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...
2
... Comparison of semi-supervised learning performance
Tab.3 方法 A /%r s =1%r s =10%r v =1%r v =10%3s-C-F[23 ] 52.3 76.5 53.1 81.3 PCM3 [27 ] 53.8 77.7 53.1 82.8 HiCo[2 ] 54.4 73.0 54.8 78.3 Lin等[28 ] 55.2 78.9 54.9 82.9 UmURL[25 ] 58.1 76.5 58.3 81.5 CMD[29 ] 50.6 75.4 53.0 80.2 RMMD[4 ] 58.3 77.1 56.0 81.0 本研究方法 62.1 79.9 63.3 84.5
2.2.4. 迁移学习性能比较 通过迁移学习范式对模型的跨数据集泛化性能展开验证. 在实验过程中,模型首先在源数据集上进行无监督表示学习,随后在目标数据集上进行骨架动作识别性能评估. 所有评估均在x-sub设置下实施. 实验结果详见表4 ,其中N60、N120分别表示以NTU RGB+D 60、NTU RGB+D 120为源数据集. 可以看出,所提方法以明显的性能优势超越了其他方法,充分证实了所提方法即使在跨场景的情况下,也能够更有效地捕获固定的骨架运动模式,并将其应用于骨架动作分类. ...
... Performance comparison when transferred to PKU-MMD II dataset
Tab.4 方法 A /%N60 N120 HaLP[24 ] 54.8 55.4 RMMD[4 ] 55.0 — HSTM-Transformer[17 ] 55.6 55.5 HiCo[2 ] 56.3 55.4 Lin等[28 ] 56.5 57.8 3s-C-F[23 ] 58.1 — CMD[29 ] 56.0 57.0 UmURL[25 ] 58.2 57.6 KTCL[3 ] 58.4 — 本研究方法 59.5 59.0
2.2.5. 噪声稳定性分析 为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5 所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;r t 为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能. ...