浙江大学学报(工学版), 2026, 60(9): 1972-1979 doi: 10.3785/j.issn.1008-973X.2026.09.014

计算机技术、自动控制技术

大模型辅助的噪声鲁棒无监督骨架表示学习

蔡蕊,, 郭钦涵, 张子豪, 董建锋,, 张荣, 刘宝龙, 王勋

1. 浙江工商大学 计算机科学与技术学院,浙江 杭州 310035

2. 浙江省大数据与未来电子商务技术重点实验室,浙江 杭州 310035

Large model-assisted noise-robust unsupervised skeleton representation learning

CAI Rui,, GUO Qinhan, ZHANG Zihao, DONG Jianfeng,, ZHANG Rong, LIU Baolong, WANG Xun

1. School of Computer Science and Technology, Zhejiang Gongshang University, Hangzhou 310035, China

2. Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology, Hangzhou 310035, China

通讯作者: 董建锋,男,研究员. E-mail:dongjf24@gmail.com

收稿日期: 2025-07-16  

基金资助: 国家自然科学基金资助项目(62306278,62472385,62302449);浙江省自然科学基金重点资助项目(LZ23F020004);中国科协青年人才托举工程资助项目(2022QNRC001);浙江省自然科学基金资助项目(LQ23F020008,LQ23F020009);浙江省“尖兵”“领雁”研发攻关计划资助项目(2024C01110);浙江省属高校基本科研业务费专项资金资助项目(FR2402ZD).

Received: 2025-07-16  

Fund supported: 国家自然科学基金资助项目(62306278,62472385,62302449);浙江省自然科学基金重点资助项目(LZ23F020004);中国科协青年人才托举工程资助项目(2022QNRC001);浙江省自然科学基金资助项目(LQ23F020008,LQ23F020009);浙江省“尖兵”“领雁”研发攻关计划资助项目(2024C01110);浙江省属高校基本科研业务费专项资金资助项目(FR2402ZD).

作者简介 About authors

蔡蕊(1992—),男,副研究员,从事自然语言处理相关研究.orcid.org/0009-0006-2823-3051.E-mail:cairuics@gmail.com , E-mail:cairuics@gmail.com

摘要

针对现有方法难以捕捉细微动作差异(如剪纸、看手机)的问题,提出基于多模态大模型的噪声鲁棒无监督人体骨架表示学习方法,引入由多模态大模型生成的动作描述文本,为训练提供关键的动作信息. 为了提升多模态大模型的噪声鲁棒性,提出基于异常样本检测以及信息熵的联合噪声估计方法,为骨架表示学习提供高质量的辅助文本信号. 在3个公开数据集上的实验结果表明,文本辅助学习使模型在动作识别与检索下游任务中的性能显著优于HiCo等现有方法,并展现出较强的知识迁移能力,尤其在低资源场景下. 该方法具有良好的泛化性,适用于多数现有无监督骨架表示学习框架,其中的联合噪声估计方法在跨模态检索任务中也同样有效.

关键词: 人体骨架动作识别 ; 大模型 ; 无监督学习 ; 多模态数据 ; 噪声评估

Abstract

A noise-robust unsupervised human skeleton representation learning method based on multimodal large models was proposed to address the challenge that existing methods struggled to capture subtle differences in actions (e.g., paper cutting and looking at a phone). The action description texts generated by multimodal large models were incorporated to provide key action information for training. A joint noise estimation approach based on outlier sample detection and information entropy was developed to provide high-quality auxiliary textual signals for skeleton representation learning and improve the noise robustness of multimodal large model. The experimental results on three public datasets showed that text-assisted learning enabled the model to significantly outperform the existing methods in downstream tasks of action recognition and retrieval, while demonstrating strong knowledge transfer capability of the model, particularly in low-resource scenarios. The method has good generalization ability and is suitable for most existing unsupervised skeleton representation learning frameworks, while its joint noise estimation method is also effective in cross-modal retrieval tasks.

Keywords: human skeleton-based action recognition ; large model ; unsupervised learning ; multimodal data ; noise estimation

PDF (2113KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

蔡蕊, 郭钦涵, 张子豪, 董建锋, 张荣, 刘宝龙, 王勋. 大模型辅助的噪声鲁棒无监督骨架表示学习. 浙江大学学报(工学版)[J], 2026, 60(9): 1972-1979 doi:10.3785/j.issn.1008-973X.2026.09.014

CAI Rui, GUO Qinhan, ZHANG Zihao, DONG Jianfeng, ZHANG Rong, LIU Baolong, WANG Xun. Large model-assisted noise-robust unsupervised skeleton representation learning. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1972-1979 doi:10.3785/j.issn.1008-973X.2026.09.014

人体动作识别技术[1]是指计算机算法从原始数据(如图像、视频等)中抽取和分析动作信息,从而识别出人体在三维空间场景中的行为与动作的技术. 基于人体骨架的动作识别算法具备抽象性高、鲁棒性好以及安全性高等天然优势,已成为动作识别领域中重要的研究热点. 其中,无监督的人体骨架动作识别算法[2-4]无须人工标注即可实现训练,显著降低了成本,近年来受到了广泛关注.

基于无监督学习的人体骨架动作识别算法主要包括预训练与下游任务阶段,其中无监督预训练阶段是算法的核心. 研究人员通过设定一系列代理任务如骨架重建[5]、潜在表示预测[6]以及实例判别[7]等,让模型在无标注数据上学习不同动作的骨架序列在时间与空间结构上的特点,输出具有区分性的骨架特征表示. 现有的无监督人体骨架动作表示学习方法一般基于对比学习方法[2]及其改进方法[3,8],让模型学习不同增强样本间的特征一致性. 然而,无监督骨架编码器通常参数量较小,对于变化多样的复杂动作的编码能力有限,对于某些动作的识别准确度仍然欠佳,例如阅读、鼓掌等. 为此,一些近期的研究工作尝试引入大模型为骨架表示学习提供额外的辅助信息. Xiang等[9]使用动作标签,为骨架样本生成文本描述. Qu等[8]将标签文本作为大语言模型输出的监督信号,使用LoRA[10]微调大语言模型,并将模型应用于下游分类任务. Zhu等[11]结合生成的全局以及局部语义描述,设计自适应分区模块,对骨架序列的全局和局部特征进行语义对齐,从而在零样本动作识别任务中实现了高效的跨模态知识迁移. 虽然上述方法在性能上取得了一定提升,但是大模型生成的文本内容往往存在2类噪声:1)生成的动作描述与实际类别不匹配;2)生成的动作描述不包含任何动作区分性信息. 现有工作忽视了噪声文本对骨架表示学习的干扰,缺乏对噪声文本的识别和处理,最终限制了多模态大模型在骨架表示学习中发挥的作用.

为了解决大模型生成文本中存在的噪声问题,提出噪声鲁棒的无监督骨架表示学习方法,借助多模态大模型生成高质量文本以辅助骨架表示学习,进一步增强模型对精细动作的骨架表示学习能力. 为了保证大模型生成文本的正确性,并降低噪声文本对无监督骨架表示学习的干扰,提出联合噪声估计方法,对生成的动作描述文本进行质量分析,增强方法的噪声鲁棒性. 具体地,针对动作描述与实际类别不匹配的噪声样本,提出基于异常检测的噪声估计方法,通过计算集合内句子的语义相似度来识别出在语义上存在偏差的“离群”样本;针对不包含任何动作区分性信息的噪声文本,用信息熵衡量每个句子包含的信息量,将信息熵较大的句子视为“模糊”样本. 对于生成的每个描述文本,模型都从以上两方面进行噪声估计,最后综合样本中2种噪声的强度调整其在无监督训练时的权重. 通过在多个相关数据集上的实验,验证了2种噪声估计方法的有效性以及互补性.

1. 方法简介

基于多模态大模型的噪声鲁棒无监督人体骨架表示学习方法的整体框架如图1所示. 在先前无监督人体骨架编码器[2]的基础上,利用大模型生成描述骨架动作的文本,以辅助表示学习,并通过联合噪声估计来优化学习目标,从而提升方法的噪声鲁棒性.

图 1

图 1   基于多模态大模型的噪声鲁棒无监督骨架表示学习框架图

Fig.1   Framework diagram of noise-robust unsupervised skeleton representation learning based on multi-modal large model


1.1. 多模态大模型辅助的无监督骨架表示学习

1.1.1. 多模态特征编码

图1所示,骨架模态与文本模态数据经各自的编码器处理后被投影至公共特征空间,并在该公共空间中进行无监督对比学习.

1)骨架模态输入. 将每个骨架模态的输入样本记为${\boldsymbol{x}} \in {{\bf{R}}^{{T_{\text{s}}} \times C \times V}}$,其中${T_{\text{s}}}$$C$$V$分别为帧数、通道数和关节点数.

2)动作描述文本生成. 如图1中多模态特征编码网络的左下部分所示,对于每个RGB视频,首先采用间隔采样法抽取视频关键帧,再使用Grounding DINO方法[12]进行主体裁剪,并使用多模态大模型LLaVA[13]生成动作描述[14]. 对于每1个关键帧,生成1句关键帧的动作描述文本,记为${\boldsymbol{t}}$,该动作描述文本可以提供丰富的动作信息. 在此基础上,收集同一个视频生成的动作描述文本,记为文本集合${{T}} = {\{{\boldsymbol{t}}^1}, {{\boldsymbol{t}}^2}, \cdots ,{{\boldsymbol{t}}^G\}}$,其包含了$G$个不同的动作描述文本. 文本生成模块的参数保持冻结状态,不参与模型训练,以降低模型的训练开销. 此外,所有的描述文本仅用于训练阶段的骨架表示学习;在模型的推理阶段,仅使用骨架模态输入,不依赖于动作描述文本,以保证模型在推理阶段的计算效率.

3)公共空间映射. 在将骨架模态输入映射到同一维度的嵌入空间后,分别使用骨架编码器和文本编码器对骨架和2种文本模态进行编码,以获得骨架和文本模态的特征表示. 由于编码过程不是主要研究内容,将编码过程简化表示为

$ {\boldsymbol{s}} = {g_{\text{s}}}({\mathrm{Skeleton}}\_{\mathrm{Encoder}}\;({\boldsymbol{x}})), $

$ {\boldsymbol{l}} = {g_{\text{t}}}({\mathrm{Text}}\_{\mathrm{Encoder}}\;({\boldsymbol{t}})). $

式中:骨架、文本投影层${g_{\text{s}}}{\text{(}} \cdot )$${g_{\text{t}}}( \cdot )$均为单线性映射层;${\boldsymbol{s}} \in {{\bf{R}}^{{D_{{\text{dc}}}}}}$为投影后的归一化骨架特征表示;${\boldsymbol{l}} \in {{\bf{R}}^{G \times {D_{{\text{dc}}}}}}$为投影后归一化的文本特征表示;${\text{Skeleton}}\_ {\text{Encoder}}( \cdot )$表示骨架编码器对特征的处理,其编码策略与先前工作[2]相同;${\text{Text}}\_{\text{Encoder}}( \cdot )$表示完全冻结的预训练文本编码器对特征的处理.

1.1.2. 文本辅助表示学习

一些细节信息在骨架输入中区分度较低,而在文本输入中具有明显的差异,因此使用额外文本特征作为骨架编码器的监督学习信号. 以实例判别任务为代理任务,利用文本模态特有的辨别性信息指导骨架编码器的表示学习. 经过文本、骨架编码以及公共编码空间映射,可以得到骨架特征${\boldsymbol{S}} \in {{\bf{R}}^{N \times {D_{{\text{dc}}}}}}$和文本特征${\boldsymbol{L}} \in {{\bf{R}}^{N \times G \times {D_{{\text{dc}}}}}}$,其中$N$为1个批次中的骨架样本数目,每个骨架样本特征对应$G$个动作文本描述特征. 采用归一化温标交叉熵损失函数[15]进行参数优化,提升骨架与对应动作文本描述之间的相似度,并最小化该骨架与其他骨架的动作文本描述相似性,学习目标为

$ \mathcal{L}_{\mathrm{CL}}\left(\boldsymbol{S}, \boldsymbol{L}, \boldsymbol{I}_{\mathrm{B}}\right)=-\displaystyle\sum_{j=1}^G I_{\mathrm{B}}^{i j} \ln \dfrac{\exp \left(\operatorname{sim}\left(\boldsymbol{S}_i \cdot \boldsymbol{L}_i^j\right) / \tau\right)}{\displaystyle\sum_{k=1, k \neq i}^N \exp \left(\operatorname{sim}\left(\boldsymbol{S}_i \cdot \boldsymbol{L}_k^j\right) / \tau\right)} . $

式中:${{\boldsymbol{S}}_i}$为批次内第$i$个骨架样本,${\boldsymbol{L}}_i^j$$\boldsymbol{L}_k^j $为第$i$$k $组文本描述的第$j$个动作描述,$\tau $为温度系数,${\text{sim }}( \cdot , \cdot )$为余弦相似度计算函数,${{\boldsymbol{ I}}_{\mathrm{B}}}$为骨架特征与文本特征之间的原始硬标签,$I_{\mathrm{B}}^{ij}$为对应样本的原始权重.

1.2. 噪声鲁棒的骨架表示学习方法

大模型生成的文本往往面临着潜在的噪声问题,因此提出基于异常样本检测与信息熵的联合噪声估计方法. 前者利用文本编码器本身对语义空间中离群的动作描述文本进行评估,后者对批次内描述文本的信息熵进行评估. 将2种方法的估计结果与原始标签进行线性融合,得到噪声鲁棒的新优化学习目标.

1.2.1. 基于异常样本检测的噪声估计方法

对于每一个骨架样本,利用多模态大模型生成包含$G$个句子的描述文本集合. 由于每个集合内的句子描述的是同一个骨架,集合内所有句子在语义上十分接近,即拥有较小的语义距离. 如果某个句子和其他句子的语义存在明显差异,那么该句子有较大概率是带有噪声的. 基于此假设,提出基于异常样本检测的噪声估计方法,利用冻结的预训练文本编码器获取所有句子的语义表示,找出每个集合内“离群”的动作文本描述并加以区分.

具体来说,采用余弦相似度函数衡量句子间的语义距离,得到文本间相似度矩阵$ \boldsymbol{W}=\boldsymbol{L} \boldsymbol{L}^{\mathrm{T}} /\|\boldsymbol{L}\|_2^2$$\boldsymbol{W} \in \mathbf{R}^{N \times G \times G}$为某一骨架样本对应的所有动作文本描述之间两两计算得到的余弦相似度. 如图2所示,当集合内多数描述文本均含有近似的动作信息时,语义空间中少量的离群样本与其他样本之间存在较大的平均距离.

图 2

图 2   基于异常样本检测的噪声估计方法示意图

Fig.2   Illustration of noise estimation method based on outlier sample detection


为了简单、高效地估计样本的离群程度,计算骨架样本数据中每个文本描述与其他文本描述之间的平均余弦相似度:

$ \boldsymbol{I}_{\mathrm{L}}=\dfrac{1}{G} \displaystyle\sum_{k=1}^G \boldsymbol{W}_{[:,:, k]}. $

式中:$\boldsymbol{I}_{\mathrm{L}} \in \mathbf{R}^{N \times G}$为每个文本与组内其他$G - 1$个文本之间的平均余弦相似度;$ \boldsymbol{W}_{[:,:, k]}$表示对三维张量$\boldsymbol{W} \in \mathbf{R}^{N \times G \times G}$进行切片,取出第1~3维中所有索引为k的元素. 由于平均余弦相似度可以反映离群样本与其他样本的差异,可以将${{\boldsymbol{I}}_{\text{L}}}$作为模型优化时的学习目标之一.

1.2.2. 基于信息熵的噪声估计方法

如果某个句子的语义表示与多个不同骨架表示的相似度均为较高值,说明该句子的描述十分笼统、模糊,无法准确地对应某个特定动作. 由于模糊样本不能为无监督骨架表示学习提供精细化的动作描述,且会降低训练效率,有必要在训练过程中识别出这些低质量的模糊样本,降低其对模型训练的影响. 采用信息熵来衡量句子$ {\boldsymbol{t}} $所包含的信息量:

$ H(\boldsymbol{t})=-\displaystyle\sum_{i=1}^N p_i(\boldsymbol{t}) \ln p_i(\boldsymbol{t}). $

式中:${p_i}(\boldsymbol{t})$为句子$\boldsymbol{t}$匹配第$i$个骨架动作的概率. 当概率分布$\left\{ {p_1}(\boldsymbol{t}),{p_2}(\boldsymbol{t}), \cdots ,{p_N}(\boldsymbol{t})\right\} $趋向于均匀分布时,信息熵$H(\boldsymbol{t})$的值较大,表明句子$\boldsymbol{t}$所包含的动作信息较少. 根据此规律,提出基于信息熵的噪声估计方法,如图3所示. 该方法通过计算当前动作描述文本与批次内所有骨架的相似度,得到该动作描述文本的归一化信息熵. 该信息熵可以衡量当前文本与批次内所有骨架之间的分布是否具有确定性:如果当前动作描述文本表示与批次内骨架样本表示均相似,则信息熵接近于1;如果与某些特定的骨架样本表示之间具有较大的相似度,而与其他骨架表示的相似度较小,则信息熵的值接近于0.

图 3

图 3   基于信息熵的噪声估计方法示意图

Fig.3   Illustration of noise estimation method based on information entropy


$\boldsymbol{P}(\boldsymbol{L}, \boldsymbol{S}) \in \mathbf{R}^{N \times G \times N}$表示批次内每个句子与骨架表示之间的匹配概率:

$ \boldsymbol{P}(\boldsymbol{L}, \boldsymbol{S})=\rho\left(\dfrac{\boldsymbol{L} \boldsymbol{S}^{\mathrm{T}}}{\|\boldsymbol{L}\|_2\cdot \|\boldsymbol{S}\|_2}\right). $

式中:$\rho ( \cdot )$为标准指数归一化函数. 动作描述文本与批次内所有骨架样本之间的信息熵${\boldsymbol{H}}(\boldsymbol{L}, \boldsymbol{S})$的计算公式为

$ \boldsymbol{H}(\boldsymbol{L}, \boldsymbol{S})=-\dfrac{\displaystyle{\sum}_{i=1}^N \boldsymbol{P}_{[:,:, i]}(\boldsymbol{L}, \boldsymbol{S}) \ln \left(\boldsymbol{P}_{[:,:, i]}(\boldsymbol{L}, \boldsymbol{S})\right)}{\ln N} . $

信息熵越大,表明该句子所包含的信息量越少,因此执行取反操作,并填充负样本学习目标后,可以得到基于信息熵的噪声估计学习目标$\boldsymbol{I}_{\mathrm{E}} \in \mathbf{R}^{N \times G}$

$ \boldsymbol{I}_{\mathrm{E}}={1}-\boldsymbol{H}(\boldsymbol{L}, \boldsymbol{S}) . $

将上述噪声指标${{\boldsymbol{I}}_{\mathrm{L}}}$${{\boldsymbol{I}}_{\mathrm{E}}}$与文本-骨架匹配标签${{\boldsymbol{I}}_{\mathrm{B}}}$进行融合,得到噪声鲁棒的学习目标为

$ \tilde{\boldsymbol{I}}=(1-\alpha-\beta) \boldsymbol{I}_{\mathrm{B}}+\alpha \boldsymbol{I}_{\mathrm{L}}+\beta \boldsymbol{I}_{\mathrm{E}} . $

式中:$\alpha $$\beta $为超参数. 通过上述方式,提出的噪声估计方法能够利用文本编码器以及骨架编码器的记忆效应筛选并剔除有噪声的动作文本描述,从而为骨架编码器的学习提供更加有效的学习目标,降低噪声带来的负面影响.

1.2.3. 渐进式模型训练

骨架与文本在表示学习之初尚未对齐,因而在文本辅助的骨架表示学习过程中,过早地引入联合噪声估计方法不能很好地区分噪声样本与正常样本,反而会影响骨架表示学习的质量. 受Andonian等[16]工作的启发,采用渐进式学习策略来逐步适应来自文本模态的监督信号. 具体来说,在训练时将批次内样本分为2部分,一部分使用原始对应关系${\boldsymbol{I}_{\mathrm{B}}}$进行训练,另一部分采用联合噪声估计方法生成的噪声鲁棒的学习目标${\tilde {\boldsymbol{I}}}$进行优化,其中使用学习目标${\tilde{\boldsymbol{I}}}$的数据比重随着训练轮次的增加不断增大,具体过程如下.

通过定义超参数$ {\alpha _0} $,将当前骨架批次划分为规模为${N_{\mathrm{h}}}$${N_{\mathrm{s}}}$的2部分:

$ {N_{\text{h}}} = {\alpha _0}N,\;\; {N_{\text{s}}} = N - {\alpha _0}N. $

经过上述数据划分,最终噪声鲁棒的人体骨架表示学习损失函数为

$ \mathcal{L}_{\mathrm{h}}=\mathcal{L}_{{\mathrm{C L}}}\left(\overline{\boldsymbol{S}}, \boldsymbol{L}, \boldsymbol{I}_{\mathrm{B}}\right) ,\;\; \mathcal{L}_{\mathrm{s}}=\mathcal{L}_{{\mathrm{C L}}}(\underline{\boldsymbol{S}}, \boldsymbol{L}, \tilde{\boldsymbol{I}}),$

$ \mathcal{L}=\alpha_0 \mathcal{L}_{\mathrm{h}}+\left(1-\alpha_0\right) \mathcal{L}_{\mathrm{s}} . $

式中:$\overline{\boldsymbol{S}} \in \mathbf{R}^{N_{\mathrm{h}} \times D} $$ \underline{\boldsymbol{S}} \in \mathbf{R}^{N_{\mathrm{s}} \times D}$分别对应于规模为$ {N}_{{\mathrm{h}}} $$ {N}_{{\mathrm{s}}} $的骨架数据. 值得注意的是,为了保证模型在训练以及推理阶段的计算效率,文本生成与编码分支的参数始终处于冻结状态,不对其进行任何优化. 此外,模型仅在训练阶段使用文本数据来辅助模型理解并进行文本去噪,在推理阶段只使用骨架数据,从而保证模型在实际应用中的计算效率.

2. 实验分析

2.1. 实验设置

2.1.1. 数据集

参照先前的研究工作[2,17],选用3个被广泛使用的数据集:NTU RGB+D 60[18]、NTU RGB+D 120[19]与PKU-MMD[20]. 其中,NTU RGB+D 60数据集提供2种标准评估设置:跨视角(x-view)设置,利用3台呈120度环形布设的摄像机采集数据,其中视角2、3下采集的数据构成训练集,视角1的数据作为测试集;跨受试者(x-sub)设置,将50%受试者的动作样本作为训练数据,剩余受试者的数据用于测试. NTU RGB+D 120数据集将行为类别扩展至120种,涵盖113945个动作实例,在32种实验配置下对106名受试者完成采集. 该数据集新增了跨配置(x-setup)评估设置,即采用偶数序号的配置样本构建训练集,将奇数配置样本构成测试集. PKU-MMD数据集最初专为动作检测任务构建,现已成为无监督骨架表示学习研究中的主流评估数据集,包含I、II 2个子集. 其中PKU-MMD II涵盖51类行为,共7 000个运动序列,每个动作类别的数据采集自1或2名受试者,因显著的视角多样性而具有更高的挑战性,被广泛应用于相关研究工作.

2.1.2. 评估指标

骨架动作识别是用于评估无监督骨架表示学习效果的重要任务之一.具体流程为:将无监督训练模型的代理任务投影头去除,并冻结整个模型,在此冻结模型的输出层之后添加1层全连接层作为分类头,并在训练集上对分类头进行微调,最后在测试集上测试骨架动作分类的Top-1准确率.

在骨架动作检索任务中,通过计算模型输出的骨架序列表示之间的余弦相似度,从所有样本中检索最相似的动作,评估二者所属的动作类别是否相同. 显然,骨架动作检索性能反映了模型在表示学习阶段学习到的特征质量.

2.2. 性能比较与分析
2.2.1. 骨架动作识别性能比较

表1总结了不同模型在多个骨架数据集上进行人体骨架动作识别的结果. 其中,A为Top-1准确率,NTU RGB+D 60、NTU RGB+D 120以及PKU-MMD II数据集分别被简写为N60、N120和P-II,x-sub、x-view和x-setup为不同的评估设置. 在无监督学习的设定下,提出的方法在性能上以显著的优势超越了其他同类工作. 现有方法中性能最优的模型C2VL[14]也使用了多模态大模型,除人体骨架序列模态外,还额外使用了视觉与文本模态信号,用于无监督表示学习. 所提文本辅助学习方法的Top-1准确率显著超越了C2VL,证明了噪声评估后的文本模态信号优于C2VL使用的“视觉+文本”信号.

表 1   NTU RGB+D 60、NTU RGB+D 120以及PKU-MMD II数据集上所提方法与其他方法的骨架动作识别性能比较

Tab.1  Comparison of skeleton-based action recognition performance of proposed method and other methods on NTU RGB+D 60, NTU RGB+D 120 and PKU-MMD II datasets

方法A/%
N60
x-sub
N60
x-view
N120
x-sub
N120
x-setup
P-II
x-sub
AimCLR++[21]77.281.565.567.841.2
ViA[22]78.185.869.266.9
3s-C-F[23]79.187.269.270.849.8
HaLP[24]79.786.871.172.243.5
HiCo[2]81.188.672.874.149.4
HSTM-Transformer[17]81.890.473.574.646.9
UmURL[25]82.389.873.574.352.1
Skeleton-logoCLR[26]82.487.272.873.554.7
KTCL[3]82.489.474.474.555.5
RMMD[4]83.090.575.275.850.6
PCM3[27]83.990.476.577.551.5
Lin等[28]83.990.375.777.2
C2VL[14]84.489.876.078.752.6
本研究方法85.892.578.179.654.2

新窗口打开| 下载CSV


2.2.2. 骨架动作检索性能比较

表2总结了所提方法与先进无监督骨架表示学习方法在骨架检索任务上的性能比较结果. 与其他方法相比,所提方法在NTU RGB+D 60和NTU RGB+D 120数据集上的性能均有较大幅度的提升. 这意味着噪声评估后的动作描述文本可以为骨架动作识别提供高质量的监督信号,使得人体骨架特征表示具备更明显的差异性,从而使模型可以更好地区分不同类别的动作.

表 2   NTU RGB+D 60和NTU RGB+D 120数据集上所提方法与其他方法的骨架动作检索性能对比

Tab.2  Comparison of skeleton-based action retrieval performance of proposed method and other methods on NTU RGB+D 60 and NTU RGB+D 120 datasets

方法A/%
N60
x-sub
N60
x-view
N120
x-sub
N120
x-setup
KTCL[3]67.184.758.959.8
HiCo[2]68.384.856.659.1
HSTM-Transformer[17]70.088.357.759.8
RMMD[4]70.987.458.461.8
HaLP[24]65.886.355.859.0
UmURL[25]71.388.358.560.9
本研究方法73.590.261.865.5

新窗口打开| 下载CSV


2.2.3. 半监督学习性能比较

针对半监督学习,实验遵循文献[2]中的设置,采用NTU RGB+D 60数据集. 为了深入探索不同方法在半监督学习中的性能,随机抽取不同比例(1%、10%)的标注数据参与模型训练. 表3展示了不同设置下的Top-1准确率,其中rsrv分别为x-sub、x-view设置下的标注数据比例. 可以看出,提出的方法在不同数据集以及标注数据比例下均显著优于对比方法. 值得注意的是,相较于10%的标注数据,当仅使用1%的标注数据时本研究方法相对于其他方法的优势更加显著. 这一现象意味着当资源受限时,多模态大模型提供的动作描述文本可以为训练提供关键的动作信息,有效缓解了标注数据稀缺对模型性能带来的负面影响.

表 3   半监督学习性能比较

Tab.3  Comparison of semi-supervised learning performance

方法A/%
rs=1%rs=10%rv=1%rv=10%
3s-C-F[23]52.376.553.181.3
PCM3[27]53.877.753.182.8
HiCo[2]54.473.054.878.3
Lin等[28]55.278.954.982.9
UmURL[25]58.176.558.381.5
CMD[29]50.675.453.080.2
RMMD[4]58.377.156.081.0
本研究方法62.179.963.384.5

新窗口打开| 下载CSV


2.2.4. 迁移学习性能比较

通过迁移学习范式对模型的跨数据集泛化性能展开验证. 在实验过程中,模型首先在源数据集上进行无监督表示学习,随后在目标数据集上进行骨架动作识别性能评估. 所有评估均在x-sub设置下实施. 实验结果详见表4,其中N60、N120分别表示以NTU RGB+D 60、NTU RGB+D 120为源数据集. 可以看出,所提方法以明显的性能优势超越了其他方法,充分证实了所提方法即使在跨场景的情况下,也能够更有效地捕获固定的骨架运动模式,并将其应用于骨架动作分类.

表 4   迁移到PKU-MMD II数据集上的性能对比

Tab.4  Performance comparison when transferred to PKU-MMD II dataset

方法A/%
N60N120
HaLP[24]54.855.4
RMMD[4]55.0
HSTM-Transformer[17]55.655.5
HiCo[2]56.355.4
Lin等[28]56.557.8
3s-C-F[23]58.1
CMD[29]56.057.0
UmURL[25]58.257.6
KTCL[3]58.4
本研究方法59.559.0

新窗口打开| 下载CSV


2.2.5. 噪声稳定性分析

为了讨论噪声估计方法的失效边界,考虑到生成文本的错误率难以精确统计,设计简单实验:将不同比例的生成文本替换为随机的错误文本,测试去噪方法在这种情况下能否正常工作. 实验结果表5所示,其中基线模型舍弃了骨架-文本配对损失,因此其性能不受文本质量的影响;rt为随机文本比例. 随着随机文本比例的上升,所提方法的性能逐步下降. 当90%的文本为错误文本时,所提方法的动作识别准确率为78.8%,接近于基线模型的78.7%. 由于使用了联合噪声估计方法,即使文本错误比例很高,也并未使模型性能受到严重影响而导致模型崩溃,且始终优于不使用文本进行训练的基线模型的性能.

表 5   NTU RGB+D 120数据集上所提方法与基线模型对文本噪声的稳定性分析

Tab.5  Stability analysis of proposed method and baseline model against textual noise on NTU RGB+D 120 dataset

方法A/%
rt=0%rt=30%rt=60%rt=90%rt=100%
基线模型78.778.778.778.778.7
本研究方法79.679.379.078.878.7

新窗口打开| 下载CSV


2.3. 消融实验

为了验证所提方法中不同模态的输入数据的重要性,在NTU RGB+D 120数据集上进行消融实验,下游任务为骨架动作识别. 实验结果见表6. 当仅使用文本模态作为监督信号进行训练时,模型在骨架动作识别任务上的性能较低,其原因是缺乏来自骨架间表示学习的监督信号. 加上骨架模态后,模型性能达到了最佳,这表明骨架模态对于无监督骨架表示学习而言不可或缺,而加入文本模态的监督信号可以为骨架表示学习提供额外的补充信息.

表 6   2类模态数据的消融实验

Tab.6  Ablation experiment on data of two modalities

骨架模态文本模态A/%
x-subx-setup
77.378.7
71.874.3
78.179.6

新窗口打开| 下载CSV


为了探讨基于异常样本检测的噪声估计方法(记为方法1)与基于信息熵的噪声估计方法(记为方法2)的有效性,在NTU RGB+D 120数据集上进行消融实验,下游任务为骨架动作识别. 实验结果如表7所示. 当引入大模型生成的文本t而忽略噪声问题时,模型性能相较于不使用外部文本的基线模型进一步降低,说明使用未经筛选的噪声文本对于训练反而是有害的. 而在基线模型上使用不同的文本噪声估计方法均实现了性能提升,其中基于信息熵的方法带来的提升效果更为明显. 当同时使用2种方法进行噪声估计时,模型性能得到进一步提升,证明了2种噪声估计方法的互补性.

表 7   NTU RGB+D 120数据集上的噪声估计方法消融实验

Tab.7  Ablation experiment on noise estimation methods for NTU RGB+D 120 dataset

文本t方法1方法2A/%
x-subx-setup
77.378.7
76.678.2
77.278.9
77.679.3
78.179.6

新窗口打开| 下载CSV


3. 结 语

提出基于多模态大模型的噪声鲁棒骨架表示学习方法,引入多模态大模型生成的动作文本描述,以辅助无监督人体骨架表示学习. 针对动作文本描述中包含噪声的问题,提出联合噪声估计方法,为辅助学习筛选出更有区分性的文本. 在多个数据集上的实验结果表明,联合噪声估计方法与多模态大模型共同为骨架表示学习提供了强有力的支撑,提升了表示学习的质量. 通过实验发现,提出的多模态大模型辅助训练也可以与其他先进的骨架表示学习模型相结合,进一步提升其生成的骨架特征质量. 提出的方法为骨架动作识别领域提供了由大模型指导的无监督且噪声鲁棒的解决方案;此外,其中的噪声估计方法具有通用性,可以被拓展至其他相关领域.

参考文献

FEI H, WU S, ZHANG M, et al

Enhancing video-language representations with structural spatio-temporal alignment

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46 (12): 7701- 7719

DOI:10.1109/TPAMI.2024.3393452      [本文引用: 1]

DONG J, SUN S, LIU Z, et al. Hierarchical contrast for unsupervised skeleton-based action representation learning [C]// Proceedings of the AAAI Conference on Artificial Intelligence. Washington, D. C. : AAAI Press, 2023: 525–533.

[本文引用: 10]

WANG X, MU Y

Localized linear temporal dynamics for self-supervised skeleton action recognition

[J]. IEEE Transactions on Multimedia, 2024, 26: 10189- 10199

DOI:10.1109/TMM.2024.3405712      [本文引用: 4]

HE Z, LV J, FANG S

Representation modeling learning with multi-domain decoupling for unsupervised skeleton-based action recognition

[J]. Neurocomputing, 2024, 582: 127495

DOI:10.1016/j.neucom.2024.127495      [本文引用: 5]

WU W, HUA Y, ZHENG C, et al. Skeletonmae: spatial-temporal masked autoencoders for self-supervised skeleton action recognition [C]// Proceedings of the IEEE International Conference on Multimedia and Expo Workshops. Brisbane: IEEE, 2023: 224–229.

[本文引用: 1]

ABDELFATTAH M, ALAHI A. S-JEPA: a joint embedding predictive architecture for skeletal action recognition [C]// Proceedings of the European Conference on Computer Vision. Milan: Springer, 2024: 367–384.

[本文引用: 1]

RAO H, XU S, HU X, et al

Augmented skeleton based contrastive action learning with momentum LSTM for unsupervised action recognition

[J]. Information Sciences, 2021, 569: 90- 109

DOI:10.1016/j.ins.2021.04.023      [本文引用: 1]

QU H, CAI Y, LIU J. LLMs are good action recognizers [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 18395–18406.

[本文引用: 2]

XIANG W, LI C, ZHOU Y, et al. Generative action description prompts for skeleton-based action recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2023: 10242–10251.

[本文引用: 1]

HU E J, SHEN Y, WALLIS P, et al. LoRA: low-rank adaptation of large language models [EB/OL]. (2021-10-16) [2025-07-10]. https://arxiv.org/abs/2106.09685.

[本文引用: 1]

ZHU A, KE Q, GONG M, et al. Part-aware unified representation of language and skeleton for zero-shot action recognition [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 18761–18770.

[本文引用: 1]

LIU S, ZENG Z, REN T, et al. Grounding DINO: marrying DINO with grounded pre-training for open-set object detection [C]// Proceedings of the European Conference on Computer Vision. Milan: Springer, 2024: 38–55.

[本文引用: 1]

LIU H, LI C, WU Q, et al. Visual instruction tuning [C]// Proceedings of the 37th International Conference on Neural Information Processing Systems. New Orleans: Curran Associates Inc, 2023: 34892–34916.

[本文引用: 1]

CHEN Y, HE T, FU J, et al

Vision-language meets the skeleton: progressively distillation with cross-modal knowledge for 3D action representation learning

[J]. IEEE Transactions on Multimedia, 2025, 27: 2293- 2303

DOI:10.1109/TMM.2024.3521718      [本文引用: 3]

CHEN T, KORNBLITH S, NOROUZI M, et al. A simple framework for contrastive learning of visual representations [EB/OL]. (2020-07-01) [2025-07-10]. https://arxiv.org/abs/2002.05709.

[本文引用: 1]

ANDONIAN A, CHEN S, HAMID R. Robust cross-modal representation learning with progressive self-distillation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 16409–16420.

[本文引用: 1]

CAO W, ZHANG A, HE Z, et al

Hierarchical spatial-temporal masked contrast for skeleton action recognition

[J]. IEEE Transactions on Artificial Intelligence, 2024, 5 (11): 5801- 5814

DOI:10.1109/TAI.2024.3430260      [本文引用: 4]

SHAHROUDY A, LIU J, NG T T, et al. NTU RGB+D: a large scale dataset for 3D human activity analysis [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 1010–1019.

[本文引用: 1]

LIU J, SHAHROUDY A, PEREZ M, et al

NTU RGB+ D 120: a large-scale benchmark for 3D human activity understanding

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2020, 42 (10): 2684- 2701

DOI:10.1109/TPAMI.2019.2916873      [本文引用: 1]

LIU C, HU Y, LI Y, et al. PKU-MMD: a large scale benchmark for continuous multi-modal human action understanding [EB/OL]. (2017-03-28) [2025-07-10]. https://arxiv.org/abs/1703.07475.

[本文引用: 1]

GUO T, LIU M, LIU H, et al

Improving self-supervised action recognition from extremely augmented skeleton sequences

[J]. Pattern Recognition, 2024, 150: 110333

DOI:10.1016/j.patcog.2024.110333      [本文引用: 1]

YANG D, WANG Y, DANTCHEVA A, et al

View-invariant skeleton action representation learning via motion retargeting

[J]. International Journal of Computer Vision, 2024, 132 (7): 2351- 2366

DOI:10.1007/s11263-023-01967-8      [本文引用: 1]

YANG S, LIU J, LU S, et al

Self-supervised 3D action representation learning with skeleton cloud colorization

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46 (1): 509- 524

DOI:10.1109/TPAMI.2023.3325463      [本文引用: 3]

SHAH A, ROY A, SHAH K, et al. HaLP: hallucinating latent positives for skeleton-based self-supervised learning of actions [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 18846–18856.

[本文引用: 3]

SUN S, LIU D, DONG J, et al. Unified multi-modal unsupervised representation learning for skeleton-based action understanding [C]// Proceedings of the 31st ACM International Conference on Multimedia. Ottawa: ACM, 2023: 2973–2984.

[本文引用: 4]

HU J, HOU Y, GUO Z, et al

Global and local contrastive learning for self-supervised skeleton-based action recognition

[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2024, 34 (11): 10578- 10589

DOI:10.1109/TCSVT.2024.3410301      [本文引用: 1]

ZHANG J, LIN L, LIU J. Prompted contrast with masked motion modeling: towards versatile 3D action representation learning [C]// Proceedings of the 31st ACM International Conference on Multimedia. Ottawa: ACM, 2023: 7175–7183.

[本文引用: 2]

LIN L, ZHANG J, LIU J

Mutual information driven equivariant contrastive learning for 3D action representation learning

[J]. IEEE Transactions on Image Processing, 2024, 33: 1883- 1897

DOI:10.1109/TIP.2024.3372451      [本文引用: 3]

MAO Y, ZHOU W, LU Z, et al. CMD: self-supervised 3D action representation learning with cross-modal mutual distillation [C]// Proceedings of the European Conference on Computer Vision. Tel Aviv: Springer, 2022: 734–752.

[本文引用: 2]

/