浙江大学学报(工学版), 2026, 60(8): 1670-1677 doi: 10.3785/j.issn.1008-973X.2026.08.006

计算机技术

全局学习扩展的可见光-红外行人重识别

郭子强,, 肖璇, 陶浩然, 王少荣,

1. 北京林业大学 信息学院,北京 100083

2. 国家林业草原林业智能信息处理工程技术研究中心,北京 100083

Global learning-expanded visible-infrared person re-identification

GUO Ziqiang,, XIAO Xuan, TAO Haoran, WANG Shaorong,

1. School of Information Science and Technology, Beijing Forest University, Beijing 100083, China

2. Engineering Research Center for Forestry-oriented Intelligent Information Processing of National Forestry and Grassland Administration, Beijing 100083, China

通讯作者: 王少荣,男,副教授. orcid.org/0000-0001-8955-6854. E-mail:shaorongwang@hotmail.com

收稿日期: 2025-07-15  

Received: 2025-07-15  

作者简介 About authors

郭子强(1998—),男,硕士生,从事计算机视觉研究.orcid.org/0009-0005-8324-1559.E-mail:ZQGuo@bjfu.edu.cn , E-mail:ZQGuo@bjfu.edu.cn

摘要

在可见光-红外行人重识别任务中,由于训练样本有限,且可见光与红外图像之间存在较大差异,如何挖掘多样化的跨模态信息并实现特征对齐是该任务的关键挑战. 为此,提出全局学习扩展的嵌入增强网络,有效融合视觉变换器与卷积神经网络的优势,协同捕获图像的局部细节与全局结构信息. 通过生成多样化的嵌入特征,引入特征图结构对齐机制,进一步增强模型对全局结构的建模能力,减小可见光与红外图像之间的模态差异,从而学习到更加丰富且判别性强的特征表示. 实验结果表明,相较于基线模型DEEN,所提方法在SYSU-MM01数据集的全搜索模式和LLCM数据集的可见光检索红外模式下的Rank-1准确率分别提高了4.2和9.1个百分点. 该方法通过聚合全局空间信息,生成了更具判别性的特征嵌入,显著增强了网络性能.

关键词: 可见光-红外行人重识别 ; 跨模态检索 ; 全局特征 ; 特征对齐 ; 嵌入增强

Abstract

In visible-infrared person re-identification, the limited number of training samples and the significant discrepancy between visible and infrared images pose key challenges in mining diverse cross-modal information and achieving feature alignment. An embedding enhancement network based on global learning expansion was proposed to address the challenges, which effectively integrated the strengths of both vision Transformer and CNN to jointly capture local details and global structural information from images. By generating diversified embedding features and introducing the feature map structural alignment mechanism, the model’s ability to model global structures was further enhanced and the modality gap between visible and infrared images was reduced, thereby enabling more comprehensive and discriminative feature representations to be learned. Experimental results demonstrated that, compared to the baseline model DEEN, the proposed method achieved improvements of 4.2 and 9.1 percentage points in Rank-1 accuracy under the full-search mode of the SYSU-MM01 dataset and the visible-light-to-infrared retrieval mode of the LLCM dataset, respectively. By aggregating global spatial information, the proposed method generated more discriminative feature embeddings, significantly boosting the network performance.

Keywords: visible-infrared person re-identification ; cross-modal retrieval ; global feature ; feature alignment ; embedding enhancement

PDF (2304KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

郭子强, 肖璇, 陶浩然, 王少荣. 全局学习扩展的可见光-红外行人重识别. 浙江大学学报(工学版)[J], 2026, 60(8): 1670-1677 doi:10.3785/j.issn.1008-973X.2026.08.006

GUO Ziqiang, XIAO Xuan, TAO Haoran, WANG Shaorong. Global learning-expanded visible-infrared person re-identification. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1670-1677 doi:10.3785/j.issn.1008-973X.2026.08.006

行人重识别(person re-identification, ReID)即通过匹配不同摄像机捕获的行人图像而实现目标检索[1]. 现有研究大多局限于单模态场景,即基于可见光图像进行识别[2-3]. 然而,在实际应用场景中,监控系统须适应全天候光照条件;尤其在夜间或低光照环境下,红外成像技术成为关键补充手段. 为此,研究者提出可见光-红外行人重识别(visible-infrared person re-identification, VI-ReID)方法[4-5],以实现可见光与红外图像之间的跨模态行人匹配. 相较于传统的单模态ReID任务,由于可见光和红外图像之间存在显著的跨模态差异(如颜色和纹理缺失、光谱响应偏差等),可见光-红外行人重识别任务更具挑战性[6-7].

近年来,单模态ReID研究取得了显著进展. 现有方法主要通过卷积神经网络(CNN)来学习具有类内一致性和类间判别性的特征表示[8]. 为了增强特征鲁棒性,Sun等[9]提出无须依赖外部线索的特征对齐方法,通过重新分配局部特征中的异常值,精确对齐局部特征. 随着视觉变换器(vision Transformer, ViT)模型的兴起,He等[10]首次将ViT变体应用于单模态ReID任务. 此外,ReID领域衍生出了一些重要分支,如无监督的领域自适应ReID和领域泛化ReID[11]等. 现有方法虽然在单模态ReID中表现良好,但是在可见光-红外行人重识别任务中,其识别性能明显下降.

可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12-17]. CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18]提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19-22]. ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21]采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23-24]. 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限.

针对上述问题,提出全局学习扩展的新型嵌入增强网络架构. 该网络由全局特征聚合(global feature aggregation, GFA)和特征多样化扩展(feature diversification expansion, FDE)模块组成. GFA模块将ViT的优点融合到CNN中,使其拥有全局感受野,同时产生与局部卷积相同的位置敏感特征,有效融合局部与全局结构信息,提升网络挖掘多样化嵌入的能力. FDE模块通过基于CNN和ViT的多分支生成结构生成多样化的嵌入,并配合全局特征学习(global feature learning, GFL)损失,生成更关注全局且模态差异更小的嵌入. GFA提升特征质量,FDE拓展特征表达,GFL强化模态一致性,最终在端到端框架中共同优化模型性能,实现对跨模态行人图像的精准匹配与识别.

1. 可见光-红外行人重识别方法

1.1. 模型架构

图1展示了提出的全局学习扩展(global learning expansion, GLE)网络的整体架构,该网络以双流ResNet-50[15,25]作为主干网络,分别提取可见光模态和红外模态的初始特征. 在网络的前3个阶段,将ResNet-50的第1~3个残差阶段提取的特征分别输入GFA-1~GFA-3中,以融合局部与全局结构信息,并生成具有方向感知能力的增强特征. 在阶段3中,进一步地将GFA-3提取到的模态特征输入FDE模块,以产生更多嵌入并输入至下一阶段.

图 1

图 1   全局学习扩展网络的整体架构

Fig.1   Overall architecture of global learning expansion network


为了使生成的嵌入更加关注全局信息,并减小不同模态特征的差异,提出GFL损失,以驱动FDE模块生成更具判别性的多样化特征嵌入.

最后,在训练过程中,将批量归一化层前、后的特征输入多组损失函数中进行联合优化,从而实现GLE模型的端到端学习.

1.2. 全局特征聚合模块

为了充分融合局部特征与全局结构信息,增强网络挖掘多样化嵌入的能力,引入全局特征聚合模块. GFA模块采用纯卷积操作来实现全局感受野,通过循环卷积模拟ViT的长距离建模能力,在结构上实现了对全局信息的聚合,且相较于ViT的自注意力机制,其计算效率更高. 此外,设计的GFA模块可以应用于主干网络中的多个阶段,具有较强的可移植性与灵活性. 相比于传统注意力模块仅在输出特征上调整权重,GFA直接从位置编码出发构建空间感知特征,能够从更深层次提升模型的全局建模能力.

传统的局部卷积操作会破坏输入特征的全局空间结构,尤其是在边缘区域. 循环卷积虽然将感受野扩展至全局,但是仍然会丢失空间位置关系. 因此,引入位置编码,将垂直或水平方向上的位置编码信息添加到相应的输入特征中,从而让特征具有空间信息表达能力.

图1所示,首先将输入特征$ \boldsymbol{f}\in {\mathbf{R}}^{C\times H\times W} $在通道维度上平均分为2部分:$ {\boldsymbol{f}}_{\mathrm{w}}^{1}\in {\mathbf{R}}^{\left(C/2\right)\times H\times W} $$ {\boldsymbol{f}}_{\mathrm{h}}^{1}\in {\mathbf{R}}^{\left(C/2\right)\times H\times W} $. 其中,CHW分别为通道数、高度和宽度,$ {\boldsymbol{f}}_{\mathrm{w}}^{1} $$ \boldsymbol{f} $拆分后在水平方向上的特征,$ {\boldsymbol{f}}_{\mathrm{h}}^{1} $$ \boldsymbol{f} $拆分后在垂直方向上的特征.

下面以水平方向上的特征处理为例,说明基于位置编码的特征提取过程. 首先,初始化可学习的位置编码$ {\mathbf{p}\mathbf{e}}^{\mathrm{w}} $,其维度为$ (C/2)\times 1\times W $. 然后,通过扩展函数EW(·)沿垂直方向复制H次,得到维度为$ \left(C/2\right)\times H\times W $的矩阵$ {\mathbf{P}\mathbf{E}}^{\mathrm{w}} $. 将得到的矩阵和$ {\boldsymbol{f}}_{\mathrm{w}}^{1} $相加得到$ {\boldsymbol{f}}_{\mathrm{w}}^{2}\in {\mathbf{R}}^{(C/2)\times H\times W} $,再将$ {\boldsymbol{f}}_{\mathrm{w}}^{2} $沿水平方向堆叠,并在每个通道上移除特征的最后1列得到$ {\boldsymbol{f}}_{\mathrm{w}}^{3}\in {\mathbf{R}}^{(C/2)\times H\times (2W-1)} $.$ {\boldsymbol{f}}_{\mathrm{w}}^{3} $使用1×W的卷积核进行水平方向上的循环卷积操作,得到$ {\boldsymbol{f}}_{\mathrm{w}}^{+} $.

图2展示了输入一维向量时的循环卷积操作. 将输入特征在水平方向堆叠后,连接其起始端和末端形成闭环结构. 卷积核沿着闭环顺时针执行W次卷积操作,得到输出特征.

图 2

图 2   水平方向上的循环卷积

Fig.2   Circular convolution in horizontal direction


同理,在垂直方向上采用类似的方法进行循环卷积处理得到$ {\boldsymbol{f}}_{\text{h}}^{+} $. 将得到的$ {\boldsymbol{f}}_{\text{w}}^{+} $$ {\boldsymbol{f}}_{\text{h}}^{+} $沿通道维度进行拼接,最终得到输出特征$ {\boldsymbol{f}}_{\text{c}}^{{\mathrm{GFA}}} $.

1.3. 特征多样化扩展模块

为了缓解样本数据不足的问题,提出特征多样化扩展模块,利用CNN和ViT架构来生成多样化的嵌入特征.

图1所示,FDE生成结构包含3个分支. 对分支1、2采用相同的处理方式,即分别使用3个具有不同扩张率(1、2或3)的3×3空洞卷积层($ {\varphi }_{3\times 3}^{1} $$ {\varphi }_{3\times 3}^{2}、{\varphi }_{3\times 3}^{3} $)对特征图进行降维;随后,将得到的3个特征融合并经过ReLU激活层,提高特征的非线性表示能力;最后,通过1×1卷积层$ {\theta }_{1\times 1} $变换特征维度,使之与输入特征的维度一致. 分支1、2生成的特征嵌入分别为

$ \begin{split} \boldsymbol{f}_+^i =&\theta_{1 \times 1}\left({\operatorname{ReLU}}\left(\varphi_{3 \times 3}^1(\boldsymbol{f}) + \varphi_{3 \times 3}^2(\boldsymbol{f}) + \varphi_{3 \times 3}^3(\boldsymbol{f})\right)\right) ;\;\; i = 1,2.\end{split} $

为了捕获全局特征,引入分支3. 该分支是包含2个四头自注意力机制的ViT模块(T):

$ \boldsymbol{f}_+^3=T(\boldsymbol{f}). $

最后,对原始特征和所有生成的特征嵌入沿批量大小维度进行拼接,作为主干网络下一阶段的输入:

$ \boldsymbol{f}_\text{c}^{{\mathrm{FDE}}}=\left[\boldsymbol{f}, \boldsymbol{f}_+^1, \boldsymbol{f}_+^2, \boldsymbol{f}_+^3\right] . $

1.4. 全局特征学习损失

特征图结构中蕴含丰富的关系信息和分布特性[15,26]. 为了充分挖掘这些潜在的关联特征并增强特征表达能力,提出全局特征学习损失. 一方面,通过图结构对齐操作,驱动ViT分支生成的嵌入$ {\boldsymbol{f}}_{+}^{3} $引导原始特征f生成更关注全局信息的嵌入;另一方面,对齐原始特征f的2个模态,使原始特征f生成的嵌入模态差异更小.

对于模态$ a $,引入用于表示特征间关系的图结构亲和矩阵Aa

$ \alpha_{i j}=\frac{\exp \left(D\left(\boldsymbol{f}_a^i, \boldsymbol{f}_a^j\right)\right)}{\displaystyle{\sum}_{k \in N} \exp \left(D\left(\boldsymbol{f}_a^i, \boldsymbol{f}_a^k\right)\right)} ;\; i, j \in N . $

式中:$ \alpha_{i j} $为亲和矩阵中的元素,N为模态a的样本数目,$ {\boldsymbol{f}}_a^i $$\boldsymbol{f}_a^j $$\boldsymbol{f}_a^k $为第ijk个样本的特征,D(·)表示计算2个特征的欧几里得距离. 亲和度矩阵Aa中的每一行都表征了对应样本的图结构.

给定模态$ a $$b$,为了将2种不同的特征分布对齐,定义图结构对齐损失:

$ L_{\mathrm{GFL}}^{(a ; b)}=\displaystyle\sum_{p=1}^P \displaystyle\sum_{k=1}^K \operatorname{KL}\left(\boldsymbol{A}_a^{p_k}, \boldsymbol{A}_b^{p_k}\right) . $

式中:$ {\boldsymbol{A}}_a^{{p_k}} $$\boldsymbol{A}_b^{p_k} $为模态ab的第p类中第k个样本的图结构,$ P $为人物类别总数,$ K $为单模态下每类样本的数量,KL表示对2个模态的矩阵进行KL散度对齐.

更进一步地,定义损失$ {L_{{\mathrm{GFL}}}} $

$ L_{\mathrm{GFL}}=L_{\mathrm{GFL}}^{\left(\boldsymbol{f}, \text{V} ; \boldsymbol{f}_+^3, \text{V}\right)}+L_{\mathrm{GFL}}^{\left(\boldsymbol{f}, \text{I} ; \boldsymbol{f}_+^3, \text{I}\right)}+L_{\mathrm{GFL}}^{(\boldsymbol{f}, \text{V} ; \boldsymbol{f}, \text{I})} . $

图3所示,式(6)中前2项$ L_{{\text{GFL}}}^{({\boldsymbol{f}},\text{V};{\boldsymbol{f}}_+^3,\text{V})} $$ L_{{\text{GFL}}}^{({\boldsymbol{f}},\text{I};{\boldsymbol{f}}_+^3,\text{I})} $分别用于可见光模态和红外模态下$ {\boldsymbol{f}}_{+}^{3} $f的对齐,从而将全局信息传递给f,使生成的嵌入更加关注全局信息. $ L_{{\text{GFL}}}^{({\boldsymbol{f}},\text{V};{\boldsymbol{f}},\text{I})} $用于f在可见光模态和红外模态下的对齐,从而使生成的嵌入模态差异更小.

图 3

图 3   全局特征学习损失示意图

Fig.3   Schematic of global feature learning loss


1.5. 多重损失优化

除了提出的全局特征学习损失$ {L_{{\text{GFL}}}} $之外,还采用交叉熵损失$ {L_{{\text{ce}}}} $[27]和三元组损失$ {L_{{\text{tri}}}} $[28]

$ \begin{aligned} L_{\mathrm{ce}}=\lambda_1 L_{\mathrm{ce}}^{\mathrm{cnn}}+\left(1-\lambda_1\right) L_{\mathrm{ce}}^{\mathrm{vit}},\end{aligned} $

$ \begin{aligned} L_{\mathrm{tri}}=\lambda_2 L_{\mathrm{tri}}^{\mathrm{cnn}}+\left(1-\lambda_2\right) L_{\mathrm{tri}}^{\mathrm{vit}} .\end{aligned} $

式中:$L_{\mathrm{ce}}^{\mathrm{cnn}} $$L_{\mathrm{tri}}^{\mathrm{cnn}} $为基于嵌入[f, $ {\boldsymbol{f}}_{+}^{1} $, $ {\boldsymbol{f}}_{+}^{2} $]所对应的特征计算得到的交叉熵损失和三元组损失,$L_{\mathrm{ce}}^{\mathrm{vit}} $$L_{\mathrm{tri}}^{\mathrm{vit}} $为基于嵌入$ {\boldsymbol{f}}_{+}^{3} $对应的特征计算得到的交叉熵损失和三元组损失,${\lambda _1}$${\lambda _2}$为损失项系数.

最终的损失函数为

$ L_{\mathrm{tot}}=L_{\mathrm{ce}}+L_{\mathrm{tri}}+\lambda_3 L_{\mathrm{GFL}} . $

式中:${\lambda _3}$为损失项系数.

2. 实 验

2.1. 数据集

SYSU-MM01数据集包含491个人物身份,30 071张可见光图像和15 792张红外图像. RegDB数据集由412个人物身份组成,每个身份包含由2个重叠摄像机采集的10张可见光图像和10张红外图像. LLCM数据集在弱光环境下采集得到,其中训练集包含713个人物身份、16 946张可见光图像和13 975张红外图像,测试集包含351个人物身份、8 680张可见光图像和7 166张红外图像.

2.2. 实施细节

所提方法的相关实验都在PyTorch框架上实现. 与基线模型DEEN保持一致,所有输入图像首先被调整为3×384×144像素,并在训练阶段采用随机水平翻转和随机擦除技术[29]对其进行数据增强. 初始学习率设置为10−2,并通过预热策略在10个epoch后将学习率提高到10−1. 随后,在第20个epoch将学习率衰减到10−2,并分别在第80、120个epoch进一步衰减到10−3和5×10−4,直至完成150个epoch的训练. 在每个小批量中,随机选择6个人物身份,对每个身份的4张可见光图像和4张红外图像进行训练. 优化器采用SGD进行训练,将动量设置为0.9.

2.3. 与先进方法的比较

首先将提出的GLE方法与当前先进方法进行比较,以验证其优越性. 在SYSU-MM01、RegDB、LLCM数据集上的实验结果分别如表1~3所示. 其中R-k准确率为前k个结果中正确匹配的概率,mAP为检索排序结果中各查询样本平均精度的均值.

表 1   SYSU-MMO1数据集上GLE与先进方法的性能比较

Tab.1  Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset

方法全搜索室内搜索
R-1/%R-10/%R-20/%mAP/%R-1/%R-10/%R-20/%mAP/%
DART[30]68.796.499.066.372.597.899.578.2
CAJ[31]69.995.798.566.976.397.999.580.4
MPANet[32]70.696.298.868.276.798.299.681.0
MMN[33]70.696.299.066.976.297.299.379.6
DCLNet[34]70.865.373.576.8
MAUM[4]71.768.877.081.9
DEEN[16]74.797.699.271.880.399.099.883.3
HOS-Net[35]75.674.284.286.7
SAAI[36]75.977.083.288.0
MUN[37]76.297.873.879.498.182.1
MSCLNet[38]77.097.699.271.678.599.399.981.2
PartMix[17]77.874.681.584.4
IDKL[18]81.497.498.979.987.198.399.389.4
GLE78.998.499.676.186.099.399.788.1

新窗口打开| 下载CSV


表 2   RegDB数据集上GLE与先进方法的性能比较

Tab.2  Performance comparison of GLE and state-of-the-art methods on RegDB dataset

方法可见光检索红外红外检索可见光
R-1/%R-10/%R-20/%mAP/%R-1/%R-10/%R-20/%mAP/%
DART[30]83.675.782.073.8
CAJ[31]85.095.597.579.184.895.397.577.8
MPANet[32]82.880.783.780.9
MMN[33]91.697.798.984.187.596.098.180.5
DCLNet[34]81.274.378.070.6
MAUM[4]87.985.187.084.3
DEEN[16]91.197.898.985.189.596.898.483.4
HOS-Net[35]94.790.493.389.2
SAAI[36]91.191.592.192.0
CMT[21]95.298.887.392.097.999.184.5
MUN[37]95.298.987.291.998.085.0
IDKL[18]94.790.294.290.4
GLE94.998.899.690.590.298.099.189.2

新窗口打开| 下载CSV


表 3   LLCM数据集上GLE与先进方法的性能比较

Tab.3  Performance comparison of GLE and state-of-the-art methods on LLCM dataset

方法可见光检索红外红外检索可见光
R-1/%R-10/%R-20/%mAP/%R-1/%R-10/%R-20/%mAP/%
DDAG[15]48.079.286.152.340.371.479.648.4
AGW[7]51.581.587.955.343.674.682.451.8
LbA[39]50.884.391.155.643.878.286.653.1
CAJ[31]56.585.390.959.848.879.585.356.6
DART[30]60.487.191.963.252.280.787.059.8
MMN[33]59.988.593.662.752.581.688.458.9
DEEN[16]62.590.394.765.854.984.990.962.9
HOS-Net[35]64.967.956.463.2
IDKL[18]72.266.470.765.2
GLE71.692.596.256.957.786.392.164.4

新窗口打开| 下载CSV


与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值.

表2所示,在RegDB数据集上,可见光检索红外模式下的GLE取得了94.9%的Rank-1准确率、98.8%的Rank-10准确率、99.6%的Rank-20准确率以及90.5%的mAP值. 在红外检索可见光模式下,模型同样表现优异,获得了90.2%的Rank-1准确率、98.0%的Rank-10准确率、99.1%的Rank-20准确率以及89.2%的mAP值. 值得注意的是,GLE在多个关键指标上均达到了当前最优水平. 这些实验结果充分表明,GLE能够有效缓解可见光与红外模态之间的跨模态差异,展现出优异的跨模态检索能力.

表3所示,在LLCM数据集上,可见光检索红外模式下的GLE取得了71.6%的Rank-1准确率、92.5%的Rank-10准确率、96.2%的Rank-20准确率以及56.9%的mAP值. 对于红外检索可见光模式,所提GLE方法取得了57.7%的Rank-1准确率、86.3%的Rank-10准确率、92.1%的Rank-20准确率以及64.4%的mAP值. 由于低光照、模态不均衡和背景干扰显著等因素,LLCM数据集上的跨模态检索任务更具有挑战性,但是GLE的性能仍然展现了一定优越性.

2.4. 消融研究

为了评估GLE模型中各组件的贡献,在SYSU-MM01数据集上进行消融实验. 采用控制变量法,在基线模型上逐步加入GLE中的关键模块,同时保持其他实验条件不变,具体结果如表4所示. 实验结果表明,当单独使用FDE模块时,虽然通过生成结构增加了嵌入特征数量,但是性能提升有限. 引入GFL损失函数后,模型性能显著提升,这表明GFL能够有效约束生成特征. GFA模块通过全局特征聚合,进一步提升了模型的性能,证明了其在空间信息挖掘上的有效性.

表 4   GLE中各模块的消融实验结果

Tab.4  Ablation experiment results of each module in GLE

FDEGFLGFAR-1/%mAP/%
×××74.771.8
××75.672.6
×76.973.5
××76.272.5
×77.774.7
78.976.1

新窗口打开| 下载CSV


通过将FDE、GFL和GFA模块集成到端到端学习框架中,构建完整的GLE模型. 实验结果表明,GLE在SYSU-MM01数据集上取得了显著的性能提升,这验证了FDE和GFA在生成多样化嵌入特征方面的协同作用,二者能够相互补充,共同提升模型的整体表现.

为了评估损失函数中超参数对模型性能的影响,在SYSU-MM01数据集的全搜索模式下,开展控制变量实验,并通过折线图直观展示模型性能在不同超参数取值下的变化趋势,如图4所示. 其中,A为mAP或Rank-1准确率. 在实验过程中,逐步调整超参数的数值,观察其对性能的影响. 结果表明,当超参数${\lambda _1}$${\lambda _2}$${\lambda _3}$分别设置为0.6、0.6和0.2时,模型能够达到最佳性能.

图 4

图 4   损失函数中各个超参数对模型性能的影响

Fig.4   Impact of hyperparameters in loss function on model performance


2.5. 计算效率

为了平衡性能与计算成本,仅在模型高层(Layer3后)引入分支结构. 为了全面评估GLE模型的计算效率,在相同硬件环境下对计算成本进行系统性分析,并对GLE与基线模型进行详细对比. 实验结果表明,GLE模型的总参数量为115.20 M,相较于基线模型的89.04 M有所增加;模型大小增至391.26 MB(基线模型为339.68 MB);计算量(FLOPs)从18.47 G上升至23.15 G;单图推理时延由10.57 ms增至13.23 ms;在批处理大小为6的设置下,FPS从368.7帧/s降至305.2帧/s;峰值显存占用也从13.17 GB增加到16.32 GB. 尽管GLE模型在参数量与计算量上有所增加,但是仍然保持在可接受范围内,且带来了显著的精度提升.

2.6. 可视化分析

为了研究GLE有效的原因,在LLCM数据集上对类内和类间距离进行可视化分析,如图5所示. 其中,$d\left(\boldsymbol{f}_i, \boldsymbol{f}_j\right) $为特征向量fifj之间的欧氏距离,fd为对应距离区间内样本对出现的频率,$z_{i, 1} $$z_{i, 2} $为降维后的2个嵌入维度。比较图5中(a)~(c),可以得出,GLE拉大了类间和类内距离均值的差距. 与初始特征和基线特征相比,GLE得到的特征类内距离更小,类间差距更大. 此外,利用t-SNE[40]将特征分布映射到二维空间中进行可视化,如图5(d)~(f)所示. 结果表明,GLE能够清晰地区分不同人物的特征并聚合同一人物的特征,有效减小了模态差异.

图 5

图 5   类内、类间距离和特征分布可视化

Fig.5   Visualization of intra-class distance, inter-class distance, and feature distribution


为了进一步说明GLE的有效性,在图6中展示了GLE在LLCM数据集上的部分检索结果. 对于每个检索案例,GLE能够有效优化排序结果,使得正确匹配的图像在排序中靠前,从而显著提高了检索准确率.

图 6

图 6   LLCM数据集上GLE与基线模型DEEN的检索结果对比

Fig.6   Comparison of retrieval results between GLE and baseline model DEEN


3. 结 语

面向可见光-红外行人重识别任务,提出新颖的全局学习扩展(GLE)网络. GLE网络通过全局特征聚合模块有效融合了局部细节与全局结构信息,增强了模型对图像空间关系的建模能力;同时借助特征多样化扩展模块生成多源嵌入特征,提升了特征的判别性与多样性. 为了进一步优化特征表示,引入全局特征学习损失,通过图结构对齐机制促进跨模态特征分布的一致性,显著缓解了可见光与红外图像之间的模态差异. 在SYSU-MM01、RegDB和LLCM数据集上的实验结果表明,GLE网络在Rank-1、Rank-10、mAP等关键指标上取得了领先的性能表现,验证了其在复杂跨模态场景下的有效性与鲁棒性.

参考文献

ZHENG Y, TANG S, TENG G, et al. Online pseudo label generation by hierarchical cluster dynamics for adaptive person re-identification [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 8351–8361.

[本文引用: 1]

PU N, CHEN W, LIU Y, et al. Lifelong person re-identification via adaptive knowledge accumulation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 7897–7906.

[本文引用: 1]

TAN L, DAI P, JI R, et al. Dynamic prototype mask for occluded person re-identification [C]// Proceedings of the 30th ACM International Conference on Multimedia. Lisboa: ACM, 2022: 531–540.

[本文引用: 1]

LIU J, SUN Y, ZHU F, et al. Learning memory-augmented unidirectional metrics for cross-modality person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 19344–19353.

[本文引用: 3]

YANG B, YE M, CHEN J, et al. Augmented dual-contrastive aggregation learning for unsupervised visible-infrared person re-identification [C]// Proceedings of the 30th ACM International Conference on Multimedia. Lisboa: ACM, 2022: 2843–2851.

[本文引用: 1]

WEI X, LI D, HONG X, et al. Co-attentive lifting for infrared-visible person re-identification [C]// Proceedings of the 28th ACM International Conference on Multimedia. Seattle: ACM, 2020: 1028–1037.

[本文引用: 1]

YE M, SHEN J, LIN G, et al

Deep learning for person re-identification: a survey and outlook

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44 (6): 2872- 2893

DOI:10.1109/TPAMI.2021.3054775      [本文引用: 2]

REN M, HE L, LIAO X, et al. Learning instance-level spatial-temporal patterns for person re-identification [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 14910–14919.

[本文引用: 1]

SUN Y, ZHENG L, YANG Y, et al. Beyond part models: person retrieval with refined part pooling (and a strong convolutional baseline) [C]// Proceedings of the European Conference on Computer Vision. Munich: Springer, 2018: 501–518.

[本文引用: 1]

HE S, LUO H, WANG P, et al. TransReID: Transformer-based object re-identification [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 14993–15002.

[本文引用: 1]

ZHANG L, LIU Z, ZHANG W, et al

Style uncertainty based self-paced meta learning for generalizable person re-identification

[J]. IEEE Transactions on Image Processing, 2023, 32: 2107- 2119

DOI:10.1109/TIP.2023.3263112      [本文引用: 1]

FU X, HUANG F, ZHOU Y, et al

Cross-modal cross-domain dual alignment network for RGB-infrared person re-identification

[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2022, 32 (10): 6874- 6887

DOI:10.1109/TCSVT.2022.3173263      [本文引用: 1]

LIANG W, WANG G, LAI J, et al

Homogeneous-to-heterogeneous: unsupervised learning for RGB-infrared person re-identification

[J]. IEEE Transactions on Image Processing, 2021, 30: 6392- 6407

DOI:10.1109/TIP.2021.3092578     

WU A, ZHENG W S, YU H X, et al. RGB-infrared cross-modality person re-identification [C]// Proceedings of the IEEE International Conference on Computer Vision. Venice: IEEE, 2017: 5390–5399.

YE M, SHEN J, CRANDALL D J, et al. Dynamic dual-attentive aggregation learning for visible-infrared person re-identification [C]// Proceedings of the European Conference on Computer Vision. Glasgow: Springer, 2020: 229–247.

[本文引用: 3]

ZHANG Y, WANG H. Diverse embedding expansion network and low-light cross-modality benchmark for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 2153–2162.

[本文引用: 3]

KIM M, KIM S, PARK J, et al. PartMix: regularization strategy to learn part discovery for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 18621–18632.

[本文引用: 2]

REN K, ZHANG L. Implicit discriminative knowledge learning for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 393–402.

[本文引用: 4]

YANG B, CHEN J, YE M. Top-K visual tokens Transformer: selecting tokens for visible-infrared person re-identification [C]// Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing. Rhodes Island: IEEE, 2023: 1–5.

[本文引用: 1]

CHEN C, YE M, QI M, et al

Structure-aware positional Transformer for visible-infrared person re-identification

[J]. IEEE Transactions on Image Processing, 2022, 31: 2352- 2364

DOI:10.1109/TIP.2022.3141868     

JIANG K, ZHANG T, LIU X, et al. Cross-modality Transformer for visible-infrared person re-identification [C]// Proceedings of the European Conference on Computer Vision. Tel Aviv: Springer, 2022: 480–496.

[本文引用: 2]

ZHAO J, WANG H, ZHOU Y, et al

Spatial-channel enhanced Transformer for visible-infrared person re-identification

[J]. IEEE Transactions on Multimedia, 2023, 25: 3668- 3680

DOI:10.1109/TMM.2022.3163847      [本文引用: 1]

ZHANG H, HU W, WANG X. ParC-Net: position aware circular convolution with merits from ConvNets and Transformer [C]// Proceedings of the European Conference on Computer Vision. Tel Aviv: Springer, 2022: 613–630.

[本文引用: 1]

CHEN Y, DAI X, CHEN D, et al. Mobile-former: bridging MobileNet and Transformer [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 5260–5269.

[本文引用: 1]

HE K, ZHANG X, REN S, et al. Deep residual learning for image recognition [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 770–778.

[本文引用: 1]

LI X, LU Y, LIU B, et al. Counterfactual intervention feature transfer for visible-infrared person re-identification [C]// Proceedings of the European Conference on Computer Vision. Tel Aviv: Springer, 2022: 381–398.

[本文引用: 1]

LUO H, GU Y, LIAO X, et al. Bag of tricks and a strong baseline for deep person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. Long Beach: IEEE, 2019: 1487–1495.

[本文引用: 1]

HERMANS A, BEYER L, LEIBE B. In defense of the triplet loss for person re-identification [EB/OL]. (2017–11–21) [2024–10–25]. https://arxiv.org/abs/1703.07737.

[本文引用: 1]

ZHONG Z, ZHENG L, KANG G, et al

Random erasing data augmentation

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2020, 34 (7): 13001- 13008

DOI:10.1609/aaai.v34i07.7000      [本文引用: 1]

YANG M, HUANG Z, HU P, et al. Learning with twin noisy labels for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 14288–14297.

[本文引用: 3]

YE M, RUAN W, DU B, et al. Channel augmented joint learning for visible-infrared recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 13547–13556.

[本文引用: 3]

WU Q, DAI P, CHEN J, et al. Discover cross-modality nuances for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 4328–4337.

[本文引用: 2]

ZHANG Y, YAN Y, LU Y, et al. Towards a unified middle modality learning for visible-infrared person re-identification [C]// Proceedings of the 29th ACM International Conference on Multimedia. [S.l.]: ACM, 2021: 788–796.

[本文引用: 3]

SUN H, LIU J, ZHANG Z, et al. Not all pixels are matched: dense contrastive learning for cross-modality person re-identification [C]// Proceedings of the 30th ACM International Conference on Multimedia. Lisboa: ACM, 2022: 5333–5341.

[本文引用: 2]

QIU L, CHEN S, YAN Y, et al

High-order structure based middle-feature learning for visible-infrared person re-identification

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2024, 38 (5): 4596- 4604

DOI:10.1609/aaai.v38i5.28259      [本文引用: 3]

FANG X, YANG Y, FU Y. Visible-infrared person re-identification via semantic alignment and affinity inference [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2023: 11236–11245.

[本文引用: 2]

YU H, CHENG X, PENG W, et al. Modality unifying network for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2023: 11151–11161.

[本文引用: 2]

ZHANG Y, ZHAO S, KANG Y, et al. Modality synergy complement learning with cascaded aggregation for visible-infrared person re-identification [C]// Proceedings of the European Conference on Computer Vision. Tel Aviv: Springer, 2022: 462–479.

[本文引用: 1]

PARK H, LEE S, LEE J, et al. Learning by aligning: visible-infrared person re-identification using cross-modal correspondences [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 12026–12035.

[本文引用: 1]

VAN DER MAATEN L, HINTON G

Visualizing data using t-SNE

[J]. Journal of Machine Learning Research, 2008, 9 (86): 2579- 2605

[本文引用: 1]

/