[1]
ZHENG Y, TANG S, TENG G, et al. Online pseudo label generation by hierarchical cluster dynamics for adaptive person re-identification [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 8351–8361.
[本文引用: 1]
[2]
PU N, CHEN W, LIU Y, et al. Lifelong person re-identification via adaptive knowledge accumulation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Nashville: IEEE, 2021: 7897–7906.
[本文引用: 1]
[3]
TAN L, DAI P, JI R, et al. Dynamic prototype mask for occluded person re-identification [C]// Proceedings of the 30th ACM International Conference on Multimedia . Lisboa: ACM, 2022: 531–540.
[本文引用: 1]
[4]
LIU J, SUN Y, ZHU F, et al. Learning memory-augmented unidirectional metrics for cross-modality person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . New Orleans: IEEE, 2022: 19344–19353.
[本文引用: 3]
[5]
YANG B, YE M, CHEN J, et al. Augmented dual-contrastive aggregation learning for unsupervised visible-infrared person re-identification [C]// Proceedings of the 30th ACM International Conference on Multimedia . Lisboa: ACM, 2022: 2843–2851.
[本文引用: 1]
[6]
WEI X, LI D, HONG X, et al. Co-attentive lifting for infrared-visible person re-identification [C]// Proceedings of the 28th ACM International Conference on Multimedia . Seattle: ACM, 2020: 1028–1037.
[本文引用: 1]
[7]
YE M, SHEN J, LIN G, et al Deep learning for person re-identification: a survey and outlook
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2022 , 44 (6 ): 2872 - 2893
DOI:10.1109/TPAMI.2021.3054775
[本文引用: 2]
[8]
REN M, HE L, LIAO X, et al. Learning instance-level spatial-temporal patterns for person re-identification [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 14910–14919.
[本文引用: 1]
[9]
SUN Y, ZHENG L, YANG Y, et al. Beyond part models: person retrieval with refined part pooling (and a strong convolutional baseline) [C]// Proceedings of the European Conference on Computer Vision . Munich: Springer, 2018: 501–518.
[本文引用: 1]
[10]
HE S, LUO H, WANG P, et al. TransReID: Transformer-based object re-identification [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 14993–15002.
[本文引用: 1]
[11]
ZHANG L, LIU Z, ZHANG W, et al Style uncertainty based self-paced meta learning for generalizable person re-identification
[J]. IEEE Transactions on Image Processing , 2023 , 32 : 2107 - 2119
DOI:10.1109/TIP.2023.3263112
[本文引用: 1]
[12]
FU X, HUANG F, ZHOU Y, et al Cross-modal cross-domain dual alignment network for RGB-infrared person re-identification
[J]. IEEE Transactions on Circuits and Systems for Video Technology , 2022 , 32 (10 ): 6874 - 6887
DOI:10.1109/TCSVT.2022.3173263
[本文引用: 1]
[13]
LIANG W, WANG G, LAI J, et al Homogeneous-to-heterogeneous: unsupervised learning for RGB-infrared person re-identification
[J]. IEEE Transactions on Image Processing , 2021 , 30 : 6392 - 6407
DOI:10.1109/TIP.2021.3092578
[14]
WU A, ZHENG W S, YU H X, et al. RGB-infrared cross-modality person re-identification [C]// Proceedings of the IEEE International Conference on Computer Vision . Venice: IEEE, 2017: 5390–5399.
[15]
YE M, SHEN J, CRANDALL D J, et al. Dynamic dual-attentive aggregation learning for visible-infrared person re-identification [C]// Proceedings of the European Conference on Computer Vision . Glasgow: Springer, 2020: 229–247.
[本文引用: 3]
[16]
ZHANG Y, WANG H. Diverse embedding expansion network and low-light cross-modality benchmark for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Vancouver: IEEE, 2023: 2153–2162.
[本文引用: 3]
[17]
KIM M, KIM S, PARK J, et al. PartMix: regularization strategy to learn part discovery for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Vancouver: IEEE, 2023: 18621–18632.
[本文引用: 2]
[18]
REN K, ZHANG L. Implicit discriminative knowledge learning for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2024: 393–402.
[本文引用: 4]
[19]
YANG B, CHEN J, YE M. Top-K visual tokens Transformer: selecting tokens for visible-infrared person re-identification [C]// Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing . Rhodes Island: IEEE, 2023: 1–5.
[本文引用: 1]
[20]
CHEN C, YE M, QI M, et al Structure-aware positional Transformer for visible-infrared person re-identification
[J]. IEEE Transactions on Image Processing , 2022 , 31 : 2352 - 2364
DOI:10.1109/TIP.2022.3141868
[21]
JIANG K, ZHANG T, LIU X, et al. Cross-modality Transformer for visible-infrared person re-identification [C]// Proceedings of the European Conference on Computer Vision . Tel Aviv: Springer, 2022: 480–496.
[本文引用: 2]
[22]
ZHAO J, WANG H, ZHOU Y, et al Spatial-channel enhanced Transformer for visible-infrared person re-identification
[J]. IEEE Transactions on Multimedia , 2023 , 25 : 3668 - 3680
DOI:10.1109/TMM.2022.3163847
[本文引用: 1]
[23]
ZHANG H, HU W, WANG X. ParC-Net: position aware circular convolution with merits from ConvNets and Transformer [C]// Proceedings of the European Conference on Computer Vision . Tel Aviv: Springer, 2022: 613–630.
[本文引用: 1]
[24]
CHEN Y, DAI X, CHEN D, et al. Mobile-former: bridging MobileNet and Transformer [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . New Orleans: IEEE, 2022: 5260–5269.
[本文引用: 1]
[25]
HE K, ZHANG X, REN S, et al. Deep residual learning for image recognition [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition . Las Vegas: IEEE, 2016: 770–778.
[本文引用: 1]
[26]
LI X, LU Y, LIU B, et al. Counterfactual intervention feature transfer for visible-infrared person re-identification [C]// Proceedings of the European Conference on Computer Vision . Tel Aviv: Springer, 2022: 381–398.
[本文引用: 1]
[27]
LUO H, GU Y, LIAO X, et al. Bag of tricks and a strong baseline for deep person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops . Long Beach: IEEE, 2019: 1487–1495.
[本文引用: 1]
[28]
HERMANS A, BEYER L, LEIBE B. In defense of the triplet loss for person re-identification [EB/OL]. (2017–11–21) [2024–10–25]. https://arxiv.org/abs/1703.07737.
[本文引用: 1]
[29]
ZHONG Z, ZHENG L, KANG G, et al Random erasing data augmentation
[J]. Proceedings of the AAAI Conference on Artificial Intelligence , 2020 , 34 (7 ): 13001 - 13008
DOI:10.1609/aaai.v34i07.7000
[本文引用: 1]
[30]
YANG M, HUANG Z, HU P, et al. Learning with twin noisy labels for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . New Orleans: IEEE, 2022: 14288–14297.
[本文引用: 3]
[31]
YE M, RUAN W, DU B, et al. Channel augmented joint learning for visible-infrared recognition [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 13547–13556.
[本文引用: 3]
[32]
WU Q, DAI P, CHEN J, et al. Discover cross-modality nuances for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Nashville: IEEE, 2021: 4328–4337.
[本文引用: 2]
[33]
ZHANG Y, YAN Y, LU Y, et al. Towards a unified middle modality learning for visible-infrared person re-identification [C]// Proceedings of the 29th ACM International Conference on Multimedia . [S.l.]: ACM, 2021: 788–796.
[本文引用: 3]
[34]
SUN H, LIU J, ZHANG Z, et al. Not all pixels are matched: dense contrastive learning for cross-modality person re-identification [C]// Proceedings of the 30th ACM International Conference on Multimedia . Lisboa: ACM, 2022: 5333–5341.
[本文引用: 2]
[35]
QIU L, CHEN S, YAN Y, et al High-order structure based middle-feature learning for visible-infrared person re-identification
[J]. Proceedings of the AAAI Conference on Artificial Intelligence , 2024 , 38 (5 ): 4596 - 4604
DOI:10.1609/aaai.v38i5.28259
[本文引用: 3]
[36]
FANG X, YANG Y, FU Y. Visible-infrared person re-identification via semantic alignment and affinity inference [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Paris: IEEE, 2023: 11236–11245.
[本文引用: 2]
[37]
YU H, CHENG X, PENG W, et al. Modality unifying network for visible-infrared person re-identification [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Paris: IEEE, 2023: 11151–11161.
[本文引用: 2]
[38]
ZHANG Y, ZHAO S, KANG Y, et al. Modality synergy complement learning with cascaded aggregation for visible-infrared person re-identification [C]// Proceedings of the European Conference on Computer Vision . Tel Aviv: Springer, 2022: 462–479.
[本文引用: 1]
[39]
PARK H, LEE S, LEE J, et al. Learning by aligning: visible-infrared person re-identification using cross-modal correspondences [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 12026–12035.
[本文引用: 1]
[40]
VAN DER MAATEN L, HINTON G Visualizing data using t-SNE
[J]. Journal of Machine Learning Research , 2008 , 9 (86 ): 2579 - 2605
[本文引用: 1]
1
... 行人重识别(person re-identification, ReID)即通过匹配不同摄像机捕获的行人图像而实现目标检索[1 ] . 现有研究大多局限于单模态场景,即基于可见光图像进行识别[2 -3 ] . 然而,在实际应用场景中,监控系统须适应全天候光照条件;尤其在夜间或低光照环境下,红外成像技术成为关键补充手段. 为此,研究者提出可见光-红外行人重识别(visible-infrared person re-identification, VI-ReID)方法[4 -5 ] ,以实现可见光与红外图像之间的跨模态行人匹配. 相较于传统的单模态ReID任务,由于可见光和红外图像之间存在显著的跨模态差异(如颜色和纹理缺失、光谱响应偏差等),可见光-红外行人重识别任务更具挑战性[6 -7 ] . ...
1
... 行人重识别(person re-identification, ReID)即通过匹配不同摄像机捕获的行人图像而实现目标检索[1 ] . 现有研究大多局限于单模态场景,即基于可见光图像进行识别[2 -3 ] . 然而,在实际应用场景中,监控系统须适应全天候光照条件;尤其在夜间或低光照环境下,红外成像技术成为关键补充手段. 为此,研究者提出可见光-红外行人重识别(visible-infrared person re-identification, VI-ReID)方法[4 -5 ] ,以实现可见光与红外图像之间的跨模态行人匹配. 相较于传统的单模态ReID任务,由于可见光和红外图像之间存在显著的跨模态差异(如颜色和纹理缺失、光谱响应偏差等),可见光-红外行人重识别任务更具挑战性[6 -7 ] . ...
1
... 行人重识别(person re-identification, ReID)即通过匹配不同摄像机捕获的行人图像而实现目标检索[1 ] . 现有研究大多局限于单模态场景,即基于可见光图像进行识别[2 -3 ] . 然而,在实际应用场景中,监控系统须适应全天候光照条件;尤其在夜间或低光照环境下,红外成像技术成为关键补充手段. 为此,研究者提出可见光-红外行人重识别(visible-infrared person re-identification, VI-ReID)方法[4 -5 ] ,以实现可见光与红外图像之间的跨模态行人匹配. 相较于传统的单模态ReID任务,由于可见光和红外图像之间存在显著的跨模态差异(如颜色和纹理缺失、光谱响应偏差等),可见光-红外行人重识别任务更具挑战性[6 -7 ] . ...
3
... 行人重识别(person re-identification, ReID)即通过匹配不同摄像机捕获的行人图像而实现目标检索[1 ] . 现有研究大多局限于单模态场景,即基于可见光图像进行识别[2 -3 ] . 然而,在实际应用场景中,监控系统须适应全天候光照条件;尤其在夜间或低光照环境下,红外成像技术成为关键补充手段. 为此,研究者提出可见光-红外行人重识别(visible-infrared person re-identification, VI-ReID)方法[4 -5 ] ,以实现可见光与红外图像之间的跨模态行人匹配. 相较于传统的单模态ReID任务,由于可见光和红外图像之间存在显著的跨模态差异(如颜色和纹理缺失、光谱响应偏差等),可见光-红外行人重识别任务更具挑战性[6 -7 ] . ...
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
1
... 行人重识别(person re-identification, ReID)即通过匹配不同摄像机捕获的行人图像而实现目标检索[1 ] . 现有研究大多局限于单模态场景,即基于可见光图像进行识别[2 -3 ] . 然而,在实际应用场景中,监控系统须适应全天候光照条件;尤其在夜间或低光照环境下,红外成像技术成为关键补充手段. 为此,研究者提出可见光-红外行人重识别(visible-infrared person re-identification, VI-ReID)方法[4 -5 ] ,以实现可见光与红外图像之间的跨模态行人匹配. 相较于传统的单模态ReID任务,由于可见光和红外图像之间存在显著的跨模态差异(如颜色和纹理缺失、光谱响应偏差等),可见光-红外行人重识别任务更具挑战性[6 -7 ] . ...
1
... 行人重识别(person re-identification, ReID)即通过匹配不同摄像机捕获的行人图像而实现目标检索[1 ] . 现有研究大多局限于单模态场景,即基于可见光图像进行识别[2 -3 ] . 然而,在实际应用场景中,监控系统须适应全天候光照条件;尤其在夜间或低光照环境下,红外成像技术成为关键补充手段. 为此,研究者提出可见光-红外行人重识别(visible-infrared person re-identification, VI-ReID)方法[4 -5 ] ,以实现可见光与红外图像之间的跨模态行人匹配. 相较于传统的单模态ReID任务,由于可见光和红外图像之间存在显著的跨模态差异(如颜色和纹理缺失、光谱响应偏差等),可见光-红外行人重识别任务更具挑战性[6 -7 ] . ...
Deep learning for person re-identification: a survey and outlook
2
2022
... 行人重识别(person re-identification, ReID)即通过匹配不同摄像机捕获的行人图像而实现目标检索[1 ] . 现有研究大多局限于单模态场景,即基于可见光图像进行识别[2 -3 ] . 然而,在实际应用场景中,监控系统须适应全天候光照条件;尤其在夜间或低光照环境下,红外成像技术成为关键补充手段. 为此,研究者提出可见光-红外行人重识别(visible-infrared person re-identification, VI-ReID)方法[4 -5 ] ,以实现可见光与红外图像之间的跨模态行人匹配. 相较于传统的单模态ReID任务,由于可见光和红外图像之间存在显著的跨模态差异(如颜色和纹理缺失、光谱响应偏差等),可见光-红外行人重识别任务更具挑战性[6 -7 ] . ...
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
1
... 近年来,单模态ReID研究取得了显著进展. 现有方法主要通过卷积神经网络(CNN)来学习具有类内一致性和类间判别性的特征表示[8 ] . 为了增强特征鲁棒性,Sun等[9 ] 提出无须依赖外部线索的特征对齐方法,通过重新分配局部特征中的异常值,精确对齐局部特征. 随着视觉变换器(vision Transformer, ViT)模型的兴起,He等[10 ] 首次将ViT变体应用于单模态ReID任务. 此外,ReID领域衍生出了一些重要分支,如无监督的领域自适应ReID和领域泛化ReID[11 ] 等. 现有方法虽然在单模态ReID中表现良好,但是在可见光-红外行人重识别任务中,其识别性能明显下降. ...
1
... 近年来,单模态ReID研究取得了显著进展. 现有方法主要通过卷积神经网络(CNN)来学习具有类内一致性和类间判别性的特征表示[8 ] . 为了增强特征鲁棒性,Sun等[9 ] 提出无须依赖外部线索的特征对齐方法,通过重新分配局部特征中的异常值,精确对齐局部特征. 随着视觉变换器(vision Transformer, ViT)模型的兴起,He等[10 ] 首次将ViT变体应用于单模态ReID任务. 此外,ReID领域衍生出了一些重要分支,如无监督的领域自适应ReID和领域泛化ReID[11 ] 等. 现有方法虽然在单模态ReID中表现良好,但是在可见光-红外行人重识别任务中,其识别性能明显下降. ...
1
... 近年来,单模态ReID研究取得了显著进展. 现有方法主要通过卷积神经网络(CNN)来学习具有类内一致性和类间判别性的特征表示[8 ] . 为了增强特征鲁棒性,Sun等[9 ] 提出无须依赖外部线索的特征对齐方法,通过重新分配局部特征中的异常值,精确对齐局部特征. 随着视觉变换器(vision Transformer, ViT)模型的兴起,He等[10 ] 首次将ViT变体应用于单模态ReID任务. 此外,ReID领域衍生出了一些重要分支,如无监督的领域自适应ReID和领域泛化ReID[11 ] 等. 现有方法虽然在单模态ReID中表现良好,但是在可见光-红外行人重识别任务中,其识别性能明显下降. ...
Style uncertainty based self-paced meta learning for generalizable person re-identification
1
2023
... 近年来,单模态ReID研究取得了显著进展. 现有方法主要通过卷积神经网络(CNN)来学习具有类内一致性和类间判别性的特征表示[8 ] . 为了增强特征鲁棒性,Sun等[9 ] 提出无须依赖外部线索的特征对齐方法,通过重新分配局部特征中的异常值,精确对齐局部特征. 随着视觉变换器(vision Transformer, ViT)模型的兴起,He等[10 ] 首次将ViT变体应用于单模态ReID任务. 此外,ReID领域衍生出了一些重要分支,如无监督的领域自适应ReID和领域泛化ReID[11 ] 等. 现有方法虽然在单模态ReID中表现良好,但是在可见光-红外行人重识别任务中,其识别性能明显下降. ...
Cross-modal cross-domain dual alignment network for RGB-infrared person re-identification
1
2022
... 可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12 -17 ] . CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18 ] 提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19 -22 ] . ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21 ] 采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23 -24 ] . 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限. ...
Homogeneous-to-heterogeneous: unsupervised learning for RGB-infrared person re-identification
0
2021
3
... 图1 展示了提出的全局学习扩展(global learning expansion, GLE)网络的整体架构,该网络以双流ResNet-50[15 ,25 ] 作为主干网络,分别提取可见光模态和红外模态的初始特征. 在网络的前3个阶段,将ResNet-50的第1~3个残差阶段提取的特征分别输入GFA-1~GFA-3中,以融合局部与全局结构信息,并生成具有方向感知能力的增强特征. 在阶段3中,进一步地将GFA-3提取到的模态特征输入FDE模块,以产生更多嵌入并输入至下一阶段. ...
... 特征图结构中蕴含丰富的关系信息和分布特性[15 ,26 ] . 为了充分挖掘这些潜在的关联特征并增强特征表达能力,提出全局特征学习损失. 一方面,通过图结构对齐操作,驱动ViT分支生成的嵌入$ {\boldsymbol{f}}_{+}^{3} $ 引导原始特征f 生成更关注全局信息的嵌入;另一方面,对齐原始特征f 的2个模态,使原始特征f 生成的嵌入模态差异更小. ...
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
3
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
2
... 可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12 -17 ] . CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18 ] 提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19 -22 ] . ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21 ] 采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23 -24 ] . 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限. ...
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
4
... 可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12 -17 ] . CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18 ] 提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19 -22 ] . ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21 ] 采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23 -24 ] . 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限. ...
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
1
... 可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12 -17 ] . CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18 ] 提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19 -22 ] . ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21 ] 采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23 -24 ] . 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限. ...
Structure-aware positional Transformer for visible-infrared person re-identification
0
2022
2
... 可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12 -17 ] . CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18 ] 提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19 -22 ] . ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21 ] 采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23 -24 ] . 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限. ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
Spatial-channel enhanced Transformer for visible-infrared person re-identification
1
2023
... 可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12 -17 ] . CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18 ] 提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19 -22 ] . ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21 ] 采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23 -24 ] . 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限. ...
1
... 可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12 -17 ] . CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18 ] 提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19 -22 ] . ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21 ] 采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23 -24 ] . 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限. ...
1
... 可见光-红外行人重识别任务主要采用2种主流模型架构. 一种是基于CNN的方法[12 -17 ] . CNN凭借其局部感受野和权值共享机制,在提取局部特征方面表现出显著优势,能够有效捕捉行人图像中的细节信息,如纹理、边缘等局部特征. Ren等[18 ] 提出隐式判别知识学习方法,该方法通过双流CNN分离模态特定特征与共享特征,利用信息净化器消除模态差异并保留判别信息,再通过特征和语义对齐来增强共享特征的判别性. 另一种是基于ViT的方法[19 -22 ] . ViT通过自注意力机制建立全局依赖关系,擅长捕捉图像的整体结构和长距离特征关联,在全局特征提取方面展现出独特优势. Jiang等[21 ] 采用跨模态ViT,利用全局模态原型和跨模态注意力机制来补偿缺失的模态特征. 在2种架构中,CNN擅长捕获局部特征,ViT擅长获取全局特征[23 -24 ] . 然而,现有方法通常使用单一模型架构来提取特征,难以在全局语义理解和局部细节捕捉之间实现有效平衡. 此外,跨模态行人重识别面临着模态差异这一核心挑战. 由于可见光图像和红外图像的成像原理不同,两者在颜色、纹理等视觉特征上存在显著差异,这种模态差异严重影响了特征表示的准确性和鲁棒性. 现有方法往往侧重于单一模态的特征提取,而忽视了跨模态特征对齐,这也导致模型在实际应用中性能受限. ...
1
... 图1 展示了提出的全局学习扩展(global learning expansion, GLE)网络的整体架构,该网络以双流ResNet-50[15 ,25 ] 作为主干网络,分别提取可见光模态和红外模态的初始特征. 在网络的前3个阶段,将ResNet-50的第1~3个残差阶段提取的特征分别输入GFA-1~GFA-3中,以融合局部与全局结构信息,并生成具有方向感知能力的增强特征. 在阶段3中,进一步地将GFA-3提取到的模态特征输入FDE模块,以产生更多嵌入并输入至下一阶段. ...
1
... 特征图结构中蕴含丰富的关系信息和分布特性[15 ,26 ] . 为了充分挖掘这些潜在的关联特征并增强特征表达能力,提出全局特征学习损失. 一方面,通过图结构对齐操作,驱动ViT分支生成的嵌入$ {\boldsymbol{f}}_{+}^{3} $ 引导原始特征f 生成更关注全局信息的嵌入;另一方面,对齐原始特征f 的2个模态,使原始特征f 生成的嵌入模态差异更小. ...
1
... 除了提出的全局特征学习损失$ {L_{{\text{GFL}}}} $ 之外,还采用交叉熵损失$ {L_{{\text{ce}}}} $ [27 ] 和三元组损失$ {L_{{\text{tri}}}} $ [28 ] : ...
1
... 除了提出的全局特征学习损失$ {L_{{\text{GFL}}}} $ 之外,还采用交叉熵损失$ {L_{{\text{ce}}}} $ [27 ] 和三元组损失$ {L_{{\text{tri}}}} $ [28 ] : ...
Random erasing data augmentation
1
2020
... 所提方法的相关实验都在PyTorch框架上实现. 与基线模型DEEN保持一致,所有输入图像首先被调整为3×384×144像素,并在训练阶段采用随机水平翻转和随机擦除技术[29 ] 对其进行数据增强. 初始学习率设置为10−2 ,并通过预热策略在10个epoch后将学习率提高到10−1 . 随后,在第20个epoch将学习率衰减到10−2 ,并分别在第80、120个epoch进一步衰减到10−3 和5×10−4 ,直至完成150个epoch的训练. 在每个小批量中,随机选择6个人物身份,对每个身份的4张可见光图像和4张红外图像进行训练. 优化器采用SGD进行训练,将动量设置为0.9. ...
3
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
3
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
2
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
3
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
2
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
High-order structure based middle-feature learning for visible-infrared person re-identification
3
2024
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
2
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
2
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
... Performance comparison of GLE and state-of-the-art methods on RegDB dataset
Tab.2 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 83.6 — — 75.7 82.0 — — 73.8 CAJ[31 ] 85.0 95.5 97.5 79.1 84.8 95.3 97.5 77.8 MPANet[32 ] 82.8 — — 80.7 83.7 — — 80.9 MMN[33 ] 91.6 97.7 98.9 84.1 87.5 96.0 98.1 80.5 DCLNet[34 ] 81.2 — — 74.3 78.0 — — 70.6 MAUM[4 ] 87.9 — — 85.1 87.0 — — 84.3 DEEN[16 ] 91.1 97.8 98.9 85.1 89.5 96.8 98.4 83.4 HOS-Net[35 ] 94.7 — — 90.4 93.3 — — 89.2 SAAI[36 ] 91.1 — — 91.5 92.1 — — 92.0 CMT[21 ] 95.2 98.8 — 87.3 92.0 97.9 99.1 84.5 MUN[37 ] 95.2 98.9 — 87.2 91.9 98.0 — 85.0 IDKL[18 ] 94.7 — — 90.2 94.2 — — 90.4 GLE 94.9 98.8 99.6 90.5 90.2 98.0 99.1 89.2
表 3 LLCM数据集上GLE与先进方法的性能比较 ...
1
... Performance comparison of GLE and state-of-the-art methods on SYSU-MM01 dataset
Tab.1 方法 全搜索 室内搜索 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DART[30 ] 68.7 96.4 99.0 66.3 72.5 97.8 99.5 78.2 CAJ[31 ] 69.9 95.7 98.5 66.9 76.3 97.9 99.5 80.4 MPANet[32 ] 70.6 96.2 98.8 68.2 76.7 98.2 99.6 81.0 MMN[33 ] 70.6 96.2 99.0 66.9 76.2 97.2 99.3 79.6 DCLNet[34 ] 70.8 — — 65.3 73.5 — — 76.8 MAUM[4 ] 71.7 — — 68.8 77.0 — — 81.9 DEEN[16 ] 74.7 97.6 99.2 71.8 80.3 99.0 99.8 83.3 HOS-Net[35 ] 75.6 — — 74.2 84.2 — — 86.7 SAAI[36 ] 75.9 — — 77.0 83.2 — — 88.0 MUN[37 ] 76.2 97.8 — 73.8 79.4 98.1 — 82.1 MSCLNet[38 ] 77.0 97.6 99.2 71.6 78.5 99.3 99.9 81.2 PartMix[17 ] 77.8 — — 74.6 81.5 — — 84.4 IDKL[18 ] 81.4 97.4 98.9 79.9 87.1 98.3 99.3 89.4 GLE 78.9 98.4 99.6 76.1 86.0 99.3 99.7 88.1
表 2 RegDB数据集上GLE与先进方法的性能比较 ...
1
... Performance comparison of GLE and state-of-the-art methods on LLCM dataset
Tab.3 方法 可见光检索红外 红外检索可见光 R-1/% R-10/% R-20/% mAP/% R-1/% R-10/% R-20/% mAP/% DDAG[15 ] 48.0 79.2 86.1 52.3 40.3 71.4 79.6 48.4 AGW[7 ] 51.5 81.5 87.9 55.3 43.6 74.6 82.4 51.8 LbA[39 ] 50.8 84.3 91.1 55.6 43.8 78.2 86.6 53.1 CAJ[31 ] 56.5 85.3 90.9 59.8 48.8 79.5 85.3 56.6 DART[30 ] 60.4 87.1 91.9 63.2 52.2 80.7 87.0 59.8 MMN[33 ] 59.9 88.5 93.6 62.7 52.5 81.6 88.4 58.9 DEEN[16 ] 62.5 90.3 94.7 65.8 54.9 84.9 90.9 62.9 HOS-Net[35 ] 64.9 — — 67.9 56.4 — — 63.2 IDKL[18 ] 72.2 — — 66.4 70.7 — — 65.2 GLE 71.6 92.5 96.2 56.9 57.7 86.3 92.1 64.4
与先进方法相比,GLE方法在SYSU-MM01数据集上展现出显著的性能优势. 具体而言,在全搜索模式下,GLE取得了78.9%的Rank-1准确率、98.4%的Rank-10准确率、99.6%的Rank-20准确率以及76.1%的mAP值,其中Rank-10和Rank-20准确率均达到当前最优水平. 在室内搜索模式下,GLE的表现同样突出,实现了86.0%的Rank-1准确率和88.1%的mAP值. ...
Visualizing data using t-SNE
1
2008
... 为了研究GLE有效的原因,在LLCM数据集上对类内和类间距离进行可视化分析,如图5 所示. 其中,$d\left(\boldsymbol{f}_i, \boldsymbol{f}_j\right) $ 为特征向量f i 与f j 之间的欧氏距离,f d 为对应距离区间内样本对出现的频率,$z_{i, 1} $ 、$z_{i, 2} $ 为降维后的2个嵌入维度.比较图5 中(a)~(c),可以得出,GLE拉大了类间和类内距离均值的差距. 与初始特征和基线特征相比,GLE得到的特征类内距离更小,类间差距更大. 此外,利用t-SNE[40 ] 将特征分布映射到二维空间中进行可视化,如图5 (d)~(f)所示. 结果表明,GLE能够清晰地区分不同人物的特征并聚合同一人物的特征,有效减小了模态差异. ...