[1]
ARANDJELOVIC R, GRONAT P, TORII A, et al. NetVLAD: CNN architecture for weakly supervised place recognition [C]// IEEE Conference on Computer Vision and Pattern Recognition . Las Vegas: IEEE, 2016: 5297–5307.
[本文引用: 1]
[2]
YANDEX A B, LEMPITSKY V. Aggregating local deep features for image retrieval [C]// IEEE International Conference on Computer Vision . Santiago: IEEE, 2015: 1269–1277.
[3]
BABENKO A, SLESAREV A, CHIGORIN A, et al. Neural codes for image retrieval [C]// European Conference on Computer Vision . Zurich: Springer Nature Publishing, 2014: 584−599.
[本文引用: 1]
[4]
HE K, LU Y, SCLAROFF S. Local descriptors optimized for average precision [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition . Salt Lake City: IEEE, 2018: 596–605.
[本文引用: 1]
[5]
NOH H, ARAUJO A, SIM J, et al. Large-scale image retrieval with attentive deep local features [C]// IEEE International Conference on Computer Vision . Venice: IEEE, 2017: 3476–3485.
[本文引用: 2]
[6]
REVAUD J, DE SOUZA C, HUMENBERGER M, et al R2d2: reliable and repeatable detector and descriptor
[J]. Advances in Neural Information Processing Systems , 2019 , 32 : 12405 - 12415
[本文引用: 1]
[7]
SCHROFF F, KALENICHENKO D, PHILBIN J. FaceNet: a unified embedding for face recognition and clustering [C]// IEEE Conference on Computer Vision and Pattern Recognition . Boston: IEEE, 2015: 815–823.
[本文引用: 1]
[8]
HU J, LU J, TAN Y P. Discriminative deep metric learning for face verification in the wild [C]// IEEE Conference on Computer Vision and Pattern Recognition . Columbus: IEEE, 2014: 1875–1882.
[本文引用: 1]
[9]
DENG J, GUO J, XUE N, et al. ArcFace: additive angular margin loss for deep face recognition [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition . Long Beach: IEEE, 2019: 4690–4699.
[本文引用: 2]
[10]
KALANTIDIS Y, MELLINA C, OSINDERO S. Cross-dimensional weighting for aggregated deep convolutional features [C]// European Conference on Computer Vision . Amsterdam: Springer International Publishing, 2016: 685–701.
[本文引用: 1]
[11]
TOLIAS G, SICRE R, JÉGOU H. Particular object retrieval with integral max-pooling of CNN activations [EB/OL]. (2016−02−24)[2023−10−13]. https://arxiv.org/abs/1511.05879.
[本文引用: 2]
[12]
RADENOVIĆ F, TOLIAS G, CHUM O Fine-tuning CNN image retrieval with No human annotation
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2019 , 41 (7 ): 1655 - 1668
DOI:10.1109/TPAMI.2018.2846566
[本文引用: 2]
[13]
SHAO S, CHEN K, KARPUR A, et al. Global features are all you need for image retrieval and reranking [C]// IEEE/CVF International Conference on Computer Vision . Paris: IEEE, 2023: 11002–11012.
[本文引用: 1]
[14]
NG T, BALNTAS V, TIAN Y, et al. SOLAR: second-order loss and attention for image retrieval [C]// European Conference on Computer Vision . Glasgow: Springer International Publishing, 2020: 253−270.
[本文引用: 2]
[15]
WU H, WANG M, ZHOU W, et al. Learning token-based representation for image retrieval [C]// AAAI Conference on Artificial Intelligence . Vancouver: AAAI, 2022, 36(3): 2703−2711.
[本文引用: 1]
[16]
YANG M, HE D, FAN M, et al. DOLG: single-stage image retrieval with deep orthogonal fusion of local and global features [C]// IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 11752–11761.
[本文引用: 2]
[17]
SONG C H, YOON J, CHOI S, et al. Boosting vision transformers for image retrieval [C]// IEEE/CVF Winter Conference on Applications of Computer Vision . Waikoloa: IEEE, 2023: 107–117.
[本文引用: 1]
[19]
BAY H, ESS A, TUYTELAARS T, et al Speeded-up robust features (SURF)
[J]. Computer Vision and Image Understanding , 2008 , 110 (3 ): 346 - 359
DOI:10.1016/j.cviu.2007.09.014
[本文引用: 1]
[20]
DUSMANU M, ROCCO I, PAJDLA T, et al. D2-net: a trainable cnn for joint detection and description of local features [EB/OL]. (2019−05−09)[2023−11−28]. https://arxiv.org/abs/1905.03561.
[本文引用: 1]
[21]
TOLIAS G, JENICEK T, CHUM O. Learning and aggregating deep local descriptors for instance-level recognition [C]// European Conference on Computer Vision . Glasgow: Springer International Publishing, 2020: 460−477.
[本文引用: 3]
[22]
WEINZAEPFEL P, LUCAS T, LARLUS D, et al. Learning super-features for image retrieval [EB/OL]. (2022−01−31)[2023−12−17]. https://arxiv.org/abs/2201.13182.
[本文引用: 2]
[23]
TAN F, YUAN J, ORDONEZ V. Instance-level image retrieval using reranking transformers [C]// IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 12085–12095.
[本文引用: 1]
[24]
LEE S, SEONG H, LEE S, et al. Correlation verification for image retrieval [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition . New Orleans: IEEE, 2022: 5364–5374.
[本文引用: 1]
[25]
KANG D, KWON H, MIN J, et al. Relational embedding for few-shot classification [C]// IEEE/CVF International Conference on Computer Vision . Montreal: IEEE, 2021: 8802–8813.
[本文引用: 1]
[26]
WOO S, PARK J, LEE J Y, et al. CBAM: Convolutional block attention module [C]// European Conference on Computer Vision . Munich: Springer International Publishing, 2018: 3−19.
[本文引用: 1]
[27]
GORDO A, RADENOVIC F, BERG T. Attention-based query expansion learning [C]// European Conference on Computer Vision . Cham: Springer International Publishing, 2020: 172−188.
[本文引用: 2]
[28]
ARANDJELOVIĆ R, ZISSERMAN A. Three things everyone should know to improve object retrieval [C]// IEEE Conference on Computer Vision and Pattern Recognition . Providence: IEEE, 2012: 2911–2918.
[本文引用: 1]
[29]
GORDO A, ALMAZÁN J, REVAUD J, et al End-to-end learning of deep visual representations for image retrieval
[J]. International Journal of Computer Vision , 2017 , 124 (2 ): 237 - 254
DOI:10.1007/s11263-017-1016-8
[本文引用: 1]
[30]
WEYAND T, ARAUJO A, CAO B, et al. Google landmarks dataset v2–A large-scale benchmark for instance-level recognition and retrieval [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2020: 2575–2584.
[本文引用: 1]
[31]
RADENOVIC F, ISCEN A, TOLIAS G, et al. Revisiting Oxford and paris: large-scale image retrieval benchmarking [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition . Salt Lake City: IEEE, 2018: 5706–5715.
[本文引用: 2]
[32]
PHILBIN J, CHUM O, ISARD M, et al. Object retrieval with large vocabularies and fast spatial matching [C]// IEEE Conference on Computer Vision and Pattern Recognition . Minneapolis: IEEE, 2007: 1–8.
[本文引用: 1]
[33]
CAO B, ARAUJO A, SIM J. Unifying deep local and global features for image search [C]// European Conference on Computer Vision . Glasgow: Springer International Publishing, 2020: 726−743.
[本文引用: 2]
[34]
SONG C H, HAN H J, AVRITHIS Y. All the attention you need: global-local, spatial-channel attention for image retrieval [C]// IEEE/CVF Winter Conference on Applications of Computer Vision . Waikoloa: IEEE, 2022: 439–448.
[本文引用: 1]
[35]
SONG Y, ZHU R, YANG M, et al. Dalg: Deep attentive local and global modeling for image retrieval [EB/OL]. (2022−07−01)[2024−03−11]. https://arxiv.org/abs/2207.00287.
[本文引用: 1]
[36]
ZHANG Z, WANG L, ZHOU L, et al. Learning spatial-context-aware global visual feature representation for instance image retrieval [C]// IEEE/CVF International Conference on Computer Vision . Paris: IEEE, 2023: 11216–11225.
[本文引用: 1]
[37]
LEE S, LEE S, SEONG H, et al. Revisiting self-similarity: structural embedding for image retrieval [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition . Vancouver: IEEE, 2023: 23412–23421.
[本文引用: 1]
[38]
TOLIAS G, AVRITHIS Y, JÉGOU H Image search with selective match kernels: aggregation across single and multiple images
[J]. International Journal of Computer Vision , 2016 , 116 (3 ): 247 - 261
DOI:10.1007/s11263-015-0810-4
[本文引用: 1]
[39]
TEICHMANN M, ARAUJO A, ZHU M, et al. Detect-to-retrieve: efficient regional aggregation for image search [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition . Long Beach: IEEE, 2019: 5109–5118.
[本文引用: 1]
[40]
SIMÉONI O, AVRITHIS Y, CHUM O. Local features and visual words emerge in activations [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition . Long Beach: IEEE, 2019: 11651–11660.
[本文引用: 1]
1
... 基于内容的图像检索任务是在大规模数据库中查找与查询图像内容相似的图像,其关键在于提取出图像中的信息以生成能准确表征图像的特征描述符. 图像包含视觉特征信息和几何结构信息. 图像的特征可以分为局部特征和全局特征,局部特征是图像中各个区域的特征描述符,全局特征是总结整个图像中的局部特征所生成的描述符. 通常通过提取图像中的全局特征[1 -3 ] 和局部特征[4 -6 ] 来判断2张图像中是否包含相似信息. 现有图像检索方法按主导检索的特征类型分为全局特征方法和局部特征方法. ...
1
... 基于内容的图像检索任务是在大规模数据库中查找与查询图像内容相似的图像,其关键在于提取出图像中的信息以生成能准确表征图像的特征描述符. 图像包含视觉特征信息和几何结构信息. 图像的特征可以分为局部特征和全局特征,局部特征是图像中各个区域的特征描述符,全局特征是总结整个图像中的局部特征所生成的描述符. 通常通过提取图像中的全局特征[1 -3 ] 和局部特征[4 -6 ] 来判断2张图像中是否包含相似信息. 现有图像检索方法按主导检索的特征类型分为全局特征方法和局部特征方法. ...
1
... 基于内容的图像检索任务是在大规模数据库中查找与查询图像内容相似的图像,其关键在于提取出图像中的信息以生成能准确表征图像的特征描述符. 图像包含视觉特征信息和几何结构信息. 图像的特征可以分为局部特征和全局特征,局部特征是图像中各个区域的特征描述符,全局特征是总结整个图像中的局部特征所生成的描述符. 通常通过提取图像中的全局特征[1 -3 ] 和局部特征[4 -6 ] 来判断2张图像中是否包含相似信息. 现有图像检索方法按主导检索的特征类型分为全局特征方法和局部特征方法. ...
2
... 在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18 ] 和加速鲁棒特征(speeded-up robust features,SURF)[19 ] . 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20 ] . 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21 ] 可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5 ] ;HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21 ] ;Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
R2d2: reliable and repeatable detector and descriptor
1
2019
... 基于内容的图像检索任务是在大规模数据库中查找与查询图像内容相似的图像,其关键在于提取出图像中的信息以生成能准确表征图像的特征描述符. 图像包含视觉特征信息和几何结构信息. 图像的特征可以分为局部特征和全局特征,局部特征是图像中各个区域的特征描述符,全局特征是总结整个图像中的局部特征所生成的描述符. 通常通过提取图像中的全局特征[1 -3 ] 和局部特征[4 -6 ] 来判断2张图像中是否包含相似信息. 现有图像检索方法按主导检索的特征类型分为全局特征方法和局部特征方法. ...
1
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
1
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
2
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
... 采用分类损失函数中的ArcFace[9 ] 损失函数训练整个网络,表达式如下: ...
1
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
2
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
Fine-tuning CNN image retrieval with No human annotation
2
2019
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
2
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
2
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... 全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7 ] 、对比损失[8 ] 和分类损失[9 ] 来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10 ] 、区域最大池化(maxpooling for each region, R-MAC)[11 ] 和广义平均池化(generalized-mean pooling, GeM)[12 ] . Shao等[13 ] 提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14 ] 在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15 -16 ] 提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17 ] 将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征. ...
Distinctive image features from scale-invariant keypoints
1
2004
... 在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18 ] 和加速鲁棒特征(speeded-up robust features,SURF)[19 ] . 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20 ] . 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21 ] 可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5 ] ;HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21 ] ;Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
Speeded-up robust features (SURF)
1
2008
... 在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18 ] 和加速鲁棒特征(speeded-up robust features,SURF)[19 ] . 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20 ] . 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21 ] 可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5 ] ;HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21 ] ;Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
1
... 在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18 ] 和加速鲁棒特征(speeded-up robust features,SURF)[19 ] . 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20 ] . 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21 ] 可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5 ] ;HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21 ] ;Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
3
... 在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18 ] 和加速鲁棒特征(speeded-up robust features,SURF)[19 ] . 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20 ] . 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21 ] 可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5 ] ;HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21 ] ;Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
... [21 ];Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
2
... 在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18 ] 和加速鲁棒特征(speeded-up robust features,SURF)[19 ] . 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20 ] . 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21 ] 可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5 ] ;HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21 ] ;Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... 在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18 ] 和加速鲁棒特征(speeded-up robust features,SURF)[19 ] . 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20 ] . 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21 ] 可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5 ] ;HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21 ] ;Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
1
... 在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18 ] 和加速鲁棒特征(speeded-up robust features,SURF)[19 ] . 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20 ] . 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21 ] 可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5 ] ;HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21 ] ;Weinzaepfel等[22 ] 提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23 -24 ] 单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性. ...
1
... 全局特征方法忽略局部结构信息,难以分辨具有相同纹理、不同形状的图像内容;局部特征方法能有效利用图像中的局部结构信息,但是局部特征的处理会占用大量的推理时间和内存. 针对上述问题,提出基于自相似嵌入网络和全局特征重排序的图像检索方法. 自相似嵌入网络通过自相似表示模块[25 ] 强化局部特征所包含的信息,提取图像中的结构信息;通过卷积块注意力模块(convolutional block attention module, CBAM)[26 ] 增强重要区域局部特征的权重;将局部特征描述符通过特征融合模块嵌入初始特征描述符中,使得生成的全局特征能够更好地表述图像中的局部区域的空间信息. 全局特征重排序方法能够更新查询图像以及初始检索结果中排名靠前图像的特征描述符;在更新过程中,强调具有相同内容的图像之间的共同信息,减少图像中不相关区域信息的干扰,使具有不同内容的图片的特征描述符之间的差距增大,从而使生成的图像特征具有更强的鲁棒性. ...
1
... 全局特征方法忽略局部结构信息,难以分辨具有相同纹理、不同形状的图像内容;局部特征方法能有效利用图像中的局部结构信息,但是局部特征的处理会占用大量的推理时间和内存. 针对上述问题,提出基于自相似嵌入网络和全局特征重排序的图像检索方法. 自相似嵌入网络通过自相似表示模块[25 ] 强化局部特征所包含的信息,提取图像中的结构信息;通过卷积块注意力模块(convolutional block attention module, CBAM)[26 ] 增强重要区域局部特征的权重;将局部特征描述符通过特征融合模块嵌入初始特征描述符中,使得生成的全局特征能够更好地表述图像中的局部区域的空间信息. 全局特征重排序方法能够更新查询图像以及初始检索结果中排名靠前图像的特征描述符;在更新过程中,强调具有相同内容的图像之间的共同信息,减少图像中不相关区域信息的干扰,使具有不同内容的图片的特征描述符之间的差距增大,从而使生成的图像特征具有更强的鲁棒性. ...
2
... 鲁棒的图像表示是保证图像检索准确性的关键. 将相似图像的表示与原始图像的表示组合成新的扩展表示,然后作为查询重新发布,可优化全局特征,提高模型召回率[27 -28 ] . 例如,查询扩展(query expansion, QE)[27 ] 用扩展版本替换查询图像的原始表示,可以在数据库中更有效地检索到图像. 数据库侧增强(database augmentation,DBA)[29 ] 是将QE应用于数据库中每张图像的方法. 其关键思想是,视觉上相似的图像很可能是相同对象的不同表现形式,如同一个建筑在不同光照和角度下的表示. 这些图像的特征细化提高了图像表示的鲁棒性,同时强调了感兴趣对象的关键特征,进一步改进了图像表示. 尽管QE和DBA方法性能优异,但成本较高:QE须对整个数据库发出新的查询;DBA须将所有数据库图像表示相互比较,这在大规模数据集中是不可行的. ...
... [27 ]用扩展版本替换查询图像的原始表示,可以在数据库中更有效地检索到图像. 数据库侧增强(database augmentation,DBA)[29 ] 是将QE应用于数据库中每张图像的方法. 其关键思想是,视觉上相似的图像很可能是相同对象的不同表现形式,如同一个建筑在不同光照和角度下的表示. 这些图像的特征细化提高了图像表示的鲁棒性,同时强调了感兴趣对象的关键特征,进一步改进了图像表示. 尽管QE和DBA方法性能优异,但成本较高:QE须对整个数据库发出新的查询;DBA须将所有数据库图像表示相互比较,这在大规模数据集中是不可行的. ...
1
... 鲁棒的图像表示是保证图像检索准确性的关键. 将相似图像的表示与原始图像的表示组合成新的扩展表示,然后作为查询重新发布,可优化全局特征,提高模型召回率[27 -28 ] . 例如,查询扩展(query expansion, QE)[27 ] 用扩展版本替换查询图像的原始表示,可以在数据库中更有效地检索到图像. 数据库侧增强(database augmentation,DBA)[29 ] 是将QE应用于数据库中每张图像的方法. 其关键思想是,视觉上相似的图像很可能是相同对象的不同表现形式,如同一个建筑在不同光照和角度下的表示. 这些图像的特征细化提高了图像表示的鲁棒性,同时强调了感兴趣对象的关键特征,进一步改进了图像表示. 尽管QE和DBA方法性能优异,但成本较高:QE须对整个数据库发出新的查询;DBA须将所有数据库图像表示相互比较,这在大规模数据集中是不可行的. ...
End-to-end learning of deep visual representations for image retrieval
1
2017
... 鲁棒的图像表示是保证图像检索准确性的关键. 将相似图像的表示与原始图像的表示组合成新的扩展表示,然后作为查询重新发布,可优化全局特征,提高模型召回率[27 -28 ] . 例如,查询扩展(query expansion, QE)[27 ] 用扩展版本替换查询图像的原始表示,可以在数据库中更有效地检索到图像. 数据库侧增强(database augmentation,DBA)[29 ] 是将QE应用于数据库中每张图像的方法. 其关键思想是,视觉上相似的图像很可能是相同对象的不同表现形式,如同一个建筑在不同光照和角度下的表示. 这些图像的特征细化提高了图像表示的鲁棒性,同时强调了感兴趣对象的关键特征,进一步改进了图像表示. 尽管QE和DBA方法性能优异,但成本较高:QE须对整个数据库发出新的查询;DBA须将所有数据库图像表示相互比较,这在大规模数据集中是不可行的. ...
1
... 使用图像检索领域经典数据集GLDv2-clean[30 ] 来进行训练,GLDv2数据集包含超过500万张来自世界各地摄影师收集的图像,包含20多万个不同的地标,GLDv2-clean为GLDv2的子集,包含150万张图像,包含81 313个类. 每张图片都注释了其对应的地标信息. ...
2
... 采用ROxford5K数据集和RParis6K数据集[31 ] 来测试本研究方法的性能. 最初的Oxford和Paris数据集[32 ] 分别由5 063、6 392张高分辨率图像组成,每个数据集均包含55个查询,每个地标包含5个查询,来自总共11个地标. 相较于以往的Oxford5K和Paris6K数据集,ROxford5K、RParis6K进行了重新标注,修复了以往的标签问题,将查询图像的数量从55张增加到70张,并且提出Easy/Medium/Hard共3种类型的评估方式. R1M数据集[31 ] 包括1 001 001 张地标图像,通过引入R1M数据集来模拟大规模数据集图像检索. ...
... [31 ]包括1 001 001 张地标图像,通过引入R1M数据集来模拟大规模数据集图像检索. ...
1
... 采用ROxford5K数据集和RParis6K数据集[31 ] 来测试本研究方法的性能. 最初的Oxford和Paris数据集[32 ] 分别由5 063、6 392张高分辨率图像组成,每个数据集均包含55个查询,每个地标包含5个查询,来自总共11个地标. 相较于以往的Oxford5K和Paris6K数据集,ROxford5K、RParis6K进行了重新标注,修复了以往的标签问题,将查询图像的数量从55张增加到70张,并且提出Easy/Medium/Hard共3种类型的评估方式. R1M数据集[31 ] 包括1 001 001 张地标图像,通过引入R1M数据集来模拟大规模数据集图像检索. ...
2
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
... [
33 ]
81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24 3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
Image search with selective match kernels: aggregation across single and multiple images
1
2016
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...
1
... Evaluation results of various methods on RParis6K and ROxford5K datasets
Tab.1 类别 方法 mAP/% Medium(ROxf) Medium(RPar) Hard(ROxf) Hard(RPar) 全局特征 R-MAC[11 ] 75.14 85.28 53.77 71.28 GeM-AP[12 ] 67.50 80.10 42.80 60.60 SOLAR[14 ] 79.65 88.63 59.99 75.26 DELG[33 ] 76.40 86.74 55.92 72.60 DOLG[16 ] 80.50 89.81 58.82 77.70 GLAM[34 ] 78.60 88.50 60.20 76.80 Swin-S-DALG[35 ] 79.94 90.04 57.55 79.06 SpCa[36 ] 81.55 88.60 61.69 76.21 SENet[37 ] 81.90 90.00 63.00 78.10 局部特征聚合+重排序 HesAff-rSIFT-ASMK+SP[38 ] 60.60 61.40 36.70 35.50 DELF-ASMK+SP[5 ] 67.80 76.90 43.10 55.40 DELF-R-ASMK+SP[39 ] 76.00 80.20 52.40 58.60 HOW-ASMK[21 ] 79.40 81.60 56.90 62.40 Fire[22 ] 81.80 85.30 61.20 70.00 全局特征+局部特征重排序 GeM+DSM[40 ] 65.30 77.40 39.20 56.20 DELG+SP[33 ] 81.20 87.20 64.00 72.80 全局特征 本研究方法(未重排序) 77.21 87.79 60.85 75.17 全局特征+全局特征再重排序 本研究方法 82.11 90.38 66.85 80.24
3.4.1. 全局特征 在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性. ...