浙江大学学报(工学版), 2025, 59(6): 1130-1139 doi: 10.3785/j.issn.1008-973X.2025.06.004

计算机技术

基于自相似嵌入和全局特征重排序的图像检索方法

陈捷丰,, 姚金良,

杭州电子科技大学 计算机学院,浙江 杭州 310018

Image retrieval method based on self-similar embedding and global feature reranking

CHEN Jiefeng,, YAO Jinliang,

College of Computer Science and Technology, Hangzhou Dianzi University, Hangzhou 310018, China

通讯作者: 姚金良,男,副教授,博士. orcid.org/0000-0003-4689-3302. E-mail:yaojinl@hdu.edu.cn

收稿日期: 2024-07-3  

Received: 2024-07-3  

作者简介 About authors

陈捷丰(2000—),男,硕士生,从事计算机视觉研究.orcid.org/0009-0007-6864-3749.E-mail:1172560181@qq.com , E-mail:1172560181@qq.com

摘要

现有的图像检索方法在特征提取阶段所提取的局部特征往往缺失结构信息,并且局部特征重排序方法会占用大量资源. 为此,提出基于自相似嵌入和全局特征重排序的图像检索方法. 提出自相似嵌入网络,以捕捉图像的内部结构,并将其压缩成密集的自相似特征图. 自相似特征图和初始图像特征图融合生成自相似嵌入特征图,可以同时表示图像的视觉和结构信息,从而达到更细粒度的检索效果. 参考查询扩展和数据库增强,提出全局特征重排序的方法. 根据初次排序的结果,提取每张图像对应的相似度排序靠前的图像的特征,采用进行线性求和的方法更新图像的初始特征,以突出具有相同内容的图像的共同特征,增大类间差距,以减少假阳例. 在实验中采用mAP作为评估指标对所提出自相似嵌入和重排序方法进行验证,结果表明,相较于现有方法,所提出方法在ROxford5K和RParis6K数据集上展现出更先进的性能.

关键词: 图像检索 ; 结构信息 ; 自相似性 ; 特征嵌入 ; 全局特征重排序

Abstract

Existing image retrieval methods often suffer from the loss of structural information during local feature extraction and the high computational cost associated with local feature re-ranking. To address these issues, an image retrieval method based on self-similarity embedding and global feature re-ranking was proposed. A self-similarity embedding network was introduced to capture the internal structure of images and compress it into a dense self-similarity feature map. A self-similarity embedded feature map was generated by fusing the self-similarity feature map with the initial image feature map. The generated map could represent both the visual and the structural information of the image, thereby achieving finer-grained retrieval results. A global feature re-ranking method was proposed by drawing inspiration from query expansion and database enhancement techniques. Based on the initial ranking results, the features of the top-ranked similar images for each image were extracted and the initial features were updated using a linear summation approach. This process highlighted the common features of images with the same content and increased the inter-class distance, thereby reducing the number of false positives. In experiments, the proposed self-similarity embedding and re-ranking methods were evaluated using the mean average precision (mAP) as the evaluation metric. The results demonstrated that the proposed method outperformed existing approaches on the ROxford5K and RParis6K datasets.

Keywords: image retrieval ; structural information ; self-similarity ; feature embedding ; global feature reranking

PDF (1809KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

陈捷丰, 姚金良. 基于自相似嵌入和全局特征重排序的图像检索方法. 浙江大学学报(工学版)[J], 2025, 59(6): 1130-1139 doi:10.3785/j.issn.1008-973X.2025.06.004

CHEN Jiefeng, YAO Jinliang. Image retrieval method based on self-similar embedding and global feature reranking. Journal of Zhejiang University(Engineering Science)[J], 2025, 59(6): 1130-1139 doi:10.3785/j.issn.1008-973X.2025.06.004

基于内容的图像检索任务是在大规模数据库中查找与查询图像内容相似的图像,其关键在于提取出图像中的信息以生成能准确表征图像的特征描述符. 图像包含视觉特征信息和几何结构信息. 图像的特征可以分为局部特征和全局特征,局部特征是图像中各个区域的特征描述符,全局特征是总结整个图像中的局部特征所生成的描述符. 通常通过提取图像中的全局特征[1-3]和局部特征[4-6]来判断2张图像中是否包含相似信息. 现有图像检索方法按主导检索的特征类型分为全局特征方法和局部特征方法.

全局特征被广泛用于表示各种计算机视觉任务的图像内容. 一些研究应用更有效的损失函数,包括三元损失[7]、对比损失[8]和分类损失[9]来训练模型. 其他研究则探索如何将整个特征图汇集成一个紧凑的特征向量,同时保持它们的差异,这些方法包括加权和池化(cross-dimensional weighting and sumpooling, CroW)[10]、区域最大池化(maxpooling for each region, R-MAC)[11]和广义平均池化(generalized-mean pooling, GeM)[12]. Shao等[13]提出超级全局特征的提取方法,将全局池化细分为2个步骤,以优化池化方式. 一些方法试图修改训练模型的架构,以在训练过程中捕获更多有用信息. 二阶损失和注意力模型(second-order loss and attention for image retrieval, SOLAR)[14]在传统的CNN骨干网络中添加自注意力模块,将常规训练与二阶信息相结合. Wu等[15-16]提出具有多个分支的CNN模型,以挖掘更多的互补信息并将其融合到最终的特征向量中. 深度令牌池模型(deep token pooling,DToP)[17]将视觉Transformer (vision transformer, ViT)用于图像检索任务,通过高级池化机制对来自Transformer编码器的最后几层令牌嵌入进行处理以生成有效的全局特征.

在引入深度学习之前,局部特征方法主要依赖于手工设计(hand-crafted)的局部描述符,例如,尺度不变特征转换(scale-invariant feature transform, SIFT) [18]和加速鲁棒特征(speeded-up robust features,SURF)[19]. 在深度学习的推动下,从图像中学习局部特征取得了显著进展[20]. 深度局部特征描述符的关键在于其蕴含的空间信息,这些描述符通常用于内核比对聚合,例如,聚合选择匹配核(aggregated selective match kernel,ASMK)[21]可用于相似性度量;深度局部特征模型(deep local features, DELF)使用关键点(通常是图像中独特或显著的位置)来聚焦图像中最具信息量的区域[5];HOW模型在DELF的基础上结合ASMK技术达到了更好的准确度[21];Weinzaepfel等[22]提出结合自注意力机制和HOW模型的Super-features(超级特征)的架构;Tan等[23-24]单独训练匹配模型,以数据驱动的方式直接比较2张图像(或其预提取的局部描述符)的相似性.

全局特征方法忽略局部结构信息,难以分辨具有相同纹理、不同形状的图像内容;局部特征方法能有效利用图像中的局部结构信息,但是局部特征的处理会占用大量的推理时间和内存. 针对上述问题,提出基于自相似嵌入网络和全局特征重排序的图像检索方法. 自相似嵌入网络通过自相似表示模块[25]强化局部特征所包含的信息,提取图像中的结构信息;通过卷积块注意力模块(convolutional block attention module, CBAM)[26]增强重要区域局部特征的权重;将局部特征描述符通过特征融合模块嵌入初始特征描述符中,使得生成的全局特征能够更好地表述图像中的局部区域的空间信息. 全局特征重排序方法能够更新查询图像以及初始检索结果中排名靠前图像的特征描述符;在更新过程中,强调具有相同内容的图像之间的共同信息,减少图像中不相关区域信息的干扰,使具有不同内容的图片的特征描述符之间的差距增大,从而使生成的图像特征具有更强的鲁棒性.

1. 自相似嵌入网络

全局嵌入网络通常结合注意力机制. 给定输入图像,将从骨干网络中提取的初始特征图输入到空间注意力机制或自注意力机制模块中,以获得强调空间局部信息的局部特征图;随后,将局部信息嵌入初始特征图中. 空间注意力机制和自注意力机制均仅考虑到局部特征的权重以及局部特征之间的关联性,忽视了图像中的结构信息以及空间关联信息.

本研究提出自相似嵌入网络,关注如何在不影响全局特征原有视觉信息的同时更好地表征图像中的结构信息,网络结构如图1所示. 给定一幅图像,通过CNN骨干网络获得原始的深度局部特征F0$ {{{{\boldsymbol{F}}}}_0} \in {{\mathbf{R}}^{{{C}} \times {{W}} \times {{H}}}} $),其中骨干网络采用Res101网络;通过CBAM模块得到注意力得分图S${{{\boldsymbol{S}}}} \in {{\mathbf{R}}^{C \times W \times H}}$),计算注意力得分图每个位置x$x \in [1,{H} ] \times [1,{W} ]$)上的C维向量与其在初始特征图中对应位置的邻域向量集的哈达玛积. 所得到的特征图集合称为自相似张量Fs${{{{\boldsymbol{F}}}}_{\mathrm{s}}} \in {{\mathbf{R}}^{{C} \times U \times V \times W \times H}}$). 表达式如下:

图 1

图 1   自相似嵌入网络结构

Fig.1   Self-similar embedded network structure


$ {{{{\boldsymbol{F}}}}_{\mathrm{s}}}\left( {x,p} \right) = {\boldsymbol{S}}\left( x \right) \times {{\boldsymbol{F}}_0}\left( {x+p} \right) .$

式中:${{\boldsymbol{F}}_{\mathrm{s}}}\left( {x,p} \right)$表示生成的向量,$x$对应着向量所在的特征图在自相似张量中的位置,p为在特征图中的相对位置,$p \in [ - {\mathrm{{\mathrm{d}}}}u,{\mathrm{d}}u] \times [ - {\mathrm{d}}v,{\mathrm{d}}v]$, 须满足$2{\mathrm{d}}u+ 1 = U$$2{\mathrm{d}}v+1 = V$(包括中心位置),$U$$V$表示所设定的邻域窗口的尺寸. 特征图的边缘以0填充以用于边缘的采样.

将自相似张量Fs输入自相似张量编码模块,从而使Fs编码成紧凑的自相似特征图Fd${{\boldsymbol{F}}_{{\mathrm{d}}} } \in {{\mathbf{R}}^{{C} \times W \times H}}$). 自相似特征图提取了初始特征图中的结构信息和空间关联信息,但自相似特征不能单独用于进行图像间的匹配,因此,须通过特征融合模块将Fd嵌入到初始特征图中,得到自相似嵌入特征图Fe${{\boldsymbol{F}}_{\mathrm{e}}} \in {{\mathbf{R}}^{{C} \times W \times H}}$). 通过全局池化模块得到包含空间局部信息和空间关联信息的全局特征. 使用ArcFace损失函数训练整个网络. 从而,视觉和结构信息都能较好地反映在全局特征中.

1.1. CBAM模块

CBAM模块结构如图2所示. CBAM模块是生成自相关张量Fs的中间模块,其自适应地学习通道和空间注意力权重,以提高卷积神经网络的特征表达能力. 通过结合通道注意力和空间注意力,CBAM模块能够在不同维度上捕获特征之间的相关性.

图 2

图 2   CBAM模块结构

Fig.2   CBAM module structure


1.1.1. 通道注意力模块

该模块由全局最大池化、全局平均池化、全连接层、sigmoid激活函数和注意力加权组成. 该模块运行过程表达式如下:

$ {{\boldsymbol{F}}_{\mathrm{C}}} = {\sigma \text{ (MLP (Avg (}}{{\boldsymbol{F}}_0}{\text{))}}+{\text{MLP (Max (}}{{\boldsymbol{F}}_0}{\text{)))}} \otimes {{\boldsymbol{F}}_0} . $

式中:${{\boldsymbol{F}}_{\mathrm{C}}}$为通道注意力强化描述符,${\sigma}$为激活函数. MLP由2个线性层以及两者之间的ReLU函数组成,使用全局最大池化和全局平均池化的方法提取通道注意力权重,最大池化在于强调较重要的局部信息,而平均池化则保留全局信息. 全连接层用于学习每个通道的注意力权重,通过学习,网络可以自适应地决定哪些通道对于当前任务更加重要. 将全局最大特征向量和平均特征向量相加,得到最终注意力权重向量,使用Sigmoid激活函数确保注意力权重为[0,1.0],这些权重将应用于原始特征图的每个通道. 将所得到的注意力权重与原始特征图的每个通道相乘,得到注意力加权后的通道特征图. 这种方法强调了对当前任务有帮助的通道,并抑制了无关的通道.

1.1.2. 空间注意力模块

空间注意力模块则从另一个维度出发学习空间注意力权重. 常规CBAM模块通过全局最大池化和全局平均池化方法得到空间得分图,而本研究采用卷积方法将特征图压缩成二维的得分图. 相较于原方法,所提方法在结构上更简单. 通道注意力强化描述符$ {{\boldsymbol{F}}_{{\mathrm{C}}} } $先通过卷积层生成初始的二维空间得分图,然后通过激活函数和归一化操作得到最终的空间得分图,再与$ {{\boldsymbol{F}}_{{\mathrm{C}}} } $相乘得到注意力得分图${\boldsymbol{S}}$,这样能够通过学习得到更好的权重分配方式.

1.2. 自相似张量编码模块

自相似张量编码模块结构如图3所示. 该模块将高维自相似张量Fs编码为紧凑的自相似特征图Fd,同时学习和分析来自查询图像的几何结构信息. 自相似编码器由编码模块组成,该编码模块依次包括3×3卷积、归一化层和ReLU函数. 编码模块中的所有操作都是逐像素的,从而减少了整体计算负载. 在经过3个编码模块之后,每个像素的特征图的空间维度从$ U \times V $减少到1×1. 最后,通过线性层将编码的自相似性描述符的维度恢复为原始特征图${{\boldsymbol{F}}_{{\mathrm{d}}} }$的维度. 至此,自相似张量${{\boldsymbol{F}}_{\mathrm{s}}}$转换为自相似特征图${{\boldsymbol{F}}_{\mathrm{d}}}$.

图 3

图 3   自相似张量编码流程

Fig.3   Process of self-similar tensor coding


1.3. 特征融合模块

特征融合模块结构如图4所示. 自相似特征图${{\boldsymbol{F}}_{\mathrm{d}}}$中的自相似描述符是区域描述符,它揭示了感兴趣区域中的局部几何结构,但也会导致区域中细粒度纹理信息和全局信息的缺失. 因此, ${{\boldsymbol{F}}_{\mathrm{d}}}$有助于图像检索,但不能单独使用. 引入特征融合模块,融合${{\boldsymbol{F}}_{\mathrm{d}}}$${{\boldsymbol{F}}_0}$,从而反映图像的结构特性和视觉特性. 另外,添加归一化层,有助于将自相似性描述符融合到初始特征图中,而不破坏初始特征图的信息. 将求和所得的特征映射输入到2个卷积层和它们之间的ReLU函数中,表达式如下:

图 4

图 4   特征融合模块结构

Fig.4   Feature fusion module structure


$ {{\boldsymbol{F}}_{\mathrm{e}}} = {\text{Conv }}\left( {{\text{max } }\left( {0,{\text{Conv }}\left( {{{\boldsymbol{F}}_{\mathrm{e}}}+{ \text{BN}}\left( {{{\boldsymbol{F}}_0}} \right)} \right)} \right)} \right) .$

式中:${{\boldsymbol{F}}_{\mathrm{e}}}$为特征融合所得的嵌入特征图,Conv为卷积操作. 在这个模块中,所有像素位置都被单独处理,以减少整体计算负载. 该嵌入特征图${{\boldsymbol{F}}_{\mathrm{e}}}.$最终通过GeM池化聚合成全局特征${\boldsymbol{f}}$.

1.4. 损失函数

采用分类损失函数中的ArcFace[9]损失函数训练整个网络,表达式如下:

$ L = - {\text{log }}\left( {\frac{{{\text{exp}}\left( {{\gamma} \times {\text{AF}}\left( {{\boldsymbol{w}}_t^{\mathrm{T}}{{\boldsymbol{f}}_{{\mathrm{g}}} },1} \right)} \right)}}{{\mathop \sum \nolimits_n {\text{exp}}\left( {{\gamma} \times {\text{AF}}\left( {{\boldsymbol{w}}_n^{\mathrm{T}}{\boldsymbol{f}}_{\mathrm{g}},{y_n}} \right)} \right)}}} \right) .$

式中:${{\boldsymbol{w}}_i}$表示$ {\boldsymbol{w}} $的第i行;${{\boldsymbol{f}}_{{\mathrm{g}}} }$为全局特征${\boldsymbol{f}}$的L2归一化版本;${\boldsymbol{ y}} $为one-hot标签向量,yn为第n张图的独特编码,当第n张图像与查询图像为同一种类图像时,yn=1,否则为0;t为实际类索引,${y_t} = 1$${\gamma}$为比例因子;AF为ArcFace-adjusted余弦相似度. AF表达式如下:

$ {\mathrm{AF}}\left(s,c\right)=\left\{\begin{array}{ll}\text{cos }\left(\text{arccos }s+m\right)\text{ },&c=1 ;\\s\text{}\text{ },&c=0 .\end{array}\right. $

式中:$ s $为余弦相似度,$ m $为ArcFace边距,$ c = 1 $表示图像对应真实标签的情况,c=0表示图像对应错误标签的情况 .

2. 基于全局特征的重排序

鲁棒的图像表示是保证图像检索准确性的关键. 将相似图像的表示与原始图像的表示组合成新的扩展表示,然后作为查询重新发布,可优化全局特征,提高模型召回率[27-28]. 例如,查询扩展(query expansion, QE)[27]用扩展版本替换查询图像的原始表示,可以在数据库中更有效地检索到图像. 数据库侧增强(database augmentation,DBA)[29]是将QE应用于数据库中每张图像的方法. 其关键思想是,视觉上相似的图像很可能是相同对象的不同表现形式,如同一个建筑在不同光照和角度下的表示. 这些图像的特征细化提高了图像表示的鲁棒性,同时强调了感兴趣对象的关键特征,进一步改进了图像表示. 尽管QE和DBA方法性能优异,但成本较高:QE须对整个数据库发出新的查询;DBA须将所有数据库图像表示相互比较,这在大规模数据集中是不可行的.

特征细化的关键在于抑制假阳性样本的噪声干扰并增强共同特征表达. 为此,本研究提出重排序方法,具体的重排序方法框架图如图5所示.

图 5

图 5   全局特征重排序流程

Fig.5   Process of global feature reranking


数据库端图像作为被查询图像,特征向量更新的核心在于突出相似图像间的标志性共性特征,因此更新过程须强化这些图像的共同信息. 为此,提出加权池化方法,采用增强α权重的方法,即将相似度分数的α次幂作为权重. 在对特征进行加权后,采用平均池化的方法. 特征向量更新过程表达式如下:

$ {{\boldsymbol{V}}_{\mathrm{r}}} = {{\displaystyle\sum_{i=1}^{n_{\mathrm{d}}}} {\text{score}}_{{{\mathrm{d}}} i}^\alpha {{\boldsymbol{V}}_i}}\Bigg/{{ \displaystyle\sum_{i=1}^{n_{\mathrm{d}}}} {\text{score}}_{{{\mathrm{d}}} i}^\alpha } .$

式中:$ {{\boldsymbol{V}}_{\mathrm{r}}} $为更新后的特征向量,${\text{score}}_{{\text{d}}i}^{}$${\boldsymbol{V}}_{\mathrm{d}}^{\mathrm{T}}$${{\boldsymbol{V}}_i}$的之间的相似度分数,表达式为${\boldsymbol{V}}_{\mathrm{d}}^{\mathrm{T}}{{\boldsymbol{V}}_i}$${\boldsymbol{V}}_{\mathrm{d}}^{\mathrm{T}}$为原数据库图像特征,${{\boldsymbol{V}}_i}$为相似度排名为i的图像特征;nd为参与更新每个数据库特征所用图像特征的数量. 以相似度分数的α次方作为权重可以减轻假阳例带来的影响,使得更相似的图像具有更高的权重,除此之外不对原始特征提供额外的权重,这一过程可以突出共同信息,有利于增加具有不同种类信息的图像间的类间差距.

对于查询侧图像,所选择的图像所处的条件通常是随机的,图像中所包含的信息都是不可忽视的,因此不仅要突出共同信息,也要保证查询图像中的其他信息不被遗漏,为初始特征提供额外的权重,其表达式如下:

$ {\boldsymbol{V}}_{{\mathrm{q}}} ^{\mathrm{T}}{\text{score}}_{{{\mathrm{q}}} i}^\alpha {{\boldsymbol{V}}_{\mathrm{r}}} = {{\boldsymbol{V}}_{{\mathrm{q}}} }+ {{{\displaystyle\sum _{i=1}^{ n_{\mathrm{q}}}} {\text{score}}_{{{\mathrm{q}}} i}^\alpha \times {{\boldsymbol{V}}_i}}}\Bigg/{{\displaystyle\sum_{i=1}^{ n_{\mathrm{q}}}} {\text{score}}_{{{\mathrm{q}}} i}^\alpha } . $

式中:$\text{score}_{{{\mathrm{q}}} i} $${\boldsymbol{V}}_{{\mathrm{q}}} ^{\mathrm{T}}$${{\boldsymbol{V}}_i}$之间的相似度分数,其表达式为$ {\boldsymbol{V}}_{{\mathrm{q}}} ^{\mathrm{T}}{{\boldsymbol{V}}_i} $,其中${\boldsymbol{V}}_{{\mathrm{q}}} ^{\mathrm{T}}$为查询图像特征向量,${{\boldsymbol{V}}_i}$为相似度排名为i的图像特征; nq为查询图像所用到的图像特征的数量. 相较于数据库端,查询端唯一的不同在于为初始特征提供额外的权重加成,这一权重加成的作用是在突出类内共同信息的同时不遗漏本身的信息.

通过上述重排序方法,用同种图像的加权向量和取代初始图像,强调了感兴趣对象的关键特征,进一步改进了图像表示. 强调同种图像的共同特征,随着共同特征的强化,局部结构信息在决策中将有更高的权重占比,充分发挥了自相似嵌入网络提取的局部结构信息的作用,同时也降低了图像中不重要信息带来的干扰,从而大大增强了模型的鲁棒性.

3. 实 验

3.1. 训练细节

本模型使用Pytorch深度学习框架实现. 使用GLDv2-clean数据集作为训练数据集,从随机调整大小的图像中截取362×362像素的子图像. 使用32的批量大小在单张NVIDIA TitanX 24G GPU上训练模型,共训练20个epoch. 在训练中使用初始学习率为1×10−2、学习率衰减系数为1×10−4、动量为0.9的SGD优化器. 采用线性衰减调度器,当达到所需的迭代次数时,逐渐衰减学习率至0. 设置全局特征的尺寸d=1 024. 对于ArcFace边缘损失,根据经验设置边缘m=0.2,尺度r=32.0. CBAM模块中的最大池化层由AdaptiveMaxPool2d函数实现,设定outsize=1. 使用kernel_size=1的卷积层替代CBAM中的线性层,设定第1个线性层输入通道数为1024,输出通道数为64,第2个线性层输入通道数为64,输出通道数为1 024.

3.2. 数据集

3.2.1. 训练数据集

使用图像检索领域经典数据集GLDv2-clean[30]来进行训练,GLDv2数据集包含超过500万张来自世界各地摄影师收集的图像,包含20多万个不同的地标,GLDv2-clean为GLDv2的子集,包含150万张图像,包含81 313个类. 每张图片都注释了其对应的地标信息.

3.2.2. 测试数据集

采用ROxford5K数据集和RParis6K数据集[31]来测试本研究方法的性能. 最初的Oxford和Paris数据集[32]分别由5 063、6 392张高分辨率图像组成,每个数据集均包含55个查询,每个地标包含5个查询,来自总共11个地标. 相较于以往的Oxford5K和Paris6K数据集,ROxford5K、RParis6K进行了重新标注,修复了以往的标签问题,将查询图像的数量从55张增加到70张,并且提出Easy/Medium/Hard共3种类型的评估方式. R1M数据集[31]包括1 001 001 张地标图像,通过引入R1M数据集来模拟大规模数据集图像检索.

3.3. 评估指标

所采用的评估指标为mAP,mAP是较为通用的用于评估图像检索算法准确性的指标. AP为不同召回率上的正确率的平均值,表达式如下:

$ {{\mathrm{AP}}} = \mathop \sum \limits_{x \in {X} } {i} / {x} .$

式中:${X} $为数据集中和查询图像相关的全部图像的集合,$x$为图像在数据集中的排名,$i$为图像在${X} $中的排名. mAP 则是全部查询图像 AP 的平均值,表达式如下:

$ {{\mathrm{mAP}}} = \frac{1}{q}\sum\limits_{i \in {Q} } {{\text{A}}{{\text{P}}_i}} .$

式中:q为查询图像的数量,Q为全部查询图像的集合.

3.4. 性能评估

表1所示展示了本研究方法和其他图像检索方法的对比,后续表中ROxf和RPar分别为ROxford5K数据集和RParis6K数据集的缩写. 将现有图像检索方法分为3组:(a)全局特征检索;(b)局部特征聚合后进行重排序;(c)全局特征检索后进行局部特征重排序,并选取各阶段最优秀的图像检索方法进行比较.

表 1   RParis6K数据集和ROxford5K数据集上各个方法的评估结果

Tab.1  Evaluation results of various methods on RParis6K and ROxford5K datasets

类别方法mAP/%
Medium(ROxf)Medium(RPar)Hard(ROxf)Hard(RPar)
全局特征
R-MAC[11]75.1485.2853.7771.28
GeM-AP[12]67.5080.1042.8060.60
SOLAR[14]79.6588.6359.9975.26
DELG[33]76.4086.7455.9272.60
DOLG[16]80.5089.8158.8277.70
GLAM[34]78.6088.5060.2076.80
Swin-S-DALG[35]79.9490.0457.5579.06
SpCa[36]81.5588.6061.6976.21
SENet[37]81.9090.0063.0078.10
局部特征聚合+重排序
HesAff-rSIFT-ASMK+SP[38]60.6061.4036.7035.50
DELF-ASMK+SP[5]67.8076.9043.1055.40
DELF-R-ASMK+SP[39]76.0080.2052.4058.60
HOW-ASMK[21]79.4081.6056.9062.40
Fire[22]81.8085.3061.2070.00
全局特征+局部特征重排序GeM+DSM[40]65.3077.4039.2056.20
DELG+SP[33]81.2087.2064.0072.80
全局特征本研究方法(未重排序)77.2187.7960.8575.17
全局特征+全局特征再重排序本研究方法82.1190.3866.8580.24

新窗口打开| 下载CSV


3.4.1. 全局特征

在全局特征方法中,Swin-S-DALG在RParis6K数据集上具有最好的性能,而SENet方法在ROxford5K数据集上具有最好的性能. 本研究方法优于这2种方法,相较于Swin-S-DALG方法在RParis6K数据集上的表现,本研究方法在Medium难度上提升了0.34个百分点,在Hard难度上提升了1.18个百分点. 相较于SENet方法在ROxford5K数据集上的表现,本研究方法在Medium难度上提升了0.21个百分点,在Hard难度上提升了3.85个百分点. 可以看出,本研究方法在Hard难度上有着更为明显的提升,说明在困难的检索任务中,提取结构信息的本研究方法具有更强的鲁棒性.

3.4.2. 局部特征聚合+重排序

在该分类中,Fire方法具有最好的性能. 本研究模型则在各个方面优于Fire方法. 在Medium难度上分别提升了0.31个百分点和5.08个百分点,在Hard难度上分别提升了5.65个百分点和10.24个百分点. 因为在图像检索中仅依靠局部特征是不够的,局部特征着重于局部的纹理信息,而忽略了图像中的结构信息和空间关联信息. 这也说明了本研究中自相似嵌入模块提取到的结构信息的重要性.

3.4.3. 全局特征+局部特征重排序

在该分类中,DELG+SP方法的效果是最好的. 相较于该方法,本研究方法在Medium难度上分别提升了0.91个百分点和3.18个百分点,在Hard难度上分别提升了2.85个百分点和7.44个百分点. 表明不同于以往的全局特征+局部特征重排序将局部特征和全局特征的作用阶段分隔开来,局部特征嵌入和全局特征重排序的方法将对局部特征和全局特征信息的强化的过程完全融入到了初次排序和重排序2个阶段中. 这种方法能更有效地提取和突出图像中的视觉特征和几何结构.

3.5. 注意力可视化

为了探究所提出的自嵌入模块的学习效果,使用Grad-CAMS可视化自相似嵌入模块模型与纯Res101模型在ResNet最后一层卷积层的注意力分布热力图的差异,如图6所示. 图中,亮色区域代表着更多的注意力分布. 将红色所对应的关键区域截取出来,可看出当查询目标为拱门上方的浮雕时,相较于仅经过Res101模型,具有自相似嵌入模块的模型能够完整关注到浮雕的全部区域,说明不同于Res101模型仅关注到浮雕核心区域的纹理信息,本研究模型在保证细粒度纹理信息的同时更关注到了局部的结构信息. 这也是在分布图中本研究模型受到周边具有相似纹理浮雕的干扰更小的原因,也证明了结构信息在图像检索中的重要性.

图 6

图 6   注意力分布热力图

Fig.6   Heat map of attention distribution


3.6. 结果展示

图7所示展示了采用贝列尔学院和阿什莫林博物馆作为查询的检索结果,其中包括每次查询中重排序前和重排序后的前10个检索结果,绿色边框代表相关图像而红色粗线边框则是假阳例. 可以看出,在初次排序中,即使阿什莫林博物馆样例中的查询图像信息被大幅度遮挡,仍可以达到较好的效果. 但是初次排序仍受到语义上相近的图像的干扰,检索出了少量的假阳例;通过重新排序突出具有相同内容的图像中的共同信息,明显消除了部分假阳例的干扰,大大增强了模型的鲁棒性.

图 7

图 7   本模型检索结果展示

Fig.7   Retrieval results display of proposed model


3.7. 资源占用对比

本研究还对局部特征重排序方法、局部特征聚合方法以及本研究全局特征重排序方法的内存占用情况进行了对比. 如表2所示,分别将RPar加上R1M共 1 006 064 张地标图像和ROxf加上R1M共1 007 393张地标图像作为图像库,以对比各方法占用内存. 图中,M为占用内存. 可以看出,本研究方法占用的内存远远小于局部特征重排序以及局部特征聚合方法的.

表 2   各个重排序方法的内存占用对比

Tab.2  Comparison of memory footprint of each reoranking method

方法M/GB
ROxf+R1MRPar+R1M
DELF-R-ASMK27.6
DELG485.9486.6
DELG(3 scales)437.1437.8
DELF(3 scales)434.2434.8
DELF(7 scales)477.9478.9
本研究方法3.83.8

新窗口打开| 下载CSV


3.8. 消融实验

对本研究方法进行大规模的消融实验,以证明方法的有效性,评估的指标为mAP.

3.8.1. 各个模块的影响

单独使用特征融合模块或者自相似张量编码模块是不合理的,因此将两者绑定作为消融实验的变量. 使用R101-ArcFace作为基准,并逐步添加特征融合模块加自相似张量编码模块、自相似计算模块和CBAM模块,消融实验结果如表3所示. 表中,S为参数量. 可以看出,在加入自相似编码和特征融合模块之后,模型的性能得到了明显的提升,但同时参数量也大大提升了,此时相当于仅多进行了几层卷积操作. 在加入自相似计算模块之后,各个局部特征有其中心作为权重加持,准确度明显提高. 这个过程是合理的,在检索过程中,往往会在纹路复杂区域有较高的权重,仅进行卷积操作而不进行权重加持会导致模型更多地关注图像中的结构信息,从而忽视了细粒度上的纹理信息. 在加入CBAM模块之后,准确度进一步提升,参数量有轻微的提升. 这表明经过空间注意力机制和通道注意力机制后的得分图相较于直接用特征图谱作为得分图更能突出重要部分的局部信息. 综上,这4个模块均对模型性能的提升起到了正向作用,且除了自相似张量编码模块,其他模块的参数量较小,它们的组合使得本研究所提出的自相似嵌入网络得到最好的效果.

表 3   模型中重要模块消融实验分析

Tab.3  Ablation study analysis of key modules in proposed model

CBAM自相似计算特征融合+自相似张量编码mAP/%S/106
Medium(ROxf)Medium(RPar)Hard(ROxf)Hard(RPar)
77.2187.7960.8575.17165.11
76.1887.3658.4374.49164.96
76.8686.5957.2072.50164.96
74.2084.9051.6070.30119.94

新窗口打开| 下载CSV


3.8.2. 重排序参数的影响

表4所示为数据库端参与更新的图片数量n1对重排序算法性能的影响. 可以看出,当$n_1$=5时,网络具有最好的检索性能.

表 4   数据库端图片数量对重排序的影响

Tab.4  Effect of number of images on reordering on database side

$n_1$mAP/%
Medium
(ROxf)
Medium
(RPar)
Hard
(ROxf)
Hard
(RPar)
280.8489.7065.5478.82
381.1989.9765.3179.42
481.5590.1166.3379.75
581.7390.2466.6880.11
681.2790.3266.3480.31
780.5590.3664.2780.41

新窗口打开| 下载CSV


表5所示为数据库端权重因子${\alpha}_1$对重排序算法性能的影响. 可以看出,当${\alpha}_1$=4时,网络具有最好的检索性能.

表 5   数据库端权重因子对重排序的影响

Tab.5  Impact of database-side weighting factors on reordering

${\alpha}_1$mAP/%
Medium
(ROxf)
Medium
(RPar)
Hard
(ROxf)
Hard
(RPar)
180.5790.1163.8679.70
281.1590.1965.9879.92
381.7390.2466.6880.11
481.7190.2466.8180.15
581.6590.2166.7280.01
681.4990.1566.4779.97
781.4290.0666.2479.75

新窗口打开| 下载CSV


表6所示为查询端参与更新的图片数量n2对重排序算法性能的影响. 可以看出,当$n_2 < 4$时,在2个数据集上的检索性能都稳定提升;在$n_2 > 4$后,在ROxf上的性能持续下降,在RPar上的性能还在持续提升,这是由于2个数据集中图像的侧重点不同. 权衡2个数据集上的性能,当$n_2$=4时,检索性能整体上达到最好.

表 6   查询端图片数量对重排序的影响

Tab.6  Effect of query-side image numbers on reordering

$n_2$mAP/%
Medium
(ROxf)
Medium
(RPar)
Hard
(ROxf)
Hard
(RPar)
181.4689.6965.4279.24
280.4889.7165.6179.33
381.6389.9966.3779.73
482.0290.2166.9980.07
581.7390.2466.6880.11
681.4490.2166.4780.14
781.0490.2966.3880.28

新窗口打开| 下载CSV


表7所示为查询库端权重因子$\alpha_2$对重排序算法性能的影响. 由于在查询端对初始查询图像增加了额外权重,权重因子${\alpha}_2$带来的影响较小,但仍可以看出,当${\alpha}_2$=4时,检索性能整体上最好.

表 7   查询端权重因子对重排序的影响

Tab.7  Impact of query-side weighting factors on reordering

${\alpha}_2$mAP/%
Medium
(ROxf)
Medium
(RPar)
Hard
(ROxf)
Hard
(RPar)
182.1790.3466.8580.21
282.1490.2866.9680.15
382.0290.2166.9980.07
482.2190.3866.8580.24
582.0890.3966.7580.24
681.3490.3964.4080.22
781.2290.3964.2680.20

新窗口打开| 下载CSV


3.8.3. 邻域窗口尺寸的影响

邻域窗口的尺寸由参数$U$$V$决定. 在执行不同的检索任务时,考虑到检索目标在特征上的水平和垂直分布可能存在差异,应当相应地调整参数UV以达到最佳效果. 在本研究中,检索目标为地标图像,其特征分布均匀,所以设置$U$=$V$.表8所示为邻域窗口尺寸带来的影响. 可以看出,参数量随着窗口的增大而增大,而在$U$=$V$=7时,模型的准确率整体取得最好的效果.

表 8   邻域窗口尺寸对重排序的影响

Tab.8  Effect of neighborhood window size on reordering

U (V)mAP/%S/106
Medium
(ROxf)
Medium
(RPar)
Hard
(ROxf)
Hard
(RPar)
577.0885.9658.6573.47155.96
777.2187.7960.8575.17165.11
976.9688.0258.1375.35173.96

新窗口打开| 下载CSV


4. 结 语

现阶段图像检索工作中仍存在局部特征缺少结构信息以及局部特征重排序消耗大量资源的问题. 对于结构信息的提取,采用自相似嵌入网络,通过引入自相似机制提取图像中的结构信息,并通过引入CBAM模块增强对重要区域信息的关注. 采用特征融合模块将包含结构信息的局部特征嵌入全局特征,以获取兼具视觉特征和几何结构信息的全局特征. 针对资源占用问题,采用全局特征重排序的方法,通过强化具有相同类别信息图像中的共同特征来提高召回率,在保证性能的同时大大减少资源的占用. 随着人们对技术的要求提升,大规模实例检索任务在图像检索任务中的重要性也将日益提升. 本研究的图像检索方法具有优异的检索性能且占用少量资源,更能满足该任务需求.

当前方法达到高准确率的前提在于大量高质量的标签数据集,未来考虑在学习过程中使用更少的标签. 另外, 在未来的实例检索中将会更多地关注自监督学习、不平衡学习、噪声标签感知学习等.

参考文献

ARANDJELOVIC R, GRONAT P, TORII A, et al. NetVLAD: CNN architecture for weakly supervised place recognition [C]// IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 5297–5307.

[本文引用: 1]

YANDEX A B, LEMPITSKY V. Aggregating local deep features for image retrieval [C]// IEEE International Conference on Computer Vision. Santiago: IEEE, 2015: 1269–1277.

BABENKO A, SLESAREV A, CHIGORIN A, et al. Neural codes for image retrieval [C]// European Conference on Computer Vision. Zurich: Springer Nature Publishing, 2014: 584−599.

[本文引用: 1]

HE K, LU Y, SCLAROFF S. Local descriptors optimized for average precision [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018: 596–605.

[本文引用: 1]

NOH H, ARAUJO A, SIM J, et al. Large-scale image retrieval with attentive deep local features [C]// IEEE International Conference on Computer Vision. Venice: IEEE, 2017: 3476–3485.

[本文引用: 2]

REVAUD J, DE SOUZA C, HUMENBERGER M, et al

R2d2: reliable and repeatable detector and descriptor

[J]. Advances in Neural Information Processing Systems, 2019, 32: 12405- 12415

[本文引用: 1]

SCHROFF F, KALENICHENKO D, PHILBIN J. FaceNet: a unified embedding for face recognition and clustering [C]// IEEE Conference on Computer Vision and Pattern Recognition. Boston: IEEE, 2015: 815–823.

[本文引用: 1]

HU J, LU J, TAN Y P. Discriminative deep metric learning for face verification in the wild [C]// IEEE Conference on Computer Vision and Pattern Recognition. Columbus: IEEE, 2014: 1875–1882.

[本文引用: 1]

DENG J, GUO J, XUE N, et al. ArcFace: additive angular margin loss for deep face recognition [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2019: 4690–4699.

[本文引用: 2]

KALANTIDIS Y, MELLINA C, OSINDERO S. Cross-dimensional weighting for aggregated deep convolutional features [C]// European Conference on Computer Vision. Amsterdam: Springer International Publishing, 2016: 685–701.

[本文引用: 1]

TOLIAS G, SICRE R, JÉGOU H. Particular object retrieval with integral max-pooling of CNN activations [EB/OL]. (2016−02−24)[2023−10−13]. https://arxiv.org/abs/1511.05879.

[本文引用: 2]

RADENOVIĆ F, TOLIAS G, CHUM O

Fine-tuning CNN image retrieval with No human annotation

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2019, 41 (7): 1655- 1668

DOI:10.1109/TPAMI.2018.2846566      [本文引用: 2]

SHAO S, CHEN K, KARPUR A, et al. Global features are all you need for image retrieval and reranking [C]// IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2023: 11002–11012.

[本文引用: 1]

NG T, BALNTAS V, TIAN Y, et al. SOLAR: second-order loss and attention for image retrieval [C]// European Conference on Computer Vision. Glasgow: Springer International Publishing, 2020: 253−270.

[本文引用: 2]

WU H, WANG M, ZHOU W, et al. Learning token-based representation for image retrieval [C]// AAAI Conference on Artificial Intelligence. Vancouver: AAAI, 2022, 36(3): 2703−2711.

[本文引用: 1]

YANG M, HE D, FAN M, et al. DOLG: single-stage image retrieval with deep orthogonal fusion of local and global features [C]// IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 11752–11761.

[本文引用: 2]

SONG C H, YOON J, CHOI S, et al. Boosting vision transformers for image retrieval [C]// IEEE/CVF Winter Conference on Applications of Computer Vision. Waikoloa: IEEE, 2023: 107–117.

[本文引用: 1]

LOWE D G

Distinctive image features from scale-invariant keypoints

[J]. International Journal of Computer Vision, 2004, 60 (2): 91- 110

DOI:10.1023/B:VISI.0000029664.99615.94      [本文引用: 1]

BAY H, ESS A, TUYTELAARS T, et al

Speeded-up robust features (SURF)

[J]. Computer Vision and Image Understanding, 2008, 110 (3): 346- 359

DOI:10.1016/j.cviu.2007.09.014      [本文引用: 1]

DUSMANU M, ROCCO I, PAJDLA T, et al. D2-net: a trainable cnn for joint detection and description of local features [EB/OL]. (2019−05−09)[2023−11−28]. https://arxiv.org/abs/1905.03561.

[本文引用: 1]

TOLIAS G, JENICEK T, CHUM O. Learning and aggregating deep local descriptors for instance-level recognition [C]// European Conference on Computer Vision. Glasgow: Springer International Publishing, 2020: 460−477.

[本文引用: 3]

WEINZAEPFEL P, LUCAS T, LARLUS D, et al. Learning super-features for image retrieval [EB/OL]. (2022−01−31)[2023−12−17]. https://arxiv.org/abs/2201.13182.

[本文引用: 2]

TAN F, YUAN J, ORDONEZ V. Instance-level image retrieval using reranking transformers [C]// IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 12085–12095.

[本文引用: 1]

LEE S, SEONG H, LEE S, et al. Correlation verification for image retrieval [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 5364–5374.

[本文引用: 1]

KANG D, KWON H, MIN J, et al. Relational embedding for few-shot classification [C]// IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 8802–8813.

[本文引用: 1]

WOO S, PARK J, LEE J Y, et al. CBAM: Convolutional block attention module [C]// European Conference on Computer Vision. Munich: Springer International Publishing, 2018: 3−19.

[本文引用: 1]

GORDO A, RADENOVIC F, BERG T. Attention-based query expansion learning [C]// European Conference on Computer Vision. Cham: Springer International Publishing, 2020: 172−188.

[本文引用: 2]

ARANDJELOVIĆ R, ZISSERMAN A. Three things everyone should know to improve object retrieval [C]// IEEE Conference on Computer Vision and Pattern Recognition. Providence: IEEE, 2012: 2911–2918.

[本文引用: 1]

GORDO A, ALMAZÁN J, REVAUD J, et al

End-to-end learning of deep visual representations for image retrieval

[J]. International Journal of Computer Vision, 2017, 124 (2): 237- 254

DOI:10.1007/s11263-017-1016-8      [本文引用: 1]

WEYAND T, ARAUJO A, CAO B, et al. Google landmarks dataset v2–A large-scale benchmark for instance-level recognition and retrieval [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 2575–2584.

[本文引用: 1]

RADENOVIC F, ISCEN A, TOLIAS G, et al. Revisiting Oxford and paris: large-scale image retrieval benchmarking [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018: 5706–5715.

[本文引用: 2]

PHILBIN J, CHUM O, ISARD M, et al. Object retrieval with large vocabularies and fast spatial matching [C]// IEEE Conference on Computer Vision and Pattern Recognition. Minneapolis: IEEE, 2007: 1–8.

[本文引用: 1]

CAO B, ARAUJO A, SIM J. Unifying deep local and global features for image search [C]// European Conference on Computer Vision. Glasgow: Springer International Publishing, 2020: 726−743.

[本文引用: 2]

SONG C H, HAN H J, AVRITHIS Y. All the attention you need: global-local, spatial-channel attention for image retrieval [C]// IEEE/CVF Winter Conference on Applications of Computer Vision. Waikoloa: IEEE, 2022: 439–448.

[本文引用: 1]

SONG Y, ZHU R, YANG M, et al. Dalg: Deep attentive local and global modeling for image retrieval [EB/OL]. (2022−07−01)[2024−03−11]. https://arxiv.org/abs/2207.00287.

[本文引用: 1]

ZHANG Z, WANG L, ZHOU L, et al. Learning spatial-context-aware global visual feature representation for instance image retrieval [C]// IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2023: 11216–11225.

[本文引用: 1]

LEE S, LEE S, SEONG H, et al. Revisiting self-similarity: structural embedding for image retrieval [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 23412–23421.

[本文引用: 1]

TOLIAS G, AVRITHIS Y, JÉGOU H

Image search with selective match kernels: aggregation across single and multiple images

[J]. International Journal of Computer Vision, 2016, 116 (3): 247- 261

DOI:10.1007/s11263-015-0810-4      [本文引用: 1]

TEICHMANN M, ARAUJO A, ZHU M, et al. Detect-to-retrieve: efficient regional aggregation for image search [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2019: 5109–5118.

[本文引用: 1]

SIMÉONI O, AVRITHIS Y, CHUM O. Local features and visual words emerge in activations [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2019: 11651–11660.

[本文引用: 1]

/