浙江大学学报(工学版), 2026, 60(9): 1872-1880 doi: 10.3785/j.issn.1008-973X.2026.09.004

机械工程

基于注意力增强的跨模态多层融合网络的物体位姿估计

杨恒,, 王韶涵, 董青, 赵科渊, 杨明亮

太原科技大学 机械工程学院,山西 太原 030024

Object pose estimation based on attention enhancement cross-modal multilayer fusion network

YANG Heng,, WANG Shaohan, DONG Qing, ZHAO Keyuan, YANG Mingliang

School of Mechanical Engineering, Taiyuan University of Science and Technology, Taiyuan 030024, China

收稿日期: 2025-07-17  

基金资助: 国家自然科学基金资助项目(52105269);省部级科技计划资助项目(202402150101006).

Received: 2025-07-17  

Fund supported: 国家自然科学基金资助项目(52105269);省部级科技计划资助项目(202402150101006).

作者简介 About authors

杨恒(1982—),男,副教授,从事智能机械装备关键技术的研究.orcid.org/0009-0004-1920-8677.E-mail:93328173@qq.com , E-mail:93328173@qq.com

摘要

提出鲁棒的端到端6D位姿估计网络. 利用层次化特征融合机制,使得RGB-D数据有效融合. 网络通过注意力增强模块提取像素级特征,通过多尺度网络对融合后的像素级多模态特征进行处理,得到多尺度多模态特征. 将多模态特征分别送至后续模块中,得到对应的全局特征. 将多模态特征与全局特征进行拼接,形成包含全局信息的多尺度密集判别特征. 根据多尺度密集判别特征得到最终位姿,实现精确的6D位姿估计. 在LineMOD和YCB-Video数据集上开展多项实验,所提方法的表现出色,特别是在处理YCB-Video数据集中具有挑战性的光滑和无纹理物体时表现突出. 在LineMOD数据集上,所提方法的精度优于现有的代表性方法DenseFusion,处理速度显著提升.

关键词: 6D位姿 ; 深度学习 ; 神经网络 ; 跨模态融合 ; 注意力机制

Abstract

A robust end-to-end 6D pose estimation network was proposed. A hierarchical feature fusion mechanism was used to effectively integrate RGB-D data. The pixel-level feature was extracted via an attention enhancement module. Then a multi-scale network was employed to process the fused pixel-level multimodal feature, yielding multi-scale multimodal features. The multimodal features were subsequently fed into subsequent modules to obtain corresponding global features. The global features were concatenated with the multimodal features to form multi-scale dense discriminative features that encode global information. The final pose was derived from multi-scale dense discriminative features, enabling accurate 6D pose estimation. Extensive experiments on the LineMOD and YCB-Video datasets demonstrate that the proposed method achieves superior performance, particularly in handling challenging smooth and textureless objects in the YCB-Video dataset. The method outperforms the representative approach DenseFusion in terms of accuracy on the LineMOD dataset, while achieving significantly higher processing speed.

Keywords: 6D pose ; deep learning ; neural network ; cross-modal fusion ; attention mechanism

PDF (1443KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

杨恒, 王韶涵, 董青, 赵科渊, 杨明亮. 基于注意力增强的跨模态多层融合网络的物体位姿估计. 浙江大学学报(工学版)[J], 2026, 60(9): 1872-1880 doi:10.3785/j.issn.1008-973X.2026.09.004

YANG Heng, WANG Shaohan, DONG Qing, ZHAO Keyuan, YANG Mingliang. Object pose estimation based on attention enhancement cross-modal multilayer fusion network. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1872-1880 doi:10.3785/j.issn.1008-973X.2026.09.004

在计算机视觉任务中,位姿估计的目标是建立物体从本体坐标系到相机观测系的空间映射关系. 位姿估计的本质是通过计算物体在三维空间中的旋转变换矩阵与平移变换向量,实现对物体几何状态的确定. 该技术在机器人抓取与操作[1-2]、增强现实[3-4]及自动驾驶[5-6]等领域具有重要的应用价值. 在现实世界中,物体种类繁多,形状各不相同,且受到光照变化、场景杂乱、遮挡等因素的影响,使该任务富有挑战性.

传统方法[7]通常依赖人工设计的特征(如SIFT)在RGB图像与物体3D模型之间建立对应关系,或是针对无纹理物体的轮廓和边缘梯度生成模板集后进行匹配[8],再使用迭代最近点(ICP)算法[9]辅助执行后处理步骤. 该方法虽然在速度上具有优势,但对物体表面纹理的依赖程度高,模板创建繁琐且灵活性与稳定性不足,难以适应复杂的实际场景. 针对上述挑战,高效融合RGB与深度信息来构建具有鲁棒性的特征处理流程成为解决问题、提升性能的关键研究方向.

近年来,随着视觉传感装置(如RGB-D相机[10-11])的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12-13]. 如DenseFusion[13]在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14]提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15],Ma等[16]开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17]利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18]、BB8[19]、SSD-6D[20]和PVNet[21]等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22]求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23]通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间.

针对上述问题,特别是直接融合RGB与深度特征易出现噪声干扰、关键信息被淹没的难点,本文提出基于RGB-D的端到端物体6D位姿估计网络. 引入注意力增强模块(AFE)[24]. 该模块结合空间与通道注意力机制,精准提升RGB与深度特征的质量,抑制噪声干扰,充分挖掘2种模态在位姿估计中的互补潜力,实现有效的像素级融合,并构建高效的特征处理流程. 将经过AFE优化的多模态特征进行整合后输入多层感知机(MLP)中,实现特征的高效利用与6D位姿参数的直接回归,提升了处理效率. RGB-D图像提供的空间深度信息与物体形状特征[25]弥补了RGB在光照、纹理缺失或遮挡情况下的不足[26]. 基于上述核心模块与流程,构建基于RGB-D输入的新型端到端6D物体位姿估计网络.

1. 6D位姿估计研究

基于数据驱动的深度学习能够从数据中自动提取具有鲁棒性的特征,有效应对复杂场景的挑战. 利用深度神经网络的特征编码装置(如ResNet处理RGB图像,PointNet处理点云),能够自动学习融合物体的外观、几何结构及语义信息的多模态特征表达[12-13],该特征的适应能力和区分能力优于人为设计的特征. 通过引入注意力机制,模型能够在特征提取时关注位姿估计的关键区域,有效抑制背景噪声和无关信息干扰,特定的注意力增强模块进一步强化了此能力. 这使得该网络模型在复杂场景(尤其是弱纹理物体和动态环境)下的泛化能力和鲁棒性得到显著增强. 在标准数据集(如LineMOD、YCB-Video)上,先进的深度学习方法在核心评价指标(如ADD(-S))上优于传统方法.

深度学习的发展提高了基于RGB图像位姿估计的精度. PoseNet[27]和PoseCNN直接从RGB图像回归6D位姿. DeepIM[28]预测初始的6D位姿,通过迭代匹配逐步优化. Pix2pose[29]预测图像中物体像素对应的3D坐标. 这类直接回归方法对高纹理物体的估计精度与泛化能力不足,且搜索空间大,导致位姿估计精度受限. 其他方法通过间接回归从RGB图像中估计位姿,例如BB8和SSD-6D通过预测,或PVNet利用Hough投票,获得物体三维关键点的2D投影,利用PnP算法计算6D位姿参数. 这类方法分2步估计位姿,在抗遮挡、处理纹理丰富目标及估计精度方面有所提升,但存在投影误差,影响检测结果,限制了位姿估计的精度.

RGB-D传感装置凭借成熟的技术、高采集精度、小巧的体积及低成本等优势,在三维视觉领域得到广泛的应用. 现有方法根据对RGB与深度信息的处理方式,主要分为3类. 1)直接合并RGB和深度信息来估计6D位姿[30-31],该方式仅是简单地拼接深度和RGB通道. 2)分阶段地使用这2种信息,如PoseCNN和PVNet,先从RGB图像中粗略预测6D物体位姿,再借助深度信息和ICP算法进行细化. 这类方法未考虑RGB-D数据的互补性. 常见的做法是将深度图转换为3D点云后与物体的三维模型进行匹配并依赖ICP算法进行姿态改进,但ICP对初始估计较敏感. 3)通过后期融合颜色与深度信息进行位姿估计,或从融合特征中检测3D关键点结合ICP算法,如DenseFusion和PVN3D[31],然而在特征融合时未有效利用邻近区域信息,导致精度受限.

提出跨模态多层深度融合网络,如图1所示. 该网络的核心是通过注意力增强模块优化特征提取与融合过程. 1)对语义分割网络提取的颜色特征及PointNet++[32]提取的几何特征进行高效异构特征提取,在保留颜色与几何信息的同时,避免直接融合的干扰. 2)通过多模态特征提取框架整合像素级多模态特征,强化特征表达能力,将多模态特征输入多尺度特征提取框架中,提取全局特征. 3)将多模态特征与全局特征融合,输入网络后续结构中,实现精细的6D物体位姿预测. 相较于依赖ICP迭代细化或单一特征融合的传统方法,该框架通过注意力驱动的多尺度特征深度融合机制,显著提升了位姿估计的精度. 后续实验将通过与PoseCNN+ICP和DenseFusion方法的对比,验证优越性.

图 1

图 1   从RGB-D图像中提取像素级特征

Fig.1   Extracting pixel-level feature from RGB-D image


2. 网络框架

DeepFusion6D网络使用RGB-D图像,估计已知物体的6D位姿. 该网络的结构如图2所示,主要分为3个阶段,分别是语义分割、多模态特征提取框架和多尺度特征提取框架. 基于深度图生成目标分割掩码,定位目标并裁剪RGB图像,以消除背景干扰. 将处理后的颜色与深度数据分别输入PoseCNN和PointNet++提取像素级特征,通过注意力增强模块融合几何轮廓与表面纹理信息. 多尺度特征提取框架整合跨尺度特征,在经Conv、ReLU、BatchNorm及AvgPool处理后,由MLP融合全局特征生成多尺度密集判别特征,输出6D位姿估计结果. 该设计显著提升了复杂场景下的姿态估计精度.

图 2

图 2   DeepFusion6D网络的整体结构

Fig.2   Overall structure of DeepFusion6D network


2.1. 语义分割

对RGB和深度信息的语义分割步骤至关重要. 这2种异构数据源属于不同空间且数据结构存在差异,因此分别提取几何与颜色特征,同时保留原始的数据结构. 第一阶段的主要目的是从输入图像中识别并分割出感兴趣的目标区域,为后续的位姿估计工作奠定基础.

该网络采用Xiang 等[18]提供的预训练语义分割结果. 采用这一策略,能够有效隔离前端处理模块带来的影响,保证了结果的一致性. DeepFusion网络的处理速度达到20 帧/s,在不限制系统性能的同时,有效节省了计算资源,保证了语义分割模块的质量与稳定性,从而整体提升了位姿估计的效率.

利用预训练模型,网络能够高效地生成高质量的掩码图像,精准标记出RGB和深度图像中的目标物体位置,为后续的颜色和几何特征提取做好准备.

2.2. 注意力增强模块

在神经网络中,注意力机制常用于聚焦关键特征,对计算机视觉和自然语言处理任务具有重要意义[33-34]. 注意力增强模块(AFE)在该网络中表现出显著优势. 与SENet[33]主要关注的通道维度不同,AFE模块结合通道和空间注意力,且不同于CBAM[34]的顺序处理,AFE模块采用平行和交叉处理,有效提升特征提取的全面性. 这种设计使AFE模块能够更有效地捕捉颜色和深度2种模态的关键特征,提升特征提取的全面性.

AFE模块在多模态特征融合方面表现出色,能够增强与6D位姿估计任务相关的特征,抑制不相关特征. AFE模块对像素级特征关系的精细处理,在精确像素信息需求的6D位姿估计中具有优势. 如图3所示为AFE模块的整体结构,通过AFE模块增强RGB和深度模态的特征后,实现更有效的特征提取和融合,为6D位姿估计提供更稳健的特征基础.

图 3

图 3   AFE的整体结构

Fig.3   Overall structure of AFE


AFE的整体结构如图3所示. 其中,MUL表示逐元素乘法操作;CA表示通道注意力机制;MAX-C表示在空间注意力中沿通道维度取最大值;POOL操作会消除空间维度信息,使模型仅关注通道注意力特征提取.

2.3. 像素级特征提取

特征提取领域的关键技术挑战是从颜色和深度通道中正确提取信息,将两者协同融合. 颜色和深度信息在RGB-D框架中具有相似的结构,但它们的信息实际分布在空间域,因此采用双分支编码器架构,分别处理点云和RGB信息,提取几何和颜色特征.

输入点云$ P = \left\{{\boldsymbol{p}}_{{i}} = {\left[{X}_{i},{Y}_{i},{Z}_{i}\right]}^{{\mathrm{T}}} \in {\bf{R}}^{3}\left| i = 1,2,3,\cdots ,n\right.\right\} $,包含n个点,$ {\boldsymbol{p}}_{{i}} $为输入云中第i个点的三维空间坐标,利用已知的相机内参将分割后的深度像素转换为三维点云而得到. 输入图像是由语义分割掩码的边界框裁剪出的H×W×3 RGB图像.

在第2阶段,将利用不同编码器得到的点云和RGB信息输入注意力模块AFE中,提取像素级的几何和颜色特征. AFE模块通过对颜色特征和点云特征进行融合和增强处理. 经AFE处理后的特征输入卷积层,卷积层对特征进行卷积操作,提取更深层次的特征信息. 卷积层的输出与AFE模块的输出一同输入ResNet模块. ResNet模块利用残差连接结构进一步提取特征的高层次抽象信息,解决深层网络的梯度消失问题. ResNet模块的输出多模态特征(multimodal feature),为后续任务提供融合颜色和点云信息的高质量特征表达. 这种对像素级特征关系的精细处理,使得AFE机制在6D位姿估计任务中具有独特的优势.

2.4. 多尺度密集特征

由于每个像素邻近区域内的信息被像素特征提取所忽略,在第3阶段,从RGB-D图像中提取的融合后的像素级几何特征和颜色特征被馈送到多尺度特征提取框架中,通过整合不同尺度的多模态特征来增强特征表示. 为了获得有效的判别特征,对局部和全局特征进行融合.

具体来说,多模态特征(multimodal feature)经过卷积层(Conv)进行特征变换,提取更深层次的特征表示. 卷积操作能够捕捉特征图中的局部模式,增强特征的判别能力. 特征通过ReLU激活函数,引入非线性因素,使网络能够学习到更复杂的特征关系. BatchNorm层对特征进行归一化处理,提高训练的稳定性和收敛速度,有助于解决内部变量偏移问题. AvgPool层对特征进行平均池化操作,减少特征的空间维度,保留主要的特征信息. 多模态特征1直接指向后续的拼接操作,将原始的多尺度特征与经过Conv、ReLU、BatchNorm和AvgPool处理后的多尺度密集特征进行拼接,融合不同层次的特征信息. 将拼接后的特征输入MLP中,将维度压缩,以减少参数量并防止过拟合. 输出7维向量,前3个维度解析为平移向量,后4个维度解析为一个四元数来表示3×3的旋转矩阵. 得到最终的位姿预测.

多尺度密集判别特征提取的过程分为3个步骤. 1)将在第2阶段提取的有影响的像素级多模态特征作为初步的多模态特征$ {{\boldsymbol{f}}}^{'} $. 将初步多模态特征$ {{\boldsymbol{f}}}^{'} $输入多模态特征提取框架,以提取多模态特征. 使用2种不同的尺度,表示为$ f_{s}^{'}\left| s=1{,}2\right. $. 将提取的每个尺度的多模态特征馈送到由1个ReLU、1个BatchNorm和1个AvgPool组成的多尺度特征提取框架中,获得相应的全局特征. 该全局特征与输入的多模态特征连接,提供全局信息. 得到包含全局信息的多尺度密集判别特征:

$ {\boldsymbol{f}}_{s}^{''}={\boldsymbol{f}}_{s}^{'} \oplus {\mathrm{Avgpool}}\left({{\boldsymbol{W}}}_{s}\otimes {\boldsymbol{f}}_{s}^{'}+{{\boldsymbol{b}}}_{s}\right);\; s=1{,}2. $

式中:$ \oplus $表示特征通道的拼接,$ \otimes $表示卷积运算,$ {{\boldsymbol{W}}}_{s}和{{\boldsymbol{b}}}_{s} $分别为$ {\boldsymbol{f}}_{s}^{'} $的权值和偏置.

图4所示为DeepFusion网络特征提取过程中各模块的输出大小. 为了说明清楚,省略批量大小. 将大小为$ \left[N\times 384\right] $的加权像素特征馈送到由1个1D卷积层、1个ReLu激活函数、1个BatchNorm和1个AvgPool组成的模块中,输出$ \left[N\times 1\;408\right] $的全局特征向量. 特征大小的选择是为了在合理的网络参数大小下保证良好的性能. 当最终特征的大小增加到$ ({N}/{2})\times 384 $时,性能很好. 当尺寸继续增加时,在更大的网络参数尺寸下,性能几乎相同. 将原始的多尺度特征和全局特征连接起来,形成多尺度密集特征,用于6D目标位姿估计.

图 4

图 4   提取的多尺度密集判别特征中每个模块的输出大小

Fig.4   Output size of each module in extracted multi-scale dense discriminative features


2.5. 6D物体位姿估计

6D物体位姿估计的质量标准是物体模型中采样点之间的平均距离,这是由地面真值和预测姿态变换得到的. 其中预测姿态是通过多尺度密集特征的密集回归输出的. 相应地,预测姿态的质量评估公式为

$ L_i^{\mathrm{p}} = \frac{1}{M}\sum\nolimits_j {\left\| {({\boldsymbol{R}}{{\boldsymbol{x}}_j} + {\boldsymbol{t}}) - ({{{{\tilde {\boldsymbol{R}}}}}_{{i}}}{{\boldsymbol{x}}_j} + {{{{\tilde {\boldsymbol{t}}}}}_{{i}}})} \right\|} .$

式中:$ {x}_{j} $为物体模型的第j个点,$\left[\boldsymbol{R}\left| \boldsymbol{t}\right.\right] $为地面真实姿态,$ [ {{\tilde {{\boldsymbol{R}}}}_{{i}}}\left| {\tilde {{\boldsymbol{t}}}}_{{i}}\right.] $为预测姿态,M为物体模型中的点数.

上述标准仅适用于位姿唯一的非对称物体. 由于对称物体可能存在多个等效的旋转位姿,为了避免网络回归到等效位姿时产生误判,针对对称物体时采用新评价指标:

$ L_i^{\mathrm{p}} = \dfrac{1}{M} {\sum}_j \min_{\substack{0 \lt k \lt M}} \left\| ({\boldsymbol{R}} {\boldsymbol{x}}_j + {\boldsymbol{t}}) - (\tilde{{\boldsymbol{R}}}_i {\boldsymbol{x}}_k + \tilde{{\boldsymbol{t}}}_i) \right\|. $

计算物体模型采样点在真实位姿与预测位姿下的最近邻点之间的平均距离. 式(3)也适用于非对称物体.

为了使网络独立筛选出最可能正确的物体预测位姿$ {{{\tilde {\boldsymbol{p}}}}_i} $,在损失函数中进行如下设计:将每个预测位姿$\tilde{\boldsymbol{p}}_{{I,s}} $对应的损失项$ L_{i,s}^{{\mathrm{p}}} $乘以自监督生成的密集像素置信度$ {c}_{i,s} $[28]作为权重. 添加置信度正则化项,促使网络选择$ L_{i,s}^{{\mathrm{p}}} $最小且$ {c}_{i,s} $最高的预测姿态.

$ L=\frac{1}{N_{\mathrm{p}}}{\sum }_{i,s}\left(L_{i,s}^{{\mathrm{p}}}{c}_{i,s}-\omega {\ln }\; {c}_{i,s}\right). $

式中:Np为预测位姿的数量;$ \omega $为置信度正则化项的平衡超参数,当置信度较低时,$ \omega $增大正则化强度. 下标s = 1、2表示图4所示的多模态特征的2个尺度.

3. 实验分析

3.1. 数据集和实验设置

在实验中,使用2个基准数据集(LineMOD[35]和YCB-Video[18])来评估该网络. LineMOD数据集由13个RGB-D序列组成,提供了含6DoF姿态、CAD模型、2D边界框及二进制掩模的注释RGB-D图像,将每个序列的约15%的图像用于训练,其余85%用于测试. 该数据集涵盖杂乱场景、无纹理物体、带噪声的深度数据和多变光照条件,是评估位姿估计方法鲁棒性的理想基准数据集. 如表1所示为不同方法在该数据集上的实验结果.

表 1   linenmod数据集上ADD(-S)分数的定量评估

Tab.1  Quantitative assessment of ADD(-S) score on linenmod dataset

方法输入数据ADD(-S)分数/%
ApeBenCameraCanCatDrillerDuckEggboxGlueHoleIronLampPhone平均值
BB8[19]RGB40.291.755.863.762.973.744.358.141.067.284.776.954.062.3
PVNet[21]43.699.986.995.579.396.452.699.295.781.998.999.392.486.3
DeepIM[28]77.297.893.796.882.095.077.897.199.352.898.398.087.989.0
TexPose[36]80.999.094.899.792.697.483.494.993.479.399.898.378.991.7
SSD-6D+ICP[20]RGB-D65.080.078.086.070.073.066.010010049.078.073.079.076.7
CFFM+CWTM[23]88.291.593.493.894.491.689.497.399.189.395.794.293.793.2
Per-pixel Densefusion[13]79.884.176.786.888.977.876.210099.079.092.192.088.086.1
Iterative-Densefusion[13]92.193.294.393.196.587.092.010010092.197.095.192.894.3
本文方法(仅使用多尺度模块)93.889.690.590.291.190.389.510010084.793.191.589.089.4
本文方法(仅使用注意力增强模块)89.390.189.789.290.289.888.710098.489.390.289.790.089.0
本文方法95.493.195.993.295.094.290.310010092.296.595.194.895.2

新窗口打开| 下载CSV


YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2所示.

表 2   YCB-Video数据集上ADD(-S)分数和ADD(-S) AUC的定量评估

Tab.2  Quantitative evaluation of ADD(-S) score and ADD(-S) AUC on YCB-Video dataset

方法ADD(-S)分数/%
master-
chef-
can
cracker-
box
sugar-
box
tomato-
soup-
can
mustard-
bottle
tuna-
fish-
can
pudding-
box
gelatin-
box
potted-
meat-
can
Bananapitcher-
base
bleach-
cleaner
BowlMugpower-
drill
wood-
block
Scissorlarge-
marker
large-
clamp
extra-
large-
clamp
foam-
brick
平均值
PointFusion[12]99.862.295.496.984.099.896.710088.570.579.865.024.199.822.818.235.980.450.020.110074.1
PVN3D[31]10091.610096.910010010010093.699.710099.454.999.899.680.295.699.774.948.810093.2
DenseFusion[13]10099.510096.910010010010091.310010010098.810098.794.610010079.276.310096.8
CFFM+CWTM[23]10095.310095.710099.093.910090.893.410097.853.298.297.481.394.796.768.362.599.693.5
FoundationPose[14]99.198.799.398.999.599.098.899.498.599.298.698.398.098.798.497.597.198.296.996.599.199.0
本文方法
(仅使用多
尺度模块)
98.593.198.089.194.397.393.999.992.495.197.493.692.194.194.693.291.096.288.183.299.494.3
本文方法
(仅使用注意
力增强模块)
99.194.998.790.695.797.894.710093.796.398.195.193.595.395.894.792.597.590.385.899.795.2
本文方法10097.599.093.597.598.596.510096.097.598.097.099.297.096.598.096.598.085.082.010097.1
方法AUC/%
master-
chef-
can
cracker-
box
sugar-
box
tomato-
soup-
can
mustard-
bottle
tuna-
fish-
can
pudding-
box
gelatin-
box
potted-
meat-
can
Bananapitcher-
base
bleach-
cleaner
BowlMugpower-
drill
wood-
block
Scissorlarge-
marker
large-
clamp
extra-
large-
clamp
foam-
brick
平均值
PointFusion[12]90.980.590.491.988.593.887.595.086.484.785.581.075.794.271.568.176.787.965.960.491.883.9
PVN3D[31]95.892.798.294.598.697.197.998.892.797.197.896.981.095.098.287.691.797.275.264.497.293.0
DenseFusion[13]96.495.597.594.697.296.696.598.191.396.697.195.888.297.196.089.795.297.572.969.892.593.1
CFFM+CWTM[23]94.392.298.793.997.194.893.399.191.691.195.286.583.890.594.884.392.888.673.262.393.390.5
FoundationPose[14]96.594.296.895.097.496.194.597.093.896.394.092.591.894.393.189.588.292.087.585.495.993.2
本文方法
(仅使用多
尺度模块)
93.984.393.780.990.891.389.297.885.987.993.689.479.589.187.285.478.789.373.568.794.088.5
本文方法
(仅使用注意
力增强模块)
94.786.794.482.792.092.790.398.388.289.794.891.082.790.688.987.782.391.075.271.595.589.7
本文方法96.998.698.695.096.594.593.199.090.391.895.593.488.392.590.510085.598.482.580.597.093.7

新窗口打开| 下载CSV


本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω设置为0.01,逐像素特征个数n设置为500.

3.2. 评价指标

ADD指标是物体三维模型点集分别经过真值位姿变换与预测位姿变换后的平均欧氏距离:

$ {\mathrm{ADD}}= \dfrac{1}{m} {\sum}_{{\boldsymbol{x}} \in M} \left\| ({\boldsymbol{R x}} + {\boldsymbol{t}}) - \left( \tilde{{\boldsymbol{R}}} {\boldsymbol{x}} + \tilde{{\boldsymbol{t}}} \right) \right\|. $

式中:M为模型点集,m为模型点的个数.

ADD-S指标是物体三维模型点集经真值位姿变换后,与经预测位姿变换后的对应最近邻点之间的平均距离:

$ {\text{ADD-S}} = \dfrac{1}{m} {\sum}_{{\boldsymbol{x}}_1 \in M} \min_{{\boldsymbol{x}}_2 \in M} \left\| ({\boldsymbol{R x}}_1 + {\boldsymbol{t}}) - \left( \tilde{{\boldsymbol{R}}} {\boldsymbol{x}}_2 + \tilde{{\boldsymbol{t}}} \right) \right\| .$

3.3. LineMOD数据集的评价

在LineMOD数据集上,若ADD(-S)小于物体直径的10%,则认为姿态估计是正确的,ADD(-S)分数定义为姿态估计的正确比率[13].

表1中,加粗的对象是对称物体,“仅使用多尺度模块”指移除AFE模块,“仅使用注意力增强模块”指移除多尺度网络. 从表1可知,本文方法的平均ADD(-S)评分为95.2%. 其他方法的得分如下:BB8 (62.3%)、PVNet (86.3%)、DeepIM (89.0%)、TexPose[36] (91.7%)、SSD-6D+ICP (76.7%)、Per-pixel Densefusion(86.1%)、Iterative-Densefusion(94.3%). 重投影误差在二维图像平面中难以避免.

在BB8和SSD-6D网络中投影预定义的3D关键点,使得BB8和SSD-6D+ICP分别在基于RGB和RGB-D图像的方法中表现最差. 由于缺乏空间信息,仅使用RGB图像作为输入的DeepIM方法的性能比使用RGB-D图像作为输入的其他方法差.

在与现有先进方法的对比中,DeepFusion网络在速度与精度上均展现出显著优势. 与DeepIM相比,在ADD(-S)得分上领先6.2%,运行速度提升了4倍以上(本文方法的运行速度为21帧/s,DeepIM方法的运行速度为5帧/s). 与Iterative-Densefusion相比,在ADD(-S)得分上领先0.9%,运行速度提高了25%(Iterative-Densefusion方法的运行速度为16帧/s).

3.4. YCB-Video数据集的评价

表2所示为使用PoseCNN的语义分割对YCB-Video数据集的21个对象的评估结果. 其中,加粗的对象是对称物体. 若ADD(-S)小于平均距离阈值,则认为姿态估计是正确的,将ADD(-S)分数定义为正确姿态估计的百分比. 使用2个指标,衡量本文方法的有效性. 一个指标是ADD分数阈值曲线下的面积(AUC),阈值为0~10 cm. 另一个指标是阈值为2 cm的ADD(-S)评分.

实验结果表明,本文方法在AUC指标上相较于DenseFusion和PVN3D分别实现了0.6%和0.7%的提升,且在ADD(-S)分数指标上较 DenseFusion 的均值(96.8%)提升了0.3%(本文方法达到97.1%),优于CFFM+CWTM(93.5%).

本文方法在不同纹理特征的物体上均表现出优势. 高纹理物体,如"cracker_box"、"sugar_box"(AUC = 98.6%)、"tomato_soup_can"(AUC = 95.0%)和"wood_block"(AUC = 100.0%)的AUC指标显著提升的原因是多尺度模块对局部细节的增强感知;低纹理物体,如"large_marker"(AUC = 98.4%),与CFFM+CWTM的88.6%相比,形成明显差距,得益于注意力增强模块对RGB-D信息的高效提取,弥补了纹理信息的缺失. 在“mustard_bottle”(本文方法的AUC = 96.5%,FoundationPose方法的AUC = 97.4%,差距为0.9%)物体上存在明显不足,表明网络对复杂轮廓的边界定位需要进一步的优化.

多尺度特征提取与注意力增强模块的协同合作能够有效地融合局部特征与全局语义,在复杂场景中实现更稳健的6D位姿估计. 尤其在遮挡条件下,如"Bowl"的ADD(-S)分数从DenseFusion的98.8%提升至99.2%,本文方法通过有效抑制噪声干扰,验证了该方法对部分可见物体的强泛化能力.

表3所示,通过系统性的消融实验,验证了各模块的贡献与特性. 其中,推理时间tin仅衡量神经网络前向传播耗时,参数量Np与计算量FLOPs仅统计可训练的融合网络部分. 多尺度模块通过层次化特征融合,增强了模型对尺度变化的鲁棒性,但该模块结构复杂,导致FLOPs增加28.7%. 注意力模块以极低的代价,带来了效率的显著提升.

表 3   YCB-Video数据集上的效率与精度消融实验

Tab.3  Ablation study on efficiency and accuracy on YCB-Video dataset

模型配置Np/106FLOPs/109tin/msAUC/%ADD(-S)
分数/%
Baseline78.035.916.483.590.1
+Multi-scale91.046.221.585.892.5
+AFE(Attention)81.037.517.688.995.3
完整模型(本文方法)94.047.922.393.797.1

新窗口打开| 下载CSV


完整模型融合两者的优势,以合理的推理延迟实现了最终性能的提升,达到93.7%. 该结果证明本文方法在精度与效率间的有效平衡.

图5所示为PoseCNN和地面真值分割的“large_clamp”和“extra_large_clamp”的ADD(-S)分数比较. 其中,$\tau $为阈值. 结果表明,利用地面真值掩模进行分割,可以显著地提高ADD(-S) AUC.

图 5

图 5   PoseCNN和地面真实分割的‘large_clamp’ 和‘extra_large_clamp’的ADD(-S)分数-阈值曲线

Fig.5   ADD(-S) score-threshold curve for 'large_clamp' and 'extra_large_clamp' split by PoseCNN and Ground Truth


图6所示,$\alpha $为不可见表面百分比阈值,YCB-Video数据集包含复杂的光照条件和部分遮挡场景,这一结果验证了本文方法对动态环境干扰的强鲁棒性.

图 6

图 6   不同方法在YCB-Video数据集上随遮挡水平增加的性能变化

Fig.6   Performance change of different methods on YCB-Video dataset with increasing level of occlusion


DeepFusion6D在位姿估计方面的定性结果示例如图7所示. 其中,语义分割结果由PoseCNN提供.

图 7

图 7   DeepFusion6D在LINEMOD数据集上估计物体6D位姿的可视化结果

Fig.7   Visualization of DeepFusion6D’s estimated 6D object pose on LINEMOD dataset


3.5. 消融研究

与最相关方法DenseFusion相比,本文方法有2处改进. 1)提出注意力增强模块和融合像素多模态特征. 2)提出多尺度特征提取框架,对具有不同接受域的像素级多模态特征进行多尺度提取. 为了说明这2个模块的效果,对LineMOD和YCB-Video数据集进行消融研究,结果如表12所示.

表1所示,仅使用多尺度模块的方法的平均ADD(-S)分数为89.4%,而仅使用注意力增强模块的方法的平均ADD(-S)分数为89.0%. 当多尺度模块和注意力模块都使用时,平均ADD(-S)分数达到95.2%. 可以看出,本文方法仅使用任意一个模块的ADD(-S)分数高于除Iterative-Densefusion之外的其他方法. 利用本文方法,可以更有效地提取和融合像素多模态特征.

表2所示,本文方法在平均ADD(-S)分数和ADD(-S) AUC上均优于DenseFusion,其中本文方法的ADD(-S)分数比DenseFusion高0.3%,ADD(-S) AUC比DenseFusion高0.6%. 这表明结合多尺度和注意力增强模块,能够有效地提升性能. 当单独使用多尺度模块时,平均ADD(-S)分数为94.3%,比DenseFusion低2.5%. 当单独使用注意力增强模块时,平均ADD(-S)分数为95.2%,比DenseFusion低1.6%. 这表明单独使用某一模块时性能略逊于DenseFusion,但完整方法的组合显著提升了结果. 此外,仅使用多尺度模块的方法的平均ADD(-S)分数和ADD(-S) AUC分别为94.3%和88.5%,均高于PoseCNN+ICP,说明即使仅使用多尺度模块,本文方法也优于PoseCNN+ICP.

4. 结 语

提出端到端的鲁棒性物体6D位姿估计网络,与传统的串行处理网络不同,本文采用双分支并行架构,分别提取深度图像的轮廓特征和RGB图像的表面纹理特征,通过多尺度特征提取框架实现跨模态特征对齐与互补,并借助分层融合机制整合多尺度特征. 在LineMOD和YCB-Video数据集上进行评估. 在YCB-Video数据集的光滑和无纹理对象上表现优异,ADD(-S)分数达到97.1%,较DenseFusion方法提升0.3%,在LineMOD数据集上的性能超过DenseFusion,每帧处理速度提升25%. 该模型在保持20帧/s实时处理能力的前提下,提升了遮挡场景中物体的识别准确率. 后续研究将对网络结构的轻量化进行改进,通过通道剪枝与量化压缩技术,将计算资源消耗降低40%以上,满足AR/VR实时交互场景下低延迟、高精度的空间定位需求.

参考文献

JIN D, ZHANG R, LI Y, et al. Mitigating latency effects on subjective experience in robot teleoperation using a VR-enabled virtual spring [C]//Proceedings of the IEEE International Symposium on Mixed and Augmented Reality. Bellevue: IEEE, 2024: 1276–1282.

[本文引用: 1]

ZHAO Y, WANG B, YU H, et al. Research on the self-powered flexible non-contact distance/contact pressure dual-mode sensor for manipulator based on triboelectric nanogenerator [C]//Proceedings of the China Automation Congress. Qingdao: IEEE, 2024: 437–441.

[本文引用: 1]

PAWAR U S, KULKARNI R A. Navigation with augmented reality [C]//Proceedings of the 1st International Conference on AIML: Applications for Engineering and Technology. Pune: IEEE, 2025: 1–6.

[本文引用: 1]

DIAS P, MARQUES B, FELIX I, et al. Creating asynchronous augmented reality instructions through a virtual reality framework [C]//Proceedings of the IEEE Conference on Virtual Reality and 3D User Interfaces Abstracts and Workshops. Saint Malo: IEEE, 2025: 1065–1071.

[本文引用: 1]

KIM J, JEON J, PARK J, et al. Continuous performance improvement of infrastructure guidance service for autonomous cooperative driving: focusing on data-centric AI [C]//Proceedings of the International Conference on Electronics, Information, and Communication. Taipei: IEEE, 2024: 1–4.

[本文引用: 1]

FENG Y, SHEN H, SHAN Z, et al

Semantic communication for edge intelligence enabled autonomous driving system

[J]. IEEE Network, 2025, 39 (2): 149- 157

DOI:10.1109/MNET.2024.3468328      [本文引用: 1]

CHEN J, LEI B, SONG Q, et al. A hierarchical graph network for 3D object detection on point clouds [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 389–398.

[本文引用: 1]

LU P, SHI W, QIAO X

Multi-view image-based 3D reconstruction in indoor scenes: a survey

[J]. ZTE Communications, 2024, 22 (3): 91- 98

[本文引用: 1]

BESL P J, MCKAY N D

Method for registration of 3-D shapes

[J]. Sensor Fusion IV: Control Paradigms and Data Structures, 1992, 1611: 586- 606

DOI:10.1109/cisp.2012.6469977      [本文引用: 1]

ZHAO R, ZHANG Y, WEN W, et al

E-TPE: EfficientThumbnail: preserving encryption for privacy protection in visual sensor networks

[J]. ACM Transactions on Sensor Networks, 2024, 20 (4): 1- 26

[本文引用: 1]

HANH N T, CUONG V D, TUNG D D, et al. H-LSHADE: an efficient hybrid approach for solving heterogeneous target coverage in visual sensor networks [C]//International Symposium on Information and Communication Technology. Singapore: Springer, 2024: 297–307.

[本文引用: 1]

XU D, ANGUELOV D, JAIN A. PointFusion: deep sensor fusion for 3D bounding box estimation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018: 244–253.

[本文引用: 4]

WANG C, XU D, ZHU Y, et al. DenseFusion: 6D object pose estimation by iterative dense fusion [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2020: 3338–3347.

[本文引用: 8]

WEN B, YANG W, KAUTZ J, et al. FoundationPose: unified 6D pose estimation and tracking of novel objects [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 17868–17879.

[本文引用: 3]

GOPAL G Y, AMER M A. Separable self and mixed attention transformers for efficient object tracking [C]//Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. Waikoloa: IEEE, 2024: 6708–6717.

[本文引用: 1]

LEI X, LU W, YONG J, et al

RFF-PoseNet: a 6D object pose estimation network based on robust feature fusion in complex scenes

[J]. Electronics, 2024, 13 (17): 3518

DOI:10.3390/electronics13173518      [本文引用: 1]

LV Z, GUO Y, YANG S, et al

Multiscale feature fusion with self-attention for efficient 6D pose estimation

[J]. Algorithms, 2025, 18 (4): 207

DOI:10.3390/a18040207      [本文引用: 1]

XIANG Y, SCHMIDT T, NARAYANAN V, et al. PoseCNN: a convolutional neural network for 6D object pose estimation in cluttered scenes [C]//Proceedings of the Robotics: Science and Systems XIV. Robotics: Science and Systems Foundation, 2018.

[本文引用: 3]

RAD M, LEPETIT V. BB8: a scalable, accurate, robust to partial occlusion method for predicting the 3D poses of challenging objects without using depth [C]//Proceedings of the IEEE International Conference on Computer Vision. Venice: IEEE, 2017: 3848–3856.

[本文引用: 2]

KEHL W, MANHARDT F, TOMBARI F, et al. SSD-6D: making RGB-based 3D detection and 6D pose estimation great again [C]//Proceedings of the IEEE International Conference on Computer Vision. Venice: IEEE, 2017: 1530–1538.

[本文引用: 2]

PENG S, LIU Y, HUANG Q, et al. PVNet: pixel-wise voting network for 6DoF pose estimation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2020: 4556–4565.

[本文引用: 2]

LEPETIT V, MORENO-NOGUER F, FUA P

EPnP: an accurate O(n) solution to the PnP problem

[J]. International Journal of Computer Vision, 2009, 81 (2): 155- 166

DOI:10.1007/s11263-008-0152-6      [本文引用: 1]

JIANG M, ZHANG L, WANG X, et al

6D object pose estimation based on cross-modality feature fusion

[J]. Sensors, 2023, 23 (19): 8088

DOI:10.3390/s23198088      [本文引用: 4]

ZENG C, KWONG S. Dual swin-transformer based mutual interactive network for RGB-D salient object detection [EB/OL]. [2025-08-20]. https://arxiv.org/abs/2206.03105

[本文引用: 1]

WU P, LI W, YAN M

3D scene reconstruction based on improved ICP algorithm

[J]. Microprocessors and Microsystems, 2020, 75: 103064

DOI:10.1016/j.micpro.2020.103064      [本文引用: 1]

WOHLHART P, LEPETIT V. Learning descriptors for object recognition and 3D pose estimation [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Boston: IEEE, 2015: 3109–3118.

[本文引用: 1]

KENDALL A, GRIMES M, CIPOLLA R. PoseNet: a convolutional network for real-time 6-DOF camera relocalization [C]//Proceedings of the IEEE International Conference on Computer Vision. Santiago: IEEE, 2016: 2938–2946.

[本文引用: 1]

LI Y, WANG G, JI X, et al

DeepIM: deep iterative matching for 6D pose estimation

[J]. International Journal of Computer Vision, 2020, 128 (3): 657- 678

DOI:10.1007/s11263-019-01250-9      [本文引用: 3]

PARK K, PATTEN T, VINCZE M. Pix2Pose: pixel-wise coordinate regression of objects for 6D pose estimation [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Seoul: IEEE, 2019: 7667–7676.

[本文引用: 1]

HOSSEINI JAFARI O, MUSTIKOVELA S K, PERTSCH K, et al. iPose: instance-aware 6D pose estimation of partly occluded objects [C]// 2018 Asian Conference on Computer Vision. Cham: Springer, 2019: 477–492.

[本文引用: 1]

HE Y, SUN W, HUANG H, et al. PVN3D: a deep point-wise 3D keypoints voting network for 6DoF pose estimation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 11629–11638.

[本文引用: 4]

QI C R, YI L, SU H, et al. PointNet++: deep hierarchical feature learning on point sets in a metric space [C]//Advances in Neural Information Processing Systems. Long Beach: NIPS, 2017: 5100–5109.

[本文引用: 1]

HU J, SHEN L, SUN G. Squeeze-and-excitation networks [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018: 7132–7141.

[本文引用: 2]

WOO S, PARK J, LEE J Y, et al. CBAM: convolutional block attention module [C]//European Conference on Computer Vision. Munich: Springer, 2018: 3–19.

[本文引用: 2]

HINTERSTOISSER S, CAGNIAT C, IIII V L, et al. Multimodal templates for real-time detection of texture-less objects in heavily cluttered scenes [C]//International Conference on Computer Vision. Barcelona: IEEE, 2011: 858–865.

[本文引用: 1]

CHEN H, MANHARDT F, NAVAB N, et al. TexPose: neural texture learning for self-supervised 6D object pose estimation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 4841–4852.

[本文引用: 2]

/