[1]
JIN D, ZHANG R, LI Y, et al. Mitigating latency effects on subjective experience in robot teleoperation using a VR-enabled virtual spring [C]//Proceedings of the IEEE International Symposium on Mixed and Augmented Reality . Bellevue: IEEE, 2024: 1276–1282.
[本文引用: 1]
[2]
ZHAO Y, WANG B, YU H, et al. Research on the self-powered flexible non-contact distance/contact pressure dual-mode sensor for manipulator based on triboelectric nanogenerator [C]//Proceedings of the China Automation Congress . Qingdao: IEEE, 2024: 437–441.
[本文引用: 1]
[3]
PAWAR U S, KULKARNI R A. Navigation with augmented reality [C]//Proceedings of the 1st International Conference on AIML: Applications for Engineering and Technology . Pune: IEEE, 2025: 1–6.
[本文引用: 1]
[4]
DIAS P, MARQUES B, FELIX I, et al. Creating asynchronous augmented reality instructions through a virtual reality framework [C]//Proceedings of the IEEE Conference on Virtual Reality and 3D User Interfaces Abstracts and Workshops . Saint Malo: IEEE, 2025: 1065–1071.
[本文引用: 1]
[5]
KIM J, JEON J, PARK J, et al. Continuous performance improvement of infrastructure guidance service for autonomous cooperative driving: focusing on data-centric AI [C]//Proceedings of the International Conference on Electronics, Information, and Communication . Taipei: IEEE, 2024: 1–4.
[本文引用: 1]
[6]
FENG Y, SHEN H, SHAN Z, et al Semantic communication for edge intelligence enabled autonomous driving system
[J]. IEEE Network , 2025 , 39 (2 ): 149 - 157
DOI:10.1109/MNET.2024.3468328
[本文引用: 1]
[7]
CHEN J, LEI B, SONG Q, et al. A hierarchical graph network for 3D object detection on point clouds [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2020: 389–398.
[本文引用: 1]
[8]
LU P, SHI W, QIAO X Multi-view image-based 3D reconstruction in indoor scenes: a survey
[J]. ZTE Communications , 2024 , 22 (3 ): 91 - 98
[本文引用: 1]
[9]
BESL P J, MCKAY N D Method for registration of 3-D shapes
[J]. Sensor Fusion IV: Control Paradigms and Data Structures , 1992 , 1611 : 586 - 606
DOI:10.1109/cisp.2012.6469977
[本文引用: 1]
[10]
ZHAO R, ZHANG Y, WEN W, et al E-TPE: EfficientThumbnail: preserving encryption for privacy protection in visual sensor networks
[J]. ACM Transactions on Sensor Networks , 2024 , 20 (4 ): 1 - 26
[本文引用: 1]
[11]
HANH N T, CUONG V D, TUNG D D, et al. H-LSHADE: an efficient hybrid approach for solving heterogeneous target coverage in visual sensor networks [C]//International Symposium on Information and Communication Technology . Singapore: Springer, 2024: 297–307.
[本文引用: 1]
[12]
XU D, ANGUELOV D, JAIN A. PointFusion: deep sensor fusion for 3D bounding box estimation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Salt Lake City: IEEE, 2018: 244–253.
[本文引用: 4]
[13]
WANG C, XU D, ZHU Y, et al. DenseFusion: 6D object pose estimation by iterative dense fusion [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Long Beach: IEEE, 2020: 3338–3347.
[本文引用: 8]
[14]
WEN B, YANG W, KAUTZ J, et al. FoundationPose: unified 6D pose estimation and tracking of novel objects [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2024: 17868–17879.
[本文引用: 3]
[15]
GOPAL G Y, AMER M A. Separable self and mixed attention transformers for efficient object tracking [C]//Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision . Waikoloa: IEEE, 2024: 6708–6717.
[本文引用: 1]
[16]
LEI X, LU W, YONG J, et al RFF-PoseNet: a 6D object pose estimation network based on robust feature fusion in complex scenes
[J]. Electronics , 2024 , 13 (17 ): 3518
DOI:10.3390/electronics13173518
[本文引用: 1]
[17]
LV Z, GUO Y, YANG S, et al Multiscale feature fusion with self-attention for efficient 6D pose estimation
[J]. Algorithms , 2025 , 18 (4 ): 207
DOI:10.3390/a18040207
[本文引用: 1]
[18]
XIANG Y, SCHMIDT T, NARAYANAN V, et al. PoseCNN: a convolutional neural network for 6D object pose estimation in cluttered scenes [C]//Proceedings of the Robotics: Science and Systems XIV . Robotics: Science and Systems Foundation, 2018.
[本文引用: 3]
[19]
RAD M, LEPETIT V. BB8: a scalable, accurate, robust to partial occlusion method for predicting the 3D poses of challenging objects without using depth [C]//Proceedings of the IEEE International Conference on Computer Vision . Venice: IEEE, 2017: 3848–3856.
[本文引用: 2]
[20]
KEHL W, MANHARDT F, TOMBARI F, et al. SSD-6D: making RGB-based 3D detection and 6D pose estimation great again [C]//Proceedings of the IEEE International Conference on Computer Vision . Venice: IEEE, 2017: 1530–1538.
[本文引用: 2]
[21]
PENG S, LIU Y, HUANG Q, et al. PVNet: pixel-wise voting network for 6DoF pose estimation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Long Beach: IEEE, 2020: 4556–4565.
[本文引用: 2]
[22]
LEPETIT V, MORENO-NOGUER F, FUA P EPnP: an accurate O(n) solution to the PnP problem
[J]. International Journal of Computer Vision , 2009 , 81 (2 ): 155 - 166
DOI:10.1007/s11263-008-0152-6
[本文引用: 1]
[23]
JIANG M, ZHANG L, WANG X, et al 6D object pose estimation based on cross-modality feature fusion
[J]. Sensors , 2023 , 23 (19 ): 8088
DOI:10.3390/s23198088
[本文引用: 4]
[24]
ZENG C, KWONG S. Dual swin-transformer based mutual interactive network for RGB-D salient object detection [EB/OL]. [2025-08-20]. https://arxiv.org/abs/2206.03105
[本文引用: 1]
[26]
WOHLHART P, LEPETIT V. Learning descriptors for object recognition and 3D pose estimation [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition . Boston: IEEE, 2015: 3109–3118.
[本文引用: 1]
[27]
KENDALL A, GRIMES M, CIPOLLA R. PoseNet: a convolutional network for real-time 6-DOF camera relocalization [C]//Proceedings of the IEEE International Conference on Computer Vision . Santiago: IEEE, 2016: 2938–2946.
[本文引用: 1]
[28]
LI Y, WANG G, JI X, et al DeepIM: deep iterative matching for 6D pose estimation
[J]. International Journal of Computer Vision , 2020 , 128 (3 ): 657 - 678
DOI:10.1007/s11263-019-01250-9
[本文引用: 3]
[29]
PARK K, PATTEN T, VINCZE M. Pix2Pose: pixel-wise coordinate regression of objects for 6D pose estimation [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision . Seoul: IEEE, 2019: 7667–7676.
[本文引用: 1]
[30]
HOSSEINI JAFARI O, MUSTIKOVELA S K, PERTSCH K, et al. iPose: instance-aware 6D pose estimation of partly occluded objects [C]// 2018 Asian Conference on Computer Vision . Cham: Springer, 2019: 477–492.
[本文引用: 1]
[31]
HE Y, SUN W, HUANG H, et al. PVN3D: a deep point-wise 3D keypoints voting network for 6DoF pose estimation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2020: 11629–11638.
[本文引用: 4]
[32]
QI C R, YI L, SU H, et al. PointNet++: deep hierarchical feature learning on point sets in a metric space [C]//Advances in Neural Information Processing Systems . Long Beach: NIPS, 2017: 5100–5109.
[本文引用: 1]
[33]
HU J, SHEN L, SUN G. Squeeze-and-excitation networks [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Salt Lake City: IEEE, 2018: 7132–7141.
[本文引用: 2]
[34]
WOO S, PARK J, LEE J Y, et al. CBAM: convolutional block attention module [C]//European Conference on Computer Vision . Munich: Springer, 2018: 3–19.
[本文引用: 2]
[35]
HINTERSTOISSER S, CAGNIAT C, IIII V L, et al. Multimodal templates for real-time detection of texture-less objects in heavily cluttered scenes [C]//International Conference on Computer Vision . Barcelona: IEEE, 2011: 858–865.
[本文引用: 1]
[36]
CHEN H, MANHARDT F, NAVAB N, et al. Tex Pose: neural texture learning for self-supervised 6D object pose estimation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Vancouver: IEEE, 2023: 4841–4852.
[本文引用: 2]
1
... 在计算机视觉任务中,位姿估计的目标是建立物体从本体坐标系到相机观测系的空间映射关系. 位姿估计的本质是通过计算物体在三维空间中的旋转变换矩阵与平移变换向量,实现对物体几何状态的确定. 该技术在机器人抓取与操作[1 -2 ] 、增强现实[3 -4 ] 及自动驾驶[5 -6 ] 等领域具有重要的应用价值. 在现实世界中,物体种类繁多,形状各不相同,且受到光照变化、场景杂乱、遮挡等因素的影响,使该任务富有挑战性. ...
1
... 在计算机视觉任务中,位姿估计的目标是建立物体从本体坐标系到相机观测系的空间映射关系. 位姿估计的本质是通过计算物体在三维空间中的旋转变换矩阵与平移变换向量,实现对物体几何状态的确定. 该技术在机器人抓取与操作[1 -2 ] 、增强现实[3 -4 ] 及自动驾驶[5 -6 ] 等领域具有重要的应用价值. 在现实世界中,物体种类繁多,形状各不相同,且受到光照变化、场景杂乱、遮挡等因素的影响,使该任务富有挑战性. ...
1
... 在计算机视觉任务中,位姿估计的目标是建立物体从本体坐标系到相机观测系的空间映射关系. 位姿估计的本质是通过计算物体在三维空间中的旋转变换矩阵与平移变换向量,实现对物体几何状态的确定. 该技术在机器人抓取与操作[1 -2 ] 、增强现实[3 -4 ] 及自动驾驶[5 -6 ] 等领域具有重要的应用价值. 在现实世界中,物体种类繁多,形状各不相同,且受到光照变化、场景杂乱、遮挡等因素的影响,使该任务富有挑战性. ...
1
... 在计算机视觉任务中,位姿估计的目标是建立物体从本体坐标系到相机观测系的空间映射关系. 位姿估计的本质是通过计算物体在三维空间中的旋转变换矩阵与平移变换向量,实现对物体几何状态的确定. 该技术在机器人抓取与操作[1 -2 ] 、增强现实[3 -4 ] 及自动驾驶[5 -6 ] 等领域具有重要的应用价值. 在现实世界中,物体种类繁多,形状各不相同,且受到光照变化、场景杂乱、遮挡等因素的影响,使该任务富有挑战性. ...
1
... 在计算机视觉任务中,位姿估计的目标是建立物体从本体坐标系到相机观测系的空间映射关系. 位姿估计的本质是通过计算物体在三维空间中的旋转变换矩阵与平移变换向量,实现对物体几何状态的确定. 该技术在机器人抓取与操作[1 -2 ] 、增强现实[3 -4 ] 及自动驾驶[5 -6 ] 等领域具有重要的应用价值. 在现实世界中,物体种类繁多,形状各不相同,且受到光照变化、场景杂乱、遮挡等因素的影响,使该任务富有挑战性. ...
Semantic communication for edge intelligence enabled autonomous driving system
1
2025
... 在计算机视觉任务中,位姿估计的目标是建立物体从本体坐标系到相机观测系的空间映射关系. 位姿估计的本质是通过计算物体在三维空间中的旋转变换矩阵与平移变换向量,实现对物体几何状态的确定. 该技术在机器人抓取与操作[1 -2 ] 、增强现实[3 -4 ] 及自动驾驶[5 -6 ] 等领域具有重要的应用价值. 在现实世界中,物体种类繁多,形状各不相同,且受到光照变化、场景杂乱、遮挡等因素的影响,使该任务富有挑战性. ...
1
... 传统方法[7 ] 通常依赖人工设计的特征(如SIFT)在RGB图像与物体3D模型之间建立对应关系,或是针对无纹理物体的轮廓和边缘梯度生成模板集后进行匹配[8 ] ,再使用迭代最近点(ICP)算法[9 ] 辅助执行后处理步骤. 该方法虽然在速度上具有优势,但对物体表面纹理的依赖程度高,模板创建繁琐且灵活性与稳定性不足,难以适应复杂的实际场景. 针对上述挑战,高效融合RGB与深度信息来构建具有鲁棒性的特征处理流程成为解决问题、提升性能的关键研究方向. ...
Multi-view image-based 3D reconstruction in indoor scenes: a survey
1
2024
... 传统方法[7 ] 通常依赖人工设计的特征(如SIFT)在RGB图像与物体3D模型之间建立对应关系,或是针对无纹理物体的轮廓和边缘梯度生成模板集后进行匹配[8 ] ,再使用迭代最近点(ICP)算法[9 ] 辅助执行后处理步骤. 该方法虽然在速度上具有优势,但对物体表面纹理的依赖程度高,模板创建繁琐且灵活性与稳定性不足,难以适应复杂的实际场景. 针对上述挑战,高效融合RGB与深度信息来构建具有鲁棒性的特征处理流程成为解决问题、提升性能的关键研究方向. ...
Method for registration of 3-D shapes
1
1992
... 传统方法[7 ] 通常依赖人工设计的特征(如SIFT)在RGB图像与物体3D模型之间建立对应关系,或是针对无纹理物体的轮廓和边缘梯度生成模板集后进行匹配[8 ] ,再使用迭代最近点(ICP)算法[9 ] 辅助执行后处理步骤. 该方法虽然在速度上具有优势,但对物体表面纹理的依赖程度高,模板创建繁琐且灵活性与稳定性不足,难以适应复杂的实际场景. 针对上述挑战,高效融合RGB与深度信息来构建具有鲁棒性的特征处理流程成为解决问题、提升性能的关键研究方向. ...
E-TPE: EfficientThumbnail: preserving encryption for privacy protection in visual sensor networks
1
2024
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
1
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
4
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... 基于数据驱动的深度学习能够从数据中自动提取具有鲁棒性的特征,有效应对复杂场景的挑战. 利用深度神经网络的特征编码装置(如ResNet处理RGB图像,PointNet处理点云),能够自动学习融合物体的外观、几何结构及语义信息的多模态特征表达[12 -13 ] ,该特征的适应能力和区分能力优于人为设计的特征. 通过引入注意力机制,模型能够在特征提取时关注位姿估计的关键区域,有效抑制背景噪声和无关信息干扰,特定的注意力增强模块进一步强化了此能力. 这使得该网络模型在复杂场景(尤其是弱纹理物体和动态环境)下的泛化能力和鲁棒性得到显著增强. 在标准数据集(如LineMOD、YCB-Video)上,先进的深度学习方法在核心评价指标(如ADD(-S))上优于传统方法. ...
... Quantitative evaluation of ADD(-S) score and ADD(-S) AUC on YCB-Video dataset
Tab.2 方法 ADD(-S)分数/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 99.8 62.2 95.4 96.9 84.0 99.8 96.7 100 88.5 70.5 79.8 65.0 24.1 99.8 22.8 18.2 35.9 80.4 50.0 20.1 100 74.1 PVN3D[31 ] 100 91.6 100 96.9 100 100 100 100 93.6 99.7 100 99.4 54.9 99.8 99.6 80.2 95.6 99.7 74.9 48.8 100 93.2 DenseFusion[13 ] 100 99.5 100 96.9 100 100 100 100 91.3 100 100 100 98.8 100 98.7 94.6 100 100 79.2 76.3 100 96.8 CFFM+CWTM[23 ] 100 95.3 100 95.7 100 99.0 93.9 100 90.8 93.4 100 97.8 53.2 98.2 97.4 81.3 94.7 96.7 68.3 62.5 99.6 93.5 FoundationPose[14 ] 99.1 98.7 99.3 98.9 99.5 99.0 98.8 99.4 98.5 99.2 98.6 98.3 98.0 98.7 98.4 97.5 97.1 98.2 96.9 96.5 99.1 99.0 本文方法 (仅使用多 尺度模块) 98.5 93.1 98.0 89.1 94.3 97.3 93.9 99.9 92.4 95.1 97.4 93.6 92.1 94.1 94.6 93.2 91.0 96.2 88.1 83.2 99.4 94.3 本文方法 (仅使用注意 力增强模块) 99.1 94.9 98.7 90.6 95.7 97.8 94.7 100 93.7 96.3 98.1 95.1 93.5 95.3 95.8 94.7 92.5 97.5 90.3 85.8 99.7 95.2 本文方法 100 97.5 99.0 93.5 97.5 98.5 96.5 100 96.0 97.5 98.0 97.0 99.2 97.0 96.5 98.0 96.5 98.0 85.0 82.0 100 97.1 方法 AUC/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 90.9 80.5 90.4 91.9 88.5 93.8 87.5 95.0 86.4 84.7 85.5 81.0 75.7 94.2 71.5 68.1 76.7 87.9 65.9 60.4 91.8 83.9 PVN3D[31 ] 95.8 92.7 98.2 94.5 98.6 97.1 97.9 98.8 92.7 97.1 97.8 96.9 81.0 95.0 98.2 87.6 91.7 97.2 75.2 64.4 97.2 93.0 DenseFusion[13 ] 96.4 95.5 97.5 94.6 97.2 96.6 96.5 98.1 91.3 96.6 97.1 95.8 88.2 97.1 96.0 89.7 95.2 97.5 72.9 69.8 92.5 93.1 CFFM+CWTM[23 ] 94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7
本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
... [
12 ]
90.9 80.5 90.4 91.9 88.5 93.8 87.5 95.0 86.4 84.7 85.5 81.0 75.7 94.2 71.5 68.1 76.7 87.9 65.9 60.4 91.8 83.9 PVN3D[31 ] 95.8 92.7 98.2 94.5 98.6 97.1 97.9 98.8 92.7 97.1 97.8 96.9 81.0 95.0 98.2 87.6 91.7 97.2 75.2 64.4 97.2 93.0 DenseFusion[13 ] 96.4 95.5 97.5 94.6 97.2 96.6 96.5 98.1 91.3 96.6 97.1 95.8 88.2 97.1 96.0 89.7 95.2 97.5 72.9 69.8 92.5 93.1 CFFM+CWTM[23 ] 94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7 本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
8
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... [13 ]在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... 基于数据驱动的深度学习能够从数据中自动提取具有鲁棒性的特征,有效应对复杂场景的挑战. 利用深度神经网络的特征编码装置(如ResNet处理RGB图像,PointNet处理点云),能够自动学习融合物体的外观、几何结构及语义信息的多模态特征表达[12 -13 ] ,该特征的适应能力和区分能力优于人为设计的特征. 通过引入注意力机制,模型能够在特征提取时关注位姿估计的关键区域,有效抑制背景噪声和无关信息干扰,特定的注意力增强模块进一步强化了此能力. 这使得该网络模型在复杂场景(尤其是弱纹理物体和动态环境)下的泛化能力和鲁棒性得到显著增强. 在标准数据集(如LineMOD、YCB-Video)上,先进的深度学习方法在核心评价指标(如ADD(-S))上优于传统方法. ...
... Quantitative assessment of ADD(-S) score on linenmod dataset
Tab.1 方法 输入数据 ADD(-S)分数/% Ape Ben Camera Can Cat Driller Duck Eggbox Glue Hole Iron Lamp Phone 平均值 BB8[19 ] RGB 40.2 91.7 55.8 63.7 62.9 73.7 44.3 58.1 41.0 67.2 84.7 76.9 54.0 62.3 PVNet[21 ] 43.6 99.9 86.9 95.5 79.3 96.4 52.6 99.2 95.7 81.9 98.9 99.3 92.4 86.3 DeepIM[28 ] 77.2 97.8 93.7 96.8 82.0 95.0 77.8 97.1 99.3 52.8 98.3 98.0 87.9 89.0 TexPose[36 ] 80.9 99.0 94.8 99.7 92.6 97.4 83.4 94.9 93.4 79.3 99.8 98.3 78.9 91.7 SSD-6D+ICP[20 ] RGB-D 65.0 80.0 78.0 86.0 70.0 73.0 66.0 100 100 49.0 78.0 73.0 79.0 76.7 CFFM+CWTM[23 ] 88.2 91.5 93.4 93.8 94.4 91.6 89.4 97.3 99.1 89.3 95.7 94.2 93.7 93.2 Per-pixel Densefusion[13 ] 79.8 84.1 76.7 86.8 88.9 77.8 76.2 100 99.0 79.0 92.1 92.0 88.0 86.1 Iterative-Densefusion[13 ] 92.1 93.2 94.3 93.1 96.5 87.0 92.0 100 100 92.1 97.0 95.1 92.8 94.3 本文方法(仅使用多尺度模块) 93.8 89.6 90.5 90.2 91.1 90.3 89.5 100 100 84.7 93.1 91.5 89.0 89.4 本文方法(仅使用注意力增强模块) 89.3 90.1 89.7 89.2 90.2 89.8 88.7 100 98.4 89.3 90.2 89.7 90.0 89.0 本文方法 95.4 93.1 95.9 93.2 95.0 94.2 90.3 100 100 92.2 96.5 95.1 94.8 95.2
YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2 所示. ...
... [
13 ]
92.1 93.2 94.3 93.1 96.5 87.0 92.0 100 100 92.1 97.0 95.1 92.8 94.3 本文方法(仅使用多尺度模块) 93.8 89.6 90.5 90.2 91.1 90.3 89.5 100 100 84.7 93.1 91.5 89.0 89.4 本文方法(仅使用注意力增强模块) 89.3 90.1 89.7 89.2 90.2 89.8 88.7 100 98.4 89.3 90.2 89.7 90.0 89.0 本文方法 95.4 93.1 95.9 93.2 95.0 94.2 90.3 100 100 92.2 96.5 95.1 94.8 95.2 YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2 所示. ...
... Quantitative evaluation of ADD(-S) score and ADD(-S) AUC on YCB-Video dataset
Tab.2 方法 ADD(-S)分数/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 99.8 62.2 95.4 96.9 84.0 99.8 96.7 100 88.5 70.5 79.8 65.0 24.1 99.8 22.8 18.2 35.9 80.4 50.0 20.1 100 74.1 PVN3D[31 ] 100 91.6 100 96.9 100 100 100 100 93.6 99.7 100 99.4 54.9 99.8 99.6 80.2 95.6 99.7 74.9 48.8 100 93.2 DenseFusion[13 ] 100 99.5 100 96.9 100 100 100 100 91.3 100 100 100 98.8 100 98.7 94.6 100 100 79.2 76.3 100 96.8 CFFM+CWTM[23 ] 100 95.3 100 95.7 100 99.0 93.9 100 90.8 93.4 100 97.8 53.2 98.2 97.4 81.3 94.7 96.7 68.3 62.5 99.6 93.5 FoundationPose[14 ] 99.1 98.7 99.3 98.9 99.5 99.0 98.8 99.4 98.5 99.2 98.6 98.3 98.0 98.7 98.4 97.5 97.1 98.2 96.9 96.5 99.1 99.0 本文方法 (仅使用多 尺度模块) 98.5 93.1 98.0 89.1 94.3 97.3 93.9 99.9 92.4 95.1 97.4 93.6 92.1 94.1 94.6 93.2 91.0 96.2 88.1 83.2 99.4 94.3 本文方法 (仅使用注意 力增强模块) 99.1 94.9 98.7 90.6 95.7 97.8 94.7 100 93.7 96.3 98.1 95.1 93.5 95.3 95.8 94.7 92.5 97.5 90.3 85.8 99.7 95.2 本文方法 100 97.5 99.0 93.5 97.5 98.5 96.5 100 96.0 97.5 98.0 97.0 99.2 97.0 96.5 98.0 96.5 98.0 85.0 82.0 100 97.1 方法 AUC/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 90.9 80.5 90.4 91.9 88.5 93.8 87.5 95.0 86.4 84.7 85.5 81.0 75.7 94.2 71.5 68.1 76.7 87.9 65.9 60.4 91.8 83.9 PVN3D[31 ] 95.8 92.7 98.2 94.5 98.6 97.1 97.9 98.8 92.7 97.1 97.8 96.9 81.0 95.0 98.2 87.6 91.7 97.2 75.2 64.4 97.2 93.0 DenseFusion[13 ] 96.4 95.5 97.5 94.6 97.2 96.6 96.5 98.1 91.3 96.6 97.1 95.8 88.2 97.1 96.0 89.7 95.2 97.5 72.9 69.8 92.5 93.1 CFFM+CWTM[23 ] 94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7
本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
... [
13 ]
96.4 95.5 97.5 94.6 97.2 96.6 96.5 98.1 91.3 96.6 97.1 95.8 88.2 97.1 96.0 89.7 95.2 97.5 72.9 69.8 92.5 93.1 CFFM+CWTM[23 ] 94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7 本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
... 在LineMOD数据集上,若ADD(-S)小于物体直径的10%,则认为姿态估计是正确的,ADD(-S)分数定义为姿态估计的正确比率[13 ] . ...
3
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... Quantitative evaluation of ADD(-S) score and ADD(-S) AUC on YCB-Video dataset
Tab.2 方法 ADD(-S)分数/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 99.8 62.2 95.4 96.9 84.0 99.8 96.7 100 88.5 70.5 79.8 65.0 24.1 99.8 22.8 18.2 35.9 80.4 50.0 20.1 100 74.1 PVN3D[31 ] 100 91.6 100 96.9 100 100 100 100 93.6 99.7 100 99.4 54.9 99.8 99.6 80.2 95.6 99.7 74.9 48.8 100 93.2 DenseFusion[13 ] 100 99.5 100 96.9 100 100 100 100 91.3 100 100 100 98.8 100 98.7 94.6 100 100 79.2 76.3 100 96.8 CFFM+CWTM[23 ] 100 95.3 100 95.7 100 99.0 93.9 100 90.8 93.4 100 97.8 53.2 98.2 97.4 81.3 94.7 96.7 68.3 62.5 99.6 93.5 FoundationPose[14 ] 99.1 98.7 99.3 98.9 99.5 99.0 98.8 99.4 98.5 99.2 98.6 98.3 98.0 98.7 98.4 97.5 97.1 98.2 96.9 96.5 99.1 99.0 本文方法 (仅使用多 尺度模块) 98.5 93.1 98.0 89.1 94.3 97.3 93.9 99.9 92.4 95.1 97.4 93.6 92.1 94.1 94.6 93.2 91.0 96.2 88.1 83.2 99.4 94.3 本文方法 (仅使用注意 力增强模块) 99.1 94.9 98.7 90.6 95.7 97.8 94.7 100 93.7 96.3 98.1 95.1 93.5 95.3 95.8 94.7 92.5 97.5 90.3 85.8 99.7 95.2 本文方法 100 97.5 99.0 93.5 97.5 98.5 96.5 100 96.0 97.5 98.0 97.0 99.2 97.0 96.5 98.0 96.5 98.0 85.0 82.0 100 97.1 方法 AUC/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 90.9 80.5 90.4 91.9 88.5 93.8 87.5 95.0 86.4 84.7 85.5 81.0 75.7 94.2 71.5 68.1 76.7 87.9 65.9 60.4 91.8 83.9 PVN3D[31 ] 95.8 92.7 98.2 94.5 98.6 97.1 97.9 98.8 92.7 97.1 97.8 96.9 81.0 95.0 98.2 87.6 91.7 97.2 75.2 64.4 97.2 93.0 DenseFusion[13 ] 96.4 95.5 97.5 94.6 97.2 96.6 96.5 98.1 91.3 96.6 97.1 95.8 88.2 97.1 96.0 89.7 95.2 97.5 72.9 69.8 92.5 93.1 CFFM+CWTM[23 ] 94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7
本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
... [
14 ]
96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7 本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
1
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
RFF-PoseNet: a 6D object pose estimation network based on robust feature fusion in complex scenes
1
2024
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
Multiscale feature fusion with self-attention for efficient 6D pose estimation
1
2025
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
3
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... 该网络采用Xiang 等[18 ] 提供的预训练语义分割结果. 采用这一策略,能够有效隔离前端处理模块带来的影响,保证了结果的一致性. DeepFusion网络的处理速度达到20 帧/s,在不限制系统性能的同时,有效节省了计算资源,保证了语义分割模块的质量与稳定性,从而整体提升了位姿估计的效率. ...
... 在实验中,使用2个基准数据集(LineMOD[35 ] 和YCB-Video[18 ] )来评估该网络. LineMOD数据集由13个RGB-D序列组成,提供了含6DoF姿态、CAD模型、2D边界框及二进制掩模的注释RGB-D图像,将每个序列的约15%的图像用于训练,其余85%用于测试. 该数据集涵盖杂乱场景、无纹理物体、带噪声的深度数据和多变光照条件,是评估位姿估计方法鲁棒性的理想基准数据集. 如表1 所示为不同方法在该数据集上的实验结果. ...
2
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... Quantitative assessment of ADD(-S) score on linenmod dataset
Tab.1 方法 输入数据 ADD(-S)分数/% Ape Ben Camera Can Cat Driller Duck Eggbox Glue Hole Iron Lamp Phone 平均值 BB8[19 ] RGB 40.2 91.7 55.8 63.7 62.9 73.7 44.3 58.1 41.0 67.2 84.7 76.9 54.0 62.3 PVNet[21 ] 43.6 99.9 86.9 95.5 79.3 96.4 52.6 99.2 95.7 81.9 98.9 99.3 92.4 86.3 DeepIM[28 ] 77.2 97.8 93.7 96.8 82.0 95.0 77.8 97.1 99.3 52.8 98.3 98.0 87.9 89.0 TexPose[36 ] 80.9 99.0 94.8 99.7 92.6 97.4 83.4 94.9 93.4 79.3 99.8 98.3 78.9 91.7 SSD-6D+ICP[20 ] RGB-D 65.0 80.0 78.0 86.0 70.0 73.0 66.0 100 100 49.0 78.0 73.0 79.0 76.7 CFFM+CWTM[23 ] 88.2 91.5 93.4 93.8 94.4 91.6 89.4 97.3 99.1 89.3 95.7 94.2 93.7 93.2 Per-pixel Densefusion[13 ] 79.8 84.1 76.7 86.8 88.9 77.8 76.2 100 99.0 79.0 92.1 92.0 88.0 86.1 Iterative-Densefusion[13 ] 92.1 93.2 94.3 93.1 96.5 87.0 92.0 100 100 92.1 97.0 95.1 92.8 94.3 本文方法(仅使用多尺度模块) 93.8 89.6 90.5 90.2 91.1 90.3 89.5 100 100 84.7 93.1 91.5 89.0 89.4 本文方法(仅使用注意力增强模块) 89.3 90.1 89.7 89.2 90.2 89.8 88.7 100 98.4 89.3 90.2 89.7 90.0 89.0 本文方法 95.4 93.1 95.9 93.2 95.0 94.2 90.3 100 100 92.2 96.5 95.1 94.8 95.2
YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2 所示. ...
2
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... Quantitative assessment of ADD(-S) score on linenmod dataset
Tab.1 方法 输入数据 ADD(-S)分数/% Ape Ben Camera Can Cat Driller Duck Eggbox Glue Hole Iron Lamp Phone 平均值 BB8[19 ] RGB 40.2 91.7 55.8 63.7 62.9 73.7 44.3 58.1 41.0 67.2 84.7 76.9 54.0 62.3 PVNet[21 ] 43.6 99.9 86.9 95.5 79.3 96.4 52.6 99.2 95.7 81.9 98.9 99.3 92.4 86.3 DeepIM[28 ] 77.2 97.8 93.7 96.8 82.0 95.0 77.8 97.1 99.3 52.8 98.3 98.0 87.9 89.0 TexPose[36 ] 80.9 99.0 94.8 99.7 92.6 97.4 83.4 94.9 93.4 79.3 99.8 98.3 78.9 91.7 SSD-6D+ICP[20 ] RGB-D 65.0 80.0 78.0 86.0 70.0 73.0 66.0 100 100 49.0 78.0 73.0 79.0 76.7 CFFM+CWTM[23 ] 88.2 91.5 93.4 93.8 94.4 91.6 89.4 97.3 99.1 89.3 95.7 94.2 93.7 93.2 Per-pixel Densefusion[13 ] 79.8 84.1 76.7 86.8 88.9 77.8 76.2 100 99.0 79.0 92.1 92.0 88.0 86.1 Iterative-Densefusion[13 ] 92.1 93.2 94.3 93.1 96.5 87.0 92.0 100 100 92.1 97.0 95.1 92.8 94.3 本文方法(仅使用多尺度模块) 93.8 89.6 90.5 90.2 91.1 90.3 89.5 100 100 84.7 93.1 91.5 89.0 89.4 本文方法(仅使用注意力增强模块) 89.3 90.1 89.7 89.2 90.2 89.8 88.7 100 98.4 89.3 90.2 89.7 90.0 89.0 本文方法 95.4 93.1 95.9 93.2 95.0 94.2 90.3 100 100 92.2 96.5 95.1 94.8 95.2
YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2 所示. ...
2
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... Quantitative assessment of ADD(-S) score on linenmod dataset
Tab.1 方法 输入数据 ADD(-S)分数/% Ape Ben Camera Can Cat Driller Duck Eggbox Glue Hole Iron Lamp Phone 平均值 BB8[19 ] RGB 40.2 91.7 55.8 63.7 62.9 73.7 44.3 58.1 41.0 67.2 84.7 76.9 54.0 62.3 PVNet[21 ] 43.6 99.9 86.9 95.5 79.3 96.4 52.6 99.2 95.7 81.9 98.9 99.3 92.4 86.3 DeepIM[28 ] 77.2 97.8 93.7 96.8 82.0 95.0 77.8 97.1 99.3 52.8 98.3 98.0 87.9 89.0 TexPose[36 ] 80.9 99.0 94.8 99.7 92.6 97.4 83.4 94.9 93.4 79.3 99.8 98.3 78.9 91.7 SSD-6D+ICP[20 ] RGB-D 65.0 80.0 78.0 86.0 70.0 73.0 66.0 100 100 49.0 78.0 73.0 79.0 76.7 CFFM+CWTM[23 ] 88.2 91.5 93.4 93.8 94.4 91.6 89.4 97.3 99.1 89.3 95.7 94.2 93.7 93.2 Per-pixel Densefusion[13 ] 79.8 84.1 76.7 86.8 88.9 77.8 76.2 100 99.0 79.0 92.1 92.0 88.0 86.1 Iterative-Densefusion[13 ] 92.1 93.2 94.3 93.1 96.5 87.0 92.0 100 100 92.1 97.0 95.1 92.8 94.3 本文方法(仅使用多尺度模块) 93.8 89.6 90.5 90.2 91.1 90.3 89.5 100 100 84.7 93.1 91.5 89.0 89.4 本文方法(仅使用注意力增强模块) 89.3 90.1 89.7 89.2 90.2 89.8 88.7 100 98.4 89.3 90.2 89.7 90.0 89.0 本文方法 95.4 93.1 95.9 93.2 95.0 94.2 90.3 100 100 92.2 96.5 95.1 94.8 95.2
YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2 所示. ...
EPnP: an accurate O(n) solution to the PnP problem
1
2009
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
6D object pose estimation based on cross-modality feature fusion
4
2023
... 近年来,随着视觉传感装置(如RGB-D相机[10 -11 ] )的广泛应用,实现了颜色与几何信息的融合,为解决上述问题提供了新方式. 在特征融合及优化方面,现有研究主要注重结合RGB与深度信息的互补特性[12 -13 ] . 如DenseFusion[13 ] 在像素层面分别对RGB图像和点云信息进行处理,并将两者进行特征融合,利用局部外观和几何特征,提升了对遮挡的鲁棒性并避免了耗时的后处理. Wen等[14 ] 提出统一的基础模型架构,支持多种情境下的位姿估计与跟踪. 注意力机制的引入为增强特征的表达能力提供了新思路,如Gopal利用可分离自注意力和混合注意力构建轻量级跟踪架构[15 ] ,Ma等[16 ] 开发基于鲁棒特征融合的6D目标位姿估计网络RFF-PoseNet,Lv等[17 ] 利用多尺度特征融合与自注意力机制实现高效的6D位姿估计. 上述研究侧重于多尺度特征融合过程与注意力机制的结合,以提升位姿估计的效率与精度,强化场景处理能力. 现有的代表性方法,如PoseCNN[18 ] 、BB8[19 ] 、SSD-6D[20 ] 和PVNet[21 ] 等,通常基于CNN预测2D-3D对应关系(如关键点投影),通过PnP算法[22 ] 求解初始位姿,且需要ICP来进一步优化. 尽管比传统方法更具鲁棒性,但多阶段流程(尤其是优化步骤)耗时长且无法端到端优化. CFFM+CWTM方法[23 ] 通过引入跨模态特征融合模块(CFFM)和特征贡献权重训练模块(CWTM)来分配2种模态的不同贡献,该方法在复杂遮挡下的多尺度特征感知与融合效率方面仍有提升空间. ...
... Quantitative assessment of ADD(-S) score on linenmod dataset
Tab.1 方法 输入数据 ADD(-S)分数/% Ape Ben Camera Can Cat Driller Duck Eggbox Glue Hole Iron Lamp Phone 平均值 BB8[19 ] RGB 40.2 91.7 55.8 63.7 62.9 73.7 44.3 58.1 41.0 67.2 84.7 76.9 54.0 62.3 PVNet[21 ] 43.6 99.9 86.9 95.5 79.3 96.4 52.6 99.2 95.7 81.9 98.9 99.3 92.4 86.3 DeepIM[28 ] 77.2 97.8 93.7 96.8 82.0 95.0 77.8 97.1 99.3 52.8 98.3 98.0 87.9 89.0 TexPose[36 ] 80.9 99.0 94.8 99.7 92.6 97.4 83.4 94.9 93.4 79.3 99.8 98.3 78.9 91.7 SSD-6D+ICP[20 ] RGB-D 65.0 80.0 78.0 86.0 70.0 73.0 66.0 100 100 49.0 78.0 73.0 79.0 76.7 CFFM+CWTM[23 ] 88.2 91.5 93.4 93.8 94.4 91.6 89.4 97.3 99.1 89.3 95.7 94.2 93.7 93.2 Per-pixel Densefusion[13 ] 79.8 84.1 76.7 86.8 88.9 77.8 76.2 100 99.0 79.0 92.1 92.0 88.0 86.1 Iterative-Densefusion[13 ] 92.1 93.2 94.3 93.1 96.5 87.0 92.0 100 100 92.1 97.0 95.1 92.8 94.3 本文方法(仅使用多尺度模块) 93.8 89.6 90.5 90.2 91.1 90.3 89.5 100 100 84.7 93.1 91.5 89.0 89.4 本文方法(仅使用注意力增强模块) 89.3 90.1 89.7 89.2 90.2 89.8 88.7 100 98.4 89.3 90.2 89.7 90.0 89.0 本文方法 95.4 93.1 95.9 93.2 95.0 94.2 90.3 100 100 92.2 96.5 95.1 94.8 95.2
YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2 所示. ...
... Quantitative evaluation of ADD(-S) score and ADD(-S) AUC on YCB-Video dataset
Tab.2 方法 ADD(-S)分数/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 99.8 62.2 95.4 96.9 84.0 99.8 96.7 100 88.5 70.5 79.8 65.0 24.1 99.8 22.8 18.2 35.9 80.4 50.0 20.1 100 74.1 PVN3D[31 ] 100 91.6 100 96.9 100 100 100 100 93.6 99.7 100 99.4 54.9 99.8 99.6 80.2 95.6 99.7 74.9 48.8 100 93.2 DenseFusion[13 ] 100 99.5 100 96.9 100 100 100 100 91.3 100 100 100 98.8 100 98.7 94.6 100 100 79.2 76.3 100 96.8 CFFM+CWTM[23 ] 100 95.3 100 95.7 100 99.0 93.9 100 90.8 93.4 100 97.8 53.2 98.2 97.4 81.3 94.7 96.7 68.3 62.5 99.6 93.5 FoundationPose[14 ] 99.1 98.7 99.3 98.9 99.5 99.0 98.8 99.4 98.5 99.2 98.6 98.3 98.0 98.7 98.4 97.5 97.1 98.2 96.9 96.5 99.1 99.0 本文方法 (仅使用多 尺度模块) 98.5 93.1 98.0 89.1 94.3 97.3 93.9 99.9 92.4 95.1 97.4 93.6 92.1 94.1 94.6 93.2 91.0 96.2 88.1 83.2 99.4 94.3 本文方法 (仅使用注意 力增强模块) 99.1 94.9 98.7 90.6 95.7 97.8 94.7 100 93.7 96.3 98.1 95.1 93.5 95.3 95.8 94.7 92.5 97.5 90.3 85.8 99.7 95.2 本文方法 100 97.5 99.0 93.5 97.5 98.5 96.5 100 96.0 97.5 98.0 97.0 99.2 97.0 96.5 98.0 96.5 98.0 85.0 82.0 100 97.1 方法 AUC/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 90.9 80.5 90.4 91.9 88.5 93.8 87.5 95.0 86.4 84.7 85.5 81.0 75.7 94.2 71.5 68.1 76.7 87.9 65.9 60.4 91.8 83.9 PVN3D[31 ] 95.8 92.7 98.2 94.5 98.6 97.1 97.9 98.8 92.7 97.1 97.8 96.9 81.0 95.0 98.2 87.6 91.7 97.2 75.2 64.4 97.2 93.0 DenseFusion[13 ] 96.4 95.5 97.5 94.6 97.2 96.6 96.5 98.1 91.3 96.6 97.1 95.8 88.2 97.1 96.0 89.7 95.2 97.5 72.9 69.8 92.5 93.1 CFFM+CWTM[23 ] 94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7
本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
... [
23 ]
94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7 本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
1
... 针对上述问题,特别是直接融合RGB与深度特征易出现噪声干扰、关键信息被淹没的难点,本文提出基于RGB-D的端到端物体6D位姿估计网络. 引入注意力增强模块(AFE)[24 ] . 该模块结合空间与通道注意力机制,精准提升RGB与深度特征的质量,抑制噪声干扰,充分挖掘2种模态在位姿估计中的互补潜力,实现有效的像素级融合,并构建高效的特征处理流程. 将经过AFE优化的多模态特征进行整合后输入多层感知机(MLP)中,实现特征的高效利用与6D位姿参数的直接回归,提升了处理效率. RGB-D图像提供的空间深度信息与物体形状特征[25 ] 弥补了RGB在光照、纹理缺失或遮挡情况下的不足[26 ] . 基于上述核心模块与流程,构建基于RGB-D输入的新型端到端6D物体位姿估计网络. ...
3D scene reconstruction based on improved ICP algorithm
1
2020
... 针对上述问题,特别是直接融合RGB与深度特征易出现噪声干扰、关键信息被淹没的难点,本文提出基于RGB-D的端到端物体6D位姿估计网络. 引入注意力增强模块(AFE)[24 ] . 该模块结合空间与通道注意力机制,精准提升RGB与深度特征的质量,抑制噪声干扰,充分挖掘2种模态在位姿估计中的互补潜力,实现有效的像素级融合,并构建高效的特征处理流程. 将经过AFE优化的多模态特征进行整合后输入多层感知机(MLP)中,实现特征的高效利用与6D位姿参数的直接回归,提升了处理效率. RGB-D图像提供的空间深度信息与物体形状特征[25 ] 弥补了RGB在光照、纹理缺失或遮挡情况下的不足[26 ] . 基于上述核心模块与流程,构建基于RGB-D输入的新型端到端6D物体位姿估计网络. ...
1
... 针对上述问题,特别是直接融合RGB与深度特征易出现噪声干扰、关键信息被淹没的难点,本文提出基于RGB-D的端到端物体6D位姿估计网络. 引入注意力增强模块(AFE)[24 ] . 该模块结合空间与通道注意力机制,精准提升RGB与深度特征的质量,抑制噪声干扰,充分挖掘2种模态在位姿估计中的互补潜力,实现有效的像素级融合,并构建高效的特征处理流程. 将经过AFE优化的多模态特征进行整合后输入多层感知机(MLP)中,实现特征的高效利用与6D位姿参数的直接回归,提升了处理效率. RGB-D图像提供的空间深度信息与物体形状特征[25 ] 弥补了RGB在光照、纹理缺失或遮挡情况下的不足[26 ] . 基于上述核心模块与流程,构建基于RGB-D输入的新型端到端6D物体位姿估计网络. ...
1
... 深度学习的发展提高了基于RGB图像位姿估计的精度. PoseNet[27 ] 和PoseCNN直接从RGB图像回归6D位姿. DeepIM[28 ] 预测初始的6D位姿,通过迭代匹配逐步优化. Pix2pose[29 ] 预测图像中物体像素对应的3D坐标. 这类直接回归方法对高纹理物体的估计精度与泛化能力不足,且搜索空间大,导致位姿估计精度受限. 其他方法通过间接回归从RGB图像中估计位姿,例如BB8和SSD-6D通过预测,或PVNet利用Hough投票,获得物体三维关键点的2D投影,利用PnP算法计算6D位姿参数. 这类方法分2步估计位姿,在抗遮挡、处理纹理丰富目标及估计精度方面有所提升,但存在投影误差,影响检测结果,限制了位姿估计的精度. ...
DeepIM: deep iterative matching for 6D pose estimation
3
2020
... 深度学习的发展提高了基于RGB图像位姿估计的精度. PoseNet[27 ] 和PoseCNN直接从RGB图像回归6D位姿. DeepIM[28 ] 预测初始的6D位姿,通过迭代匹配逐步优化. Pix2pose[29 ] 预测图像中物体像素对应的3D坐标. 这类直接回归方法对高纹理物体的估计精度与泛化能力不足,且搜索空间大,导致位姿估计精度受限. 其他方法通过间接回归从RGB图像中估计位姿,例如BB8和SSD-6D通过预测,或PVNet利用Hough投票,获得物体三维关键点的2D投影,利用PnP算法计算6D位姿参数. 这类方法分2步估计位姿,在抗遮挡、处理纹理丰富目标及估计精度方面有所提升,但存在投影误差,影响检测结果,限制了位姿估计的精度. ...
... 为了使网络独立筛选出最可能正确的物体预测位姿$ {{{\tilde {\boldsymbol{p}}}}_i} $ ,在损失函数中进行如下设计:将每个预测位姿$\tilde{\boldsymbol{p}}_{{I,s}} $ 对应的损失项$ L_{i,s}^{{\mathrm{p}}} $ 乘以自监督生成的密集像素置信度$ {c}_{i,s} $ [28 ] 作为权重. 添加置信度正则化项,促使网络选择$ L_{i,s}^{{\mathrm{p}}} $ 最小且$ {c}_{i,s} $ 最高的预测姿态. ...
... Quantitative assessment of ADD(-S) score on linenmod dataset
Tab.1 方法 输入数据 ADD(-S)分数/% Ape Ben Camera Can Cat Driller Duck Eggbox Glue Hole Iron Lamp Phone 平均值 BB8[19 ] RGB 40.2 91.7 55.8 63.7 62.9 73.7 44.3 58.1 41.0 67.2 84.7 76.9 54.0 62.3 PVNet[21 ] 43.6 99.9 86.9 95.5 79.3 96.4 52.6 99.2 95.7 81.9 98.9 99.3 92.4 86.3 DeepIM[28 ] 77.2 97.8 93.7 96.8 82.0 95.0 77.8 97.1 99.3 52.8 98.3 98.0 87.9 89.0 TexPose[36 ] 80.9 99.0 94.8 99.7 92.6 97.4 83.4 94.9 93.4 79.3 99.8 98.3 78.9 91.7 SSD-6D+ICP[20 ] RGB-D 65.0 80.0 78.0 86.0 70.0 73.0 66.0 100 100 49.0 78.0 73.0 79.0 76.7 CFFM+CWTM[23 ] 88.2 91.5 93.4 93.8 94.4 91.6 89.4 97.3 99.1 89.3 95.7 94.2 93.7 93.2 Per-pixel Densefusion[13 ] 79.8 84.1 76.7 86.8 88.9 77.8 76.2 100 99.0 79.0 92.1 92.0 88.0 86.1 Iterative-Densefusion[13 ] 92.1 93.2 94.3 93.1 96.5 87.0 92.0 100 100 92.1 97.0 95.1 92.8 94.3 本文方法(仅使用多尺度模块) 93.8 89.6 90.5 90.2 91.1 90.3 89.5 100 100 84.7 93.1 91.5 89.0 89.4 本文方法(仅使用注意力增强模块) 89.3 90.1 89.7 89.2 90.2 89.8 88.7 100 98.4 89.3 90.2 89.7 90.0 89.0 本文方法 95.4 93.1 95.9 93.2 95.0 94.2 90.3 100 100 92.2 96.5 95.1 94.8 95.2
YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2 所示. ...
1
... 深度学习的发展提高了基于RGB图像位姿估计的精度. PoseNet[27 ] 和PoseCNN直接从RGB图像回归6D位姿. DeepIM[28 ] 预测初始的6D位姿,通过迭代匹配逐步优化. Pix2pose[29 ] 预测图像中物体像素对应的3D坐标. 这类直接回归方法对高纹理物体的估计精度与泛化能力不足,且搜索空间大,导致位姿估计精度受限. 其他方法通过间接回归从RGB图像中估计位姿,例如BB8和SSD-6D通过预测,或PVNet利用Hough投票,获得物体三维关键点的2D投影,利用PnP算法计算6D位姿参数. 这类方法分2步估计位姿,在抗遮挡、处理纹理丰富目标及估计精度方面有所提升,但存在投影误差,影响检测结果,限制了位姿估计的精度. ...
1
... RGB-D传感装置凭借成熟的技术、高采集精度、小巧的体积及低成本等优势,在三维视觉领域得到广泛的应用. 现有方法根据对RGB与深度信息的处理方式,主要分为3类. 1)直接合并RGB和深度信息来估计6D位姿[30 -31 ] ,该方式仅是简单地拼接深度和RGB通道. 2)分阶段地使用这2种信息,如PoseCNN和PVNet,先从RGB图像中粗略预测6D物体位姿,再借助深度信息和ICP算法进行细化. 这类方法未考虑RGB-D数据的互补性. 常见的做法是将深度图转换为3D点云后与物体的三维模型进行匹配并依赖ICP算法进行姿态改进,但ICP对初始估计较敏感. 3)通过后期融合颜色与深度信息进行位姿估计,或从融合特征中检测3D关键点结合ICP算法,如DenseFusion和PVN3D[31 ] ,然而在特征融合时未有效利用邻近区域信息,导致精度受限. ...
4
... RGB-D传感装置凭借成熟的技术、高采集精度、小巧的体积及低成本等优势,在三维视觉领域得到广泛的应用. 现有方法根据对RGB与深度信息的处理方式,主要分为3类. 1)直接合并RGB和深度信息来估计6D位姿[30 -31 ] ,该方式仅是简单地拼接深度和RGB通道. 2)分阶段地使用这2种信息,如PoseCNN和PVNet,先从RGB图像中粗略预测6D物体位姿,再借助深度信息和ICP算法进行细化. 这类方法未考虑RGB-D数据的互补性. 常见的做法是将深度图转换为3D点云后与物体的三维模型进行匹配并依赖ICP算法进行姿态改进,但ICP对初始估计较敏感. 3)通过后期融合颜色与深度信息进行位姿估计,或从融合特征中检测3D关键点结合ICP算法,如DenseFusion和PVN3D[31 ] ,然而在特征融合时未有效利用邻近区域信息,导致精度受限. ...
... [31 ],然而在特征融合时未有效利用邻近区域信息,导致精度受限. ...
... Quantitative evaluation of ADD(-S) score and ADD(-S) AUC on YCB-Video dataset
Tab.2 方法 ADD(-S)分数/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 99.8 62.2 95.4 96.9 84.0 99.8 96.7 100 88.5 70.5 79.8 65.0 24.1 99.8 22.8 18.2 35.9 80.4 50.0 20.1 100 74.1 PVN3D[31 ] 100 91.6 100 96.9 100 100 100 100 93.6 99.7 100 99.4 54.9 99.8 99.6 80.2 95.6 99.7 74.9 48.8 100 93.2 DenseFusion[13 ] 100 99.5 100 96.9 100 100 100 100 91.3 100 100 100 98.8 100 98.7 94.6 100 100 79.2 76.3 100 96.8 CFFM+CWTM[23 ] 100 95.3 100 95.7 100 99.0 93.9 100 90.8 93.4 100 97.8 53.2 98.2 97.4 81.3 94.7 96.7 68.3 62.5 99.6 93.5 FoundationPose[14 ] 99.1 98.7 99.3 98.9 99.5 99.0 98.8 99.4 98.5 99.2 98.6 98.3 98.0 98.7 98.4 97.5 97.1 98.2 96.9 96.5 99.1 99.0 本文方法 (仅使用多 尺度模块) 98.5 93.1 98.0 89.1 94.3 97.3 93.9 99.9 92.4 95.1 97.4 93.6 92.1 94.1 94.6 93.2 91.0 96.2 88.1 83.2 99.4 94.3 本文方法 (仅使用注意 力增强模块) 99.1 94.9 98.7 90.6 95.7 97.8 94.7 100 93.7 96.3 98.1 95.1 93.5 95.3 95.8 94.7 92.5 97.5 90.3 85.8 99.7 95.2 本文方法 100 97.5 99.0 93.5 97.5 98.5 96.5 100 96.0 97.5 98.0 97.0 99.2 97.0 96.5 98.0 96.5 98.0 85.0 82.0 100 97.1 方法 AUC/% master- chef- can cracker- box sugar- box tomato- soup- can mustard- bottle tuna- fish- can pudding- box gelatin- box potted- meat- can Banana pitcher- base bleach- cleaner Bowl Mug power- drill wood- block Scissor large- marker large- clamp extra- large- clamp foam- brick 平均值 PointFusion[12 ] 90.9 80.5 90.4 91.9 88.5 93.8 87.5 95.0 86.4 84.7 85.5 81.0 75.7 94.2 71.5 68.1 76.7 87.9 65.9 60.4 91.8 83.9 PVN3D[31 ] 95.8 92.7 98.2 94.5 98.6 97.1 97.9 98.8 92.7 97.1 97.8 96.9 81.0 95.0 98.2 87.6 91.7 97.2 75.2 64.4 97.2 93.0 DenseFusion[13 ] 96.4 95.5 97.5 94.6 97.2 96.6 96.5 98.1 91.3 96.6 97.1 95.8 88.2 97.1 96.0 89.7 95.2 97.5 72.9 69.8 92.5 93.1 CFFM+CWTM[23 ] 94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7
本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
... [
31 ]
95.8 92.7 98.2 94.5 98.6 97.1 97.9 98.8 92.7 97.1 97.8 96.9 81.0 95.0 98.2 87.6 91.7 97.2 75.2 64.4 97.2 93.0 DenseFusion[13 ] 96.4 95.5 97.5 94.6 97.2 96.6 96.5 98.1 91.3 96.6 97.1 95.8 88.2 97.1 96.0 89.7 95.2 97.5 72.9 69.8 92.5 93.1 CFFM+CWTM[23 ] 94.3 92.2 98.7 93.9 97.1 94.8 93.3 99.1 91.6 91.1 95.2 86.5 83.8 90.5 94.8 84.3 92.8 88.6 73.2 62.3 93.3 90.5 FoundationPose[14 ] 96.5 94.2 96.8 95.0 97.4 96.1 94.5 97.0 93.8 96.3 94.0 92.5 91.8 94.3 93.1 89.5 88.2 92.0 87.5 85.4 95.9 93.2 本文方法 (仅使用多 尺度模块) 93.9 84.3 93.7 80.9 90.8 91.3 89.2 97.8 85.9 87.9 93.6 89.4 79.5 89.1 87.2 85.4 78.7 89.3 73.5 68.7 94.0 88.5 本文方法 (仅使用注意 力增强模块) 94.7 86.7 94.4 82.7 92.0 92.7 90.3 98.3 88.2 89.7 94.8 91.0 82.7 90.6 88.9 87.7 82.3 91.0 75.2 71.5 95.5 89.7 本文方法 96.9 98.6 98.6 95.0 96.5 94.5 93.1 99.0 90.3 91.8 95.5 93.4 88.3 92.5 90.5 100 85.5 98.4 82.5 80.5 97.0 93.7 本文方法基于PyTorch框架实现,运行在12th Gen intel (R) Core(TM) i5-12490F CPU和NVIDIA RTX 3060Ti GPU上. 在训练过程中,应用Adam优化器,初始学习率设置为0.01,最大值迭代次数设置为500,批大小设置为14,超参数ω 设置为0.01,逐像素特征个数n 设置为500. ...
1
... 提出跨模态多层深度融合网络,如图1 所示. 该网络的核心是通过注意力增强模块优化特征提取与融合过程. 1)对语义分割网络提取的颜色特征及PointNet++[32 ] 提取的几何特征进行高效异构特征提取,在保留颜色与几何信息的同时,避免直接融合的干扰. 2)通过多模态特征提取框架整合像素级多模态特征,强化特征表达能力,将多模态特征输入多尺度特征提取框架中,提取全局特征. 3)将多模态特征与全局特征融合,输入网络后续结构中,实现精细的6D物体位姿预测. 相较于依赖ICP迭代细化或单一特征融合的传统方法,该框架通过注意力驱动的多尺度特征深度融合机制,显著提升了位姿估计的精度. 后续实验将通过与PoseCNN+ICP和DenseFusion方法的对比,验证优越性. ...
2
... 在神经网络中,注意力机制常用于聚焦关键特征,对计算机视觉和自然语言处理任务具有重要意义[33 -34 ] . 注意力增强模块(AFE)在该网络中表现出显著优势. 与SENet[33 ] 主要关注的通道维度不同,AFE模块结合通道和空间注意力,且不同于CBAM[34 ] 的顺序处理,AFE模块采用平行和交叉处理,有效提升特征提取的全面性. 这种设计使AFE模块能够更有效地捕捉颜色和深度2种模态的关键特征,提升特征提取的全面性. ...
... [33 ]主要关注的通道维度不同,AFE模块结合通道和空间注意力,且不同于CBAM[34 ] 的顺序处理,AFE模块采用平行和交叉处理,有效提升特征提取的全面性. 这种设计使AFE模块能够更有效地捕捉颜色和深度2种模态的关键特征,提升特征提取的全面性. ...
2
... 在神经网络中,注意力机制常用于聚焦关键特征,对计算机视觉和自然语言处理任务具有重要意义[33 -34 ] . 注意力增强模块(AFE)在该网络中表现出显著优势. 与SENet[33 ] 主要关注的通道维度不同,AFE模块结合通道和空间注意力,且不同于CBAM[34 ] 的顺序处理,AFE模块采用平行和交叉处理,有效提升特征提取的全面性. 这种设计使AFE模块能够更有效地捕捉颜色和深度2种模态的关键特征,提升特征提取的全面性. ...
... [34 ]的顺序处理,AFE模块采用平行和交叉处理,有效提升特征提取的全面性. 这种设计使AFE模块能够更有效地捕捉颜色和深度2种模态的关键特征,提升特征提取的全面性. ...
1
... 在实验中,使用2个基准数据集(LineMOD[35 ] 和YCB-Video[18 ] )来评估该网络. LineMOD数据集由13个RGB-D序列组成,提供了含6DoF姿态、CAD模型、2D边界框及二进制掩模的注释RGB-D图像,将每个序列的约15%的图像用于训练,其余85%用于测试. 该数据集涵盖杂乱场景、无纹理物体、带噪声的深度数据和多变光照条件,是评估位姿估计方法鲁棒性的理想基准数据集. 如表1 所示为不同方法在该数据集上的实验结果. ...
2
... Quantitative assessment of ADD(-S) score on linenmod dataset
Tab.1 方法 输入数据 ADD(-S)分数/% Ape Ben Camera Can Cat Driller Duck Eggbox Glue Hole Iron Lamp Phone 平均值 BB8[19 ] RGB 40.2 91.7 55.8 63.7 62.9 73.7 44.3 58.1 41.0 67.2 84.7 76.9 54.0 62.3 PVNet[21 ] 43.6 99.9 86.9 95.5 79.3 96.4 52.6 99.2 95.7 81.9 98.9 99.3 92.4 86.3 DeepIM[28 ] 77.2 97.8 93.7 96.8 82.0 95.0 77.8 97.1 99.3 52.8 98.3 98.0 87.9 89.0 TexPose[36 ] 80.9 99.0 94.8 99.7 92.6 97.4 83.4 94.9 93.4 79.3 99.8 98.3 78.9 91.7 SSD-6D+ICP[20 ] RGB-D 65.0 80.0 78.0 86.0 70.0 73.0 66.0 100 100 49.0 78.0 73.0 79.0 76.7 CFFM+CWTM[23 ] 88.2 91.5 93.4 93.8 94.4 91.6 89.4 97.3 99.1 89.3 95.7 94.2 93.7 93.2 Per-pixel Densefusion[13 ] 79.8 84.1 76.7 86.8 88.9 77.8 76.2 100 99.0 79.0 92.1 92.0 88.0 86.1 Iterative-Densefusion[13 ] 92.1 93.2 94.3 93.1 96.5 87.0 92.0 100 100 92.1 97.0 95.1 92.8 94.3 本文方法(仅使用多尺度模块) 93.8 89.6 90.5 90.2 91.1 90.3 89.5 100 100 84.7 93.1 91.5 89.0 89.4 本文方法(仅使用注意力增强模块) 89.3 90.1 89.7 89.2 90.2 89.8 88.7 100 98.4 89.3 90.2 89.7 90.0 89.0 本文方法 95.4 93.1 95.9 93.2 95.0 94.2 90.3 100 100 92.2 96.5 95.1 94.8 95.2
YCB-Video数据集包含21个对象,分布在92个RGB-D视频中,每个视频包含3~9个来自YCB对象数据集的物体. 数据集共提供133 827张分辨率为640×480像素的图像,适合用于位姿估计与跟踪任务. 在该数据集上的实验结果如表2 所示. ...
... 表1 中,加粗的对象是对称物体,“仅使用多尺度模块”指移除AFE模块,“仅使用注意力增强模块”指移除多尺度网络. 从表1 可知,本文方法的平均ADD(-S)评分为95.2%. 其他方法的得分如下:BB8 (62.3%)、PVNet (86.3%)、DeepIM (89.0%)、TexPose[36 ] (91.7%)、SSD-6D+ICP (76.7%)、Per-pixel Densefusion(86.1%)、Iterative-Densefusion(94.3%). 重投影误差在二维图像平面中难以避免. ...