基于注意力增强的跨模态多层融合网络的物体位姿估计
杨恒,王韶涵,董青,赵科渊,杨明亮

Object pose estimation based on attention enhancement cross-modal multilayer fusion network
Heng YANG,Shaohan WANG,Qing DONG,Keyuan ZHAO,Mingliang YANG
表 1 linenmod数据集上ADD(-S)分数的定量评估
Tab.1 Quantitative assessment of ADD(-S) score on linenmod dataset
方法输入数据ADD(-S)分数/%
ApeBenCameraCanCatDrillerDuckEggboxGlueHoleIronLampPhone平均值
BB8[19]RGB40.291.755.863.762.973.744.358.141.067.284.776.954.062.3
PVNet[21]43.699.986.995.579.396.452.699.295.781.998.999.392.486.3
DeepIM[28]77.297.893.796.882.095.077.897.199.352.898.398.087.989.0
TexPose[36]80.999.094.899.792.697.483.494.993.479.399.898.378.991.7
SSD-6D+ICP[20]RGB-D65.080.078.086.070.073.066.010010049.078.073.079.076.7
CFFM+CWTM[23]88.291.593.493.894.491.689.497.399.189.395.794.293.793.2
Per-pixel Densefusion[13]79.884.176.786.888.977.876.210099.079.092.192.088.086.1
Iterative-Densefusion[13]92.193.294.393.196.587.092.010010092.197.095.192.894.3
本文方法(仅使用多尺度模块)93.889.690.590.291.190.389.510010084.793.191.589.089.4
本文方法(仅使用注意力增强模块)89.390.189.789.290.289.888.710098.489.390.289.790.089.0
本文方法95.493.195.993.295.094.290.310010092.296.595.194.895.2