基于注意力增强的跨模态多层融合网络的物体位姿估计
|
|
杨恒,王韶涵,董青,赵科渊,杨明亮
|
Object pose estimation based on attention enhancement cross-modal multilayer fusion network
|
|
Heng YANG,Shaohan WANG,Qing DONG,Keyuan ZHAO,Mingliang YANG
|
|
| 表 1 linenmod数据集上ADD(-S)分数的定量评估 |
| Tab.1 Quantitative assessment of ADD(-S) score on linenmod dataset |
|
| 方法 | 输入数据 | ADD(-S)分数/% | | Ape | Ben | Camera | Can | Cat | Driller | Duck | Eggbox | Glue | Hole | Iron | Lamp | Phone | 平均值 | | BB8[19] | RGB | 40.2 | 91.7 | 55.8 | 63.7 | 62.9 | 73.7 | 44.3 | 58.1 | 41.0 | 67.2 | 84.7 | 76.9 | 54.0 | 62.3 | | PVNet[21] | 43.6 | 99.9 | 86.9 | 95.5 | 79.3 | 96.4 | 52.6 | 99.2 | 95.7 | 81.9 | 98.9 | 99.3 | 92.4 | 86.3 | | DeepIM[28] | 77.2 | 97.8 | 93.7 | 96.8 | 82.0 | 95.0 | 77.8 | 97.1 | 99.3 | 52.8 | 98.3 | 98.0 | 87.9 | 89.0 | | TexPose[36] | 80.9 | 99.0 | 94.8 | 99.7 | 92.6 | 97.4 | 83.4 | 94.9 | 93.4 | 79.3 | 99.8 | 98.3 | 78.9 | 91.7 | | SSD-6D+ICP[20] | RGB-D | 65.0 | 80.0 | 78.0 | 86.0 | 70.0 | 73.0 | 66.0 | 100 | 100 | 49.0 | 78.0 | 73.0 | 79.0 | 76.7 | | CFFM+CWTM[23] | 88.2 | 91.5 | 93.4 | 93.8 | 94.4 | 91.6 | 89.4 | 97.3 | 99.1 | 89.3 | 95.7 | 94.2 | 93.7 | 93.2 | | Per-pixel Densefusion[13] | 79.8 | 84.1 | 76.7 | 86.8 | 88.9 | 77.8 | 76.2 | 100 | 99.0 | 79.0 | 92.1 | 92.0 | 88.0 | 86.1 | | Iterative-Densefusion[13] | 92.1 | 93.2 | 94.3 | 93.1 | 96.5 | 87.0 | 92.0 | 100 | 100 | 92.1 | 97.0 | 95.1 | 92.8 | 94.3 | | 本文方法(仅使用多尺度模块) | 93.8 | 89.6 | 90.5 | 90.2 | 91.1 | 90.3 | 89.5 | 100 | 100 | 84.7 | 93.1 | 91.5 | 89.0 | 89.4 | | 本文方法(仅使用注意力增强模块) | 89.3 | 90.1 | 89.7 | 89.2 | 90.2 | 89.8 | 88.7 | 100 | 98.4 | 89.3 | 90.2 | 89.7 | 90.0 | 89.0 | | 本文方法 | 95.4 | 93.1 | 95.9 | 93.2 | 95.0 | 94.2 | 90.3 | 100 | 100 | 92.2 | 96.5 | 95.1 | 94.8 | 95.2 |
|
|
|