基于知识图谱引导的三维视觉问答
|
|
毛爱华,陈思宇
|
3D visual question answering guided by knowledge graph
|
|
Aihua MAO,Siyu CHEN
|
|
| 表 1 不同方法在ScanQA带有对象的测试集上的评估指标结果对比 |
| Tab.1 Comparison evaluation metrics for different methods on ScanQA test set with objects |
|
| 方法 | EM@1/% | EM@10/% | BLEU-1/% | BLEU-4/% | ROUGE/% | METEOR/% | CIDEr | | RandomImage+MCAN[1] | 22.31 | 53.11 | 26.66 | 14.26 | 31.27 | 12.13 | 60.37 | | VoteNet+MCAN[1] | 19.71 | 50.76 | 29.46 | 6.08 | 30.97 | 12.07 | 58.23 | | scanRefer+MCAN(e2e) [1] | 20.56 | 52.35 | 27.85 | 7.46 | 30.68 | 11.97 | 57.36 | | scanQA[1] | 23.45 | 56.51 | 31.56 | 12.04 | 34.34 | 13.55 | 67.29 | | 3D-VisTA(scratch)[11] | 25.20 | 55.20 | — | 10.50 | 35.50 | 13.80 | 68.60 | | Multi-CLIP[2] | 22.76 | — | 31.08 | 13.31 | 33.84 | 13.28 | 65.81 | | 本研究 | 24.47 | 56.18 | 33.85 | 13.59 | 36.26 | 14.42 | 71.33 | | jin-Context-aware*[4] | 24.58 | 55.97 | 33.15 | 11.23 | 35.97 | 14.16 | 70.18 | | Multi-CLIP(pre-trained)*[2] | 24.02 | — | 32.63 | 12.65 | 35.46 | 13.97 | 68.70 | | 3D-VisTA*[11] | 27.00 | 57.90 | — | 16.00 | 38.60 | 15.20 | 76.60 | | CLIP*[3] | 23.92 | — | 32.72 | 14.64 | 35.15 | 13.94 | 69.53 |
|
|
|