基于知识图谱引导的三维视觉问答
|
|
毛爱华,陈思宇
|
3D visual question answering guided by knowledge graph
|
|
Aihua MAO,Siyu CHEN
|
|
| 表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 |
| Tab.2 Comparison evaluation metrics for different methods on ScanQA test set without objects |
|
| 方法 | EM@1/% | EM@10/% | BLEU-1/% | BLEU-4/% | ROUGE/% | METEOR/% | CIDEr | | RandomImage+MCAN[1] | 20.82 | 51.23 | 26.29 | 9.66 | 29.23 | 11.54 | 55.64 | | VoteNet+MCAN[1] | 18.15 | 48.56 | 29.63 | 7.10 | 29.12 | 11.68 | 53.34 | | scanRefer+MCAN(e2e)[1] | 19.04 | 49.70 | 26.98 | 7.82 | 28.61 | 11.38 | 53.41 | | scanQA[1] | 20.90 | 54.11 | 30.68 | 10.75 | 31.09 | 12.59 | 60.24 | | 3D-VisTA(scratch) [11] | 20.40 | 51.50 | — | 8.70 | 29.60 | 11.60 | 55.70 | | Multi-CLIP[2] | 20.71 | — | 31.22 | 11.49 | 31.25 | 12.80 | 60.75 | | 本研究 | 21.10 | 54.49 | 33.28 | 11.94 | 32.84 | 13.30 | 63.41 | | jin-Context-aware*[4] | 21.56 | 53.89 | 31.48 | 15.84 | 31.79 | 13.13 | 63.40 | | Multi-CLIP(pre-trained)*[2] | 21.48 | — | 32.69 | 12.87 | 32.61 | 13.36 | 63.20 | | 3D-VisTA*[11] | 23.00 | 53.50 | — | 11.90 | 32.80 | 12.90 | 62.60 | | CLIP*[3] | 21.37 | — | 32.70 | 11.73 | 32.41 | 13.28 | 62.83 |
|
|
|