[1]
AZUMA D, MIYANISHI T, KURITA S, et al. ScanQA: 3D question answering for spatial scene understanding [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . New Orleans: IEEE, 2022: 19107–19117.
[本文引用: 14]
[2]
DELITZAS A, PARELLI M, HARS N, et al. Multi-CLIP: contrastive vision-language pre-training for question answering tasks in 3D scenes [EB/OL]. (2023–06–04)[2025–07–02]. https://arxiv.org/pdf/2306.02329.
[本文引用: 6]
[3]
RADFORD A, KIM J W, HALLACY C, et al. Learning transferable visual models from natural language supervision [EB/OL]. (2021–02–26)[2025–07–02]. https://arxiv.org/pdf/2103.00020.
[本文引用: 5]
[4]
JIN Z, HAYAT M, YANG Y, et al. Context-aware alignment and mutual masking for 3D-language pre-training [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Vancouver: IEEE, 2023: 10984–10994.
[本文引用: 4]
[5]
CHEN D Z, CHANG A X, NIEßNER M. ScanRefer: 3D object localization in RGB-D scans using natural language [C]// Computer Vision – ECCV 2020 . [S.l.]: Springer International Publishing, 2020: 202–221.
[本文引用: 1]
[6]
HONG Y, ZHEN H, CHEN P, et al. 3D-LLM: injecting the 3D world into large language models [EB/OL]. (2023–07–24)[2025–07–02]. https://arxiv.org/pdf/2307.12981.
[本文引用: 1]
[7]
LI J, LI D, SAVARESE S, et al. BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models [C]// Proceedings of the International Conference on Machine Learning . [S.l.]: PMLR, 2023: 19730-19742.
[本文引用: 1]
[8]
ALAYRAC J B, DONAHUE J, LUC P, et al. Flamingo: a visual language model for few-shot learning [EB/OL]. (2022–11–15)[2025–07–02]. https://arxiv.org/pdf/2204.14198.
[本文引用: 1]
[9]
PAPINENI K, ROUKOS S, WARD T, et al. BLEU: a method for automatic evaluation of machine translation [C]// Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics . Philadelphia: Association for Computational Linguistics, 2002: 311–318.
[本文引用: 2]
[10]
VEDANTAM R, ZITNICK C L, PARIKH D. CIDEr: consensus-based image description evaluation [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition . Boston: IEEE, 2015: 4566–4575.
[本文引用: 2]
[11]
ZHU Z, MA X, CHEN Y, et al. 3D-VisTA: pre-trained transformer for 3D vision and text alignment [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision . Paris: IEEE, 2024: 2899–2909.
[本文引用: 7]
[12]
VO D M, CHEN H, SUGIMOTO A, et al. NOC-REK: novel object captioning with retrieved vocabulary from external knowledge [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . New Orleans: IEEE, 2022: 17979–17987.
[本文引用: 1]
[13]
SPEER R, CHIN J, HAVASI C ConceptNet 5.5: an open multilingual graph of general knowledge
[J]. Proceedings of the AAAI Conference on Artificial Intelligence , 2017 , 31 (1 ): 1
DOI:10.1609/aaai.v31i1.11164
[本文引用: 1]
[14]
DING Z, HAN X, NIETHAMMER M. VoteNet: a deep learning label fusion method for multi-atlas segmentation [C]// Medical Image Computing and Computer Assisted Intervention – MICCAI 2019 . [S.l.]: Springer, 2019: 202–210.
[本文引用: 1]
[15]
PENNINGTON J, SOCHER R, MANNING C. GloVe: global vectors for word representation [C]// Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing . Doha: Association for Computational Linguistics, 2014: 1532–1543.
[本文引用: 1]
[16]
SCHUSTER M, PALIWAL K K Bidirectional recurrent neural networks
[J]. IEEE Transactions on Signal Processing , 1997 , 45 (11 ): 2673 - 2681
DOI:10.1109/78.650093
[本文引用: 1]
[17]
KIPF T N, WELLING M. Semi-supervised classification with graph convolutional networks [EB/OL]. (2017–02–22)[2025–07–02]. https://arxiv.org/pdf/1609.02907.
[本文引用: 1]
[18]
RUMELHART D E, HINTON G E, WILLIAMS R J Learning representations by back-propagating errors
[J]. Nature , 1986 , 323 (6088 ): 533 - 536
DOI:10.1038/323533a0
[本文引用: 2]
[19]
LIN C Y, HOVY E. Automatic evaluation of summaries using N-gram co-occurrence statistics [C]// Proceedings of the 2003 Conference of the North American Chapter of the Association for Computational Linguistics on Human Language Technology - NAACL '03 . Edmonton: ACL, 2003: 71–78.
[本文引用: 1]
[20]
BANERJEE S, LAVIE A. METEOR: an automatic metric for MT evaluation with improved correlation with human judgments [C]// Proceedings of the ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and/or Summarization . Ann Arbor: Association for Computational Linguistics, 2005: 65–72.
[本文引用: 1]
14
... 三维视觉问答(3D visual question answering, 3D VQA)任务旨在回答与三维场景相关的问题,相较于传统的二维图像问答任务,3D VQA不仅要理解二维图像中的信息,还要处理物体间的空间关系和几何结构[1 ] . 3D VQA任务面临的核心挑战主要包括空间关系的建模和复杂推理的需求. 在三维场景中,物体之间的关系复杂且动态变化,如何精确捕捉这些关系并进行有效的推理是研究重点. Multi-CLIP[2 ] 利用对比学习将三维场景特征与二维图像和文本特征对齐,提升了模型对三维场景的理解和推理能力. 通过迁移二维视觉模型CLIP[3 ] 的强大能力,该方法使得模型能够在3D VQA任务中更好地融合图像和文本信息. ...
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
... 所采用的三维问答实验数据集为ScanQA,该数据集是具代表性的三维视觉问答数据集. 数据集共包含约800个场景,超20 000条问题-答案对,答案类型主要包括:实体类(如“椅子”、“电视”)和非实体类(如“2”、“是/否”). 在对比实验开始之前,对当前在ScanQA数据集上开展的三维视觉问答方法进行分类梳理. 根据模型训练策略与预训练依赖的不同,现有方法大致可以分为2个类别:第一类方法是仅在ScanQA数据集上进行训练的模型,通常从零开始对三维场景理解与语言问答进行联合建模,包括ScanQA[1 ] 和3D-VisTA(scrratch)[11 ] ,还包括一些从二维视觉问答迁移到三维视觉问答的工作[3 ] ,此类工作在原任务中大都表现优异,包括RandomImage+MCAN[1 ] 、VoteNet+MCAN[1 ] 和scanRefer+MCAN(e2e)[1 ] . 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4 ] 、3D-VisTA[11 ] 、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... [1 ]、VoteNet+MCAN[1 ] 和scanRefer+MCAN(e2e)[1 ] . 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4 ] 、3D-VisTA[11 ] 、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... [1 ]和scanRefer+MCAN(e2e)[1 ] . 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4 ] 、3D-VisTA[11 ] 、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... [1 ]. 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4 ] 、3D-VisTA[11 ] 、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... Comparison evaluation metrics for different methods on ScanQA test set with objects
Tab.1 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 22.31 53.11 26.66 14.26 31.27 12.13 60.37 VoteNet+MCAN[1 ] 19.71 50.76 29.46 6.08 30.97 12.07 58.23 scanRefer+MCAN(e2e) [1 ] 20.56 52.35 27.85 7.46 30.68 11.97 57.36 scanQA[1 ] 23.45 56.51 31.56 12.04 34.34 13.55 67.29 3D-VisTA(scratch)[11 ] 25.20 55.20 — 10.50 35.50 13.80 68.60 Multi-CLIP[2 ] 22.76 — 31.08 13.31 33.84 13.28 65.81 本研究 24.47 56.18 33.85 13.59 36.26 14.42 71.33 jin-Context-aware*[4 ] 24.58 55.97 33.15 11.23 35.97 14.16 70.18 Multi-CLIP(pre-trained)*[2 ] 24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53
表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... [
1 ]
19.71 50.76 29.46 6.08 30.97 12.07 58.23 scanRefer+MCAN(e2e) [1 ] 20.56 52.35 27.85 7.46 30.68 11.97 57.36 scanQA[1 ] 23.45 56.51 31.56 12.04 34.34 13.55 67.29 3D-VisTA(scratch)[11 ] 25.20 55.20 — 10.50 35.50 13.80 68.60 Multi-CLIP[2 ] 22.76 — 31.08 13.31 33.84 13.28 65.81 本研究 24.47 56.18 33.85 13.59 36.26 14.42 71.33 jin-Context-aware*[4 ] 24.58 55.97 33.15 11.23 35.97 14.16 70.18 Multi-CLIP(pre-trained)*[2 ] 24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53 表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... [
1 ]
20.56 52.35 27.85 7.46 30.68 11.97 57.36 scanQA[1 ] 23.45 56.51 31.56 12.04 34.34 13.55 67.29 3D-VisTA(scratch)[11 ] 25.20 55.20 — 10.50 35.50 13.80 68.60 Multi-CLIP[2 ] 22.76 — 31.08 13.31 33.84 13.28 65.81 本研究 24.47 56.18 33.85 13.59 36.26 14.42 71.33 jin-Context-aware*[4 ] 24.58 55.97 33.15 11.23 35.97 14.16 70.18 Multi-CLIP(pre-trained)*[2 ] 24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53 表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... [
1 ]
23.45 56.51 31.56 12.04 34.34 13.55 67.29 3D-VisTA(scratch)[11 ] 25.20 55.20 — 10.50 35.50 13.80 68.60 Multi-CLIP[2 ] 22.76 — 31.08 13.31 33.84 13.28 65.81 本研究 24.47 56.18 33.85 13.59 36.26 14.42 71.33 jin-Context-aware*[4 ] 24.58 55.97 33.15 11.23 35.97 14.16 70.18 Multi-CLIP(pre-trained)*[2 ] 24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53 表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... Comparison evaluation metrics for different methods on ScanQA test set without objects
Tab.2 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 20.82 51.23 26.29 9.66 29.23 11.54 55.64 VoteNet+MCAN[1 ] 18.15 48.56 29.63 7.10 29.12 11.68 53.34 scanRefer+MCAN(e2e)[1 ] 19.04 49.70 26.98 7.82 28.61 11.38 53.41 scanQA[1 ] 20.90 54.11 30.68 10.75 31.09 12.59 60.24 3D-VisTA(scratch) [11 ] 20.40 51.50 — 8.70 29.60 11.60 55.70 Multi-CLIP[2 ] 20.71 — 31.22 11.49 31.25 12.80 60.75 本研究 21.10 54.49 33.28 11.94 32.84 13.30 63.41 jin-Context-aware*[4 ] 21.56 53.89 31.48 15.84 31.79 13.13 63.40 Multi-CLIP(pre-trained)*[2 ] 21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83
分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
... [
1 ]
18.15 48.56 29.63 7.10 29.12 11.68 53.34 scanRefer+MCAN(e2e)[1 ] 19.04 49.70 26.98 7.82 28.61 11.38 53.41 scanQA[1 ] 20.90 54.11 30.68 10.75 31.09 12.59 60.24 3D-VisTA(scratch) [11 ] 20.40 51.50 — 8.70 29.60 11.60 55.70 Multi-CLIP[2 ] 20.71 — 31.22 11.49 31.25 12.80 60.75 本研究 21.10 54.49 33.28 11.94 32.84 13.30 63.41 jin-Context-aware*[4 ] 21.56 53.89 31.48 15.84 31.79 13.13 63.40 Multi-CLIP(pre-trained)*[2 ] 21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83 分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
... [
1 ]
19.04 49.70 26.98 7.82 28.61 11.38 53.41 scanQA[1 ] 20.90 54.11 30.68 10.75 31.09 12.59 60.24 3D-VisTA(scratch) [11 ] 20.40 51.50 — 8.70 29.60 11.60 55.70 Multi-CLIP[2 ] 20.71 — 31.22 11.49 31.25 12.80 60.75 本研究 21.10 54.49 33.28 11.94 32.84 13.30 63.41 jin-Context-aware*[4 ] 21.56 53.89 31.48 15.84 31.79 13.13 63.40 Multi-CLIP(pre-trained)*[2 ] 21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83 分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
... [
1 ]
20.90 54.11 30.68 10.75 31.09 12.59 60.24 3D-VisTA(scratch) [11 ] 20.40 51.50 — 8.70 29.60 11.60 55.70 Multi-CLIP[2 ] 20.71 — 31.22 11.49 31.25 12.80 60.75 本研究 21.10 54.49 33.28 11.94 32.84 13.30 63.41 jin-Context-aware*[4 ] 21.56 53.89 31.48 15.84 31.79 13.13 63.40 Multi-CLIP(pre-trained)*[2 ] 21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83 分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
6
... 三维视觉问答(3D visual question answering, 3D VQA)任务旨在回答与三维场景相关的问题,相较于传统的二维图像问答任务,3D VQA不仅要理解二维图像中的信息,还要处理物体间的空间关系和几何结构[1 ] . 3D VQA任务面临的核心挑战主要包括空间关系的建模和复杂推理的需求. 在三维场景中,物体之间的关系复杂且动态变化,如何精确捕捉这些关系并进行有效的推理是研究重点. Multi-CLIP[2 ] 利用对比学习将三维场景特征与二维图像和文本特征对齐,提升了模型对三维场景的理解和推理能力. 通过迁移二维视觉模型CLIP[3 ] 的强大能力,该方法使得模型能够在3D VQA任务中更好地融合图像和文本信息. ...
... 所采用的三维问答实验数据集为ScanQA,该数据集是具代表性的三维视觉问答数据集. 数据集共包含约800个场景,超20 000条问题-答案对,答案类型主要包括:实体类(如“椅子”、“电视”)和非实体类(如“2”、“是/否”). 在对比实验开始之前,对当前在ScanQA数据集上开展的三维视觉问答方法进行分类梳理. 根据模型训练策略与预训练依赖的不同,现有方法大致可以分为2个类别:第一类方法是仅在ScanQA数据集上进行训练的模型,通常从零开始对三维场景理解与语言问答进行联合建模,包括ScanQA[1 ] 和3D-VisTA(scrratch)[11 ] ,还包括一些从二维视觉问答迁移到三维视觉问答的工作[3 ] ,此类工作在原任务中大都表现优异,包括RandomImage+MCAN[1 ] 、VoteNet+MCAN[1 ] 和scanRefer+MCAN(e2e)[1 ] . 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4 ] 、3D-VisTA[11 ] 、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... Comparison evaluation metrics for different methods on ScanQA test set with objects
Tab.1 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 22.31 53.11 26.66 14.26 31.27 12.13 60.37 VoteNet+MCAN[1 ] 19.71 50.76 29.46 6.08 30.97 12.07 58.23 scanRefer+MCAN(e2e) [1 ] 20.56 52.35 27.85 7.46 30.68 11.97 57.36 scanQA[1 ] 23.45 56.51 31.56 12.04 34.34 13.55 67.29 3D-VisTA(scratch)[11 ] 25.20 55.20 — 10.50 35.50 13.80 68.60 Multi-CLIP[2 ] 22.76 — 31.08 13.31 33.84 13.28 65.81 本研究 24.47 56.18 33.85 13.59 36.26 14.42 71.33 jin-Context-aware*[4 ] 24.58 55.97 33.15 11.23 35.97 14.16 70.18 Multi-CLIP(pre-trained)*[2 ] 24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53
表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... [
2 ]
24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53 表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... Comparison evaluation metrics for different methods on ScanQA test set without objects
Tab.2 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 20.82 51.23 26.29 9.66 29.23 11.54 55.64 VoteNet+MCAN[1 ] 18.15 48.56 29.63 7.10 29.12 11.68 53.34 scanRefer+MCAN(e2e)[1 ] 19.04 49.70 26.98 7.82 28.61 11.38 53.41 scanQA[1 ] 20.90 54.11 30.68 10.75 31.09 12.59 60.24 3D-VisTA(scratch) [11 ] 20.40 51.50 — 8.70 29.60 11.60 55.70 Multi-CLIP[2 ] 20.71 — 31.22 11.49 31.25 12.80 60.75 本研究 21.10 54.49 33.28 11.94 32.84 13.30 63.41 jin-Context-aware*[4 ] 21.56 53.89 31.48 15.84 31.79 13.13 63.40 Multi-CLIP(pre-trained)*[2 ] 21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83
分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
... [
2 ]
21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83 分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
5
... 三维视觉问答(3D visual question answering, 3D VQA)任务旨在回答与三维场景相关的问题,相较于传统的二维图像问答任务,3D VQA不仅要理解二维图像中的信息,还要处理物体间的空间关系和几何结构[1 ] . 3D VQA任务面临的核心挑战主要包括空间关系的建模和复杂推理的需求. 在三维场景中,物体之间的关系复杂且动态变化,如何精确捕捉这些关系并进行有效的推理是研究重点. Multi-CLIP[2 ] 利用对比学习将三维场景特征与二维图像和文本特征对齐,提升了模型对三维场景的理解和推理能力. 通过迁移二维视觉模型CLIP[3 ] 的强大能力,该方法使得模型能够在3D VQA任务中更好地融合图像和文本信息. ...
... 所采用的三维问答实验数据集为ScanQA,该数据集是具代表性的三维视觉问答数据集. 数据集共包含约800个场景,超20 000条问题-答案对,答案类型主要包括:实体类(如“椅子”、“电视”)和非实体类(如“2”、“是/否”). 在对比实验开始之前,对当前在ScanQA数据集上开展的三维视觉问答方法进行分类梳理. 根据模型训练策略与预训练依赖的不同,现有方法大致可以分为2个类别:第一类方法是仅在ScanQA数据集上进行训练的模型,通常从零开始对三维场景理解与语言问答进行联合建模,包括ScanQA[1 ] 和3D-VisTA(scrratch)[11 ] ,还包括一些从二维视觉问答迁移到三维视觉问答的工作[3 ] ,此类工作在原任务中大都表现优异,包括RandomImage+MCAN[1 ] 、VoteNet+MCAN[1 ] 和scanRefer+MCAN(e2e)[1 ] . 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4 ] 、3D-VisTA[11 ] 、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... [3 ]. 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... Comparison evaluation metrics for different methods on ScanQA test set with objects
Tab.1 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 22.31 53.11 26.66 14.26 31.27 12.13 60.37 VoteNet+MCAN[1 ] 19.71 50.76 29.46 6.08 30.97 12.07 58.23 scanRefer+MCAN(e2e) [1 ] 20.56 52.35 27.85 7.46 30.68 11.97 57.36 scanQA[1 ] 23.45 56.51 31.56 12.04 34.34 13.55 67.29 3D-VisTA(scratch)[11 ] 25.20 55.20 — 10.50 35.50 13.80 68.60 Multi-CLIP[2 ] 22.76 — 31.08 13.31 33.84 13.28 65.81 本研究 24.47 56.18 33.85 13.59 36.26 14.42 71.33 jin-Context-aware*[4 ] 24.58 55.97 33.15 11.23 35.97 14.16 70.18 Multi-CLIP(pre-trained)*[2 ] 24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53
表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... Comparison evaluation metrics for different methods on ScanQA test set without objects
Tab.2 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 20.82 51.23 26.29 9.66 29.23 11.54 55.64 VoteNet+MCAN[1 ] 18.15 48.56 29.63 7.10 29.12 11.68 53.34 scanRefer+MCAN(e2e)[1 ] 19.04 49.70 26.98 7.82 28.61 11.38 53.41 scanQA[1 ] 20.90 54.11 30.68 10.75 31.09 12.59 60.24 3D-VisTA(scratch) [11 ] 20.40 51.50 — 8.70 29.60 11.60 55.70 Multi-CLIP[2 ] 20.71 — 31.22 11.49 31.25 12.80 60.75 本研究 21.10 54.49 33.28 11.94 32.84 13.30 63.41 jin-Context-aware*[4 ] 21.56 53.89 31.48 15.84 31.79 13.13 63.40 Multi-CLIP(pre-trained)*[2 ] 21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83
分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
4
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
... 所采用的三维问答实验数据集为ScanQA,该数据集是具代表性的三维视觉问答数据集. 数据集共包含约800个场景,超20 000条问题-答案对,答案类型主要包括:实体类(如“椅子”、“电视”)和非实体类(如“2”、“是/否”). 在对比实验开始之前,对当前在ScanQA数据集上开展的三维视觉问答方法进行分类梳理. 根据模型训练策略与预训练依赖的不同,现有方法大致可以分为2个类别:第一类方法是仅在ScanQA数据集上进行训练的模型,通常从零开始对三维场景理解与语言问答进行联合建模,包括ScanQA[1 ] 和3D-VisTA(scrratch)[11 ] ,还包括一些从二维视觉问答迁移到三维视觉问答的工作[3 ] ,此类工作在原任务中大都表现优异,包括RandomImage+MCAN[1 ] 、VoteNet+MCAN[1 ] 和scanRefer+MCAN(e2e)[1 ] . 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4 ] 、3D-VisTA[11 ] 、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... Comparison evaluation metrics for different methods on ScanQA test set with objects
Tab.1 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 22.31 53.11 26.66 14.26 31.27 12.13 60.37 VoteNet+MCAN[1 ] 19.71 50.76 29.46 6.08 30.97 12.07 58.23 scanRefer+MCAN(e2e) [1 ] 20.56 52.35 27.85 7.46 30.68 11.97 57.36 scanQA[1 ] 23.45 56.51 31.56 12.04 34.34 13.55 67.29 3D-VisTA(scratch)[11 ] 25.20 55.20 — 10.50 35.50 13.80 68.60 Multi-CLIP[2 ] 22.76 — 31.08 13.31 33.84 13.28 65.81 本研究 24.47 56.18 33.85 13.59 36.26 14.42 71.33 jin-Context-aware*[4 ] 24.58 55.97 33.15 11.23 35.97 14.16 70.18 Multi-CLIP(pre-trained)*[2 ] 24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53
表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... Comparison evaluation metrics for different methods on ScanQA test set without objects
Tab.2 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 20.82 51.23 26.29 9.66 29.23 11.54 55.64 VoteNet+MCAN[1 ] 18.15 48.56 29.63 7.10 29.12 11.68 53.34 scanRefer+MCAN(e2e)[1 ] 19.04 49.70 26.98 7.82 28.61 11.38 53.41 scanQA[1 ] 20.90 54.11 30.68 10.75 31.09 12.59 60.24 3D-VisTA(scratch) [11 ] 20.40 51.50 — 8.70 29.60 11.60 55.70 Multi-CLIP[2 ] 20.71 — 31.22 11.49 31.25 12.80 60.75 本研究 21.10 54.49 33.28 11.94 32.84 13.30 63.41 jin-Context-aware*[4 ] 21.56 53.89 31.48 15.84 31.79 13.13 63.40 Multi-CLIP(pre-trained)*[2 ] 21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83
分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
1
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
1
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
1
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
1
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
2
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
... 三维视觉问答属于开放式三维问答任务,要求模型以自然语言形式生成完整答案,因此在评价模型性能时,不仅要考虑答案是否与参考文本完全匹配,还要综合评估语言表达的准确性与自然性. 三维视觉问答的评估指标主要有2个类别:1)评估文本生成质量的指标,包括BLEU[9 ] ,面向召回的摘要评估替补(recall-oriented understudy for gisting evaluation, ROUGE-L)[19 ] ,显式排序的翻译评估指标(metric for evaluation of translation with explicit ordering, METEOR)[20 ] 和CIDEr[10 ] ;2)准确率评价指标EM@k [18 ] (exact match at top-k ),旨在衡量模型生成的前k 个答案中,是否存在与参考答案完全匹配的项. ...
2
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
... 三维视觉问答属于开放式三维问答任务,要求模型以自然语言形式生成完整答案,因此在评价模型性能时,不仅要考虑答案是否与参考文本完全匹配,还要综合评估语言表达的准确性与自然性. 三维视觉问答的评估指标主要有2个类别:1)评估文本生成质量的指标,包括BLEU[9 ] ,面向召回的摘要评估替补(recall-oriented understudy for gisting evaluation, ROUGE-L)[19 ] ,显式排序的翻译评估指标(metric for evaluation of translation with explicit ordering, METEOR)[20 ] 和CIDEr[10 ] ;2)准确率评价指标EM@k [18 ] (exact match at top-k ),旨在衡量模型生成的前k 个答案中,是否存在与参考答案完全匹配的项. ...
7
... 随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4 ] 提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5 ] 与ScanQA[1 ] 的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6 ] ,其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7 ] 和Flamingo[8 ] ,进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9 ] 、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10 ] 的评估指标上的提升超过9%. 此外,3D-VisTA[11 ] 尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础. ...
... 所采用的三维问答实验数据集为ScanQA,该数据集是具代表性的三维视觉问答数据集. 数据集共包含约800个场景,超20 000条问题-答案对,答案类型主要包括:实体类(如“椅子”、“电视”)和非实体类(如“2”、“是/否”). 在对比实验开始之前,对当前在ScanQA数据集上开展的三维视觉问答方法进行分类梳理. 根据模型训练策略与预训练依赖的不同,现有方法大致可以分为2个类别:第一类方法是仅在ScanQA数据集上进行训练的模型,通常从零开始对三维场景理解与语言问答进行联合建模,包括ScanQA[1 ] 和3D-VisTA(scrratch)[11 ] ,还包括一些从二维视觉问答迁移到三维视觉问答的工作[3 ] ,此类工作在原任务中大都表现优异,包括RandomImage+MCAN[1 ] 、VoteNet+MCAN[1 ] 和scanRefer+MCAN(e2e)[1 ] . 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4 ] 、3D-VisTA[11 ] 、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... [11 ]、Multi-CLIP[2 ] 和CLIP[3 ] . 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大. ...
... Comparison evaluation metrics for different methods on ScanQA test set with objects
Tab.1 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 22.31 53.11 26.66 14.26 31.27 12.13 60.37 VoteNet+MCAN[1 ] 19.71 50.76 29.46 6.08 30.97 12.07 58.23 scanRefer+MCAN(e2e) [1 ] 20.56 52.35 27.85 7.46 30.68 11.97 57.36 scanQA[1 ] 23.45 56.51 31.56 12.04 34.34 13.55 67.29 3D-VisTA(scratch)[11 ] 25.20 55.20 — 10.50 35.50 13.80 68.60 Multi-CLIP[2 ] 22.76 — 31.08 13.31 33.84 13.28 65.81 本研究 24.47 56.18 33.85 13.59 36.26 14.42 71.33 jin-Context-aware*[4 ] 24.58 55.97 33.15 11.23 35.97 14.16 70.18 Multi-CLIP(pre-trained)*[2 ] 24.02 — 32.63 12.65 35.46 13.97 68.70 3D-VisTA*[11 ] 27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53
表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... [
11 ]
27.00 57.90 — 16.00 38.60 15.20 76.60 CLIP*[3 ] 23.92 — 32.72 14.64 35.15 13.94 69.53 表 2 不同方法在ScanQA不带对象的测试集上的评估指标结果对比 ...
... Comparison evaluation metrics for different methods on ScanQA test set without objects
Tab.2 方法 EM@1/% EM@10/% BLEU-1/% BLEU-4/% ROUGE/% METEOR/% CIDEr RandomImage+MCAN[1 ] 20.82 51.23 26.29 9.66 29.23 11.54 55.64 VoteNet+MCAN[1 ] 18.15 48.56 29.63 7.10 29.12 11.68 53.34 scanRefer+MCAN(e2e)[1 ] 19.04 49.70 26.98 7.82 28.61 11.38 53.41 scanQA[1 ] 20.90 54.11 30.68 10.75 31.09 12.59 60.24 3D-VisTA(scratch) [11 ] 20.40 51.50 — 8.70 29.60 11.60 55.70 Multi-CLIP[2 ] 20.71 — 31.22 11.49 31.25 12.80 60.75 本研究 21.10 54.49 33.28 11.94 32.84 13.30 63.41 jin-Context-aware*[4 ] 21.56 53.89 31.48 15.84 31.79 13.13 63.40 Multi-CLIP(pre-trained)*[2 ] 21.48 — 32.69 12.87 32.61 13.36 63.20 3D-VisTA*[11 ] 23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83
分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
... [
11 ]
23.00 53.50 — 11.90 32.80 12.90 62.60 CLIP*[3 ] 21.37 — 32.70 11.73 32.41 13.28 62.83 分析表1 数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k 中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性. ...
1
... 受图像和视频描述任务中融合外部知识的方法[12 ] 启发,本研究提出基于知识图谱引导的三维视觉问答方法. 如图1 所示,所提方法由3个部分构成,分别是1)视觉与语言特征编码模块、2)多模态融合模块和3)目标定位与答案分类模块. 模块1)用于提取场景中各个目标的几何特征与语义类别,作为后续语义推理与文本生成的基础,利用ConceptNet知识图谱[13 ] 中的语义关系信息,通过关键词检索获取与目标相关的知识节点,并结合词嵌入与图卷积网络编码得到结构化的语义表示;语言生成模块在融合几何特征和知识特征的基础上,生成语义合理、结构清晰的自然语言描述. 该框架旨在利用知识先验缓解三维视觉中因缺乏物体之间的关联信息导致的语义贫弱问题,从而提升回答的准确率. 在ScanQA的基础上,对输入问题文本进行命名实体识别(named entity recognition, NER),抽取出问题中涉及的实体或关键词. 基于字符串匹配映射到知识图谱中的对应节点. 如果不存在完全匹配的节点,则引入同义词扩展进行模糊匹配. ...
ConceptNet 5.5: an open multilingual graph of general knowledge
1
2017
... 受图像和视频描述任务中融合外部知识的方法[12 ] 启发,本研究提出基于知识图谱引导的三维视觉问答方法. 如图1 所示,所提方法由3个部分构成,分别是1)视觉与语言特征编码模块、2)多模态融合模块和3)目标定位与答案分类模块. 模块1)用于提取场景中各个目标的几何特征与语义类别,作为后续语义推理与文本生成的基础,利用ConceptNet知识图谱[13 ] 中的语义关系信息,通过关键词检索获取与目标相关的知识节点,并结合词嵌入与图卷积网络编码得到结构化的语义表示;语言生成模块在融合几何特征和知识特征的基础上,生成语义合理、结构清晰的自然语言描述. 该框架旨在利用知识先验缓解三维视觉中因缺乏物体之间的关联信息导致的语义贫弱问题,从而提升回答的准确率. 在ScanQA的基础上,对输入问题文本进行命名实体识别(named entity recognition, NER),抽取出问题中涉及的实体或关键词. 基于字符串匹配映射到知识图谱中的对应节点. 如果不存在完全匹配的节点,则引入同义词扩展进行模糊匹配. ...
1
... 本模块的目标是将输入的三维场景和自然语言问题分别转化为统一表征空间下的语义特征向量. 具体而言,场景编码部分采用VoteNet[14 ] 作为三维目标检测网络,对输入点云场景进行处理,提取各目标的几何特征、空间位置和语义标签,为后续推理提供空间基础. 语言编码部分使用GloVe[15 ] 预训练词向量初始化文本输入,并通过BiLSTM[16 ] 网络进行上下文语义建模,获得问题中每个词的语义表示与全局语义特征. ...
1
... 本模块的目标是将输入的三维场景和自然语言问题分别转化为统一表征空间下的语义特征向量. 具体而言,场景编码部分采用VoteNet[14 ] 作为三维目标检测网络,对输入点云场景进行处理,提取各目标的几何特征、空间位置和语义标签,为后续推理提供空间基础. 语言编码部分使用GloVe[15 ] 预训练词向量初始化文本输入,并通过BiLSTM[16 ] 网络进行上下文语义建模,获得问题中每个词的语义表示与全局语义特征. ...
Bidirectional recurrent neural networks
1
1997
... 本模块的目标是将输入的三维场景和自然语言问题分别转化为统一表征空间下的语义特征向量. 具体而言,场景编码部分采用VoteNet[14 ] 作为三维目标检测网络,对输入点云场景进行处理,提取各目标的几何特征、空间位置和语义标签,为后续推理提供空间基础. 语言编码部分使用GloVe[15 ] 预训练词向量初始化文本输入,并通过BiLSTM[16 ] 网络进行上下文语义建模,获得问题中每个词的语义表示与全局语义特征. ...
1
... 本研究设计出基于知识引导的特征增强模块(knowledge graph-guided feature enhancement module, KGEM),通过引入外部知识图谱ConceptNet,为每个目标实体补充其在现实世界中的语义关联与上下位概念,帮助模型更好地理解物体的属性、功能及其与场景中其他实体之间的潜在联系. 如图2 所示,KGEM包含4个部分,分别是物体类别获取、知识检索与子图构建、图神经网络编码、融合特征生成. 1)物体类别名称获取:三维视觉问答任务的输入包含问题文本,而且问题通常包含关键实体,因此使用命名实体识别技术直接提取问题中的实体. 2)知识图谱检索与语义子图构建:将提取到的实体作为查询词,输入外部通用知识图谱ConceptNet,检索与该实体节点直接相关的上下位概念、功能性语义、组合结构等信息. 为了避免噪声与冗余信息干扰,仅保留与目标节点距离不超过k= 2的邻接节点,构成语义子图$ {G}_{{\mathrm{c}}}=({V}_{{\mathrm{c}}},{E}_{{\mathrm{c}}}) $ ,其中$ {V}_{{\mathrm{c}}} $ 为相关概念节点集合,$ {E}_{{\mathrm{c}}} $ 为概念节点之间的语义边(如IsA、UsedFor、AtLocation、RelatedTo等). 每个节点以对应的英文短语表示,通过GloVe转换为特征向量$ \boldsymbol{h}_{i}^{(0)} $ . 3)图神经网络建模知识结构:为了建模语义子图中的结构关系,采用图卷积网络[17 ] 对子图进行编码. 定义d 为每个概念节点对应的特征向量的维度,给定节点初始表示$ {\boldsymbol{H}}^{(0)}\in {{\bf{R}}}^{|{{V}_{{\mathrm{c}}}}|\times d} $ ,通过L 层图卷积传播结构信息,得到最终的知识表示,整个过程表示为 ...
Learning representations by back-propagating errors
2
1986
... 式中:$ {\mathbf{Attn}}_{\text{QO}} $ 为语言和视觉的交叉注意力输出,$ {\mathbf{Attn}}_{\text{QK}} $ 为语言和知识的交叉注意力输出,$ {\alpha }^{i} $ 为可学习门控系数,通过Sigmoid激活的线性变换自动学习得到,满足$ {\alpha }^{1}+{\alpha }^{2}\approx 1 $ . 基于可学习门控系数的动态多模态融合机制能够根据不同输入问题,自动调整视觉与知识模态的融合比重;增强模型对冗余或不相关模态信息的过滤能力;追踪门控系数的变化,分析模型对语义线索的偏好. $ \oplus $ 为特征拼接操作,多层感知机(MLP)[18 ] 用于融合后特征空间的转换与压缩. 多模态融合模块结构在保证原有视觉与语言语义建模能力的基础上,引入知识图谱所提供的实体级先验信息与语义关系,有效提升了多模态特征融合的表达能力,为后续的答案预测模块提供更加语义一致、结构合理的中间特征表示. ...
... 三维视觉问答属于开放式三维问答任务,要求模型以自然语言形式生成完整答案,因此在评价模型性能时,不仅要考虑答案是否与参考文本完全匹配,还要综合评估语言表达的准确性与自然性. 三维视觉问答的评估指标主要有2个类别:1)评估文本生成质量的指标,包括BLEU[9 ] ,面向召回的摘要评估替补(recall-oriented understudy for gisting evaluation, ROUGE-L)[19 ] ,显式排序的翻译评估指标(metric for evaluation of translation with explicit ordering, METEOR)[20 ] 和CIDEr[10 ] ;2)准确率评价指标EM@k [18 ] (exact match at top-k ),旨在衡量模型生成的前k 个答案中,是否存在与参考答案完全匹配的项. ...
1
... 三维视觉问答属于开放式三维问答任务,要求模型以自然语言形式生成完整答案,因此在评价模型性能时,不仅要考虑答案是否与参考文本完全匹配,还要综合评估语言表达的准确性与自然性. 三维视觉问答的评估指标主要有2个类别:1)评估文本生成质量的指标,包括BLEU[9 ] ,面向召回的摘要评估替补(recall-oriented understudy for gisting evaluation, ROUGE-L)[19 ] ,显式排序的翻译评估指标(metric for evaluation of translation with explicit ordering, METEOR)[20 ] 和CIDEr[10 ] ;2)准确率评价指标EM@k [18 ] (exact match at top-k ),旨在衡量模型生成的前k 个答案中,是否存在与参考答案完全匹配的项. ...
1
... 三维视觉问答属于开放式三维问答任务,要求模型以自然语言形式生成完整答案,因此在评价模型性能时,不仅要考虑答案是否与参考文本完全匹配,还要综合评估语言表达的准确性与自然性. 三维视觉问答的评估指标主要有2个类别:1)评估文本生成质量的指标,包括BLEU[9 ] ,面向召回的摘要评估替补(recall-oriented understudy for gisting evaluation, ROUGE-L)[19 ] ,显式排序的翻译评估指标(metric for evaluation of translation with explicit ordering, METEOR)[20 ] 和CIDEr[10 ] ;2)准确率评价指标EM@k [18 ] (exact match at top-k ),旨在衡量模型生成的前k 个答案中,是否存在与参考答案完全匹配的项. ...