浙江大学学报(工学版), 2026, 60(8): 1801-1808 doi: 10.3785/j.issn.1008-973X.2026.08.019

计算机技术

基于知识图谱引导的三维视觉问答

毛爱华,, 陈思宇

华南理工大学 计算机科学与工程学院,广东 广州 511400

3D visual question answering guided by knowledge graph

MAO Aihua,, CHEN Siyu

School of Computer Science and Engineering, South China University of Technology, Guangzhou 511400, China

收稿日期: 2025-07-10  

基金资助: 广东省基础与应用基础研究基金资助项目(2024A1515012791).

Received: 2025-07-10  

Fund supported: 广东省基础与应用基础研究基金资助项目(2024A1515012791).

作者简介 About authors

毛爱华(1980—),男,教授,博导,博士,从事人工智能、三维视觉研究.orcid.org/0000-0001-6861-9414.E-mail:ahmao@scut.edu.cn , E-mail:ahmao@scut.edu.cn

摘要

针对场景中物体之间潜在的常识性语义关系,提出基于知识图谱引导的三维视觉问答方法,通过引入外部结构化知识,有效增强模型的语义理解与推理能力. 从问题文本中提取关键语义实体,设计知识图谱引导的特征增强模块,利用关键语义实体获取知识特征. 将知识特征与由问题表示和三维目标检测网络提取的视觉特征进行融合,用于答案预测. 在ScanQA数据集上的实验证明,所提方法在评估指标EM@1与BLEU-4上均优于现有基线模型.

关键词: 三维视觉问答 ; 知识图谱 ; 特征增强 ; 多模态融合 ; 语义关系 ; 先验信息

Abstract

A knowledge graph-guided 3D visual question answering method was proposed to capture the implicit common-sense semantic relationships between objects in the scene. By introducing external structured knowledge, the model was effectively enhanced in both semantic understanding and reasoning ability. Specifically, key semantic entities were extracted from the question text, and a knowledge graph-guided feature enhancement module was designed to obtain knowledge features using these key semantic entities. The knowledge features were fused with visual features extracted both from the question representation and from the 3D object detection network for answer prediction. Experimental results on the ScanQA dataset showed that the proposed method outperforms existing baseline models on metrics such as EM@1 and BLEU-4.

Keywords: 3D visual question answering ; knowledge graph ; feature enhancement ; multimodal fusion ; semantic relationship ; prior information

PDF (2447KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

毛爱华, 陈思宇. 基于知识图谱引导的三维视觉问答. 浙江大学学报(工学版)[J], 2026, 60(8): 1801-1808 doi:10.3785/j.issn.1008-973X.2026.08.019

MAO Aihua, CHEN Siyu. 3D visual question answering guided by knowledge graph. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1801-1808 doi:10.3785/j.issn.1008-973X.2026.08.019

三维视觉问答(3D visual question answering, 3D VQA)任务旨在回答与三维场景相关的问题,相较于传统的二维图像问答任务,3D VQA不仅要理解二维图像中的信息,还要处理物体间的空间关系和几何结构[1]. 3D VQA任务面临的核心挑战主要包括空间关系的建模和复杂推理的需求. 在三维场景中,物体之间的关系复杂且动态变化,如何精确捕捉这些关系并进行有效的推理是研究重点. Multi-CLIP[2]利用对比学习将三维场景特征与二维图像和文本特征对齐,提升了模型对三维场景的理解和推理能力. 通过迁移二维视觉模型CLIP[3]的强大能力,该方法使得模型能够在3D VQA任务中更好地融合图像和文本信息.

随着多模态预训练技术在图像语言任务中的成功应用,越来越多研究者开始尝试将预训练范式拓展至三维视觉与自然语言的结合任务中,旨在通过构建通用的多模态对齐机制与语义增强策略,实现对三维语义场景的深度理解与跨模态迁移能力的提升. 该方向的研究亦受到图像-语言大模型的启发,逐步演化出面向三维场景的多模态基础模型. 代表性工作之一是Jin等[4]提出的3D-VLP框架. 该方法针对点云数据的稀疏性、不规则性以及语言-空间之间对齐困难等挑战,设计出两大核心机制:一是上下文感知的空间-语义对齐,分别从语义粒度和上下文结构上建立点云与文本之间的细粒度对应关系;二是互补掩码建模,通过在语言与点云中进行双向掩码预测,学习跨模态的互补表示. 此外,该方法在如ScanRefer[5]与ScanQA[1]的多个三维视觉语言数据集中取得显著效果提升,验证了方法的通用性与泛化能力. 另一项代表性的工作是3D-LLM[6],其核心思想是将三维点云知识引入大规模语言模型中,使3D-LLM具备真实空间感知与推理能力. 该方法设计了一套高效的数据生成流程,从多个三维数据源自动生成超过30万条三维语言对齐样本,涵盖问答、描述、导航等多个任务类型. 3D-LLM通过将渲染的多视角图像输入预训练的2D视觉语言模型,包括BLIP-2[7]和Flamingo[8],进而构建三维语义特征,并在此基础上提出三维定位机制,以加强模型对空间位置信息的理解能力. 实验表明,该方法在ScanQA任务上大幅超越现有模型,在如双语评估替补(bilingual evaluation understudy, BLEU)[9]、基于共识的图像描述评价(consensus-based image description evaluation, CIDEr)[10]的评估指标上的提升超过9%. 此外,3D-VisTA[11]尝试融合三维语言任务中的多种语义对齐策略,通过引入三维上下文感知机制与任务统一框架,提升模型在多种任务间的迁移与泛化能力. 这些工作不仅拓展了三维视觉语言研究的边界,也为构建具备空间认知、语言表达与多任务通用推理能力的智能体奠定了基础.

尽管已有研究在三维视觉语义建模方面取得了一定进展,但现有方法普遍面临2个突出问题. 1)大多数模型仍过度依赖视觉或语言本身的信息,忽视了三维场景中物体之间的语义联系与共现规律,难以理解“谁与谁相关”或“什么结构包含什么”隐含语义. 2)在跨模态融合过程中,语义特征往往缺乏外部知识的支撑,导致语言生成缺乏逻辑性,问答推理缺乏鲁棒性,限制了任务的泛化能力与表达质量. 本研究提出融合知识图谱的三维语义增强方法,通过引入结构化的外部语义资源,弥补现有模型在实体理解、关系建模与语义推理方面的不足. 一方面,知识图谱作为高质量的语义先验,能够为模型提供目标间的语义关系、上下位结构与空间概念等辅助信息;另一方面,结合图神经网络与注意力机制,能够实现语言、视觉与知识三模态之间的深层语义对齐,提升生成语言的描述完整性与问题回答的准确性.

1. 基于知识图谱引导的三维视觉问答

1.1. 框架概览

受图像和视频描述任务中融合外部知识的方法[12]启发,本研究提出基于知识图谱引导的三维视觉问答方法. 如图1所示,所提方法由3个部分构成,分别是1)视觉与语言特征编码模块、2)多模态融合模块和3)目标定位与答案分类模块. 模块1)用于提取场景中各个目标的几何特征与语义类别,作为后续语义推理与文本生成的基础,利用ConceptNet知识图谱[13]中的语义关系信息,通过关键词检索获取与目标相关的知识节点,并结合词嵌入与图卷积网络编码得到结构化的语义表示;语言生成模块在融合几何特征和知识特征的基础上,生成语义合理、结构清晰的自然语言描述. 该框架旨在利用知识先验缓解三维视觉中因缺乏物体之间的关联信息导致的语义贫弱问题,从而提升回答的准确率. 在ScanQA的基础上,对输入问题文本进行命名实体识别(named entity recognition, NER),抽取出问题中涉及的实体或关键词. 基于字符串匹配映射到知识图谱中的对应节点. 如果不存在完全匹配的节点,则引入同义词扩展进行模糊匹配.

图 1

图 1   基于知识图谱引导的三维视觉问答示意图

Fig.1   Schematic diagram of 3D visual question answering guided by knowledge graph


1.2. 网络结构

1.2.1. 视觉与语言特征编码模块

本模块的目标是将输入的三维场景和自然语言问题分别转化为统一表征空间下的语义特征向量. 具体而言,场景编码部分采用VoteNet[14]作为三维目标检测网络,对输入点云场景进行处理,提取各目标的几何特征、空间位置和语义标签,为后续推理提供空间基础. 语言编码部分使用GloVe[15]预训练词向量初始化文本输入,并通过BiLSTM[16]网络进行上下文语义建模,获得问题中每个词的语义表示与全局语义特征.

1.2.2. 知识图谱引导的特征增强模块

本研究设计出基于知识引导的特征增强模块(knowledge graph-guided feature enhancement module, KGEM),通过引入外部知识图谱ConceptNet,为每个目标实体补充其在现实世界中的语义关联与上下位概念,帮助模型更好地理解物体的属性、功能及其与场景中其他实体之间的潜在联系. 如图2所示,KGEM包含4个部分,分别是物体类别获取、知识检索与子图构建、图神经网络编码、融合特征生成. 1)物体类别名称获取:三维视觉问答任务的输入包含问题文本,而且问题通常包含关键实体,因此使用命名实体识别技术直接提取问题中的实体. 2)知识图谱检索与语义子图构建:将提取到的实体作为查询词,输入外部通用知识图谱ConceptNet,检索与该实体节点直接相关的上下位概念、功能性语义、组合结构等信息. 为了避免噪声与冗余信息干扰,仅保留与目标节点距离不超过k=2的邻接节点,构成语义子图$ {G}_{{\mathrm{c}}}=({V}_{{\mathrm{c}}},{E}_{{\mathrm{c}}}) $,其中$ {V}_{{\mathrm{c}}} $为相关概念节点集合,$ {E}_{{\mathrm{c}}} $为概念节点之间的语义边(如IsA、UsedFor、AtLocation、RelatedTo等). 每个节点以对应的英文短语表示,通过GloVe转换为特征向量$ \boldsymbol{h}_{i}^{(0)} $. 3)图神经网络建模知识结构:为了建模语义子图中的结构关系,采用图卷积网络[17]对子图进行编码. 定义d为每个概念节点对应的特征向量的维度,给定节点初始表示$ {\boldsymbol{H}}^{(0)}\in {{\bf{R}}}^{|{{V}_{{\mathrm{c}}}}|\times d} $,通过L层图卷积传播结构信息,得到最终的知识表示,整个过程表示为

图 2

图 2   知识图谱引导的特征增强模块结构

Fig.2   Structure of knowledge graph-guided feature enhancement module


$ {\boldsymbol{H}}^{(l+1)}=\sigma ({\hat{\boldsymbol{D}}}^{-1/2}\hat{\boldsymbol{A}}{\hat{\boldsymbol{D}}}^{-1/2}{\boldsymbol{H}}^{(l)}{\boldsymbol{W}}^{(l)}) . $

式中:$ \hat{\boldsymbol{A}}=\boldsymbol{A}+\boldsymbol{I} $为带自连接的邻接矩阵,$ \hat{\boldsymbol{D}} $为其度矩阵, $ {\boldsymbol{W}}^{(l)} $为第l层权重矩阵,$ \sigma (\cdot ) $为ReLU激活函数. 输出节点嵌入通过平均池化获得当前目标物体在ConceptNet中的语义知识特征,该过程表示为

$ {\boldsymbol{H}}_{\text{knw}}={\mathrm{MeanPooling}}\;({\boldsymbol{H}}^{(L)}) . $

1.2.3. 多模态融合模块

为了实现语言、视觉与外部知识之间的深层语义对齐,设计出知识感知的多模态融合模块,旨在充分发挥三类模态在三维问答任务中的互补优势. 如图3所示,多模态融合模块包括2个阶段的交叉注意力机制和1个多模态特征融合单元. 其中fq为问题的语义特征,fobj为目标物体的特征. 在语言-视觉交叉注意力阶段,模型以问题语义特征为查询,以三维场景中各候选目标的视觉特征为键和值,构建语言引导的注意力机制,获取与问题语义高度相关的目标表示. 该过程可以有效提升模型对场景中关键信息的聚焦能力,帮助后续的语义融合. 在语言-知识交叉注意力阶段,模型使用同样的机制,将问题特征与通过图卷积网络编码后的知识图谱实体特征进行交互. 该步骤能够引导模型理解问题中隐含的语义逻辑与常识背景,为复杂推理类问题提供外部语义支撑. 在多模态融合阶段,上述2个阶段交叉注意力的输出结果采用拼接与门控机制组合的方式,构造最终融合表示,该过程表示为

图 3

图 3   多模态融合模块结构

Fig.3   Structure of multimodal fusion module


$ \boldsymbol{F}={\mathrm{MLP}}\;([{\alpha }^{1}\cdot {\mathbf{Attn}}_{\text{QO}}\oplus {\alpha }^{2}\cdot {\mathbf{Attn}}_{\text{QK}}]) . $

式中:$ {\mathbf{Attn}}_{\text{QO}} $为语言和视觉的交叉注意力输出,$ {\mathbf{Attn}}_{\text{QK}} $为语言和知识的交叉注意力输出,$ {\alpha }^{i} $为可学习门控系数,通过Sigmoid激活的线性变换自动学习得到,满足$ {\alpha }^{1}+{\alpha }^{2}\approx 1 $. 基于可学习门控系数的动态多模态融合机制能够根据不同输入问题,自动调整视觉与知识模态的融合比重;增强模型对冗余或不相关模态信息的过滤能力;追踪门控系数的变化,分析模型对语义线索的偏好. $ \oplus $为特征拼接操作,多层感知机(MLP)[18]用于融合后特征空间的转换与压缩. 多模态融合模块结构在保证原有视觉与语言语义建模能力的基础上,引入知识图谱所提供的实体级先验信息与语义关系,有效提升了多模态特征融合的表达能力,为后续的答案预测模块提供更加语义一致、结构合理的中间特征表示.

1.2.4. 目标定位与答案分类模块

在完成多模态语义融合后,模型将融合特征用于回答问题的具体输出. 在目标定位任务中,模型的目标是从三维场景中定位出与问题语义最相关的物体实例. 具体而言,融合后的特征首先通过前馈全连接网络,对每个候选目标的表示进行评分,并输出目标概率分布. 得分最高的目标被视为模型预测的定位结果. 在答案分类任务中,模型采用多类分类器对预定义的答案集合进行分类. 输入为融合后的问题-视觉-知识表示,通过MLP进行特征转换后,接入Softmax层输出每个候选答案的置信度,最终选取置信度最高者作为模型预测的答案结果.

1.3. 损失函数

在模型训练过程中采用与ScanQA相同的多任务损失函数,用于联合优化目标定位与答案分类这2个子任务. 整体损失函数由2个部分构成,分别对应物体定位精度与答案预测准确率,表达式为

$ L={\lambda }_{1}\cdot {L}_{\text{loc}}+{\lambda }_{2}\cdot {L}_{\text{ans}} . $

式中:$ {L}_{\text{loc}} $为目标定位损失,$ {L}_{\text{ans}} $为答案分类损失,$ {\lambda }_{1} $$ {\lambda }_{2} $均为加权系数,实验中设置$ {\lambda }_{1}=1 $$ {\lambda }_{2}=1 $. 具体而言,$ {L}_{\text{loc}} $采用交叉熵损失,用于优化候选目标的选择概率,使模型能够准确定位与问题语义对应的物体:

$ {L}_{\text{loc}}=-\ln P({o}^{*}) . $

其中$ P({o}^{*}) $为模型对真实目标物体的预测概率. $ {L}_{\text{ans}} $同样采用交叉熵形式,监督模型在固定答案集合上的分类预测能力:

$ {L}_{\text{ans}}=-\ln P({a}^{*}) . $

其中$ P({a}^{*}) $为模型对正确答案的预测概率.

2. 实验结果与分析

2.1. 实验设置

三维视觉问答属于开放式三维问答任务,要求模型以自然语言形式生成完整答案,因此在评价模型性能时,不仅要考虑答案是否与参考文本完全匹配,还要综合评估语言表达的准确性与自然性. 三维视觉问答的评估指标主要有2个类别:1)评估文本生成质量的指标,包括BLEU[9],面向召回的摘要评估替补(recall-oriented understudy for gisting evaluation, ROUGE-L)[19],显式排序的翻译评估指标(metric for evaluation of translation with explicit ordering, METEOR)[20]和CIDEr[10];2)准确率评价指标EM@k[18](exact match at top-k),旨在衡量模型生成的前k个答案中,是否存在与参考答案完全匹配的项.

实验使用NVIDIA GeForce RTX 3090进行训练. 在文本处理方面,原始问题q会先进行规范化清洗,并通过spaCy分词工具划分为子词单元. 分词后的序列使用GloVe词向量进行初始化,每个词元被编码为300维词嵌入,整个问题序列最大长度限制为36,最终形成大小为36×300的特征矩阵$ \boldsymbol{Q} $. 将特征矩阵$ \boldsymbol{Q} $输入1个双向LSTM编码器,输出的特征为$ {\boldsymbol{Q}}^{'}\in {{\bf{R}}}^{36\times 512} $. 在点云编码部分,VoteNet中每个“种子点”产生1个投票,并生成1个256维的空间特征向量$ \boldsymbol{V} $. 将问题编码表示$ {\boldsymbol{Q}}^{\boldsymbol{'}} $和点云特征$ \boldsymbol{V} $分别通过1层MLP映射到512维空间,之后输入1个双分支的Transformer模块进行交互建模,分别获得语言编码向量$ {\boldsymbol{Q}}_{\text{enc}} $和视觉解码向量$ {\boldsymbol{V}}_{\text{dec}} $,最终特征维度均为256.

2.2. 评估指标

BLEU是应用于机器翻译评价的自动指标,衡量的是生成句子与参考句子之间的n-gram精确匹配程度. 本研究采用BLEU-4,即计算1-gram到4-gram的加权平均精度,计算式为

$ \mathrm{BLEU}\_ 4=\text{BP}\cdot \text{ex}\mathrm{p}\left(\sum\limits_{n=1}^{4}{w}_{n}\ln {p}_{n}\right) . $

式中:$ {p}_{n} $为第n-gram的精确匹配率;$ {w}_{{n}} $n-gram的权重,常用均匀加权$ {w}_{n}=0.25 $$ {\mathrm{BP}} $为惩罚过短句子的惩罚因子(brevity penalty):

$ \text{BP}=\begin{cases} 1,& l> r;\\\mathrm{exp}\; (1-r/l),& l\leqslant r.\end{cases} $

其中$ l $为生成句子的长度,$ r $为参考句子的长度. BLEU-4侧重于词序、语法结构的准确性,适合评价短句的语言合规性.

CIDEr是专为图像描述任务设计的指标,考虑了多个参考描述间的共识性. CIDEr基于TF-IDF加权的n-gram匹配,强调生成描述在上下文语义中的合理性和典型性. 计算过程:1)将候选句和参考句转化为n-gram向量(通常为1-gram~4-gram);2)计算n-gram的TF-IDF权重;3)计算候选句与所有参考句n-gram向量之间的余弦相似度;4)对不同n的结果求平均,得到CIDEr.

$ \text{CIDEr}\;(c,S)=\frac{1}{N}\sum\limits_{n=1}^{N}\dfrac{{\boldsymbol{g}}_{n}\left(c\right)\cdot \dfrac{1}{\left| \boldsymbol{S}\right| }\displaystyle\sum\limits_{s\in S}{\boldsymbol{g}}_{n}(s)}{\left|\left|{\boldsymbol{g}}_{n}(c)\right|\right|\cdot \left|\left|{\boldsymbol{g}}_{n}(s)\right|\right|} . $

式中:$ c $为候选句,$ S $为参考句集合,$ {\boldsymbol{g}}_{n}(\cdot ) $n-gram的TF-IDF向量. CIDEr对词频敏感,适合评估自然语言描述与“多数参考”之间的一致性.

ROUGE-L是文本摘要任务常用指标,关注2个句子之间的最长公共子序列,能够同时捕捉词序与语义相关性,计算式为

$ \mathrm{ROUGE}\_ \mathrm{L}=\frac{(1+{\beta }^{2}\cdot \text{LCS})}{R+{\beta }^{2}\cdot P} . $

式中:LCS为候选句与参考句的最长公共子序列长度;$ R $为长度LCS和候选句长度之商,$ P $为长度和参考句长度之商;$ \beta $为权衡召回与精度的系数,取$ \beta =1.2 $. ROUGE-L关注整体结构与句法相似度,适合衡量文本的通顺性与信息覆盖.

METEOR是综合性的文本评价指标,除了考虑精确匹配外,还引入词干、同义词、词序等因素,并对较短文本给予更高敏感度. METEOR包括进行词级匹配(精确词匹配、词干匹配、词形匹配与同义词匹配)、基于匹配片段数量计算词序惩罚项、结合F-score和惩罚项计算最终得分这几个过程.

$ \mathrm{METEOR}={F}_{\text{mean}}\cdot (1-\mathrm{Penalty}) . $

式中:$ {F}_{\text{mean}} $为准确率和召回率的调和平均数,Penalty为基于匹配块数量的惩罚因子. METEOR对语言的语义表达、词形变化敏感,反映自然语言生成的质量,尤其在句子结构变化较多时更具鲁棒性.

设测试集中共有N个样本,第i个样本的参考答案集合为$ {{A}}_{i} $,模型为该样本生成的前k个候选答案$ \{a_{i}^{(1)},a_{i}^{(2)},\cdots,a_{i}^{(k)}\} $

$ \mathrm{EM}@k=\frac{1}{N}\sum\limits_{i=1}^{N}I\left[\bigcup \limits_{j=1}^{k}\left(a_{i}^{(j)}\in {{A}}_{i}\right)\right] . $

式中:$ I\left[\cdot \right] $为指示函数,若括号内条件为真,则取值为1,否则为0;$ a_{i}^{(j)} $为模型为第i个问题生成的第j个候选答案. 当k=1时,EM@1衡量的是模型的首个预测是否正确;当k>1时,EM@k衡量的是模型在前k个答案中是否至少包含1个正确答案. EM@k越高,说明模型更可能生成包含正确答案的候选序列,具有更强的语言覆盖能力.

2.3. 定量实验

所采用的三维问答实验数据集为ScanQA,该数据集是具代表性的三维视觉问答数据集. 数据集共包含约800个场景,超20 000条问题-答案对,答案类型主要包括:实体类(如“椅子”、“电视”)和非实体类(如“2”、“是/否”). 在对比实验开始之前,对当前在ScanQA数据集上开展的三维视觉问答方法进行分类梳理. 根据模型训练策略与预训练依赖的不同,现有方法大致可以分为2个类别:第一类方法是仅在ScanQA数据集上进行训练的模型,通常从零开始对三维场景理解与语言问答进行联合建模,包括ScanQA[1]和3D-VisTA(scrratch)[11],还包括一些从二维视觉问答迁移到三维视觉问答的工作[3],此类工作在原任务中大都表现优异,包括RandomImage+MCAN[1]、VoteNet+MCAN[1]和scanRefer+MCAN(e2e)[1]. 第二类方法则是借助大规模三维数据集进行预训练的模型,通常在如ScanNet、ReferIt3D数据集上先进行视觉语言对齐或空间关系建模,再迁移至ScanQA任务中进行微调,包括jin-Context-aware[4]、3D-VisTA[11]、Multi-CLIP[2]和CLIP[3]. 借助大规模三维数据集进行预训练的模型具有更强的先验学习能力,训练成本也相对较大.

本研究所提方法属于第一类,即不依赖外部三维数据预训练,而在ScanQA数据集上直接训练的轻量级结构. 本研究将当前主流三维问答方法作为对比对象,并在带对象与不带对象的测试集上分别进行实验评估,结果分别如表1表2所示,所有评价指标均为“值越大表示性能越优”. 从只在ScanQA上训练的方法来看,本研究所提方法在多个指标上实现了领先或接近最优的结果,特别是在准确率与鲁棒性方面表现突出. 相比之下,部分采用粗略标注或下游任务增强的方法在特定指标上具备一定优势. 值得注意的是,第二类方法(用“*”号标记)依赖大规模的外部三维数据集进行预训练,借助更丰富的语义对齐和结构信息在测试中表现出色. 考虑到借助大规模三维数据集进行预训练的模型引入额外数据资源,对比分析时仅列出结果以供参考,避免直接对比可能带来的不公平性. 可以看出,在不借助外部预训练的前提下,所提方法在若干关键指标上仍具备可比甚至优于部分预训练方法的性能表现.

表 1   不同方法在ScanQA带有对象的测试集上的评估指标结果对比

Tab.1  Comparison evaluation metrics for different methods on ScanQA test set with objects

方法EM@1/%EM@10/%BLEU-1/%BLEU-4/%ROUGE/%METEOR/%CIDEr
RandomImage+MCAN[1]22.3153.1126.6614.2631.2712.1360.37
VoteNet+MCAN[1]19.7150.7629.466.0830.9712.0758.23
scanRefer+MCAN(e2e) [1]20.5652.3527.857.4630.6811.9757.36
scanQA[1]23.4556.5131.5612.0434.3413.5567.29
3D-VisTA(scratch)[11]25.2055.2010.5035.5013.8068.60
Multi-CLIP[2]22.7631.0813.3133.8413.2865.81
本研究24.4756.1833.8513.5936.2614.4271.33
jin-Context-aware*[4]24.5855.9733.1511.2335.9714.1670.18
Multi-CLIP(pre-trained)*[2]24.0232.6312.6535.4613.9768.70
3D-VisTA*[11]27.0057.9016.0038.6015.2076.60
CLIP*[3]23.9232.7214.6435.1513.9469.53

新窗口打开| 下载CSV


表 2   不同方法在ScanQA不带对象的测试集上的评估指标结果对比

Tab.2  Comparison evaluation metrics for different methods on ScanQA test set without objects

方法EM@1/%EM@10/%BLEU-1/%BLEU-4/%ROUGE/%METEOR/%CIDEr
RandomImage+MCAN[1]20.8251.2326.299.6629.2311.5455.64
VoteNet+MCAN[1]18.1548.5629.637.1029.1211.6853.34
scanRefer+MCAN(e2e)[1]19.0449.7026.987.8228.6111.3853.41
scanQA[1]20.9054.1130.6810.7531.0912.5960.24
3D-VisTA(scratch) [11]20.4051.508.7029.6011.6055.70
Multi-CLIP[2]20.7131.2211.4931.2512.8060.75
本研究21.1054.4933.2811.9432.8413.3063.41
jin-Context-aware*[4]21.5653.8931.4815.8431.7913.1363.40
Multi-CLIP(pre-trained)*[2]21.4832.6912.8732.6113.3663.20
3D-VisTA*[11]23.0053.5011.9032.8012.9062.60
CLIP*[3]21.3732.7011.7332.4113.2862.83

新窗口打开| 下载CSV


分析表1数据,从答案精确匹配的角度看,所提方法的EM@1和EM@10分别为24.47%和56.18%,显著优于多数只在ScanQA数据集上训练的对比方法,如RandomImage+MCAN以及scanRefer+MCAN,超过了部分结构更复杂的基线变体. 在EM@k中,EM@1是最严格的准确率评价指标,要求模型在所有候选答案中将正确答案置于首位,能直接反映模型的单次推理能力. 所提方法的EM@1=24.47%,表明融合知识图谱后的语义建模能力在理解复杂问题中的确具有显著优势. 在语言生成质量方面,所提方法在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr指标上均实现显著提升. 其中CIDEr=71.33,相比ScanQA 基线(CIDEr=67.29)提升4.04,说明模型在生成内容与参考答案之间的关键词覆盖度与语义一致性方面更为出色. CIDEr强调信息密度和多样性,提升该指标说明所提方法生成的回答更加具体、具备信息含量,体现出知识引导对于补足语义空缺、提升内容丰富度的直接帮助. BLEU-4强调短语级别的精确匹配,偏好具有固定表达模板的生成结果. 所提方法通过引入知识图谱,生成的答案更具语言多样性和上下文灵活性,可能使用不同词汇表达相近语义,导致BLEU-4略低. CLIP*和3D-VisTA在训练过程中使用了大规模多视角图像或三维场景的预训练策略,模型在表达结构上具有更强的模板泛化能力;相比之下,所提方法为轻量级结构,完全在ScanQA数据集上训练,未引入额外视觉语料或上下游任务辅助,但依然在CIDEr、ROUGE和METEOR等更关注语义丰富性与句法自然性的指标上表现优越,说明所提方法生成内容具有更强的信息密度与人类可读性.

分析表2数据,在不带对象的测试集上,模型须同时完成目标定位与语义理解这2个子任务,任务难度显著高于带对象设定. 所提方法在EM@1=21.10%、EM@10=54.49%的前提下,在BLEU-1、BLEU-4、ROUGE、METEOR和CIDEr这5项语言质量指标上均取得第一类方法中的最优结果,展现出良好的整体性能. 尤其是CIDEr=63.41和BLEU-1=33.28,所提方法已逼近甚至超过部分使用外部预训练的第二类方法,表明知识图谱引入的语义增强机制在复杂语境中的表达能力和推理辅助作用具有一定通用性,即便在更具挑战性的目标未指定场景下,仍可有效提升模型表现.

值得注意的是,所提方法在“带对象”设定下的性能提升尤为显著. 由于该设置中已知目标物体位置,模型可将更多关注集中于问题的语义理解与答案生成过程,知识图谱在此过程中提供了丰富的语义补充与常识支持,使得语言表达与语义推理更为准确. 在“不带对象”设置中,尽管知识特征仍对目标筛选起到一定辅助作用,但整体效果更受限于模型在目标定位阶段的表现. 因此,知识引导机制在语义解耦与推理增强方面的贡献在“带对象”测试中体现得更充分.

2.4. 定性实验

图4所示为所提方法在三维视觉问答任务中的4组典型问答结果的可视化示例. 每组示例包含1个三维场景、1个与场景相关的问题以及模型生成的答案. 各分图右侧上方框为模型关注的目标区域,右侧下方框为最终输出的文本答案. 可以看出,模型在多数情况下能够理解问题语义,准确定位相关目标并给出合理的自然语言回答,体现出良好的多模态推理能力. 以图4(a)为例,问题为“Where is the gray chair located ”,模型回答为“near the table”. 可以看到,灰色椅子确实靠近桌子摆放,说明模型不仅正确识别了目标对象,还成功建立了物体之间的空间关系,回答准确合理.

图 4

图 4   基于知识图谱引导的三维视觉问答方法在ScanQA数据集上的可视化结果

Fig.4   Visualization results of knowledge graph-guided 3D visual question answering method on ScanQA dataset


2.5. 消融实验

进一步验证所提知识增强模块中各组成部分的有效性,设计一系列消融实验,通过逐步剥离模型结构中的关键模块,分析各部分对模型整体性能的影响. 构造4种模型变体:1)不引入任何知识引导的基线模型;2)仅使用实体词嵌入作为知识补充,无图结构建模;3)使用不含关系边语义的图卷积网络建模图谱结构;4)完整方法,即本研究所提模型使用关系语义的图卷积网络. 带对象测试集上的消融实验结果如表3所示. 总体来看,随着知识引导模块的引入,模型在各项指标上均有稳定提升,验证了语义增强机制在三维问答任务中的有效性. 基线模型不引入任何外部知识,仅依赖语言与视觉特征,CIDEr和EM@1分别为67.29和23.12%,为本组实验的性能基线. 加入实体词嵌入后,模型在CIDEr上增加1.16,说明词汇级语义补充对答案生成具有一定帮助. 进一步构建实体图结构后,模型表现持续提升,表明结构信息有助于建模实体间的语义组织. 完整模型在引入语义关系后,在EM@1、BLEU和CIDEr等多个指标上达到最优. 其中CIDEr提升至71.33,说明模型在语言生成中的内容丰富性与语义一致性得到进一步加强. 综合来看,语义结构与关系信息的引入是推动性能提升的关键因素,尤其在带对象设定中效果更加显著.

表 3   不同模型变体在ScanQA带对象的测试集上的评估指标结果对比

Tab.3  Comparison evaluation metrics for different model variants on ScanQA test set with objects

模型EM@1/%EM@10/%BLEU-1/%BLEU-4/%ROUGE/%METEOR/%CIDEr
变体1)23.1254.8231.9412.1534.0113.4167.29
变体2)23.6755.2732.6612.6434.9513.7868.45
变体3)24.1155.7633.3013.1135.6214.0769.72
变体4)24.4756.1833.8513.5936.2614.4271.33

新窗口打开| 下载CSV


3. 结 语

针对现有方法依赖视觉信息本身进行语义建模,忽略了语言问题中蕴含的外部知识和常识逻辑问题,本研究提出基于知识图谱引导的多模态语义增强方法,通过提取关键实体并在ConceptNet知识图谱中构建语义子图形成知识特征,并与语言与视觉特征融合,用于支持答案预测. 实验结果表明,所提方法在带对象与不带对象这2种设定下均优于多个对比模型,在EM@1、CIDEr、BLEU等核心指标上取得领先表现. 定性实验进一步展示模型在真实三维场景下对目标定位与语义生成的具体效果,验证了知识图谱引导机制在复杂问题理解中的有效性. 通过消融实验分析知识引导模块各组成部分的作用,说明实体提取、图结构建模及语义关系引入在性能提升中均发挥了关键作用.

尽管研究在三维视觉语言任务中取得了一定进展,但仍存在一些值得进一步探索的问题. 1)所使用的 ConceptNet 知识图谱在领域知识、结构一致性和细粒度描述方面仍有局限,导致知识图谱的覆盖范围与表达稀疏性影响了语义建模的精度. 2)当前模型依赖静态规则检索与统一融合机制,难以适应不同问题或场景下知识使用的差异,知识检索与融合方式尚不够灵活. 3)三维描述与三维问答虽共享知识引导思想,但模型结构仍存在分裂,任务范式尚未统一,模型泛化性有限. 针对上述问题,未来工作将从以下几个方面进行改进. 第一,引入更结构化、更专业的知识图谱,如 WordNet、Wikidata 或行业领域本体,以提高语义建模的精准度. 第二,尝试引入知识选择机制或注意力控制策略,实现动态引导和显式推理,提升模型对不同问题场景的适应性. 第三,探索统一的多任务三维视觉语言理解框架,在共享表示的基础上实现三维描述与三维问答的协同优化,提升模型整体泛化能力与效率. 综上所述,知识图谱与三维视觉的结合为多模态语义建模提供了新思路,未来的研究将继续拓展知识表示的维度,提升模型对复杂语言与空间结构的建模能力,推动三维智能感知系统向更智能、更可解释的方向发展.

参考文献

AZUMA D, MIYANISHI T, KURITA S, et al. ScanQA: 3D question answering for spatial scene understanding [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 19107–19117.

[本文引用: 14]

DELITZAS A, PARELLI M, HARS N, et al. Multi-CLIP: contrastive vision-language pre-training for question answering tasks in 3D scenes [EB/OL]. (2023–06–04)[2025–07–02]. https://arxiv.org/pdf/2306.02329.

[本文引用: 6]

RADFORD A, KIM J W, HALLACY C, et al. Learning transferable visual models from natural language supervision [EB/OL]. (2021–02–26)[2025–07–02]. https://arxiv.org/pdf/2103.00020.

[本文引用: 5]

JIN Z, HAYAT M, YANG Y, et al. Context-aware alignment and mutual masking for 3D-language pre-training [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 10984–10994.

[本文引用: 4]

CHEN D Z, CHANG A X, NIEßNER M. ScanRefer: 3D object localization in RGB-D scans using natural language [C]// Computer Vision – ECCV 2020. [S.l.]: Springer International Publishing, 2020: 202–221.

[本文引用: 1]

HONG Y, ZHEN H, CHEN P, et al. 3D-LLM: injecting the 3D world into large language models [EB/OL]. (2023–07–24)[2025–07–02]. https://arxiv.org/pdf/2307.12981.

[本文引用: 1]

LI J, LI D, SAVARESE S, et al. BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models [C]// Proceedings of the International Conference on Machine Learning. [S.l.]: PMLR, 2023: 19730-19742.

[本文引用: 1]

ALAYRAC J B, DONAHUE J, LUC P, et al. Flamingo: a visual language model for few-shot learning [EB/OL]. (2022–11–15)[2025–07–02]. https://arxiv.org/pdf/2204.14198.

[本文引用: 1]

PAPINENI K, ROUKOS S, WARD T, et al. BLEU: a method for automatic evaluation of machine translation [C]// Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics. Philadelphia: Association for Computational Linguistics, 2002: 311–318.

[本文引用: 2]

VEDANTAM R, ZITNICK C L, PARIKH D. CIDEr: consensus-based image description evaluation [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Boston: IEEE, 2015: 4566–4575.

[本文引用: 2]

ZHU Z, MA X, CHEN Y, et al. 3D-VisTA: pre-trained transformer for 3D vision and text alignment [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2024: 2899–2909.

[本文引用: 7]

VO D M, CHEN H, SUGIMOTO A, et al. NOC-REK: novel object captioning with retrieved vocabulary from external knowledge [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 17979–17987.

[本文引用: 1]

SPEER R, CHIN J, HAVASI C

ConceptNet 5.5: an open multilingual graph of general knowledge

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2017, 31 (1): 1

DOI:10.1609/aaai.v31i1.11164      [本文引用: 1]

DING Z, HAN X, NIETHAMMER M. VoteNet: a deep learning label fusion method for multi-atlas segmentation [C]// Medical Image Computing and Computer Assisted Intervention – MICCAI 2019. [S.l.]: Springer, 2019: 202–210.

[本文引用: 1]

PENNINGTON J, SOCHER R, MANNING C. GloVe: global vectors for word representation [C]// Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing. Doha: Association for Computational Linguistics, 2014: 1532–1543.

[本文引用: 1]

SCHUSTER M, PALIWAL K K

Bidirectional recurrent neural networks

[J]. IEEE Transactions on Signal Processing, 1997, 45 (11): 2673- 2681

DOI:10.1109/78.650093      [本文引用: 1]

KIPF T N, WELLING M. Semi-supervised classification with graph convolutional networks [EB/OL]. (2017–02–22)[2025–07–02]. https://arxiv.org/pdf/1609.02907.

[本文引用: 1]

RUMELHART D E, HINTON G E, WILLIAMS R J

Learning representations by back-propagating errors

[J]. Nature, 1986, 323 (6088): 533- 536

DOI:10.1038/323533a0      [本文引用: 2]

LIN C Y, HOVY E. Automatic evaluation of summaries using N-gram co-occurrence statistics [C]// Proceedings of the 2003 Conference of the North American Chapter of the Association for Computational Linguistics on Human Language Technology - NAACL '03. Edmonton: ACL, 2003: 71–78.

[本文引用: 1]

BANERJEE S, LAVIE A. METEOR: an automatic metric for MT evaluation with improved correlation with human judgments [C]// Proceedings of the ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and/or Summarization. Ann Arbor: Association for Computational Linguistics, 2005: 65–72.

[本文引用: 1]

/