浙江大学学报(工学版), 2026, 60(9): 1924-1933 doi: 10.3785/j.issn.1008-973X.2026.09.009

计算机技术、自动控制技术

基于多模态知识对齐的双分支点云语义分割算法

杨军,, 卯恒睿, 党吉圣

1. 兰州交通大学 自动化与电气工程学院,甘肃 兰州 730070

2. 兰州交通大学 电子与信息工程学院,甘肃 兰州 730070

3. 新加坡国立大学 计算机科学与工程学院,新加坡 肯特岗 119077

4. 兰州大学 信息科学与工程学院,甘肃 兰州 730070

Dual-branch point cloud semantic segmentation algorithm based on multimodal knowledge alignment

YANG Jun,, MAO Hengrui, DANG Jisheng

1. School of Automation and Electrical Engineering, Lanzhou Jiaotong University, Lanzhou 730070, China

2. School of Electronic and Information Engineering, Lanzhou Jiaotong University, Lanzhou 730070, China

3. School of Computer Science and Engineering, National University of Singapore, Kent Ridge 119077, Singapore

4. School of Information Science and Engineering, Lanzhou University, Lanzhou 730070, China

收稿日期: 2025-10-14  

基金资助: 国家自然科学基金资助项目(42261067);2025年度甘肃省重点人才资助项目(2025RCXM031).

Received: 2025-10-14  

Fund supported: 国家自然科学基金资助项目(42261067);2025年度甘肃省重点人才资助项目(2025RCXM031).

作者简介 About authors

杨军(1973—),男,教授,博导,从事三维模型空间分析、遥感大数据智能解译及深度学习研究.orcid.org/0000-0001-6403-3408.E-mail:yangj@mail.lzjtu.cn , E-mail:yangj@mail.lzjtu.cn

摘要

针对多模态语义分割方法中因引入二维图像信息而带来的额外计算量,以及不同模态之间特征差异显著、融合困难等问题,提出基于二维图像信息辅助的多模态点云语义分割算法. 通过双分支特征提取网络分别提取点云特征和RGB图像特征. 为了减少因引入RGB图像而带来的额外计算负担,设计特征分离卷积,优化所提取的二维图像特征. 采用点到像素的映射策略,将三维点云特征转换为与二维图像特征兼容的表示形式. 设计多模态知识对齐模块,通过双融合注意力机制聚焦点云和RGB图像的关键特征,使点云特征与RGB图像特征映射到统一的特征空间,消除模态间的差异,使得模型能够更全面地感知环境. 该算法在SemanticKITTI和NuScenes数据集上的语义分割精度分别达到69.1%和79.3%,优于其他主流算法. 实验结果表明,该算法通过结合点云信息与RGB图像信息,发挥多模态数据的互补优势,有效提升点云语义分割的精度.

关键词: RGB图像数据 ; 点云数据 ; 点云语义分割 ; 多模态知识对齐 ; 特征分离卷积

Abstract

A multimodal point cloud semantic segmentation algorithm assisted by 2D image information was proposed in response to the excessive computational cost introduced by incorporating 2D image information in multimodal semantic segmentation methods, as well as the significant feature discrepancy and fusion difficulty between different modalities. A dual-branch feature extraction network was employed to separately extract point cloud feature and RGB image feature. A feature separation convolution was designed to optimize the extracted 2D image feature in order to reduce the additional computational burden caused by the introduction of RGB images. A point-to-pixel mapping strategy was adopted to transform 3D point cloud feature into a representation compatible with 2D image feature. A multimodal knowledge alignment module was designed. The key feature of point cloud and RGB image was emphasized through a dual-fusion attention mechanism. Then the point cloud feature and RGB image feature were mapped into a unified feature space. The discrepancy between modalities was eliminated, thereby allowing the model to perceive the environment more comprehensively. The proposed algorithm achieved semantic segmentation accuracy of 69.1% and 79.3% on the SemanticKITTI and NuScenes datasets, respectively, outperforming other mainstream algorithms. The experimental results demonstrate that the proposed algorithm effectively improves the accuracy of point cloud semantic segmentation by combining point cloud information with RGB image information and exploiting the complementary advantage of multimodal data.

Keywords: RGB image data ; point cloud data ; point cloud semantic segmentation ; multi-modal knowledge alignment ; feature separation convolution

PDF (2255KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

杨军, 卯恒睿, 党吉圣. 基于多模态知识对齐的双分支点云语义分割算法. 浙江大学学报(工学版)[J], 2026, 60(9): 1924-1933 doi:10.3785/j.issn.1008-973X.2026.09.009

YANG Jun, MAO Hengrui, DANG Jisheng. Dual-branch point cloud semantic segmentation algorithm based on multimodal knowledge alignment. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1924-1933 doi:10.3785/j.issn.1008-973X.2026.09.009

近年来,随着三维点云采集设备的不断发展和广泛应用,点云数据的获取变得更加便捷. 三维点云语义分割作为目标检测[1]、三维重建[2]和场景理解[3]等计算机视觉领域的核心技术,受到国内外研究人员的关注,在自动驾驶[4]、元宇宙[5]、机器人技术[6]及数字城市建设[7]等应用中发挥了关键作用.

早期的场景语义分割研究主要依赖于摄像头获取的RGB图像信息,通过对图像中每个像素进行类别标注来实现语义分割. 此类方法在处理复杂场景时容易受到光照变化、遮挡及物体边界模糊等因素的影响. 全卷积网络[8]、PSPNet[9]和DeepLab[10]等模型虽然有效提升了分割精度,但在弱光或遮挡情况下分割精度较低. 点云数据能够精确地表达深度和空间信息,尤其在弱光场景中展现出明显优势,因此基于点云的单模态语义分割方法得到了广泛研究[11-13]. 由于点云的稀疏性和局部信息缺失,某些物体难以被有效识别. 为了充分发挥2种模态的互补特性,近年来多模态融合方法[14]成为研究热点.

多模态数据融合方法在场景语义分割中具有显著潜力,但仍面临诸多挑战. 引入RGB图像会增加数据量,尤其在同时处理RGB图像和点云数据时,计算时间会显著增加. 点云数据和RGB图像在空间分布和特征表达方面存在显著差异,这使得多模态数据的精确融合变得异常复杂. 当前的融合算法缺乏高效的对齐机制,导致信息丢失,增加了数据融合的复杂性.

针对上述问题,本文提出基于多模态知识对齐的双分支点云语义分割算法,旨在充分利用RGB图像和点云数据的互补优势,提升语义分割精度. 针对因引入RGB图像增加数据量和运行时间的问题,提出特征分离卷积(feature separation convolution, FSConv). 在FSConv中设计高效的通道注意力模块,对特征图进行逐通道加权,在抑制空间信息冗余的同时减少通道维度的冗余信息,从而优化二维特征提取速度并提高分割精度. 针对RGB图像和点云数据在空间分布和特征表达上的显著差异,采用点到像素的映射策略,将三维点云特征转换为与二维图像特征兼容的形式,为后续的多模态特征融合提供了坚实的基础. 由于简单的线性变换无法有效地融合多模态特征,提出多模态知识对齐模块(multi-modal knowledge alignment module, MKAM). 通过双融合注意力机制,将RGB图像和点云特征映射到统一的特征空间. 在MKAM中引入代理注意力机制,通过聚焦每个模态内的关键信息,提高模态间特征的对齐质量,使得模型更全面地感知环境,从而提升分割精度.

1. 多模态融合的点云语义分割模型

针对大规模室外点云场景中存在的密度变化及色彩、纹理信息不足等问题,提出融合多模态信息的点云分割方法,即充分利用RGB图像的色彩和纹理信息,结合点云在三维空间与结构信息方面的优势,以实现更精准的分割性能. 该算法的整体框架如图1所示,分为特征提取、多模态信息融合和语义分割3个阶段. 在特征提取阶段,采用双分支架构,分别处理二维RGB图像和三维点云数据. 在多模态信息融合阶段,分别进行点到像素的映射和多模态知识对齐. 在语义分割阶段设置2个并行分割头,分别对3D分支与融合分支进行语义预测,对2路预测分布施加一致性约束,以实现跨模态对齐,提升3D分支的分割精度.

图 1

图 1   多模态融合的点云语义分割网络架构

Fig.1   Multimodal fusion network architecture for point cloud semantic segmentation


1.1. 多模态数据的特征提取与优化

在特征提取阶段,采用双分支网络结构,分别处理二维RGB图像和三维点云数据. 针对三维点云数据,利用体素化方法,将点云数据离散化为规则的体素块,并将体素化后的点云数据输入稀疏点-体素卷积神经网络(sparse point-voxel convolutional neural network, SPVCNN)进行处理. 对于二维RGB图像,由于原始图像的分辨率较高(如1 242×512像素),直接执行多模态数据融合会导致较大的计算开销. 在数据预处理阶段,对原始RGB图像进行随机裁剪,选择较小的区域(480×320像素)作为二维输入,降低计算成本. 采用ResNet34作为编码器,提取图像中的细粒度纹理与颜色特征. 由于引入二维图像会显著增加计算开销,提出特征分离卷积(feature separation convolution, FSConv),通过优化空间和通道维度,减少特征冗余,提高特征提取效率.

图2所示,FSConv通过组归一化(group normalization, GN)中的比例因子θ来评估特征图中的信息量. 计算过程如下:

图 2

图 2   特征分离卷积

Fig.2   Feature separation convolution


$ \mathrm{GN}(\boldsymbol{X})=\theta \frac{\boldsymbol{X}-\mu\cdot {\boldsymbol{1}} }{\sqrt{{\sigma }^{2}+\varepsilon }}. $

式中:GN(X)为归一化后的输出特征图;μσ2分别为特征图的均值和方差;ε为防止分母为零的小常数;X为输入的特征图;θ为组归一化的比例因子,用于衡量特征图中的像素变化程度. 为了进一步区分特征图的信息量,对不同空间信息的特征图分配权重β,根据β定义关键信息丰富的特征图与背景信息较多的特征图. 权重β定义为

$ \beta ={{\theta }_{i}}\Bigg/{\displaystyle \sum \limits_{j=1}^{k}{\theta }_{j}};\;\;i,j=0,1,2,\cdots, k. $

式中:θi为第i个特征图的比例因子,$\displaystyle \sum \nolimits_{j=1}^{k}{\theta }_{j} $为所有特征图比例因子的总和. β反映了第i个特征图在所有特征图中的重要性.

利用可学习权重参数β对归一化的输出特征图进行加权处理后,通过Sigmoid函数将权重映射到[0, 1.0],实现对关键特征的精细筛选,并通过门控函数对权重进行二值化. 具体而言,当超过或等于阈值0.5时,因子被设定为1,得到信息因子W1;当低于阈值0.5时,因子被设定为0,得到非信息因子W2. 具体过程为

$ {\boldsymbol{W}}_{\varPhi }=\mathrm{Gate}\,(\mathrm{sigmoid}\,\text{(}\beta \times \mathrm{GN}(\boldsymbol{X})));\;\varPhi =1,2. $

式中:Gate为门控函数,×表示逐元素相乘. 通过该操作,输入特征X分别与W1W2相乘,生成2个加权特征:信息量丰富且具有表现力的特征X1,信息量较少甚至无意义的特征X2. 通过这一操作,输入特征被分解为信息丰富的特征和冗余特征. 为了进一步减少空间冗余,采用交叉重构策略,通过充分融合加权后的不同信息量特征,增强它们之间的信息流动. 重构后生成的特征X1X2拼接在一起,形成空间细化的特征图Xw.

特征分离卷积通过减少冗余特征图的影响,使得模型能够更加关注关键物体的语义信息,而非背景噪声. 此外,在特征分离卷积中引入高效的通道注意力模块,以减少通道维度上的冗余信息. 该模块通过1×1卷积对输入特征图进行压缩,降低计算复杂度. 采用尺寸为K的卷积核实现跨通道的信息交互,以提取通道之间的依赖关系. 通过自适应平均池化层,将输入的特征图尺寸转化为1×1,使得每个通道的全局信息被压缩成一个标量. 利用Sigmoid函数生成通道权重,将其映射到[0,1.0]. 利用这些通道权重,对输出特征图逐通道加权,从而抑制通道维度上的冗余特征并增强关键特征的表达能力. 该模块的设计有效提升了二维特征的提取效率,减少了模型的运行时间.

1.2. 多模态信息融合

在融合阶段中,将原始三维点云的几何特征通过点到像素的映射(point-to-pixel mapping, P2P-Mapping)投影至二维坐标系中,将三维特征转化为便于与二维特征融合的形式,为后续的特征对齐奠定基础. 利用多模态知识对齐模块,对二维和三维特征进行深度对齐.

1.2.1. 点到像素的映射策略

由于图像特征以像素点为基本单位,而点云特征以点云点为基本单位,这一模态差异导致两者之间的信息传递面临显著挑战. 为了解决该问题,采用基于点到像素映射的方法,生成二维图像与三维点云的多模态配对特征,从而实现多模态对齐.

图3所示,将二维图像$ \boldsymbol{I}\in {\bf{R}}^{H\times W\times 3} $输入二维网络,提取二维特征图.

图 3

图 3   点到像素映射模块

Fig.3   Point-to-pixel mapping module


该特征图的维度为H×W×64,其中HW为图像的高度和宽度. 通过透视投影变换将输入的三维点云$ \boldsymbol{P}\in {\bf{R}}^{N\times 3} $映射到二维图像平面,生成点到像素的有效点集合$ {\boldsymbol{P}}^{\prime}\in {\bf{R}}^{{{N}^{\prime}}\times 2} $. 具体来说,利用相机的内参矩阵M和外参矩阵L,将每个点云点的三维坐标(xi, yi, zi)转化为对应的二维像素坐标(ui, vi),投影公式如下:

$ {\left[{u}_{i},{v}_{i},1\right]}^{\text{T}}=\frac{1}{{z}_{i}} \boldsymbol{M}\boldsymbol{L} {\left[{x}_{i},{y}_{i},{z}_{i},1\right]}^{\text{T}}. $

通过点到像素的映射关系,筛选出投影至图像范围内的有效点集合$ {\boldsymbol{P}}^{\prime}\in {\bf{R}}^{{{N}^{\prime}}\times 2} $,其中$ {N}^{\prime} $为投影后有效点的数量. 根据选定的二维特征图$ {\boldsymbol{F}}^{2\mathrm{D}}\in {\bf{R}}^{H\times W\times 64} $,从中找到与二维特征相对应的三维点,进而提取这些三维点的特征,生成点级特征矩阵$ {\boldsymbol{F}}^{3\mathrm{D}}\in {\bf{R}}^{{{N}^{\prime}}\times 64} $. 综上所述,通过该映射机制,三维点云中的点被投影到二维图像的像素位置,并根据二维图像中的特征找到对应的三维点. 利用该方法,有效地将三维点云特征转换为与二维图像特征兼容的形式,为后续的多模态特征融合过程提供支持.

1.2.2. 多模态知识对齐模块

在多模态融合阶段,简单的线性变换无法有效地融合来自二维图像特征F2D和经过P2P映射处理后生成的点云特征F3D. 为了解决该问题,设计多模态知识对齐模块(multi-modal knowledge alignment module, MKAM). 该模块在设计的双融合注意力机制框架下,结合一系列精细化的特征转换策略,优化不同模态之间的特征表示. 此外,引入代理注意力机制,通过在对齐过程中聚焦关键特征,提升特征对齐的质量.

图4所示,输入的二维图像特征F2D和三维点云特征F3D分别通过多层感知机(multilayer perceptron, MLP)进行非线性映射,将各模态的特征维度从高维空间投射到低维空间. 降维后的二维和三维特征通过拼接融合,形成维度为$ {N}^{\prime}\times 32 $的联合特征. 这一融合过程增强了不同模态特征间的互补性,为后续的特征优化奠定了基础. 融合后的联合特征通过全连接层进一步处理,实现维度压缩与信息精炼. 利用Sigmoid函数对全连接层的输出进行非线性变换,生成对应的注意力权重H1H2. Sigmoid函数将权重限定在[0,1.0],使其能够动态调整不同模态特征的重要性,增强特征间的互补性.

图 4

图 4   多模态知识对齐模块

Fig.4   Multi-modal knowledge alignment module


$ {\boldsymbol{H}}_{{{}_{\mathit{\Psi }}}}=\mathrm{Sigmoid}\;\text{[}f_{{\mathrm{MLP}}}\,\text{(}\mathrm{concat}\;\text{(}f_{{\mathrm{MLP}}}\,\text{(}{\boldsymbol{F}}^{2\mathrm{D}}\text{),}\;f_{{\mathrm{MLP}}}\,\text{(}{\boldsymbol{F}}^{3\mathrm{D}}\text{)))].} $

式中:ψ取值为1、2,$f_{{\mathrm{MLP}}} $表示多层感知机MLP,concat表示拼接.

结合加权策略,使用H1H2分别对三维点云特征和二维图像特征进行加权,优化融合后的特征表示,为后续的代理注意力机制提供高质量的输入. 加权后的特征通过代理注意力机制(agent attention, AA)进一步提取关键信息. 如图5所示,代理注意力机制包含2个主要阶段:聚合全局上下文信息(Agent聚合);将全局信息广播到查询特征(Agent广播). 不同于传统Self-Attention中每个查询与所有键值直接交互的方式,代理注意力机制采用“聚合-广播”的双阶段结构:先由代理令牌集中整合全局上下文,再将整合后的特征传递至所有查询. 通过这种方式,全局信息在统一处理后再扩散至各个位置,有效降低了低相关成分在查询更新中的作用,增强了上下文在不同查询之间传递的一致性.

图 5

图 5   代理注意力模块

Fig.5   Agent attention module


在Agent聚合阶段,将代理令牌$ \boldsymbol{A}\in {\bf{R}}^{n\times d} $作为查询矩阵Q,与键值对(K, V)进行注意力计算,从整体上收集上下文信息. 通过这种机制,代理令牌能够将原本分散在各位置的特征按注意力权重进行整合,并更新为集中化的全局表示. 为了进一步突出判别性区域,在相似度计算中引入聚合偏差$ {\boldsymbol{B}}_{1}\in {\bf{R}}^{n\times N} $,以调整注意力分布,使注意力权重聚焦于关键区域. 将调整后的注意力权重与值矩阵V相乘,生成聚合后的代理特征:

$ {\boldsymbol{V}}_{\mathrm{A}}=\mathrm{Softmax}\left(\frac{\boldsymbol{A}{\boldsymbol{K}}^{\mathrm{T}}}{\sqrt{{d}_{{\mathrm{k}}}}}+{\boldsymbol{B}}_{1}\right)\boldsymbol{V}{.} $

式中:dk为特征维度的缩放因子.

在Agent广播阶段,将代理令牌A作为键矩阵K,代理特征VA作为值矩阵V,与查询矩阵Q进行注意力计算. 通过这一过程,聚合得到的全局上下文信息(即代理特征VA)通过注意力机制广播到每个查询令牌Q中,使每个查询令牌Q都能接收到来自第一阶段所聚合的全局信息,从而增强查询令牌Q的表示能力. 在相似度计算中引入广播偏差$ {\boldsymbol{B}}_{2}\in {\bf{R}}^{N\times n} $,为注意力分布提供空间一致性约束,保证上下文能够稳定传递至各查询位置,最终生成输出特征O

$ \boldsymbol{O}=\mathrm{Softmax}\left(\frac{\boldsymbol{Q}{\boldsymbol{A}}^{\mathrm{T}}}{\sqrt{{d}_{{\mathrm{k}}}}}+{\boldsymbol{B}}_{2}\right){\boldsymbol{V}}_{\mathrm{A}}. $

为了捕获局部空间信息,代理注意力机制结合逐通道卷积(depthwise convolution, DWC). DWC模块对聚合后的代理特征V和广播后的输出特征O进行局部特征增强,生成更加精细且具有更强表征能力的特征:

$ {\boldsymbol{O}}_{\mathrm{final}}=\boldsymbol{O}+\mathrm{DWC}(\boldsymbol{V}). $

通过以上操作,代理注意力强化了对关键特征的表达能力. 经过代理注意力机制处理的二维特征和三维特征通过逐元素加法融合,生成最终的融合特征:

$ \boldsymbol{F}=\mathrm{AA}({{\boldsymbol{F}}}^{3\mathrm{D}}\times {{\boldsymbol{H}}}_{1})+\mathrm{AA}({{\boldsymbol{F}}}^{2\mathrm{D}}\times {{\boldsymbol{H}}}_{2}). $

式中:AA为代理注意力机制.

1.3. 语义分割

MKAM输出的多模态特征与原始三维特征分别通过2个独立的分割头(segmentation head)进行预测,如图1所示,每个分割头由多个全连接层Linear-ReLU-Linear组成. 为了增强语义一致性,在训练过程中引入KL散度(Kullback-Leibler divergence, KL)损失:

$ {{L}}_{\mathrm{KL}}={D}_{\mathrm{KL}}({\boldsymbol{S}}_{2\mathrm{D}3\mathrm{D}}\parallel {\boldsymbol{S}}_{3\mathrm{D}}). $

式中:DKL( || )表示KL散度,用于度量2个概率分布之间的差异;||表示2个概率分布之间的“相对”关系,S3D为网络模型对三维点云的预测结果,S2D3D为融合特征的预测结果. 通过最小化KL散度损失,使得三维特征的语义分数向融合后特征的语义分数靠近,从而减小这2个概率分布之间的差异. 引入三维分割损失和二维分割损失,三维分割损失直接优化点云数据,确保模型能够准确执行三维点云的语义分割,该损失与预测的点云标签和真实的点云标签的差异相关. 二维分割损失通过计算融合特征与真实图像标签之间的差异,优化RGB图像的分割精度. 总损失函数${ {L}}_{\mathrm{Loss}} $是3种损失的加权和,具体权重通过超参数进行控制:

$ { {L}}_{\mathrm{Loss}}={ {L}}_{\mathrm{C}-3\mathrm{D}}+\frac{{ {L}}_{\mathrm{C}-2\mathrm{D}} \tau }{C}+\frac{{ {L}}_{\mathrm{KL}}\upsilon }{C}. $

式中:${ {L}}_{\mathrm{C}{\text{-}}3\mathrm{D}} $为三维点云的分割损失;${ {L}}_{\mathrm{C}{\text{-}}2\mathrm{D}} $为二维图像的分割损失;τυ为超参数,分别设为0.1和0.05;C为模型处理的尺度数量.

2. 实验结果及分析

为了验证所提算法在点云语义分割任务中的性能及泛化能力,在SemanticKITTI[15]和NuScenes[16]数据集上进行实验,通过平均交并比和各类别的交并比对该算法进行评估.

2.1. 实验环境的设置和数据集

实验中的软件环境基于PyTorch 2.0.0,使用CUDA 11.8进行加速. 硬件配备为24 GB显存的Nvidia RTX 4 090. 代码实现基于2DPASS基线,并沿用相同的数据预处理流程,确保实验的公平性与可比性. 在训练过程中,优化器选择随机梯度下降,将权重衰减设置为0.000 1,动量系数为0.9,批次大小(batch size)设置为8,训练轮次(epochs)为64. 为了加速模型的收敛并减少陷入局部最优解的风险,将初始学习率设置为0.24.

SemanticKITTI数据集是大规模点云分割数据集,专为自动驾驶场景设计. 该数据集包含超过43 000帧点云数据,共标注25个语义类别,包括车道、建筑、行人、车辆等,广泛应用于3D语义分割任务. SemanticKITTI数据集分为21个序列,其中序列00~07以及09、10用于训练,序列08用于验证,序列11~21用于在线测试. SemanticKITTI数据集支持与KITTI数据集中2个前视摄像头采集的RGB图像结合,为多模态研究提供基础数据支撑.

NuScenes数据集是专为自动驾驶系统设计的多模态大规模数据集,提供了城市交通环境中车辆采集的高精度传感数据. 数据集涵盖多样的场景和天气条件,由多个传感器的同步数据组成. NuScenes数据集包含1 000个场景,其中700个场景用于训练,150个场景用于验证,另有150个场景用于测试. NuScenes提供6个摄像头数据,可以实现完整的360°视野覆盖,这为多模态任务的研究提供了更丰富的数据支持.

2.2. 评价指标

采用交并比(intersection over union, IoU)和平均交并比(mean intersection over union, mIoU)作为主要的评价指标. IoU用于衡量模型在单一语义类别上的预测区域与标注区域的重叠程度.

$ \mathrm{IoU}=\frac{\mathrm{TP}}{\mathrm{FN}+\mathrm{FP}+\mathrm{TP}}. $

式中:TP为模型正确预测为正类的实例数量,FP为模型错误地将负类预测为正类的实例数量,FN为模型错误地将正类预测为负类的实例数量.

引入mIoU作为整体分割质量评价指标. 相较于IoU,mIoU通过对各类别IoU取平均,能够更均衡地衡量模型在不同类别上的分割性能,从而更客观地反映模型在语义分割任务中的综合表现,计算公式为

$ \mathrm{mIoU}=\frac{1}{k+1}\sum \limits_{i=0}^{k}\frac{\mathrm{T}{\mathrm{P}}_{i}}{\mathrm{F}{\mathrm{N}}_{i}+\mathrm{F}{\mathrm{P}}_{i}+\mathrm{T}{\mathrm{P}}_{i}}. $

式中:k为类别的最大索引.

2.3. 对比实验

在SemanticKITTI数据集的08序列上进行对比实验,结果如表1所示. 本文算法的mIoU达到69.1%,优于现有方法. 与2DPASS[24]相比,虽然两者均采用多模态融合策略,但2DPASS在融合模块中仅依赖线性变换进行特征整合,限制了不同模态数据之间的深度交互. 利用提出的多模态知识对齐模块,能够动态调节模态特征的重要性,增强互补性,从而显著提升分割性能. SalsaNext+[21]融合了图像信息,但在点云特征上直接附加RGB数据,映射方式较简化,且未充分解决引入二维分支带来的额外计算开销. 针对这些问题,提出特征分离卷积,抑制二维分支的冗余计算,从而降低模型结构参数量并缩短推理时间. 采用点到像素的映射策略,通过几何投影关系,实现跨模态特征的精确配对,提升几何一致性. Cylinder3D[18]通过圆柱体分区,提升点云特征提取质量;WaffleIron[20]结合二维卷积与多层感知机,提升点云处理效率;TFNet[19]利用多帧点云并引入时序投票策略,强化时序特征. 这些方法均依赖单一模态,缺乏跨模态互补信息,因此在分割精度上存在一定的局限性. 本文方法不仅在整体mIoU上优于其他算法,而且在具体的语义类别上,本文模型在19个类别中的14个类别上实现了比2DPASS方法更高的IoU,展现出卓越的分割性能.

表 1   SemanticKITTI数据集上不同算法的语义分割性能对比

Tab.1  Comparison of semantic segmentation performance of different algorithms on SemanticKITTI dataset

模型mIoU/%IoU/%
道路人行道停车场其他地面建筑物小汽车卡车坐车摩托车
PointNet++[17]20.172.041.818.75.662.353.70.91.90.2
Cylinder3D[18]66.994.581.244.81.090.597.185.170.354.5
TFNet[19]66.190.675.368.529.091.694.338.460.758.5
WaffleIron[20]68.095.583.650.26.492.196.177.458.179.7
SalsaNext+[21]59.593.378.855.87.790.293.550.440.243.3
RViT-FLARES[22]66.191.677.371.132.791.495.652.456.360.5
PC-BEV[23]67.293.079.873.532.192.196.537.666.557.7
2DPASS[24]68.394.081.349.14.291.796.692.452.776.9
本文模型69.194.482.052.33.691.797.292.556.477.3
模型IoU/%
其他车辆植被树干地形行人骑自行车的人骑摩托车的人围栏立杆交通标志
PointNet++[17]0.246.513.830.00.91.00.016.96.08.9
Cylinder3D[18]80.976.592.20.086.670.870.458.764.251.8
TFNet[19]48.483.871.167.074.372.235.567.360.868.7
WaffleIron[20]59.087.873.873.081.192.21.267.565.752.2
SalsaNext+[21]41.181.863.670.949.376.69.656.954.348.9
RViT-FLARES[22]57.183.168.068.172.069.716.067.458.067.5
PC-BEV[23]48.285.470.070.062.568.049.169.262.463.0
2DPASS[24]66.189.271.976.478.392.82.766.362.554.0
本文模型74.889.473.276.678.691.00.265.362.653.0

新窗口打开| 下载CSV


图6所示为本文算法与Cylinder3D、WaffleIron和2DPASS算法在SemanticKITTI数据集上的分割效果对比. 为了更直观地对比分割效果的差异,将同一个场景中不同方法在同一位置处的语义分割可视化结果按列分布,图6中方框用于标示对比方法在这些区域分割准确性不足的部分. 可以看出,本文算法在多个关键区域的分割结果显著优于其他方法. 这主要是因为提出的多模态知识对齐模块与特征优化策略能够有效融合RGB图像与点云特征,从而更加精准地捕捉关键特征,显著提升整体分割性能.

图 6

图 6   不同方法的语义分割效果对比

Fig.6   Comparison of semantic segmentation performance across different methods


图7所示为本文算法与Cylinder3D、WaffleIron、2DPASS等算法在4种不同场景下误差分布的对比分析. 其中,黑色区域表示与真实情况不符的点,灰色区域表示准确分类的点;方框用于标注对比方法在这些区域分割准确性不足的部分. 从图7可以看出,Cylinder3D、WaffleIron和2DPASS在多个场景中均出现了明显的黑色区域,特别是在复杂边缘和细节丰富的区域,误差较大. 本文算法在这些区域的黑色面积明显减小,表明改进后的模型在分割准确性上有明显的提升.

图 7

图 7   不同方法的误差图对比

Fig.7   Comparison of error map across different methods


在NuScenes数据集上的对比实验结果如表2所示. 可以看出,本文算法的mIoU达到79.3%,优于其他主流算法. 特别是在卡车类别上,本文模型的IoU达到88.6%,相较于2DPASS算法提高了6.4%. 在10个关键类别以及小目标和非均匀分布的地表类型上均取得了优异的分割表现. 这些结果验证了本文算法在多样化的城市场景中具有良好的泛化能力和适应性,尤其在复杂路况条件下,能够更好地分割不同类别的目标,体现出更强的语义分割能力.

表 2   NuScenes数据集上不同算法的语义分割性能对比

Tab.2  Comparison of semantic segmentation performance across different methods on NuScenes dataset

模型mIoU/%IoU/%
护栏自行车公交车汽车施工区域摩托车行人交通锥
Cylinder3D[18]77.282.829.884.389.463.079.377.273.4
PMF[25]77.082.040.081.088.064.079.080.076.0
RViT-FLARES[22]77.076.739.293.092.055.281.677.264.9
PC-BEV[23]78.878.246.392.593.455.087.181.065.4
2DPASS[24]78.576.152.695.785.156.591.780.968.2
本文模型79.376.552.396.188.256.691.580.669.2
模型IoU/%
拖车卡车可行驶区域其他地面人行道地形人造结构植被
Cylinder3D[18]84.669.197.770.280.375.590.487.6
PMF[25]81.067.097.068.078.074.090.088.0
RViT-FLARES[22]70.984.196.874.195.675.188.686.7
PC-BEV[23]69.285.797.176.877.076.390.688.5
2DPASS[24]74.682.296.676.472.471.588.287.3
本文模型76.588.696.575.273.272.388.087.5

新窗口打开| 下载CSV


2.4. 消融实验

为了验证提出模块的有效性,在SemanticKITTI和NuScenes数据集上通过逐步添加不同的模型组件,评估各个模块对算法整体性能的影响.

在SemanticKITTI数据集上的实验结果如表3所示. 其中,ttr为训练时间,Np为参数量. 从表3可知,基线模型2DPASS的mIoU为68.4%,参数量为26.5×106,训练时间为42 h. 在引入MKAM模块后,模型的mIoU提升至68.9%,但参数量上升至29.8×106,训练时间增长至65.4 h. 这是因为MKAM在跨模态对齐过程中额外引入了代理注意力机制,能够有效地捕捉全局上下文并突出关键区域,从而提升预测精度,但增大了参数规模和计算复杂度,导致训练开销显著增加. 仅引入FSConv模块后,mIoU提升至68.5%,参数量为26.4×106,训练时间缩短至40.8 h. 这是因为FSConv采用轻量化策略替换部分传统卷积层,而非简单的叠加结构,在增强二维分支特征表达能力的同时有效减少了冗余计算,因此在提升分割精度的同时进一步压缩了二维分支参数量与训练开销. 当同时使用FSConv和MKAM模块时,mIoU提升至69.1%,参数量为27.7×106,计算时间缩短至63.7 h. 此时,FSConv的轻量化特性在一定程度上抵消了MKAM引入的额外负担,使得整体参数量低于单独使用MKAM的情况;分割精度得到进一步提升,模型在性能与效率之间实现了较优平衡.

表 3   SemanticKITTI数据集上不同模块的消融实验结果

Tab.3  Ablation experimental result of different modules on SemanticKITTI dataset

FSConvMKAMmIoU/%ttr/hNp/106
68.442.026.5
68.965.429.8
68.540.826.4
69.163.727.7

新窗口打开| 下载CSV


在NuScenes数据集上的实验结果如表4所示,基线模型2DPASS的mIoU为78.5%,参数量为179.2×106,训练时间为49.9 h. 在加入MKAM模块后,mIoU提升至78.9%,但参数量增至181.7×106,训练时间增长至68.1 h. 单独引入FSConv模块后,mIoU略降至78.4%,而参数量减少至178.3×106,训练时间缩短至48.6 h. 这是因为与SemanticKITTI相比,NuScenes的三维分支起始通道数为256,而SemanticKITTI仅为64,这一设定使得NuScenes的三维分支参数量高达约149×106,占总规模的80%以上,整体性能更依赖三维特征. NuScenes输入图像由1 600×900裁剪为480×320,导致纹理细节明显减少,削弱了二维分支在跨模态融合中的补充能力. FSConv模块有效压缩了二维分支的参数量并缩短了训练时间,但由于二维分支的补充能力受限,FSConv模块对模型整体性能的提升效果未能充分体现,导致mIoU略低于基线模型. 当FSConv与MKAM结合使用时,mIoU提升至79.3%,参数量为180.7 ×106,训练时间为66.0 h. FSConv在降低计算开销的同时保障了关键特征表达,与MKAM的跨模态对齐机制形成互补,使得模型在性能、参数量和训练时间之间实现了最佳平衡.

表 4   NuScenes数据集上不同模块的消融实验结果

Tab.4  Ablation experimental result of different modules on NuScenes dataset

FSConvMKAMmIoU/%ttr/hNp/106
78.549.9179.2
78.968.1181.7
78.448.6178.3
79.366.0180.7

新窗口打开| 下载CSV


在SemanticKITTI和NuScenes数据集上的消融实验结果可以看出,MKAM模块通过聚焦关键特征并赋予更高权重,确保对齐过程中能够精确提取重要特征,提升了模型在复杂场景中的分割精度. FSConv模块的贡献主要体现在参数量和训练时间的优化上,它通过在空间与通道维度上减少冗余计算,有效减少了模型的计算开销. 当MKAM与FSConv结合使用时,两者优势互补,不仅进一步提升了整体分割精度,而且在性能、参数规模与训练时间之间实现了更稳健的平衡,使得模型在大规模点云语义分割任务中展现出更优的综合表现.

2.5. 基于距离的评价

为了分析点云与激光雷达传感器之间的距离对语义分割性能的影响,对不同距离范围内的分割性能进行详细评估. 如图8所示,在SemanticKITTI数据集上对比本文算法与其他算法的mIoU随着点云距离dp变化的趋势. 可以看出,在[0, 10] m内,点云密度较高,细节信息丰富,有助于模型进行更准确地分割,本文算法的性能在这一范围内略优于其他模型. 在[10, 30] m内,点云稀疏性增加,分割精度逐渐下降,但本文算法的性能仍保持领先. 当点云距离>30 m时,点云稀疏性显著增加,各模型的性能普遍下降,但本文算法在分割精度方面依然表现出显著的优势,这主要归功于注意力机制在稀疏数据处理中的优越性.

图 8

图 8   不同距离下的语义分割性能对比

Fig.8   Comparison of semantic segmentation performance at different distance


表5所示为点云在不同距离段上的比例P分布,点云在不同距离段上的分布比例情况在一定程度上解释了上述性能变化. 其中,距离激光雷达传感器在[0, 10] m范围内的点云占总数的61%,而距离激光雷达传感器超过50 m的点云仅占1%. 这一比例分布表明,远距离点云的稀疏性是导致模型分割性能下降的主要原因.

表 5   各距离点云的比例

Tab.5  Proportion of point cloud at different distance

dp/mP/%dp/mP/%
0~106130~403
10~202640~501
20~307> 501

新窗口打开| 下载CSV


综上所述,随着距离的增加,各模型分割精度呈现逐渐下降的趋势,但本文算法在不同距离段的语义分割任务中的性能仍优于其他模型.

2.6. 体素化空间大小评估

体素分辨率r会直接影响体素分支提取到的上下文特征的质量. r过低会导致细节信息丢失,尤其是在小目标的细节上;分辨率过高虽然减少了体素化过程中的信息丢失,但会引入大量的冗余信息,影响最终的分割性能. 从表6可以看出,在SemanticKITTI数据集上,随着r的增大,网络分割精度逐渐提升,当r = 10 cm时网络分割精度达到最高值69.1%. 进一步增大体素分辨率后,模型分割精度开始下降,因为体素网格中出现大量的空体素,使得模型学习到过多无关或冗余的信息,影响了分割的准确性. 本实验中的参数r设置为10.

表 6   不同体素分辨率对分割结果的影响

Tab.6  Impact of different voxel resolution on segmentation result

r/cmmIoU/%r/cmmIoU/%
868.91169.0
969.01268.9
1069.1

新窗口打开| 下载CSV


2.7. 超参数消融实验

在SemanticKITTI数据集上,为了评估总损失中超参数τυ的作用,设置7组取值进行对比,结果见表7. 实验结果表明,当τ取0.1且υ取0.05时,模型取得最佳性能,mIoU达到69.1%. 增大τ的取值,训练会更偏向图像分支,从而削弱三维几何特征的学习能力,导致整体分割精度下降. 增大υ的取值,会强化KL散度损失的约束作用,使得2个分支的预测分布被迫过度接近,模态互补的效果受限,性能回落. 减小τυ的取值,则会导致二维监督与KL散度损失的约束作用不足,跨模态对齐和语义补充减弱,分割精度下降. 综合结果表明,在τ = 0.1,υ = 0.05的情况下,模型在二维监督与KL散度损失之间实现了较稳健的平衡,因此采用该组参数作为默认设置.

表 7   不同超参数设置下的分割性能对比

Tab.7  Segmentation performance under different hyperparameter setting

组别τυmIoU/%
10.10.0569.1
20.1250.062 567.9
30.10.062 568.0
40.1250.0568.6
50.0750.037 566.3
60.10.037 567.5
70.0750.0567.0

新窗口打开| 下载CSV


3. 结 语

提出基于多模态知识对齐的双分支点云语义分割框架. 该框架融合RGB图像与三维点云特征,引入多模态知识对齐模块与特征分离卷积模块,提升分割性能. 实验结果表明,在SemanticKITTI与NuScenes数据集上,该方法较主流对比方法取得更高的分割精度. 对于小目标、远距离目标及复杂边界区域,模型分割性能仍易受到点云稀疏性和跨模态对齐误差的影响. 后续工作将考虑引入更丰富的上下文信息与更高效的融合策略,进一步提高对齐精度,在不显著增加计算开销的前提下优化整体性能.

参考文献

QIU S, LI X, XUE X, et al. PC-BEV: an efficient polar-Cartesian BEV fusion framework for LiDAR semantic segmentation [C]//Proceedings of the AAAI Conference on Artificial Intelligence. [S. l.]: AAAI Press, 2025, 39(6): 6612–6620.

[本文引用: 4]

YAN X, GAO J, ZHENG C, et al. 2DPASS: 2D priors assisted semantic segmentation on LiDAR point clouds [C]//Proceedings of the European Conference on Computer Vision. Cham: Springer, 2022: 677–695.

[本文引用: 5]

SONG Z, LIU L, JIA F, et al

Robustness-aware 3D object detection in autonomous driving: a review and outlook

[J]. IEEE Transactions on Intelligent Transportation Systems, 2024, 25 (11): 15407- 15436

DOI:10.1109/TITS.2024.3439557      [本文引用: 1]

LUO H, ZHANG J, LIU X, et al

Large-scale 3D reconstruction from multi-view imagery: a comprehensive review

[J]. Remote Sensing, 2024, 16 (5): 773- 811

DOI:10.3390/rs16050773      [本文引用: 1]

LI H, ZHU G, ZHANG L, et al

Scene graph generation: a comprehensive survey

[J]. Neurocomputing, 2024, 566: 127052- 127077

DOI:10.1016/j.neucom.2023.127052      [本文引用: 1]

ZHAO J, ZHAO W, DENG B, et al

Autonomous driving system: a comprehensive survey

[J]. Expert Systems with Applications, 2024, 242: 122836

DOI:10.1016/j.eswa.2023.122836      [本文引用: 1]

MYSTAKIDIS S

Metaverse

[J]. Encyclopedia, 2022, 2 (1): 486- 497

DOI:10.3390/encyclopedia2010031      [本文引用: 1]

GARCIA E, JIMENEZ M A, DE SANTOS P G, et al

The evolution of robotics research

[J]. IEEE Robotics and Automation Magazine, 2007, 14 (1): 90- 103

DOI:10.1109/MRA.2007.339608      [本文引用: 1]

YING S, VAN OOSTEROM P, FAN H

New techniques and methods for modelling, visualization, and analysis of a 3D city

[J]. Journal of Geovisualization and Spatial Analysis, 2023, 7 (2): 26- 29

DOI:10.1007/s41651-023-00157-x      [本文引用: 1]

SHELHAMER E, LONG J, DARRELL T. Fully convolutional networks for semantic segmentation [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Boston: IEEE, 2015: 3431–3440.

[本文引用: 1]

ZHOU J, HAO M, ZHANG D, et al

Fusion PSPnet image segmentation based method for multi-focus image fusion

[J]. IEEE Photonics Journal, 2019, 11 (6): 6501412

DOI:10.1080/19479832.2020.1791262      [本文引用: 1]

CHEN L C, PAPANDREOU G, KOKKINOS I, et al

DeepLab: semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected CRFs

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 40 (4): 834- 848

DOI:10.1109/tpami.2017.2699184      [本文引用: 1]

杨军, 张琛

融合双注意力机制和动态图卷积的点云语义分割

[J]. 北京航空航天大学学报, 2024, 50 (10): 2984- 2994

DOI:10.13700/j.bh.1001-5965.2022.0775      [本文引用: 1]

YANG Jun, ZHANG Chen

Semantic segmentation of point clouds by fusing dual attention mechanism and dynamic graph convolution

[J]. Journal of Beijing University of Aeronautics and Astronautics, 2024, 50 (10): 2984- 2994

DOI:10.13700/j.bh.1001-5965.2022.0775      [本文引用: 1]

杨军, 党吉圣

基于上下文注意力CNN的三维点云语义分割

[J]. 通信学报, 2020, 41 (7): 195- 203

DOI:10.11959/j.issn.1000-436x.2020128     

YANG Jun, DANG Jisheng

Semantic segmentation of 3D point cloud based on contextual attention CNN

[J]. Journal on Communications, 2020, 41 (7): 195- 203

DOI:10.11959/j.issn.1000-436x.2020128     

LI B, MAO B

3D cadaster creation from generalized blueprint based on semantic boundary point extraction

[J]. Journal of Geovisualization and Spatial Analysis, 2022, 6 (2): 21- 32

DOI:10.1007/s41651-022-00113-1      [本文引用: 1]

ZHANG C, LIU M, XU D, et al. Multi-modal 3D point cloud and image fusion for semantic segmentation in autonomous driving [C]// Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021: 1356–1364.

[本文引用: 1]

BEHLEY J, GARBADE M, MILIOTO A, et al. SemanticKITTI: a dataset for semantic scene understanding of LiDAR sequences [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Seoul: IEEE, 2020: 9296–9306.

[本文引用: 1]

CAESAR H, BANKITI V, LANG A H, et al. nuScenes: a multimodal dataset for autonomous driving [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 11621–11631.

[本文引用: 1]

QI C R, YI L, SU H, et al. PointNet++: deep hierarchical feature learning on point sets in a metric space [C]// Advances in Neural Information Processing Systems. [S. l.]: Curran Associates, 2017, 30: 5099–5108.

[本文引用: 2]

ZHOU H, ZHU X, SONG X, et al. Cylinder3D: an effective 3D framework for driving-scene LiDAR semantic segmentation [EB/OL]. (2020-08-04)[2025-10-13]. https://arxiv.org/abs/2008.01550.

[本文引用: 5]

LI R, LI S, CHEN X, et al. TFNet: exploiting temporal cues for fast and accurate LiDAR semantic segmentation [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 4547–4556.

[本文引用: 3]

PUY G, BOULCH A, MARLET R. Using a waffle iron for automotive point cloud semantic segmentation [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2024: 3379–3389.

[本文引用: 3]

SÁNCHEZ-GARCÍA F, MONTIEL-MARÍN S, ANTUNES-GARCÍA M, et al

SalsaNext+: a multimodal-based point cloud semantic segmentation with range and RGB images

[J]. IEEE Access, 2025, 13: 64133- 64147

DOI:10.1109/ACCESS.2025.3559580      [本文引用: 3]

YANG B, CONDURACHE A P. FLARES: fast and accurate LiDAR multi-range semantic segmentation [EB/OL]. (2025-02-13)[2025-10-13]. https://arxiv.org/abs/2502.09274.

[本文引用: 4]

ZHUANG Z, LI R, JIA K, et al. Perception-aware multi-sensor fusion for 3D LiDAR semantic segmentation [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2022: 16260–16270.

[本文引用: 2]

/