浙江大学学报(工学版), 2026, 60(8): 1782-1791 doi: 10.3785/j.issn.1008-973X.2026.08.017

计算机技术

结合边缘辅助与多级特征融合的跨模态语义分割算法

陈广秋,, 任天蓉, 段锦,, 黄丹丹

长春理工大学 电子信息工程学院,吉林 长春 130022

Cross-modal semantic segmentation algorithm with edge-assisted and multi-level feature fusion

CHEN Guangqiu,, REN Tianrong, DUAN Jin,, HUANG Dandan

College of Electronic Information Engineering, Changchun University of Science and Technology, Changchun 130022, China

通讯作者: 段锦,男,教授,博士. orcid.org/0000-0001-8245-2462. E-mail:duanjin@vip.sina.com

收稿日期: 2025-06-12  

基金资助: 国家自然科学基金重大仪器专项(62127813);吉林省科技发展计划项目(20210203181SF).

Received: 2025-06-12  

Fund supported: 国家自然科学基金重大仪器专项(62127813);吉林省科技发展计划项目(20210203181SF).

作者简介 About authors

陈广秋(1977—),男,副教授,博士,从事图像处理与机器视觉研究.orcid.org/0009-0000-4529-2244.E-mail:guangqiu_chen@126.com , E-mail:guangqiu_chen@126.com

摘要

现有跨模态语义分割网络忽略跨模态特征间的互补性和不同尺度特征间的关联性,在复杂光照条件下存在边界模糊、远处小目标分割准确性差的问题,为此提出新的跨模态语义分割算法(EMFFNet). 在编码器中,基于浅层与深层的语义特性差异,设计多尺度注意力融合模块和跨模态特征加权融合模块,分别捕获细节纹理信息和高阶语义信息. 在解码器中,引入通道增强模块和边缘监督策略辅助训练,强化目标边界感知能力. 相比主流算法,EMFFNet在MFNet城市街景数据集上的各项评估指标均为最优,平均准确率和平均交并比分别为76.1%和59.4%. 实验结果表明,在光照变化条件下,EMFFNet能够有效缓解目标边缘模糊问题,提高远处小目标分割精度.

关键词: 多级特征融合 ; 边缘辅助监督 ; 多尺度注意力 ; 跨模态 ; 语义分割

Abstract

Existing cross-modal semantic segmentation networks ignore the complementarity among cross-modal features and the correlation among features of different scales, resulting in blurred boundaries and poor segmentation accuracy for distant small targets under complex lighting conditions. A new cross-modal semantic segmentation algorithm (EMFFNet) was proposed. In the encoder, based on the different semantic characteristics of shallow and deep layers, a multi-scale attention fusion module and a cross-modal feature weighted fusion module were designed to capture detailed texture information and high-order semantic information, respectively. A channel enhancement module and edge supervision strategy were introduced into the decoder to assist training, and the target boundary perception ability was strengthened. Compared with the mainstream algorithms, EMFFNet achieves the best evaluation metrics on the MFNet urban street view dataset, with mean accuracy and mean intersection-over-union of 76.1% and 59.4%, respectively. Experimental results show that EMFFNet effectively alleviates edge blurring and enhances segmentation accuracy of distant small targets under varying illumination.

Keywords: multi-level feature fusion ; edge-assisted supervision ; multi-scale attention ; cross-modality ; semantic segmentation

PDF (6117KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

陈广秋, 任天蓉, 段锦, 黄丹丹. 结合边缘辅助与多级特征融合的跨模态语义分割算法. 浙江大学学报(工学版)[J], 2026, 60(8): 1782-1791 doi:10.3785/j.issn.1008-973X.2026.08.017

CHEN Guangqiu, REN Tianrong, DUAN Jin, HUANG Dandan. Cross-modal semantic segmentation algorithm with edge-assisted and multi-level feature fusion. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1782-1791 doi:10.3785/j.issn.1008-973X.2026.08.017

图像语义分割通过对图像中每个像素点进行精准的语义类别标注,深度解析目标的尺寸比例、几何形态与空间位置信息,将复杂视觉场景解构为具有明确语义属性的实体单元,实现从像素级到语义级的精细化图像理解与分析. 语义分割技术在自动驾驶与智能交通、医疗影像分析、地理信息系统与遥感等[1-4]领域的应用价值显著.

传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5]、编码器-解码器结构[6-7]和金字塔结构[8]. Xie等[9]提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10]提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11]针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12]设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13]提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14]提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15]提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16]提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题.

本研究提出结合边缘辅助和多级特征融合的跨模态语义分割网络(cross-modal semantic segmentation network with edge-assisted and multi-level feature fusion, EMFFNet),融合各层次间的特征、不同模态间的互补信息和不同尺度间的交互信息,提高算法对边缘和远处小目标的分割精确度. 骨干网络提取的特征被解耦为浅层与深层2个层次,分别设计不同的融合策略. 针对浅层特征,构建多尺度注意力模块(multi-scale attention fusion module, MAFM),通过多尺度卷积层扩大感受野,结合通道与空间注意力机制,增强对跨模态图像中细节纹理信息的捕捉能力;针对深层特征,设计跨模态特征加权融合模块(cross-modal feature weighted fusion module, CFWF),利用密集连接块和非线性特征增强单元实现特征的高效传递和不同模态语义信息的自适应融合与差异性互补. 为了进一步提升模型在边界检测和目标分割上的精度,引入作为辅助监督的边缘标签与二分类标签,聚焦目标边界细节和增强特征的语义判别力,提升算法分割精度与鲁棒性.

1. 结合边缘辅助和多级特征融合的跨模态语义分割网络模型

1.1. 网络架构

图1所示,EMFFNet采用编-解码架构,由2个编码器分支、2个MAFM、3个CFWF和1个解码器构成,解码器包含5个通道特征增强模块(channel feature enhancement module, CFEM)和4个解码模块(decoder block, DB). 编码器采用在ImageNet上预训练的ResNet152[17]作为主干网络来提取特征. ResNet152后三层结构相比前两层结构,下采样操作和残差块更多,能够有效地扩大感受野,提高语义特征的表示,因此将后三层提取的特征作为深层特征,前两层提取的特征作为浅层特征. 2个编码器支路分别对红外图像和可见光图像进行不同层次的特征提取:特征图统一表示成$ \boldsymbol{F}_{j}^{i} $$ j\in \left\{1,2,3,4,5\right\} $为尺度索引,$ i\in \left\{\text{r},\text{t}\right\} $为图像模态索引;将提取的特征分为2个层次,当$ j=1、2 $时,$ \boldsymbol{F}_{j}^{i} $为浅层特征,当$ j=3、4、5 $时,$ \boldsymbol{F}_{j}^{i} $为深层特征. 针对这2个层次特征设计MAFM和CFWF. 这2个模块协同作用,形成从底层细节到高层语义的渐进式特征融合体系,有效提升编码器的特征表达能力. 融合后的特征图通过解码器中的CFWF进一步增强语义信息,利用DB进行上采样重建图像,得到语义分割结果. 在网络训练阶段,引入边界辅助监督策略,在解码器中分别计算输出与真实边界标签和真实二分类标签对的损失,辅助训练优化网络参数,提高网络的边缘分割准确性.

图 1

图 1   结合边缘辅助和多级特征融合的跨模态语义分割网络架构

Fig.1   Architecture of cross-modal semantic segmentation network with edge-assisted and multi-level feature fusion


1.2. 多尺度注意力融合模块

浅层特征包含大量的细节信息(如纹理、边缘),MAFM能够增强这些细节特征的表征能力. MAFM引入由不同尺寸卷积构成的多尺度卷积层,增加感受野,减少重要细节的丢失. 空间注意力机制通过自适应地聚焦于重要位置,强化图像中关键信息的表达. 通道注意力通过调整各通道的权重,使网络自适应地增强对重要特征的关注. 通道与空间注意力机制能够抑制冗余的背景信息,减少浅层细节对深层语义的干扰. MAFM结合多尺度卷积与双重注意力机制,与现有方法相比,在增强细节表现力和提升特征信息挖掘方面具有显著优势.

图2所示,MAFM包括2个1×1卷积层、1个多尺度空间注意力支路和1个通道注意力支路. 将在同一尺度下的2种不同模态特征图$ \boldsymbol{F}_{j}^{i} $($ j=1,2 $)级联,通过1个1×1的卷积操作调整通道数,得到特征图$ {\boldsymbol{S}}_{j} $;分别输入多尺度空间注意力支路和通道注意力支路. 在多尺度空间注意力支路中,将$ {\boldsymbol{S}}_{j} $同时输入卷积核大小分别是3×3、5×5和7×7的3个卷积层,对输出进行逐像素相加,得到多尺度特征图$ {\boldsymbol{H}}_{j} $. $ {\boldsymbol{H}}_{j} $分别进行全局平均池化和全局最大池化,通过Sigmoid函数归一化得到空间注意力权重$ \boldsymbol{W}_{j}^{\mathrm{s}} $,与$ {\boldsymbol{H}}_{j} $逐像素相乘,得到多尺度空间显著特征图$ {\boldsymbol{Q}}_{j} $.

图 2

图 2   多尺度注意力融合模块

Fig.2   Multi-scale attention fusion module


${\boldsymbol{S}}_{j}={\mathrm{Conv}}_{1\times 1}\left(\mathrm{Cat}\left(\boldsymbol{F}_{j}^{\mathrm{r}},\boldsymbol{F}_{j}^{\mathrm{t}}\right)\right),$

$ {\boldsymbol{H}}_{j}= {\mathrm{Conv}}_{3\times 3}\left({\boldsymbol{S}}_{j}\right)\oplus {\mathrm{Conv}}_{5\times 5}\left({\boldsymbol{S}}_{j}\right)\oplus {\mathrm{Conv}}_{7\times 7}\left({\boldsymbol{S}}_{j}\right), $

$ \boldsymbol{W}_{j}^{\mathrm{s}}=\sigma \left(\mathrm{Cat}\left(\mathrm{GAP}\left({\boldsymbol{H}}_{j}\right),\mathrm{GMP}\left({\boldsymbol{H}}_{j}\right)\right)\right), $

$ \boldsymbol{Q}_{j}^{}=\boldsymbol{W}_{j}^{\mathrm{s}}\otimes {\boldsymbol{H}}_{j}. $

式中:$ j\in \left\{1,2\right\} $为尺度索引,$ {\mathrm{Conv}}_{1\times 1}\left(\cdot \right) $为1×1卷积,$ {\mathrm{Conv}}_{5\times 5}\left(\cdot \right) $为5×5卷积,$ {\mathrm{Conv}}_{7\times 7}\left(\cdot \right) $为7×7卷积,$ \text{Cat}\left(\cdot \right) $为级联,$ \sigma \left(\cdot \right) $为Sigmoid激活函数,$ \mathrm{GAP}\left(\cdot \right) $为全局平均池化,$ \mathrm{GMP}\left(\cdot \right) $为全局最大池化,$\oplus $为逐元素相加,$ \otimes $为逐元素相乘. 在通道注意力支路中,对$ {\boldsymbol{S}}_{j} $进行全局最大化和全局平均池化,获得2个描述通道特征的向量,再将2个向量级联进行归一化,得到归一化的通道权重$ \boldsymbol{W}_{j}^{\text{c}} $$ \boldsymbol{W}_{j}^{\text{c}} $$ {\boldsymbol{S}}_{j} $相乘得到通道显著特征图$ \boldsymbol{P}_{j}^{} $.

$ \boldsymbol{W}_{j}^{\mathrm{c}}=\sigma \left(\mathrm{Cat}\left(\mathrm{GAP}\left({\boldsymbol{S}}_{j}\right),\mathrm{GMP}\left({\boldsymbol{S}}_{j}\right)\right)\right), $

$ \boldsymbol{P}_{j}^{}=\boldsymbol{W}_{j}^{\mathrm{c}}\otimes {\boldsymbol{S}}_{j}. $

$ \boldsymbol{Q}_{j}^{} $$ \boldsymbol{P}_{j}^{} $逐像素相加,利用1×1的卷积调整通道数,得到含有丰富纹理信息的特征图$ {\boldsymbol{G}}_{j} $.

$ {\boldsymbol{G}}_{j}={\mathrm{Conv}}_{1\times 1}\left(\boldsymbol{P}_{j}^{}\oplus \boldsymbol{Q}_{j}^{}\right). $

1.3. 跨模态特征加权融合模块

深层特征通过神经网络的多个层次逐步抽象和精炼得到,能够捕捉图像中复杂的模式和高阶语义,包含许多语义信息. 为了增强深层特征图中的高阶语义信息表征能力,设计包含2个密集连接块、2个1×1卷积层和2个3×3卷积层的CFWF. 密集连接块和非线性特征增强单元用于捕捉模态间的特征关系,生成特征权重对不同模态特征图进行加权融合,提升算法对跨模态信息的捕捉能力.

图3所示,同一尺度下的2种不同模态特征图$ {\boldsymbol{F}}_{j}^{i} $($ j=3,4,5 $)先由输入密集连接块进行深层特征提取,再与$ {\boldsymbol{F}}_{j}^{i} $($ j=3,4,5 $)逐项素交叉相乘,得到包含2种模态特征信息的特征图,经过1×1的卷积层降维,得到特征图$ \boldsymbol{O}_{j}^{i} $.$ \boldsymbol{O}_{j}^{{\mathrm{r}}} $$ \boldsymbol{O}_{j}^{{\mathrm{t}}} $级联,通过2个连续的3×3卷积操作,特征图维度调整为2,利用sigmoid激活函数进行归一化,通过split操作分离出权重图$ \boldsymbol{W}_{j}^{\mathrm{r}} $$ \boldsymbol{W}_{j}^{\mathrm{t}} $,与对应的特征图$ \boldsymbol{O}_{j}^{i} $逐项素相乘,得到具有跨模态互补信息的特征图$ {\hat{\boldsymbol{F}}}_{j}^{\mathrm{r}} $$ {\hat{\boldsymbol{F}}}_{j}^{\mathrm{t}} $,再进行逐像素相乘,进一步提取模态间的显著信息,得到显著特征图. 为了避免丢失信息,将$ {\hat{\boldsymbol{F}}}_{j}^{\mathrm{r}} $$ {\hat{\boldsymbol{F}}}_{j}^{\mathrm{t}} $和显著特征图$ {\hat{\boldsymbol{F}}}_{j}^{\text{r,t}} $进行逐像素相加,得到多模态融合特征图$ {\boldsymbol{E}}_{j} $.

图 3

图 3   跨模态特征加权融合模块

Fig.3   Cross-modal feature weighted fusion module


$ \boldsymbol{O}_{j}^{\text{r}}={\mathrm{Conv}}_{1\times 1}\left(\boldsymbol{F}_{j}^{\mathrm{t}}\otimes \mathrm{Dense}\left(\boldsymbol{F}_{j}^{\mathrm{r}}\right)\right), $

$ \boldsymbol{O}_{j}^{\mathrm{t}}={\mathrm{Conv}}_{1\times 1}\left(\boldsymbol{F}_{j}^{\mathrm{r}}\otimes \mathrm{Dense}\left(\boldsymbol{F}_{j}^{\mathrm{t}}\right)\right), $

$ \left\{\boldsymbol{W}_{j}^{\mathrm{r}};\boldsymbol{W}_{j}^{\mathrm{t}}\right\}=\sigma \left({\mathrm{Conv}}_{3\times 3}\left({\mathrm{Conv}}_{3\times 3}\left(\mathrm{Cat}\left(\boldsymbol{O}_{j}^{\mathrm{r}},\boldsymbol{O}_{j}^{\mathrm{t}}\right)\right)\right)\right), $

$ {\hat{\boldsymbol{F}}}_{j}^{\mathrm{r}}=\boldsymbol{O}_{j}^{\mathrm{r}}\otimes \boldsymbol{O}_{j}^{\mathrm{r}}, $

$ {\hat{\boldsymbol{F}}}_{j}^{\mathrm{t}}=\boldsymbol{W}_{j}^{\mathrm{t}}\otimes \boldsymbol{O}_{j}^{\mathrm{t}}, $

$ {\boldsymbol{E}}_{j}={\hat{\boldsymbol{F}}}_{j}^{\mathrm{r}}\oplus {\hat{\boldsymbol{F}}}_{j}^{\mathrm{t}}\oplus {\hat{\boldsymbol{F}}}_{j}^{\mathrm{r}}\otimes {\hat{\boldsymbol{F}}}_{j}^{\mathrm{t}}. $

式中:$ \mathrm{Dense}\left(\cdot \right) $为密集连接块. 如图4所示为密集连接块的结构,它由4个1×1的卷积层组成.

图 4

图 4   密集连接块

Fig.4   Dense block


1.4. 解码器

图5所示,解码器由CFEM和DB构成. CFEM由1个最大池化层、1个平均池化层、2个1×1卷积和1个激活函数组成;DB由3个残差卷积块和1个上采样层组成. CFEM通过自适应地调整每个通道在特征提取过程中的贡献,增强通道维度上的特征信息,提高DB对语义信息的提取能力.

图 5

图 5   解码器结构

Fig.5   Decoder structure


$ \begin{split}\boldsymbol{W}_{j}^{\mathrm{s}}= & \sigma\; ({\mathrm{Conv}}_{1\times 1}(\mathrm{ReLU}\;({\mathrm{Conv}}_{1\times 1}(\mathrm{GAP}\left({\boldsymbol{F}}_{\mathrm{in}}\right)\oplus \\& \mathrm{GMP}\left({\boldsymbol{F}}_{\mathrm{in}}\right))))),\end{split} $

$ {{\boldsymbol{F}}^{\prime}}=\left({\boldsymbol{F}}_{\mathrm{in}}\otimes \boldsymbol{W}_{j}^{\mathrm{s}}\right)\oplus {\boldsymbol{F}}_{\mathrm{in}}. $

式中:$ {\boldsymbol{F}}_{\mathrm{in}} $为解码器的输入,网络1~2层的$ {\boldsymbol{F}}_{\mathrm{in}} $$ {\boldsymbol{G}}_{j} $,网络3~5层的$ {\boldsymbol{F}}_{\mathrm{in}} $$ {\boldsymbol{E}}_{j} $$ \mathrm{ReLU}\left(\cdot \right) $为ReLU激活函数层. 经过通道增强的特征图被输入DB中,该模块由3个连续残差卷积块和1个上采样层构成. 残差连接融合特征以稳定梯度传播,经过上采样层重建高分辨率图像.

$ {\boldsymbol{F}}_{\mathrm{out}}={\mathrm{Up}}_{\times 2}\left({{\boldsymbol{F}}^{\prime}}\oplus \mathrm{CBN}\left(\mathrm{CBN}\left(\mathrm{CBN}\left({{\boldsymbol{F}}^{\prime}}\right)\right)\right)\right). $

式中:$ {\text{Up}}_{\times 2}\left(\cdot \right) $为2倍上采样;$ \mathrm{CBN}\left(\cdot \right) $为卷积块,包含1个3×3卷积层、1个批量归一化层和1个激活函数层.

1.5. 边缘辅助监督策略

为了解决分割目标边缘定位不准和边缘轮廓模糊的问题,在训练阶段引入如图6所示的边缘辅助监督策略. 在解码器阶段,输出与真实边界标签和真实二分类标签分别计算损失,使网络模型同时关注目标区域的整体分割和边界细节的提取,达到辅助训练的效果. 使用5×5的滑动窗口处理真实语义标签,得到边界标签,将真实语义标签的前景像素和背景像素标注成1和0,得到二分类标签. 训练阶段的损失函数L包含3个部分,分别为语义分割损失$ {L}_{\mathrm{sem}} $、辅助分割的边界损失$ {L}_{\mathrm{bin}} $和二元边界损失$ {L}_{\mathrm{bou}} $

图 6

图 6   边缘辅助监督结构

Fig.6   Edge-assisted supervision structure


$ L={\lambda }_{1}{L}_{\mathrm{sem}}+{\lambda }_{2}{L}_{\mathrm{bin}}+{\lambda }_{3}{L}_{\mathrm{bou}}. $

式中:$ {\lambda }_{1} $$ {\lambda }_{2} $$ {\lambda }_{3} $为平衡因子. 设置${\lambda }_{1} $=0.4、${\lambda }_{2} $=0.3和${\lambda }_{3} $=0.3,此时实验结果的客观评价指标取得最优. 使用交叉熵损失函数计算二元边界损失和边界损失,使用Lovász-softmax损失函数[18]计算语义损失,Lovász-softmax损失函数能够直接优化网络中的平均交并比指标,在保持端到端训练的同时提升分割的鲁棒性.

2. 实验结果与分析

2.1. 数据集和实验环境

实验使用公开数据集MFNet[10]和PST900[11]. MFNet是利用InfReCR500摄像机针对城市街景采集的可见光RGB图像和与红外图像对数据集,共包含1 569对图像,其中日间图像820对,夜间图像749对;除背景类别外,目标类别有8种,分别为色锥(Color Cone)、车挡(Car Stop)、行人(Person)、曲线(Curve)、自行车(Bike)、护栏(Guardrail)、车辆(Car)和凸起(Bump). PST900是在具有挑战性的环境中采集的可见光RGB图像和与红外图像对数据集,共包含894对图像;除背景类别外,目标类别有4种,分别为灭火器(Fire-Extinguisher)、背包(Backpack)、手钻(Hand-Drill)和幸存者(Survivor).

实验环境:操作系统为Win10,处理器为Inter(R) Core(TM) i5-8250U,内存为24 GB,显卡为NVIDIA RTX3090,CUDA版本为11.3,Pytorch版本为1.10.0. 实验参数设置:输入图像分辨率为640×320,迭代次数为300,批量大小为4,初始学习率为0.000 5,学习衰减权重为5.0×10−4,优化器为AdamW.

2.2. 评价指标

采用平均交并比mIoU和平均准确率mAcc作为测试结果的客观评价指标:

$ \mathrm{mIoU}=\frac{1}{N}\sum \limits_{m=1}^{N}\frac{{\mathrm{TP}}_{m}}{{\mathrm{TP}}_{m}+{\mathrm{FN}}_{m}+{\mathrm{FP}}_{m}}, $

$ \mathrm{mAcc}=\frac{1}{N}\sum \limits_{m=1}^{N}\frac{{\mathrm{TP}}_{m}}{{\mathrm{TP}}_{m}+{\mathrm{FN}}_{m}}. $

式中:N为识别的类别数,在本实验中N=8;$ {\mathrm{TP}}_{m} $为被正确识别为第m类像素点数量;$ {\mathrm{FN}}_{m} $为未被正确识别出的第m类像素点数量;$ {\mathrm{FP}}_{m} $为不是该类别但被识别为第m类像素点的数量.

2.3. 实验结果与分析

2.3.1. MFNet数据集比较

为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10]、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11]、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19]、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20]、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21]、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22]、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14]和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23]. 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法.

算法性能对比实验结果如表1表2所示,加粗字体表示该算法在该项指标上取得最好的结果.可以看出,EMFFNet在除色锥和凸起类别上,都取得了最好的结果,平均准确率与平均交并比分别为76.1%与59.4%. 相较于其他算法,EMFFNet在车挡类别上的分割结果最好,表明本研究针对浅层特征设计的多尺度注意力融合模块能够有效地增强细节纹理特征,并且利用边缘标签辅助监督网络提高算法对小目标的分割能力. EGFNet使用边缘图辅助算法进行语义分割,因此色锥和行人类别的准确率指标更高,但对多层级特征的信息挖掘不够,导致总体分割能力有限. SFAF-MA使用单一融合策略,限制了整体分割能力. CMX采用Transformer结构,在获取全局上下文信息的能力上优于EMFFNet,因此在色锥和凸起类别上分割结果最好. EMFFNet在护栏类别上的性能非常低,原因是数据集中此类别的数据非常少,算法在训练时未能获得足够的样本来学习特征,导致所有算法对该类别的识别能力不足,影响了该类别分割结果的准确性.

表 1   不同算法在MFNet数据集上的交并比

Tab.1  Intersection over union of different algorithms on MFNet dataset

算法IoU/%mIoU/%
色锥行人车挡曲线自行车护栏车辆凸起
MFNet25.258.99.929.942.90.065.927.739.7
RTFNet29.170.329.845.362.70.087.455.753.2
FuseSeg46.971.722.744.864.66.487.947.954.5
EGFNet48.369.833.842.858.87.087.647.154.8
ABMDRNet47.469.633.145.160.35.187.650.054.8
SFAF-MA45.773.029.545.661.35.588.153.855.5
CSRPNet43.772.328.147.661.48.087.857.156.0
CMX(B2)52.474.830.147.364.78.189.459.458.2
EMFFNet49.275.340.447.765.212.489.755.859.4

新窗口打开| 下载CSV


表 2   不同算法在MFNet数据集上的准确率

Tab.2  Accuracy of different algorithms on MFNet dataset

算法Acc/%mAcc/%
色锥行人车挡曲线自行车护栏车辆凸起
MFNet30.367.012.536.253.90.177.230.045.1
RTFNet45.579.338.560.776.80.093.074.763.1
FuseSeg55.881.429.168.478.563.793.166.470.6
EGFNet65.389.048.771.580.633.695.871.172.7
ABMDRNet61.790.044.164.075.731.094.366.269.5
SFAF-MA57.982.537.563.673.942.294.074.469.6
CSRPNet57.387.838.968.578.958.993.571.272.7
EMFFNet60.987.449.872.981.764.395.973.476.1

新窗口打开| 下载CSV


为了进一步验证EMFFNet的有效性,分别对数据集中的日间与夜间图像进行独立测试,测试集中包含205对日间图像和186对夜间图像,实验结果如表3所示. 可以看出,EMFFNet在2种场景中分割性能都是最好的,夜晚场景尤其明显. SegFormer[9]是单模态语义分割算法,夜间场景的分割结果明显低于日间分割结果. 其他9种跨模态语义分割算法利用红外图像特征辅助语义分割,夜间场景下的分割精度更高,再次证明了跨模态语义分割算法在光照变化场景下具有一定的优越性.

表 3   不同算法分割日夜间图像的性能对比

Tab.3  Segmentation performance of various algorithms on daytime and nighttime images %

算法日间夜间
mAccmIoUmAccmIoU
SegFormer50.643.2
MFNet42.636.141.436.8
RTFNet60.045.860.754.8
FuseSeg62.147.867.354.6
SFAF-MA71.147.068.754.9
EGFNet74.447.368.055.0
CSRPNet72.949.168.255.6
ABMDRNet58.446.768.355.5
CMX70.251.367.457.8
EMFFNet75.656.975.959.7

新窗口打开| 下载CSV


为了探索算法在现实应用中的实时性,比较模型复杂度和实时性,结果如表4所示,使用的评价指标为模型参数数量Np、每秒浮点运算数FLOPs和帧率RF. 可以看出,MFNet结构简单因此Np和FLOPs最低,RF最高,但在分割精度上表现最差. Segformer也拥有较低的模型复杂度,但RF=15.4帧/s,且Segformer为单模态语义分割算法,分割精度较低无法适应光照变化的条件. EGFNet和CMX满足分割的准确度,但计算量较大. 综合模型参数数量和推理速度指标,EMFFNet的整体分割精度最高,且兼顾分割效率.

表 4   模型复杂度和实时性对比结果

Tab.4  Results of model complexity and real-time performance

算法Np↓/106FLOPs↓/109RF↑/(帧/s−1mIoU↑
Segformer(B2)64.195.715.453.2
MFNet0.78.4468.439.7
EGFNet208.8198.652.954.8
CMX139.9134.383.258.2
EMFFNet135.1109.469.659.4

新窗口打开| 下载CSV


2.3.2. PST900数据集比较

为了验证EMFFNet的有效性,在PST900数据集上将该算法与MFNet、RTFNet、PSTNet和CSRPNet方法进行性能比较,实验结果如表5表6所示. 可以看出,EMFFNet在所有类别上都取得了最好的结果,平均准确率与平均交并比分别为89.36%与83.87%. 相较于其他算法,EMFFNet的手钻类别分割效果非常优秀,验证了EMFFNet针对小目标分割的优势. EMFFNet在PST900数据集上的分割效果再一次验证了网络的有效性.

表 5   不同算法在PST900数据集上的交并比

Tab.5  Intersection over union of different algorithms on PST900 dataset

算法IoU/%mIoU/%
背景手钻背包灭火器幸存者
MFNet98.8541.1364.2729.9042.9039.70
RTFNet99.027.0774.1751.9370.1160.46
PSTNet98.8553.6069.2070.1250.0368.36
CSRPNet99.2271.6182.0267.8954.1074.97
EMFFNet 99.4185.2083.7173.6777.3883.87

新窗口打开| 下载CSV


表 6   不同算法在PST900数据集上的准确率

Tab.6  Accuracy of different algorithms on PST900 dataset

算法Acc/%mAcc/%
背景手钻背包灭火器幸存者
MFNet30.3067.0012.5036.2053.9045.10
RTFNet99.787.7979.9662.3978.5165.69
CSRPNet99.8086.1486.7877.7155.1981.12
EMFFNet99.8290.1087.9385.2683.7089.36

新窗口打开| 下载CSV


2.4. 实验结果可视化分析

在MFNet数据集上选取4种主流跨模态语义分割算法与EMFFNet进行图像分割效果的可视化结果对比,对比算法分别为MFNet[10]、SFAF-MA[20]、EGFNet[21]和 CMX[23]. 对比8组图像的分割效果,包含4组日间图像和4组夜间图像,如图7所示,使用矩形标注值得关注的部分. 由图7的第1行图中可以看出,最左侧的车辆由于受到行人的遮挡,分割难度较大,仅EMFFNet和CMX分割准确,EMFFNet成功分割出左侧被遮挡的车辆和最右侧远处的车道线. 第7行图像标签值中右侧2个行人之间存在距离,其他算法的分割结果均出现边缘重叠的情况. EMFFNet将行人的边界清晰地分割出来,再次验证所提算法对目标边缘轮廓的分割能力.

图 7

图 7   不同算法在MFNet数据集上的图像分割效果可视化对比

Fig.7   Visual comparison of segmentation performance acrass algorithms on MFNet dataset


为了直观观察算法分割远处小目标的效果,将图7中含有小目标物体的图像进行单独比较,如图8所示. 可以看出,EMFFNet在白天和夜晚的环境下均准确分割出远处物体. 在第1行图像中EMFFNet正确分割出在自行车中存在的色准. 在第4行图像中,EMFFNet准确分割出远处的色准和小尺寸的停车柱,这表明所提算法能够解决远处小目标分割不准确的问题.

图 8

图 8   不同算法分割远处小目标性能的可视化对比

Fig.8   Visual comparison of distant small target segmentation across different algorithms


2.5. 消融实验

在实验参数设置相同的情况下对EMFFNet进行消融实验,实验在MFNet数据集上进行,实验分为以下4组:1)不添加任何模块,仅采用元素相加的方式融合特征信息;2)所有层级均采用MAFM进行融合,未添加CFWF;3)所有层级均采用CFWF,未添加MAFM;4)同时加入MAFM和CFWF,实验结果如表7所示. 相比基线模型,第2组和第3组算法在加入单一融合模块后,mIoU分别提高了3.0个百分点和3.3个百分点. 第3组的mIoU比第2组提升了0.3个百分点,验证了CFWF的优越性,MAFM针对浅层模块设计,对局部细节处理得较好,但缺乏对多模态信息的深入融合,整体性能较为局限,导致mIoU略低. 在对浅层和深层特征分别加入MAFM和CFWF后,算法的mIoU提高了1.9个百分点,性能达到最佳. 实验结果证明了算法加入各个模块的合理性.

表 7   算法模块消融实验分析

Tab.7  Ablation analysis of algorithm modules

组别基线模型MAFMCFWFmAcc /%mIoU/%
168.954.2
274.957.2
375.357.5
476.159.4

新窗口打开| 下载CSV


3. 结 语

本研究提出结合边缘辅助与多级特征融合的跨模态语义分割算法,显著提高了语义分割性能,能够适应夜间或光照变化环境,有效改善目标边缘分割模糊和远处小目标分割不准确的问题. 所提算法在模型推理速度和实时性上仍有提升空间. 未来,在自动驾驶领域,对面向道路场景的语义分割算法的实时性要求将越来越高. 应探索通过优化网络结构方式加快推理速度,满足实时应用的要求. 未来研究将沿着算法优化、效率提升以及场景拓展等多个维度持续深耕,为高级别自动驾驶、智能交通和机器人导航等关键应用提供坚实的技术支撑.

参考文献

ROMERA E, ÁLVAREZ J M, BERGASA L M, et al

ERFNet: efficient residual factorized ConvNet for real-time semantic segmentation

[J]. IEEE Transactions on Intelligent Transportation Systems, 2018, 19 (1): 263- 272

DOI:10.1109/TITS.2017.2750080      [本文引用: 1]

FAN X, WANG X, GAO J, et al. Bi-level learning of task-specific decoders for joint registration and one-shot medical image segmentation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 11726–11735.

CHEN H, LUO H, WANG C

AfaMamba: adaptive feature aggregation with visual state space model for remote sensing images semantic segmentation

[J]. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 2025, 18: 8965- 8983

DOI:10.1109/JSTARS.2025.3552942     

张振利, 胡新凯, 李凡, 等

基于CNN和Efficient Transformer的多尺度遥感图像语义分割算法

[J]. 浙江大学学报: 工学版, 2025, 59 (4): 778- 786

DOI:10.3785/j.issn.1008-973X.2025.04.013      [本文引用: 1]

ZHANG Zhenli, HU Xinkai, LI Fan, et al

Semantic segmentation algorithm for multiscale remote sensing images based on CNN and Efficient Transformer

[J]. Journal of Zhejiang University: Engineering Science, 2025, 59 (4): 778- 786

DOI:10.3785/j.issn.1008-973X.2025.04.013      [本文引用: 1]

SHELHAMER E, LONG J, DARRELL T

Fully convolutional networks for semantic segmentation

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 39 (4): 640- 651

DOI:10.1109/TPAMI.2016.2572683      [本文引用: 1]

BADRINARAYANAN V, KENDALL A, CIPOLLA R

SegNet: a deep convolutional encoder-decoder architecture for image segmentation

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 39 (12): 2481- 2495

DOI:10.1109/TPAMI.2016.2644615      [本文引用: 1]

RONNEBERGER O, FISCHER P, BROX T. U-Net: convolutional networks for biomedical image segmentation [C]// Medical Image Computing and Computer-Assisted Intervention. [S.l.]: Springer, 2015: 234–241.

[本文引用: 1]

ZHAO H, SHI J, QI X, et al. Pyramid scene parsing network [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Honolulu. IEEE, 2017: 6230–6239.

[本文引用: 1]

XIE E, WANG W, YU Z, et al. SegFormer: simple and efficient design for semantic segmentation with transformers [EB/OL]. (2021–10–28)[2026–04–28]. https://arxiv.org/pdf/2105.15203.

[本文引用: 2]

HA Q, WATANABE K, KARASAWA T, et al. MFNet: towards real-time semantic segmentation for autonomous vehicles with multi-spectral scenes [C]// Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems. Vancouver: IEEE, 2017: 5108–5115.

[本文引用: 4]

SUN Y, ZUO W, LIU M

RTFNet: RGB-thermal fusion network for semantic segmentation of urban scenes

[J]. IEEE Robotics and Automation Letters, 2019, 4 (3): 2576- 2583

DOI:10.1109/LRA.2019.2904733      [本文引用: 3]

SHIVAKUMAR S S, RODRIGUES N, ZHOU A, et al. PST900: RGB-thermal calibration, dataset and segmentation network [C]// Proceedings of the IEEE International Conference on Robotics and Automation. Paris: IEEE, 2020: 9441–9447.

[本文引用: 1]

DENG F, FENG H, LIANG M, et al. FEANet: feature-enhanced attention network for RGB-thermal real-time semantic segmentation [C]// Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems. Prague: IEEE, 2021: 4467–4473.

[本文引用: 1]

ZHANG Q, ZHAO S, LUO Y, et al. ABMDRNet: adaptive-weighted bi-directional modality difference reduction network for RGB-T semantic segmentation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021: 2633–2642.

[本文引用: 2]

YI S, CHEN M, LIU X, et al

HAFFseg: RGB-Thermal semantic segmentation network with hybrid adaptive feature fusion strategy

[J]. Signal Processing: Image Communication, 2023, 117: 117027

DOI:10.1016/j.image.2023.117027      [本文引用: 1]

ZHOU W, DONG S, FANG M, et al

CACFNet: cross-modal attention cascaded fusion network for RGB-T urban scene parsing

[J]. IEEE Transactions on Intelligent Vehicles, 2024, 9 (1): 1919- 1929

DOI:10.1109/TIV.2023.3314527      [本文引用: 1]

HE K, ZHANG X, REN S, et al. Deep residual learning for image recognition [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 770–778.

[本文引用: 1]

BERMAN M, TRIKI A R, BLASCHKO M B. The lovasz-softmax loss: a tractable surrogate for the optimization of the intersection-over-union measure in neural networks [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018: 4413–4421.

[本文引用: 1]

SUN Y, ZUO W, YUN P, et al

FuseSeg: semantic segmentation of urban scenes based on RGB and thermal data fusion

[J]. IEEE Transactions on Automation Science and Engineering, 2021, 18 (3): 1000- 1011

DOI:10.1109/TASE.2020.2993143      [本文引用: 1]

HE X, WANG M, LIU T, et al

SFAF-MA: spatial feature aggregation and fusion with modality adaptation for RGB-thermal semantic segmentation

[J]. IEEE Transactions on Instrumentation and Measurement, 2023, 72: 5012810

DOI:10.1109/tim.2023.3267529      [本文引用: 2]

ZHOU W, DONG S, XU C, et al

Edge-aware guidance fusion network for RGB–thermal scene parsing

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2022, 36 (3): 3571- 3579

DOI:10.1609/aaai.v36i3.20269      [本文引用: 2]

ZHOU Z, WU S, ZHU G, et al. Channel and spatial relation-propagation network for RGB-thermal semantic segmentation [EB/OL]. (2023–08–24)[2026–04–28]. https://arxiv.org/pdf/2308.12534.

[本文引用: 1]

ZHANG J, LIU H, YANG K, et al

CMX: cross-modal fusion for RGB-X semantic segmentation with transformers

[J]. IEEE Transactions on Intelligent Transportation Systems, 2023, 24 (12): 14679- 14694

DOI:10.1109/TITS.2023.3300537      [本文引用: 2]

/