[1]
ROMERA E, ÁLVAREZ J M, BERGASA L M, et al ERFNet: efficient residual factorized ConvNet for real-time semantic segmentation
[J]. IEEE Transactions on Intelligent Transportation Systems , 2018 , 19 (1 ): 263 - 272
DOI:10.1109/TITS.2017.2750080
[本文引用: 1]
[2]
FAN X, WANG X, GAO J, et al. Bi-level learning of task-specific decoders for joint registration and one-shot medical image segmentation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Seattle: IEEE, 2024: 11726–11735.
[3]
CHEN H, LUO H, WANG C AfaMamba: adaptive feature aggregation with visual state space model for remote sensing images semantic segmentation
[J]. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing , 2025 , 18 : 8965 - 8983
DOI:10.1109/JSTARS.2025.3552942
[4]
张振利, 胡新凯, 李凡, 等 基于CNN和Efficient Transformer的多尺度遥感图像语义分割算法
[J]. 浙江大学学报: 工学版 , 2025 , 59 (4 ): 778 - 786
DOI:10.3785/j.issn.1008-973X.2025.04.013
[本文引用: 1]
ZHANG Zhenli, HU Xinkai, LI Fan, et al Semantic segmentation algorithm for multiscale remote sensing images based on CNN and Efficient Transformer
[J]. Journal of Zhejiang University: Engineering Science , 2025 , 59 (4 ): 778 - 786
DOI:10.3785/j.issn.1008-973X.2025.04.013
[本文引用: 1]
[5]
SHELHAMER E, LONG J, DARRELL T Fully convolutional networks for semantic segmentation
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2017 , 39 (4 ): 640 - 651
DOI:10.1109/TPAMI.2016.2572683
[本文引用: 1]
[6]
BADRINARAYANAN V, KENDALL A, CIPOLLA R SegNet: a deep convolutional encoder-decoder architecture for image segmentation
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2017 , 39 (12 ): 2481 - 2495
DOI:10.1109/TPAMI.2016.2644615
[本文引用: 1]
[7]
RONNEBERGER O, FISCHER P, BROX T. U-Net: convolutional networks for biomedical image segmentation [C]// Medical Image Computing and Computer-Assisted Intervention . [S.l.]: Springer, 2015: 234–241.
[本文引用: 1]
[8]
ZHAO H, SHI J, QI X, et al. Pyramid scene parsing network [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition . Honolulu. IEEE, 2017: 6230–6239.
[本文引用: 1]
[9]
XIE E, WANG W, YU Z, et al. SegFormer: simple and efficient design for semantic segmentation with transformers [EB/OL]. (2021–10–28)[2026–04–28]. https://arxiv.org/pdf/2105.15203.
[本文引用: 2]
[10]
HA Q, WATANABE K, KARASAWA T, et al. MFNet: towards real-time semantic segmentation for autonomous vehicles with multi-spectral scenes [C]// Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems . Vancouver: IEEE, 2017: 5108–5115.
[本文引用: 4]
[11]
SUN Y, ZUO W, LIU M RTFNet: RGB-thermal fusion network for semantic segmentation of urban scenes
[J]. IEEE Robotics and Automation Letters , 2019 , 4 (3 ): 2576 - 2583
DOI:10.1109/LRA.2019.2904733
[本文引用: 3]
[12]
SHIVAKUMAR S S, RODRIGUES N, ZHOU A, et al. PST900: RGB-thermal calibration, dataset and segmentation network [C]// Proceedings of the IEEE International Conference on Robotics and Automation . Paris: IEEE, 2020: 9441–9447.
[本文引用: 1]
[13]
DENG F, FENG H, LIANG M, et al. FEANet: feature-enhanced attention network for RGB-thermal real-time semantic segmentation [C]// Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems . Prague: IEEE, 2021: 4467–4473.
[本文引用: 1]
[14]
ZHANG Q, ZHAO S, LUO Y, et al. ABMDRNet: adaptive-weighted bi-directional modality difference reduction network for RGB-T semantic segmentation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Nashville: IEEE, 2021: 2633–2642.
[本文引用: 2]
[15]
YI S, CHEN M, LIU X, et al HAFFseg: RGB-Thermal semantic segmentation network with hybrid adaptive feature fusion strategy
[J]. Signal Processing: Image Communication , 2023 , 117 : 117027
DOI:10.1016/j.image.2023.117027
[本文引用: 1]
[16]
ZHOU W, DONG S, FANG M, et al CACFNet: cross-modal attention cascaded fusion network for RGB-T urban scene parsing
[J]. IEEE Transactions on Intelligent Vehicles , 2024 , 9 (1 ): 1919 - 1929
DOI:10.1109/TIV.2023.3314527
[本文引用: 1]
[17]
HE K, ZHANG X, REN S, et al. Deep residual learning for image recognition [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition . Las Vegas: IEEE, 2016: 770–778.
[本文引用: 1]
[18]
BERMAN M, TRIKI A R, BLASCHKO M B. The lovasz-softmax loss: a tractable surrogate for the optimization of the intersection-over-union measure in neural networks [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Salt Lake City: IEEE, 2018: 4413–4421.
[本文引用: 1]
[19]
SUN Y, ZUO W, YUN P, et al FuseSeg: semantic segmentation of urban scenes based on RGB and thermal data fusion
[J]. IEEE Transactions on Automation Science and Engineering , 2021 , 18 (3 ): 1000 - 1011
DOI:10.1109/TASE.2020.2993143
[本文引用: 1]
[20]
HE X, WANG M, LIU T, et al SFAF-MA: spatial feature aggregation and fusion with modality adaptation for RGB-thermal semantic segmentation
[J]. IEEE Transactions on Instrumentation and Measurement , 2023 , 72 : 5012810
DOI:10.1109/tim.2023.3267529
[本文引用: 2]
[21]
ZHOU W, DONG S, XU C, et al Edge-aware guidance fusion network for RGB–thermal scene parsing
[J]. Proceedings of the AAAI Conference on Artificial Intelligence , 2022 , 36 (3 ): 3571 - 3579
DOI:10.1609/aaai.v36i3.20269
[本文引用: 2]
[22]
ZHOU Z, WU S, ZHU G, et al. Channel and spatial relation-propagation network for RGB-thermal semantic segmentation [EB/OL]. (2023–08–24)[2026–04–28]. https://arxiv.org/pdf/2308.12534.
[本文引用: 1]
[23]
ZHANG J, LIU H, YANG K, et al CMX: cross-modal fusion for RGB-X semantic segmentation with transformers
[J]. IEEE Transactions on Intelligent Transportation Systems , 2023 , 24 (12 ): 14679 - 14694
DOI:10.1109/TITS.2023.3300537
[本文引用: 2]
ERFNet: efficient residual factorized ConvNet for real-time semantic segmentation
1
2018
... 图像语义分割通过对图像中每个像素点进行精准的语义类别标注,深度解析目标的尺寸比例、几何形态与空间位置信息,将复杂视觉场景解构为具有明确语义属性的实体单元,实现从像素级到语义级的精细化图像理解与分析. 语义分割技术在自动驾驶与智能交通、医疗影像分析、地理信息系统与遥感等[1 -4 ] 领域的应用价值显著. ...
AfaMamba: adaptive feature aggregation with visual state space model for remote sensing images semantic segmentation
0
2025
基于CNN和Efficient Transformer的多尺度遥感图像语义分割算法
1
2025
... 图像语义分割通过对图像中每个像素点进行精准的语义类别标注,深度解析目标的尺寸比例、几何形态与空间位置信息,将复杂视觉场景解构为具有明确语义属性的实体单元,实现从像素级到语义级的精细化图像理解与分析. 语义分割技术在自动驾驶与智能交通、医疗影像分析、地理信息系统与遥感等[1 -4 ] 领域的应用价值显著. ...
基于CNN和Efficient Transformer的多尺度遥感图像语义分割算法
1
2025
... 图像语义分割通过对图像中每个像素点进行精准的语义类别标注,深度解析目标的尺寸比例、几何形态与空间位置信息,将复杂视觉场景解构为具有明确语义属性的实体单元,实现从像素级到语义级的精细化图像理解与分析. 语义分割技术在自动驾驶与智能交通、医疗影像分析、地理信息系统与遥感等[1 -4 ] 领域的应用价值显著. ...
Fully convolutional networks for semantic segmentation
1
2017
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
SegNet: a deep convolutional encoder-decoder architecture for image segmentation
1
2017
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
1
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
1
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
2
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
... 为了进一步验证EMFFNet的有效性,分别对数据集中的日间与夜间图像进行独立测试,测试集中包含205对日间图像和186对夜间图像,实验结果如表3 所示. 可以看出,EMFFNet在2种场景中分割性能都是最好的,夜晚场景尤其明显. SegFormer[9 ] 是单模态语义分割算法,夜间场景的分割结果明显低于日间分割结果. 其他9种跨模态语义分割算法利用红外图像特征辅助语义分割,夜间场景下的分割精度更高,再次证明了跨模态语义分割算法在光照变化场景下具有一定的优越性. ...
4
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
... 实验使用公开数据集MFNet[10 ] 和PST900[11 ] . MFNet是利用InfReCR500摄像机针对城市街景采集的可见光RGB图像和与红外图像对数据集,共包含1 569对图像,其中日间图像820对,夜间图像749对;除背景类别外,目标类别有8种,分别为色锥(Color Cone)、车挡(Car Stop)、行人(Person)、曲线(Curve)、自行车(Bike)、护栏(Guardrail)、车辆(Car)和凸起(Bump). PST900是在具有挑战性的环境中采集的可见光RGB图像和与红外图像对数据集,共包含894对图像;除背景类别外,目标类别有4种,分别为灭火器(Fire-Extinguisher)、背包(Backpack)、手钻(Hand-Drill)和幸存者(Survivor). ...
... 为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10 ] 、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11 ] 、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19 ] 、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20 ] 、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21 ] 、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22 ] 、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14 ] 和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23 ] . 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法. ...
... 在MFNet数据集上选取4种主流跨模态语义分割算法与EMFFNet进行图像分割效果的可视化结果对比,对比算法分别为MFNet[10 ] 、SFAF-MA[20 ] 、EGFNet[21 ] 和 CMX[23 ] . 对比8组图像的分割效果,包含4组日间图像和4组夜间图像,如图7 所示,使用矩形标注值得关注的部分. 由图7 的第1行图中可以看出,最左侧的车辆由于受到行人的遮挡,分割难度较大,仅EMFFNet和CMX分割准确,EMFFNet成功分割出左侧被遮挡的车辆和最右侧远处的车道线. 第7行图像标签值中右侧2个行人之间存在距离,其他算法的分割结果均出现边缘重叠的情况. EMFFNet将行人的边界清晰地分割出来,再次验证所提算法对目标边缘轮廓的分割能力. ...
RTFNet: RGB-thermal fusion network for semantic segmentation of urban scenes
3
2019
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
... 实验使用公开数据集MFNet[10 ] 和PST900[11 ] . MFNet是利用InfReCR500摄像机针对城市街景采集的可见光RGB图像和与红外图像对数据集,共包含1 569对图像,其中日间图像820对,夜间图像749对;除背景类别外,目标类别有8种,分别为色锥(Color Cone)、车挡(Car Stop)、行人(Person)、曲线(Curve)、自行车(Bike)、护栏(Guardrail)、车辆(Car)和凸起(Bump). PST900是在具有挑战性的环境中采集的可见光RGB图像和与红外图像对数据集,共包含894对图像;除背景类别外,目标类别有4种,分别为灭火器(Fire-Extinguisher)、背包(Backpack)、手钻(Hand-Drill)和幸存者(Survivor). ...
... 为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10 ] 、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11 ] 、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19 ] 、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20 ] 、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21 ] 、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22 ] 、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14 ] 和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23 ] . 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法. ...
1
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
1
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
2
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
... 为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10 ] 、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11 ] 、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19 ] 、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20 ] 、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21 ] 、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22 ] 、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14 ] 和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23 ] . 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法. ...
HAFFseg: RGB-Thermal semantic segmentation network with hybrid adaptive feature fusion strategy
1
2023
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
CACFNet: cross-modal attention cascaded fusion network for RGB-T urban scene parsing
1
2024
... 传统的单模态语义分割算法主要通过人工设计特征来描述图像中不同区域的视觉特性,提取的特征被输入分类器中进行像素分类. 这类算法过度依赖人工设计特征,特征表达能力有限,对于复杂场景的分割效果往往不理想. 随着深度学习技术和大量数据集可用性的发展,基于深度学习的语义分割网络取得重大进展,网络结构分为全卷积网络结构[5 ] 、编码器-解码器结构[6 -7 ] 和金字塔结构[8 ] . Xie等[9 ] 提出的SegFormer利用自注意力机制对序列间的关系进行建模,增强获取全局上下文信息的能力. 单模态语义分割网络在复杂环境下和光照变化条件下,仍然存在分割效果差和分割不稳定的问题. 为了增强复杂光照及恶劣天气条件下的分割鲁棒性,研究者通过补充红外模态数据来扩展可见光图像的信息维度,提出跨模态语义分割算法. 红外图像通过感知物体热辐射差异进行成像,具备光照免疫特性,能够在可见光失效的环境(如黑夜、浓雾)中稳定获取目标轮廓信息,结合可见光图像对纹理细节与色彩特征的高敏感度,可形成优势互补的信息组合. Ha等[10 ] 提出跨模态语义分割网络MFNet,利用2个独立的网络提取可见光特征和红外特征,并在解码器中融合跨模态特征;Sun等[11 ] 针对城市场景提出编码器融合方式的跨模态语义分割网络算法RTFNet;Shivakumar等[12 ] 设计出双路卷积神经网络结构来融合红外图像与可见光RGB图像,提出语义分割算法PSTNet;Deng等[13 ] 提出的FEANet利用注意力机制挖掘跨模态图像间的互补信息;Zhang等[14 ] 提出的ABMDRNet通过通道加权融合模块融合跨模态图像;Yi等[15 ] 提出以轻量级模型MobileNetv2为主干网络的语义分割方法HAFFseg,显著提升了算法的推理速度;Zhou等[16 ] 提出通过在解码器中添加区域模块的跨模态语义分割网络CACFNet. 上述融合方法都是通过设计特定模块无差别地处理不同层次的特征和层级间跨模态交互,忽略了不同层次、层级间的特征差异,导致网络在复杂光照条件下存在边界模糊、远处小目标分割准确性较差的问题. ...
1
... 如图1 所示,EMFFNet采用编-解码架构,由2个编码器分支、2个MAFM、3个CFWF和1个解码器构成,解码器包含5个通道特征增强模块(channel feature enhancement module, CFEM)和4个解码模块(decoder block, DB). 编码器采用在ImageNet上预训练的ResNet152[17 ] 作为主干网络来提取特征. ResNet152后三层结构相比前两层结构,下采样操作和残差块更多,能够有效地扩大感受野,提高语义特征的表示,因此将后三层提取的特征作为深层特征,前两层提取的特征作为浅层特征. 2个编码器支路分别对红外图像和可见光图像进行不同层次的特征提取:特征图统一表示成$ \boldsymbol{F}_{j}^{i} $ ,$ j\in \left\{1,2,3,4,5\right\} $ 为尺度索引,$ i\in \left\{\text{r},\text{t}\right\} $ 为图像模态索引;将提取的特征分为2个层次,当$ j=1、2 $ 时,$ \boldsymbol{F}_{j}^{i} $ 为浅层特征,当$ j=3、4、5 $ 时,$ \boldsymbol{F}_{j}^{i} $ 为深层特征. 针对这2个层次特征设计MAFM和CFWF. 这2个模块协同作用,形成从底层细节到高层语义的渐进式特征融合体系,有效提升编码器的特征表达能力. 融合后的特征图通过解码器中的CFWF进一步增强语义信息,利用DB进行上采样重建图像,得到语义分割结果. 在网络训练阶段,引入边界辅助监督策略,在解码器中分别计算输出与真实边界标签和真实二分类标签对的损失,辅助训练优化网络参数,提高网络的边缘分割准确性. ...
1
... 式中:$ {\lambda }_{1} $ ,$ {\lambda }_{2} $ 和$ {\lambda }_{3} $ 为平衡因子. 设置${\lambda }_{1} $ =0.4、${\lambda }_{2} $ =0.3和${\lambda }_{3} $ =0.3,此时实验结果的客观评价指标取得最优. 使用交叉熵损失函数计算二元边界损失和边界损失,使用Lovász-softmax损失函数[18 ] 计算语义损失,Lovász-softmax损失函数能够直接优化网络中的平均交并比指标,在保持端到端训练的同时提升分割的鲁棒性. ...
FuseSeg: semantic segmentation of urban scenes based on RGB and thermal data fusion
1
2021
... 为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10 ] 、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11 ] 、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19 ] 、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20 ] 、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21 ] 、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22 ] 、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14 ] 和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23 ] . 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法. ...
SFAF-MA: spatial feature aggregation and fusion with modality adaptation for RGB-thermal semantic segmentation
2
2023
... 为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10 ] 、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11 ] 、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19 ] 、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20 ] 、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21 ] 、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22 ] 、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14 ] 和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23 ] . 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法. ...
... 在MFNet数据集上选取4种主流跨模态语义分割算法与EMFFNet进行图像分割效果的可视化结果对比,对比算法分别为MFNet[10 ] 、SFAF-MA[20 ] 、EGFNet[21 ] 和 CMX[23 ] . 对比8组图像的分割效果,包含4组日间图像和4组夜间图像,如图7 所示,使用矩形标注值得关注的部分. 由图7 的第1行图中可以看出,最左侧的车辆由于受到行人的遮挡,分割难度较大,仅EMFFNet和CMX分割准确,EMFFNet成功分割出左侧被遮挡的车辆和最右侧远处的车道线. 第7行图像标签值中右侧2个行人之间存在距离,其他算法的分割结果均出现边缘重叠的情况. EMFFNet将行人的边界清晰地分割出来,再次验证所提算法对目标边缘轮廓的分割能力. ...
Edge-aware guidance fusion network for RGB–thermal scene parsing
2
2022
... 为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10 ] 、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11 ] 、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19 ] 、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20 ] 、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21 ] 、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22 ] 、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14 ] 和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23 ] . 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法. ...
... 在MFNet数据集上选取4种主流跨模态语义分割算法与EMFFNet进行图像分割效果的可视化结果对比,对比算法分别为MFNet[10 ] 、SFAF-MA[20 ] 、EGFNet[21 ] 和 CMX[23 ] . 对比8组图像的分割效果,包含4组日间图像和4组夜间图像,如图7 所示,使用矩形标注值得关注的部分. 由图7 的第1行图中可以看出,最左侧的车辆由于受到行人的遮挡,分割难度较大,仅EMFFNet和CMX分割准确,EMFFNet成功分割出左侧被遮挡的车辆和最右侧远处的车道线. 第7行图像标签值中右侧2个行人之间存在距离,其他算法的分割结果均出现边缘重叠的情况. EMFFNet将行人的边界清晰地分割出来,再次验证所提算法对目标边缘轮廓的分割能力. ...
1
... 为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10 ] 、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11 ] 、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19 ] 、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20 ] 、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21 ] 、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22 ] 、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14 ] 和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23 ] . 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法. ...
CMX: cross-modal fusion for RGB-X semantic segmentation with transformers
2
2023
... 为了验证EMFFNet的有效性,将所提算法与9种主流算法在MFNet数据集上进行实验对比,测试集包含205对日间图像和186对夜间图像. 对比算法包括面向多光谱自动驾驶场景的实时语义分割网络算法MFNet[10 ] 、面向城市场景语义分割的RGB-T融合网络算法RTFNet[11 ] 、面向自动驾驶场景的RGB-T融合网络算法FuseSeg[19 ] 、基于RGB-T语义分割的模态自适应空间特征融合网络算法SFAF-MA[20 ] 、针对多光谱场景的边缘感知引导语义分割网络算法EGFNet[21 ] 、基于RGB-T语义分割的通道和空间关系传播网络算法CSRPNet[22 ] 、面向RGB-T语义分割的自适应加权双向模态差分减少算法ABMDRNet[14 ] 和基于Transformer的RGB-X语义分割跨模态融合网络算法CMX(B2) [23 ] . 其中MFNet、RTFNet和FuseSeg为典型跨模态语义分割算法,SFAF-MA、EGFNet、CSRPNet、ABMDRNet和CMX(B2)为较新的跨模态语义分割算法. ...
... 在MFNet数据集上选取4种主流跨模态语义分割算法与EMFFNet进行图像分割效果的可视化结果对比,对比算法分别为MFNet[10 ] 、SFAF-MA[20 ] 、EGFNet[21 ] 和 CMX[23 ] . 对比8组图像的分割效果,包含4组日间图像和4组夜间图像,如图7 所示,使用矩形标注值得关注的部分. 由图7 的第1行图中可以看出,最左侧的车辆由于受到行人的遮挡,分割难度较大,仅EMFFNet和CMX分割准确,EMFFNet成功分割出左侧被遮挡的车辆和最右侧远处的车道线. 第7行图像标签值中右侧2个行人之间存在距离,其他算法的分割结果均出现边缘重叠的情况. EMFFNet将行人的边界清晰地分割出来,再次验证所提算法对目标边缘轮廓的分割能力. ...