[2]
熊彬, 张双德 基于改进PSPNet的卫星遥感图像建筑物语义分割算法
[J]. 遥感信息 , 2023 , 38 (4 ): 73 - 79
[本文引用: 1]
XIONG Bin, ZHANG Shuangde Semantic segmentation algorithm for buildings in satellite remote sensing images based on improved PSPNet
[J]. Remote Sensing Information , 2023 , 38 (4 ): 73 - 79
[本文引用: 1]
[3]
HE K, ZHANG X, REN S, et al. Deep residual learning for image recognition [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition . Las Vegas: IEEE, 2016: 770–778.
[本文引用: 1]
[4]
LONG J, SHELHAMER E, DARRELL T. Fully convolutional networks for semantic segmentation [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition . New York: IEEE, 2015: 3431–3440.
[本文引用: 1]
[5]
YANG M, YU K, ZHANG C, et al. DenseASPP for semantic segmentation in street scenes [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . Salt Lake City: IEEE, 2018: 3684–3692.
[本文引用: 1]
[6]
WANG W, XIE E, LI X, et al PVT v2: improved baselines with Pyramid Vision Transformer
[J]. Computational Visual Media , 2022 , 8 (3 ): 415 - 424
DOI:10.1007/s41095-022-0274-8
[本文引用: 1]
[7]
GAO R. Rethinking dilated convolution for real-time semantic segmentation [EB/OL]. (2021-11-18) [2025-03-28]. https://arxiv.org/abs/2111.09957.
[本文引用: 2]
[8]
GAO G, XU G, LI J, et al FBSNet: a fast bilateral symmetrical network for real-time semantic segmentation
[J]. IEEE Transactions on Multimedia , 2022 , 25 : 3273 - 3283
DOI:10.1109/tmm.2022.3157995
[本文引用: 4]
[9]
ZHOU Q, WANG L, GAO G, et al Boundary-guided lightweight semantic segmentation with multi-scale semantic context
[J]. IEEE Transactions on Multimedia , 2024 , 26 : 7887 - 7900
DOI:10.1109/TMM.2024.3372835
[本文引用: 1]
[10]
VASWANI A, SHAZEER N, PARMAR N, et al Attention is all you need
[J]. Advances in Neural Information Processing Systems , 2017 , 30 : 6000 - 6010
DOI:10.1007/978-3-031-84300-6_13
[本文引用: 1]
[11]
DOSOVITSKIY A, BEYER L, KOLESNIKOV A, et al. An image is worth 16x16 words: transformers for image recognition at scale [EB/OL]. (2020-10-22) [2025-03-23]. https://arxiv.org/abs/2010.11929.
[本文引用: 1]
[12]
HUANG Z, WANG X, HUANG L, et al. CCNet: criss-cross attention for semantic segmentation [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision . Seoul: IEEE, 2020: 603–612.
[本文引用: 1]
[13]
CHEN L, FU Y, GU L, et al Frequency-aware feature fusion for dense image prediction
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2024 , 46 (12 ): 10763 - 10780
DOI:10.1109/TPAMI.2024.3449959
[本文引用: 1]
[14]
DINH B D, NGUYEN T T, TRAN T T, et al. 1M parameters are enough? A lightweight CNN-based model for medical image segmentation [C]//Proceedings of the Asia Pacific Signal and Information Processing Association Annual Summit and Conference . Taipei: IEEE, 2023: 1279–1284.
[本文引用: 2]
[15]
ZHOU Z, RAHMAN SIDDIQUEE M M, TAJBAKHSH N, et al. UNet++: a nested U-Net architecture for medical image segmentation [C]//Deep Learning in Medical Image Analysis and Multimodal Learning for Clinical Decision Support . Cham: Springer, 2018: 3–11.
[本文引用: 1]
[16]
RONNEBERGER O, FISCHER P, BROX T. U-Net: convolutional networks for biomedical image segmentation [C]//Medical Image Computing and Computer-Assisted Intervention . Cham: Springer, 2015: 234–241.
[本文引用: 1]
[17]
OKTAY O, SCHLEMPER J, LE FOLGOC L, et al. Attention U-Net: learning where to look for the pancreas [EB/OL]. (2018-04-11) [2025-03-25]. https://arxiv.org/abs/1804.03999.
[本文引用: 1]
[18]
HAN Z, JIAN M, WANG G G ConvUNeXt: an efficient convolution neural network for medical image segmentation
[J]. Knowledge-Based Systems , 2022 , 253 : 109512
DOI:10.1016/j.knosys.2022.109512
[本文引用: 1]
[19]
BADRINARAYANAN V, KENDALL A, CIPOLLA R SegNet: a deep convolutional encoder-decoder architecture for image segmentation
[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence , 2017 , 39 (12 ): 2481 - 2495
DOI:10.1109/TPAMI.2016.2644615
[本文引用: 1]
[20]
LI H, XIONG P, FAN H, et al. Dfanet: deep feature aggregation for real-time semantic segmentation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . New York: IEEE, 2019: 9522–9531.
[本文引用: 1]
[21]
ZHAO H, QI X, SHEN X, et al. Icnet for real-time semantic segmentation on high-resolution images [C]// Proceedings of the European Conference on Computer Vision . Cham: Springer, 2018: 405–420.
[本文引用: 1]
[22]
FAN J, WANG F, CHU H, et al MLFNet: multi-level fusion network for real-time semantic segmentation of autonomous driving
[J]. IEEE Transactions on Intelligent Vehicles , 2022 , 8 (1 ): 756 - 767
DOI:10.1109/wcnc61545.2025.10978834
[本文引用: 1]
[23]
HE J, LIANG S, WU X, et al MGSeg: multiple granularity-based real-time semantic segmentation network
[J]. IEEE Transactions on Image Processing , 2021 , 30 : 7200 - 7214
DOI:10.1109/TIP.2021.3102509
[本文引用: 1]
[24]
PASZKE A, CHAURASIA A, KIM S, et al. ENet: a deep neural network architecture for real-time semantic segmentation [EB/OL]. (2016-06-07) [2025-03-06]. https://arxiv.org/abs/1606.02147.
[本文引用: 1]
[25]
LI S, YAN Q, ZHOU X, et al NDNet: spacewise multiscale representation learning via neighbor decoupling for real-time driving scene parsing
[J]. IEEE Transactions on Neural Networks and Learning Systems , 2024 , 35 (6 ): 7884 - 7898
DOI:10.1109/TNNLS.2022.3221745
[本文引用: 1]
[26]
LI G, YUN I, KIM J, et al. DABNet: depth-wise asymmetric bottleneck for real-time semantic segmentation [EB/OL]. (2019-07-25) [2025-02-15]. https://arxiv.org/abs/1907.11357.
[本文引用: 1]
[27]
LIU J, ZHOU Q, QIANG Y, et al. FDDWNet: a lightweight convolutional neural network for real-time semantic segmentation [C]//2020 IEEE International Conference on Acoustics, Speech and Signal Processing . Barcelona: IEEE, 2020: 2373–2377.
[本文引用: 2]
[28]
HU X, XU S, JING L Lightweight attention-guided redundancy-reuse network for real-time semantic segmentation
[J]. IET Image Processing , 2023 , 17 (9 ): 2649 - 2658
DOI:10.1049/ipr2.12816
[本文引用: 1]
[29]
吴马靖, 张永爱, 林珊玲, 等 基于BiLevelNet的实时语义分割算法
[J]. 光电工程 , 2024 , 51 (5 ): 240030
DOI:10.12086/oee.2024.240030
[本文引用: 1]
WU Majing, ZHANG Yongai, LIN Shanling, et al Real-time semantic segmentation algorithm based on BiLevelNet
[J]. Opto-Electronic Engineering , 2024 , 51 (5 ): 240030
DOI:10.12086/oee.2024.240030
[本文引用: 1]
[30]
ZHANG T, ZHUANG Y, WANG G, et al Multiscale semantic fusion-guided fractal convolutional object detection network for optical remote sensing imagery
[J]. IEEE Transactions on Geoscience and Remote Sensing , 2022 , 60 : 5608720
DOI:10.1109/tgrs.2021.3108476
[本文引用: 1]
[31]
XU G, LI J, GAO G, et al Lightweight real-time semantic segmentation network with efficient transformer and CNN
[J]. IEEE Transactions on Intelligent Transportation Systems , 2023 , 24 (12 ): 15897 - 15906
DOI:10.1109/TITS.2023.3248089
[本文引用: 2]
面向自动驾驶的交通场景语义分割
1
2021
... 语义分割作为计算机视觉领域的基础任务之一,旨在为图像中的每一个像素赋予语义标签,被广泛应用于自动驾驶[1 ] 、遥感卫星[2 ] 、智能监控等实际场景. 为了将这一密集预测任务嵌入到资源有限的终端设备中,设计轻量化的实时模型是替代以ResNet[3 ] 为代表的大规模高精度网络的必然选择. ...
面向自动驾驶的交通场景语义分割
1
2021
... 语义分割作为计算机视觉领域的基础任务之一,旨在为图像中的每一个像素赋予语义标签,被广泛应用于自动驾驶[1 ] 、遥感卫星[2 ] 、智能监控等实际场景. 为了将这一密集预测任务嵌入到资源有限的终端设备中,设计轻量化的实时模型是替代以ResNet[3 ] 为代表的大规模高精度网络的必然选择. ...
基于改进PSPNet的卫星遥感图像建筑物语义分割算法
1
2023
... 语义分割作为计算机视觉领域的基础任务之一,旨在为图像中的每一个像素赋予语义标签,被广泛应用于自动驾驶[1 ] 、遥感卫星[2 ] 、智能监控等实际场景. 为了将这一密集预测任务嵌入到资源有限的终端设备中,设计轻量化的实时模型是替代以ResNet[3 ] 为代表的大规模高精度网络的必然选择. ...
基于改进PSPNet的卫星遥感图像建筑物语义分割算法
1
2023
... 语义分割作为计算机视觉领域的基础任务之一,旨在为图像中的每一个像素赋予语义标签,被广泛应用于自动驾驶[1 ] 、遥感卫星[2 ] 、智能监控等实际场景. 为了将这一密集预测任务嵌入到资源有限的终端设备中,设计轻量化的实时模型是替代以ResNet[3 ] 为代表的大规模高精度网络的必然选择. ...
1
... 语义分割作为计算机视觉领域的基础任务之一,旨在为图像中的每一个像素赋予语义标签,被广泛应用于自动驾驶[1 ] 、遥感卫星[2 ] 、智能监控等实际场景. 为了将这一密集预测任务嵌入到资源有限的终端设备中,设计轻量化的实时模型是替代以ResNet[3 ] 为代表的大规模高精度网络的必然选择. ...
1
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
1
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
PVT v2: improved baselines with Pyramid Vision Transformer
1
2022
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
2
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
... 考虑到语义分割场景下单个实例在图像中的占比通常较小,瓶颈部分未采用如RegSeg[7 ] 使用超大感受野捕获全局特征信息的策略,而是使用自注意力机制学习长距离依赖. 如图4 所示,特征$ {\boldsymbol{x}}\in {{\bf{R}}}^{C \times H \times W} $ 展开后得到序列向量$ {\boldsymbol{x}}\in {{\bf{R}}}^{(C \times d \times d) \times (H \times W)} $ ,其中C 为原特征图的通道数,d 为窗口大小,H 、W 分别为原特征图的高度和宽度. 为了提高计算效率并捕捉不同的信息,在线性映射时,将通道数减半,以降低参数量和计算量,并分割成多个片段以关注不同角度的信息,得到$ {\boldsymbol{Q}}、{\boldsymbol{K}}、{\boldsymbol{V}}\in {{\bf{R}}}^{(H \times W) \times \frac{{{{C \times d \times d}}}}{{{{2h}}}} \times h} $ ,其中h 为分割的片段数量. 根据式(2)计算不同片段的注意力权重后,通过拼接、线性映射和重构,恢复到原来的尺寸. ...
FBSNet: a fast bilateral symmetrical network for real-time semantic segmentation
4
2022
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
... 编码部分如图2 所示,Encoder模块对输入特征使用3×3卷积用于跳跃连接,通过级联不同空洞率的空洞卷积,逐步增大感受野. 与FBSNet[8 ] 仅使用经过多级空洞卷积后的特征不同,本文拼接了空洞卷积过程中的多级特征,使模型可以学习不同尺度的语义信息. ...
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
... Performance comparison under same environment
Tab.3 模型 v /(帧·s−1 )M p /106 E c /(W·h)FDDWNet[27 ] 41 241 4.01 FBSNet[8 ] 22 411 5.25 LETNet[31 ] 28 438 4.32 U-SAM(本文方法) 69 342 3.84
综合表1 ~3 的数据可知,本文方法在推理精度、速度和参数量之间得到较好的平衡. 在精度方面,U-SAM在CamVid数据集上取得了70.2%的mIoU,在轻量级模型中仅次于LETNet. 在ISIC2018数据集上以1.32×106 的参数量取得了90.79%的Dice系数,高于所有的对比模型. 由于ISIC2018的分割任务仅为二分类任务,且病灶面积占比较小(平均占比为20.4%),本文采用轻量化设计策略,通过精简编-解码层数量,U-SAM以0.51×106 的参数量取得90.24%的Dice系数. 在参数量方面,根据LETNet的划分标准,U-SAM的参数量虽然高于部分模型,但依旧处于轻量级模型的界定范围内. 在推理速度方面,与近年来精度较高的轻量模型相比,U-SAM具有较大的优势(在RTX 4060 Ti上,运行速度约为精度最高的LETNet的2.5倍),符合图像分割任务的实时性要求. 与其他模型相比,U-SAM的内存占用和能耗较低,适合部署到边缘设备. ...
Boundary-guided lightweight semantic segmentation with multi-scale semantic context
1
2024
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
Attention is all you need
1
2017
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
1
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
1
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
Frequency-aware feature fusion for dense image prediction
1
2024
... 自从Long等[4 ] 将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5 ] ,PVTv2借助注意力机制进行全局感知[6 ] . 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7 ] 通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8 ] 和BSCNet[9 ] 使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10 ] 被广泛引入该任务(如ViT[11 ] ). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12 -13 ] 提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法. ...
2
... 将ISIC2018数据集用于皮肤病变医学图像的分割,共包含2 594张像素级标注图像. 参考U-Lite[14 ] 的实验设置,将数据集按9∶1的比例划分为训练集与测试集,并将图像裁剪为256×256. 该数据集规模相对有限且存在明显的类别不平衡问题,体现了医学图像分割中样本较少和高类间差异性的难点. ...
... Performance comparison of different models on ISIC2018 dataset
Tab.1 模型 N p /106 Dice/% IoU/% Unet++[15 ] 9.2 87.78 80.72 Unet[16 ] 31.2 88.60 81.58 Attention UNet[17 ] 31.4 88.66 81.68 ConvUNeXt[18 ] 3.5 89.81 83.19 U-Lite[14 ] 0.9 90.39 83.63 U-SAM(本文方法) 0.51 90.24 83.70 1.32 90.79 83.90
表 2 不同模型在CamVid数据集上的性能对比 ...
1
... Performance comparison of different models on ISIC2018 dataset
Tab.1 模型 N p /106 Dice/% IoU/% Unet++[15 ] 9.2 87.78 80.72 Unet[16 ] 31.2 88.60 81.58 Attention UNet[17 ] 31.4 88.66 81.68 ConvUNeXt[18 ] 3.5 89.81 83.19 U-Lite[14 ] 0.9 90.39 83.63 U-SAM(本文方法) 0.51 90.24 83.70 1.32 90.79 83.90
表 2 不同模型在CamVid数据集上的性能对比 ...
1
... Performance comparison of different models on ISIC2018 dataset
Tab.1 模型 N p /106 Dice/% IoU/% Unet++[15 ] 9.2 87.78 80.72 Unet[16 ] 31.2 88.60 81.58 Attention UNet[17 ] 31.4 88.66 81.68 ConvUNeXt[18 ] 3.5 89.81 83.19 U-Lite[14 ] 0.9 90.39 83.63 U-SAM(本文方法) 0.51 90.24 83.70 1.32 90.79 83.90
表 2 不同模型在CamVid数据集上的性能对比 ...
1
... Performance comparison of different models on ISIC2018 dataset
Tab.1 模型 N p /106 Dice/% IoU/% Unet++[15 ] 9.2 87.78 80.72 Unet[16 ] 31.2 88.60 81.58 Attention UNet[17 ] 31.4 88.66 81.68 ConvUNeXt[18 ] 3.5 89.81 83.19 U-Lite[14 ] 0.9 90.39 83.63 U-SAM(本文方法) 0.51 90.24 83.70 1.32 90.79 83.90
表 2 不同模型在CamVid数据集上的性能对比 ...
ConvUNeXt: an efficient convolution neural network for medical image segmentation
1
2022
... Performance comparison of different models on ISIC2018 dataset
Tab.1 模型 N p /106 Dice/% IoU/% Unet++[15 ] 9.2 87.78 80.72 Unet[16 ] 31.2 88.60 81.58 Attention UNet[17 ] 31.4 88.66 81.68 ConvUNeXt[18 ] 3.5 89.81 83.19 U-Lite[14 ] 0.9 90.39 83.63 U-SAM(本文方法) 0.51 90.24 83.70 1.32 90.79 83.90
表 2 不同模型在CamVid数据集上的性能对比 ...
SegNet: a deep convolutional encoder-decoder architecture for image segmentation
1
2017
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
1
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
1
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
MLFNet: multi-level fusion network for real-time semantic segmentation of autonomous driving
1
2022
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
MGSeg: multiple granularity-based real-time semantic segmentation network
1
2021
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
1
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
NDNet: spacewise multiscale representation learning via neighbor decoupling for real-time driving scene parsing
1
2024
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
1
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
2
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
... Performance comparison under same environment
Tab.3 模型 v /(帧·s−1 )M p /106 E c /(W·h)FDDWNet[27 ] 41 241 4.01 FBSNet[8 ] 22 411 5.25 LETNet[31 ] 28 438 4.32 U-SAM(本文方法) 69 342 3.84
综合表1 ~3 的数据可知,本文方法在推理精度、速度和参数量之间得到较好的平衡. 在精度方面,U-SAM在CamVid数据集上取得了70.2%的mIoU,在轻量级模型中仅次于LETNet. 在ISIC2018数据集上以1.32×106 的参数量取得了90.79%的Dice系数,高于所有的对比模型. 由于ISIC2018的分割任务仅为二分类任务,且病灶面积占比较小(平均占比为20.4%),本文采用轻量化设计策略,通过精简编-解码层数量,U-SAM以0.51×106 的参数量取得90.24%的Dice系数. 在参数量方面,根据LETNet的划分标准,U-SAM的参数量虽然高于部分模型,但依旧处于轻量级模型的界定范围内. 在推理速度方面,与近年来精度较高的轻量模型相比,U-SAM具有较大的优势(在RTX 4060 Ti上,运行速度约为精度最高的LETNet的2.5倍),符合图像分割任务的实时性要求. 与其他模型相比,U-SAM的内存占用和能耗较低,适合部署到边缘设备. ...
Lightweight attention-guided redundancy-reuse network for real-time semantic segmentation
1
2023
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
基于BiLevelNet的实时语义分割算法
1
2024
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
基于BiLevelNet的实时语义分割算法
1
2024
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
Multiscale semantic fusion-guided fractal convolutional object detection network for optical remote sensing imagery
1
2022
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
Lightweight real-time semantic segmentation network with efficient transformer and CNN
2
2023
... Performance comparison of different models on CamVid dataset
Tab.2 类别 模型 输入尺寸 主干网络 GPU FLOPs/109 N p /106 v /(帧·s−1 )mIoU/% 大型模型 SegNet[19 ] 360×480 VGG-16 Titan X 106.59 29.50 60 55.6 DFANet[20 ] 720×960 Xception Titan X — 7.80 120 64.7 ICNet[21 ] 720×960 PSPNet-50 Titan X — 26.50 28 67.1 MLFNet[22 ] 720×960 ResNet-34 Titan XP — 13.03 57 69.0 MGSeg[23 ] 736×960 ResNet-18 Titan XP — 13.30 127 72.7 轻量模型 ENet[24 ] 360×480 No Titan X 2.12 0.36 96 51.3 NDNet[25 ] 360×480 No Titan X 1.16 0.50 78 57.2 DABNet[26 ] 360×480 No 1080 Ti 3.49 0.76 136 66.4 FDDWNet[27 ] 360×480 No 2080 Ti 4.58 0.80 79 66.9 LARNet[28 ] 360×480 No 2080Ti — 0.95 204 67.1 BiLevelNet[29 ] 360×480 No 3090 — 0.70 — 68.2 FBSNet[8 ] 360×480 No 2080 Ti 7.97 0.62 120 68.9 MSCFNet[30 ] 360×480 No Titan XP — 1.15 110 69.3 LETNet[31 ] 360×480 No 3090 4.84 0.95 200 70.5 U-SAM(本文方法) 360×480 No 4060 Ti 4.43 1.32 69 70.2 720×960 No 4060 Ti 17.79 1.32 44 70.4
鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3 . 其中,M p 为内存峰值,E c 为能耗. ...
... Performance comparison under same environment
Tab.3 模型 v /(帧·s−1 )M p /106 E c /(W·h)FDDWNet[27 ] 41 241 4.01 FBSNet[8 ] 22 411 5.25 LETNet[31 ] 28 438 4.32 U-SAM(本文方法) 69 342 3.84
综合表1 ~3 的数据可知,本文方法在推理精度、速度和参数量之间得到较好的平衡. 在精度方面,U-SAM在CamVid数据集上取得了70.2%的mIoU,在轻量级模型中仅次于LETNet. 在ISIC2018数据集上以1.32×106 的参数量取得了90.79%的Dice系数,高于所有的对比模型. 由于ISIC2018的分割任务仅为二分类任务,且病灶面积占比较小(平均占比为20.4%),本文采用轻量化设计策略,通过精简编-解码层数量,U-SAM以0.51×106 的参数量取得90.24%的Dice系数. 在参数量方面,根据LETNet的划分标准,U-SAM的参数量虽然高于部分模型,但依旧处于轻量级模型的界定范围内. 在推理速度方面,与近年来精度较高的轻量模型相比,U-SAM具有较大的优势(在RTX 4060 Ti上,运行速度约为精度最高的LETNet的2.5倍),符合图像分割任务的实时性要求. 与其他模型相比,U-SAM的内存占用和能耗较低,适合部署到边缘设备. ...