浙江大学学报(工学版), 2026, 60(9): 1934-1941 doi: 10.3785/j.issn.1008-973X.2026.09.010

计算机技术、自动控制技术

用于实时语义分割的数据高效轻量模型

李宏伟,, 丁建阳, 柴志雷,

江南大学 人工智能与计算机学院,江苏 无锡 214122

Data-efficient lightweight model for real-time semantic segmentation

LI Hongwei,, DING Jianyang, CHAI Zhilei,

School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi 214122, China

通讯作者: 柴志雷,男,教授. orcid.org/0000-0003-3822-1653. E-mail:zlchai@jiangnan.edu.cn

收稿日期: 2025-11-29  

基金资助: 国家自然科学基金资助项目(61972180);中央高校基本科研业务费资助项目(JUSRP202501072);无锡市科技发展基金资助项目(K20241027).

Received: 2025-11-29  

Fund supported: 国家自然科学基金资助项目(61972180);中央高校基本科研业务费资助项目(JUSRP202501072);无锡市科技发展基金资助项目(K20241027).

作者简介 About authors

李宏伟(2002—),男,硕士生,从事人工智能研究.orcid.org/0009-0007-1337-0958.E-mail:6233114016@stu.jiangnan.edu.cn , E-mail:6233114016@stu.jiangnan.edu.cn

摘要

针对边缘设备实时语义分割任务对轻量化、高精度与高速度的要求,提出高效的轻量级模型U-SAM. 该模型基于改进的U-Net架构,在编码阶段设计多尺度空洞卷积融合模块,以增强特征表达能力并显著降低计算复杂度. 在解码阶段引入通道注意力与像素注意力机制,实现关键特征信息的有效建模与跨尺度融合. 在瓶颈部分融合自注意力机制与卷积操作,高效捕捉长距离依赖关系并提升模型泛化能力. 在小规模数据集CamVid上的实验表明,U-SAM仅需约1.3×106的参数量,即可达到70.2%的mIoU分割精度,推理速度达到69帧/s. U-SAM的综合性能显著优于多种主流轻量级实时语义分割模型,为自动驾驶、智能监控、遥感卫星等资源受限场景下的实时语义分割应用提供了高性能解决方案.

关键词: 语义分割 ; 实时性 ; 轻量模型 ; 小规模数据集 ; 空洞卷积 ; 注意力机制

Abstract

An efficient lightweight model, U-SAM, was proposed aiming at the requirement for lightweight, high-precision and high-speed performance in real-time semantic segmentation task on edge device. A multi-scale dilated convolution fusion module was designed in the encoder stage based on an improved U-Net architecture in order to enhance feature representation capability and significantly reduce computational complexity. Channel attention and pixel attention mechanism were introduced in the decoder stage in order to achieve effective modeling of key feature information and cross-scale fusion. Self-attention mechanism and convolution operation were integrated in the bottleneck section in order to efficiently capture long-range dependency and improve the generalization capability of the model. Experiments on the small-scale CamVid dataset demonstrated that U-SAM required only about 1.3×106 parameters in order to achieve segmentation accuracy of 70.2% mIoU, with inference speed reaching 69 frame/s. The overall performance of U-SAM is significantly superior to several mainstream lightweight real-time semantic segmentation models, providing a high-performance solution for real-time semantic segmentation application in resource-constrained scenarios such as autonomous driving, intelligent surveillance and remote sensing satellite.

Keywords: semantic segmentation ; real-time performance ; lightweight model ; small-scale dataset ; dilated convolution ; attention mechanism

PDF (3944KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

李宏伟, 丁建阳, 柴志雷. 用于实时语义分割的数据高效轻量模型. 浙江大学学报(工学版)[J], 2026, 60(9): 1934-1941 doi:10.3785/j.issn.1008-973X.2026.09.010

LI Hongwei, DING Jianyang, CHAI Zhilei. Data-efficient lightweight model for real-time semantic segmentation. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1934-1941 doi:10.3785/j.issn.1008-973X.2026.09.010

语义分割作为计算机视觉领域的基础任务之一,旨在为图像中的每一个像素赋予语义标签,被广泛应用于自动驾驶[1]、遥感卫星[2]、智能监控等实际场景. 为了将这一密集预测任务嵌入到资源有限的终端设备中,设计轻量化的实时模型是替代以ResNet[3]为代表的大规模高精度网络的必然选择.

自从Long等[4]将卷积神经网络应用于像素级图像分割以来,早期工作主要通过改进网络模块来提升性能,如DenseASPP采用金字塔结构感知多尺度上下文信息[5],PVTv2借助注意力机制进行全局感知[6]. 尽管分割精度有所提升,但堆叠卷积层或全局计算都带来了庞大的参数量与计算负担. 近年来,为了平衡准确性和推理速度,研究人员开发出了许多轻量级网络. RegSeg[7]通过引入不同膨胀率的空洞卷积来扩大感受野;FBSNet[8]和BSCNet[9]使用多分支或双向融合结构,协同提取深层语义与高分辨率的空间细节. 此外,凭借强大的全局上下文建模能力,Transformer[10]被广泛引入该任务(如ViT[11]). 针对注意力机制的计算复杂度较高及局部边缘细节恢复难的问题,Huang等[12-13]提出宽、高维度分离计算的CCNet以及引入频率滤波器的FreqFusion改进方法.

尽管上述模型在分割任务上表现出色,但通常依赖大量高质量的标注数据. 在实际应用场景中,获取充足的数据往往成本高昂. 小规模数据集因样本有限,容易导致模型在训练时出现过拟合,泛化能力不足. 如何在数据和计算资源双重受限的条件下,解决上下文信息不足、特征利用效率低的问题,是当前分割任务的重要研究方向.

本文提出基于U-Net改进的自注意力与多尺度聚合网络(U-Net with self-attention and multi-scale, U-SAM). 在编码器部分设计多感受野特征融合模块,在扩大视野的同时关注周围细节,获取更丰富的上下文信息. 针对训练数据不足时模型容易过拟合的问题,瓶颈部分借助卷积模块约束自注意力机制,在获取全局信息的同时降低过拟合的风险. 在解码器部分设计双注意力特征融合模块,对上采样的语义信息与跳跃连接至此的空间信息采用不同的注意力机制进行融合,有效地筛选并强化关键特征.

1. 模型结构

为了设计兼顾快速与精准的语义网络,基于编码-解码器结构和自注意力机制,设计轻量级实时语义分割模型,模型结构如图1所示. 编码部分通过多尺度空洞卷积,逐步提取特征并降低特征尺寸. 瓶颈部分通过自注意力机制和卷积模块的融合,获取全局信息并降低过拟合的风险. 解码部分对语义信息、空间信息使用不同的增强方式,提高特征利用率,并逐步恢复到原始尺寸.

图 1

图 1   U-SAM的整体结构

Fig.1   Overall architecture of U-SAM


1.1. 多感受野的特征提取

编码部分如图2所示,Encoder模块对输入特征使用3×3卷积用于跳跃连接,通过级联不同空洞率的空洞卷积,逐步增大感受野. 与FBSNet[8]仅使用经过多级空洞卷积后的特征不同,本文拼接了空洞卷积过程中的多级特征,使模型可以学习不同尺度的语义信息.

图 2

图 2   Encoder的结构

Fig.2   Architecture of Encoder


当特征矩阵尺寸与空洞率的比例降低时,原始特征在填充后的特征中占比会下降,导致模型学习到的有效信息减少,因此级联的空洞卷积数量随着特征图尺寸的降低而减少,如高分辨率使用空洞率为[2,3,5,9]的组合,低分辨率使用[2,3,5]的组合. 伴随网络深度的增大,空洞卷积数量的减少有助于降低模型的参数规模.

1.2. 双注意力特征融合

解码部分如图3所示,Decoder模块的输入分别为下层模块上采样至此的语义信息、同层Encoder模块跳跃连接至此的空间信息. 为了挖掘不同特征信息的内在价值,对语义信息使用通道注意力机制,对空间信息使用像素注意力机制,之后通过拼接与卷积以融合特征信息. 由于通道注意力的卷积核大小仅为1×1,像素注意力的输入、输出通道仅为2、1,因此在常规解码器的基础上使用双注意力机制带来的参数开销可以忽略不计.

图 3

图 3   Decoder的结构

Fig.3   Architecture of Decoder


对于语义信息,通过双线性上采样,将分辨率提升至与空间信息矩阵相匹配. 对于上采样特征图,分别计算每个通道的最大值和平均值,并将2个特征图进行拼接. 拼接后的特征图使用1×1卷积层进行降维,通过Sigmoid激活函数,以生成通道注意力权重. 将这些权重与原始语义信息矩阵相乘,从而增强重要通道的特征表示,计算过程如下:

$ {\boldsymbol{Y}}={\boldsymbol{X}}\times {\mathrm{Sig}}\;({\mathrm{Conv}}\;({\mathrm{Cat}}\;({\mathrm{Avg}}\;({\boldsymbol{X}}),{\mathrm{Max}}\;({\boldsymbol{X}})))). $

空间信息的处理流程与语义信息基本一致,区别在于参与计算的维度. 具体而言,对于空间信息,在每个空间位置上,对所有的通道维度计算最大值与平均值,拼接后进行卷积降维并激活,计算像素注意力权重.

1.3. 自注意力金字塔的特征聚合

考虑到语义分割场景下单个实例在图像中的占比通常较小,瓶颈部分未采用如RegSeg[7]使用超大感受野捕获全局特征信息的策略,而是使用自注意力机制学习长距离依赖. 如图4所示,特征$ {\boldsymbol{x}}\in {{\bf{R}}}^{C \times H \times W} $展开后得到序列向量$ {\boldsymbol{x}}\in {{\bf{R}}}^{(C \times d \times d) \times (H \times W)} $,其中C为原特征图的通道数,d为窗口大小,HW分别为原特征图的高度和宽度. 为了提高计算效率并捕捉不同的信息,在线性映射时,将通道数减半,以降低参数量和计算量,并分割成多个片段以关注不同角度的信息,得到$ {\boldsymbol{Q}}、{\boldsymbol{K}}、{\boldsymbol{V}}\in {{\bf{R}}}^{(H \times W) \times \frac{{{{C \times d \times d}}}}{{{{2h}}}} \times h} $,其中h为分割的片段数量. 根据式(2)计算不同片段的注意力权重后,通过拼接、线性映射和重构,恢复到原来的尺寸.

图 4

图 4   多头自注意力机制

Fig.4   Multi-head self-attention mechanism


$ {\mathrm{At}}{{\mathrm{t}}}_{i}={\mathrm{Softmax}}\left(\frac{{{\boldsymbol{Q}}}_{i}\otimes {{\boldsymbol{K}}}_{i}^{{\mathrm{T}}}}{{{(C \times d \times d)}}/{{(2h)}}}\right)\otimes {{\boldsymbol{V}}}_{i}^{{\mathrm{T}}}. $

传统的语义分割模型在小规模数据集中训练时,通常依赖于缩放、裁剪、翻转等数据增强策略,以解决因样本数量有限带来的问题. Transformer模块的结构复杂,对输入扰动较敏感,该模块强大的全局建模能力依赖大量的训练数据. CNN具有强大的归纳偏置能力,通过参数共享、局部卷积与池化操作进行局部特征提取,对数据规模的依赖性相对较低,即便在样本不足的情况下也能保证较稳定的性能. 在Transformer模块之后引入卷积模块和融合操作,降低过拟合风险并提升模型的泛化能力.

为了更好地融合自注意力模块和卷积模块提取到的特征,如图5所示,设计多尺度融合模块(multi-scale fusion module, MFM). 该模块借鉴了空洞金字塔池化技术,将2个特征矩阵相加,经过不同尺度的平均池化、通道压缩与扩展、反池化,得到不同尺度的注意力. 通过相加的方式融合后激活,以分配每个像素点在2个特征矩阵上的权重.

图 5

图 5   多尺度融合模块

Fig.5   Multi-scale fusion module


2. 实验与结果分析

2.1. 数据集

CamVid数据集用于城市街景语义分割,包含701张分辨率为720×960的图像(共11个类别),划分为367张训练集、101张验证集、233张测试集. 作为典型的小规模数据集,样本有限且类别分布不平衡,反映了实际应用中数据稀缺的挑战.

将ISIC2018数据集用于皮肤病变医学图像的分割,共包含2 594张像素级标注图像. 参考U-Lite[14]的实验设置,将数据集按9∶1的比例划分为训练集与测试集,并将图像裁剪为256×256. 该数据集规模相对有限且存在明显的类别不平衡问题,体现了医学图像分割中样本较少和高类间差异性的难点.

本文以CamVid作为主实验数据集,旨在验证所提方法在有限样本条件下的有效性与鲁棒性. 通过ISIC2018数据集进行辅助评估,以进一步检验模型在不同场景中的适应性与泛化能力.

2.2. 评价指标

对于街景分割任务,从3个方面对模型进行评价:平均交并比mIoU、推理速度v、参数量Np.

平均交并比是语义分割任务中最常用的评估指标之一,用于衡量预测结果与真实标签之间的重叠程度. 对于每一个语义类别,IoU定义为预测区域与真实区域的交集与并集之比,计算公式为

$ {\mathrm{Io}}{{\mathrm{U}}}_{i}=\frac{{\mathrm{T}}{{\mathrm{P}}}_{i}}{{\mathrm{T}}{{\mathrm{P}}}_{i}+{\mathrm{F}}{{\mathrm{P}}}_{i}+{\mathrm{F}}{{\mathrm{N}}}_{i}}. $

式中:TPi、FPi、FNi分别为第i类的真正例、假正例和假负例数量. mIoU为所有类别IoU的算术平均,能够综合反映模型在各个语义类别上的分割性能,在多类别场景下具备良好的区分能力和稳定性.

对于医学图像分割任务,由于该任务仅区分病变区域与正常区域,采用Dice相似系数和交并比来衡量真实掩码与预测掩码之间的相似度,以评估模型性能.

$ {\mathrm{Dice}}=\frac{2{\mathrm{TP}}}{2{\mathrm{TP}}+{\mathrm{FP}}+{\mathrm{FN}}}. $

2.3. 实验设置

实验设置如下:对于CamVid数据集,训练轮次为1 000,批量大小为6;使用AdamW优化器,初始学习率为1.2×10−3;使用warm-up调度器,预热迭代次数为500,使用带有权重的Cross-Entropy损失函数. 对于ISIC2018数据集,训练轮次为200,批量大小为8,使用Adam优化器,初始学习率为5×10−4,使用余弦退火调度器,采用Dice损失函数.

实验采用PyTorch框架构建模型,环境配置为PyTorch-2.3.1、CUDA-12.1、CUDNN-8.9.7,使用单张NVIDIA RTX 4060 Ti进行训练和推理.

2.4. 实验结果

2.4.1. 定量对比

本文方法为完全自主训练,未引入任何预训练模型作为初始权重或主干网络. 对近年来在CamVid、ISIC2018数据集上的一些具有代表性的语义分割方法进行对比,结果见表12.

表 1   不同模型在ISIC2018数据集上的性能对比

Tab.1  Performance comparison of different models on ISIC2018 dataset

模型Np/106Dice/%IoU/%
Unet++[15]9.287.7880.72
Unet[16]31.288.6081.58
Attention UNet[17]31.488.6681.68
ConvUNeXt[18]3.589.8183.19
U-Lite[14]0.990.3983.63
U-SAM(本文方法)0.5190.2483.70
1.3290.7983.90

新窗口打开| 下载CSV


表 2   不同模型在CamVid数据集上的性能对比

Tab.2  Performance comparison of different models on CamVid dataset

类别模型输入尺寸主干网络GPUFLOPs/109Np/106v/(帧·s−1)mIoU/%
大型模型SegNet[19]360×480VGG-16Titan X106.5929.506055.6
DFANet[20]720×960XceptionTitan X7.8012064.7
ICNet[21]720×960PSPNet-50Titan X26.502867.1
MLFNet[22]720×960ResNet-34Titan XP13.035769.0
MGSeg[23]736×960ResNet-18Titan XP13.3012772.7
轻量模型ENet[24]360×480NoTitan X2.120.369651.3
NDNet[25]360×480NoTitan X1.160.507857.2
DABNet[26]360×480No1080 Ti3.490.7613666.4
FDDWNet[27]360×480No2080 Ti4.580.807966.9
LARNet[28]360×480No2080Ti0.9520467.1
BiLevelNet[29]360×480No30900.7068.2
FBSNet[8]360×480No2080 Ti7.970.6212068.9
MSCFNet[30]360×480NoTitan XP1.1511069.3
LETNet[31]360×480No30904.840.9520070.5
U-SAM(本文方法)360×480No4060 Ti4.431.326970.2
720×960No4060 Ti17.791.324470.4

新窗口打开| 下载CSV


鉴于各模型在训练与推理过程中所采用的硬件设备及测试环境存在差异,导致推理速度、内存峰值、能耗等指标存在一定程度的可比性偏差. 为了评估各模型的实际推理性能,统一测试条件,采用相同的硬件平台(NVIDIA RTX 4060 Ti)、相同的输入尺寸(360×480)及测试环境,对近年来部分精度较高的语义分割模型进行测试,结果见表3. 其中,Mp为内存峰值,Ec为能耗.

表 3   相同环境下的性能对比

Tab.3  Performance comparison under same environment

模型v/(帧·s−1)Mp/106Ec/(W·h)
FDDWNet[27]412414.01
FBSNet[8]224115.25
LETNet[31]284384.32
U-SAM(本文方法)693423.84

新窗口打开| 下载CSV


综合表1~3的数据可知,本文方法在推理精度、速度和参数量之间得到较好的平衡. 在精度方面,U-SAM在CamVid数据集上取得了70.2%的mIoU,在轻量级模型中仅次于LETNet. 在ISIC2018数据集上以1.32×106的参数量取得了90.79%的Dice系数,高于所有的对比模型. 由于ISIC2018的分割任务仅为二分类任务,且病灶面积占比较小(平均占比为20.4%),本文采用轻量化设计策略,通过精简编-解码层数量,U-SAM以0.51×106的参数量取得90.24%的Dice系数. 在参数量方面,根据LETNet的划分标准,U-SAM的参数量虽然高于部分模型,但依旧处于轻量级模型的界定范围内. 在推理速度方面,与近年来精度较高的轻量模型相比,U-SAM具有较大的优势(在RTX 4060 Ti上,运行速度约为精度最高的LETNet的2.5倍),符合图像分割任务的实时性要求. 与其他模型相比,U-SAM的内存占用和能耗较低,适合部署到边缘设备.

为了验证U-SAM在数据极度稀缺场景下的鲁棒性,测试不同数据量训练的模型性能. 结果表明,当仅用1/4训练数据时U-SAM取得65.2%的mIoU,当仅用1/3训练数据时U-SAM取得67.1%的mIoU,证明了U-SAM在训练资源受限的实际应用中的可行性. 使用1/2数据训练,模型取得69.4%的mIoU,较完整数据集训练的70.2%仅略微下降,验证了设计的鲁棒性和高效的数据利用能力.

2.4.2. 定性对比

图6所示为U-SAM与其他方法在CamVid测试集上的分割结果对比. 结果显示,U-SAM在道路、天空、建筑等大目标上的语义分割准确度较高. 如图6的第1行所示,其他模型大多将“客车”的上半部分识别成了“建筑”,U-SAM得益于全局信息和局部信息的融合,是唯一较完整地识别出“客车”的模型. 在获取语义信息的同时,U-SAM没有降低对位置信息的关注度,因此对较突出目标的识别更加精准(如第5、6行,对应图7第1、2行的“路灯”).

图 6

图 6   不同网络在CamVid数据集上的可视化结果

Fig.6   Visualization result of different network on CamVid dataset


图 7

图 7   可视化结果的局部放大

Fig.7   Partial enlargement of visualization result


U-SAM在处理特定场景时存在一定的局限性. 如图6的第4行(对应图7的第3行)中,大目标“建筑”内部的小目标“树木”未能被识别,多个样例中出现“路牌”识别错误的情况. 造成这一现象的核心原因在于U-SAM为追求轻量化与实时推理做出权衡,编码器的连续降采样不可避免地稀释了小目标的像素特征;自注意力机制在计算过程中更易聚焦于占主导地位的大目标,导致内部嵌套的小目标信息丢失. 该设计体现了模型复杂度与感知精度的折中:通过适度降低小目标的分割性能,实现宏观场景的高效解析与实时推理.

综上所述,本文所提出的方法在面对大小相近、遮挡较少的目标时,能够实现较高精度的语义分割;而对于尺寸差异较大、存在嵌套关系或部分遮挡的复杂场景,模型仍有进一步提升的空间,特别是在小目标的感知与分离方面.

为了验证U-SAM在医学图像分割中的有效性,图8展示了U-SAM在ISIC2018数据集上的特征可视化过程. 整体而言,模型预测的病灶区域与真实标签高度吻合,仅存在极微小的边界偏差.

图 8

图 8   ISIC2018的特征可视化结果

Fig.8   Feature visualization result of ISIC2018


从各网络层的特征响应来看,在编码阶段,高分辨率层借助大空洞率组合有效扩大了感受野,精准捕捉到病变的边缘与纹理(病灶区域呈显著的高激活态);低分辨率层利用小空洞率组合提取高级语义,抑制背景噪声. 在瓶颈层,特征图直观反映了自注意力(负责全局上下文传播)与卷积网络(专注局部细节刻画)的协同作用,两者经MFM模块实现了高效的特征融合. 在解码阶段,双注意力机制针对性地强化了跳跃连接引入的空间细节与上采样传递的语义特征,逐步恢复出细节丰富、边界准确的病变区域,重建得到与真实标签高度吻合的分割掩码.

2.5. 消融研究

为了分析U-SAM各组件对模型整体性能的具体影响,基于CamVid数据集开展消融实验,评估各模块的实际贡献,相关结果见表4. 其中,Np为参数量.

表 4   各模块在CamVid数据集上的消融研究

Tab.4  Ablation study of each module on CamVid dataset

模块结构Np/106v/(帧·s−1)mIoU/%
编码Dilation=[2,3,5,9]1.386769.3
Dilation=[2,3,5]1.327068.8
解码No CA+PA1.2911064.6
瓶颈No Transformer+CNN1.137765.9
Only Transformer1.267166.6
Only CNN1.197366.3
U-SAM[2,3,5,9]+[2,3,5]、
CA+PA、Transformer+CNN
1.326970.2

新窗口打开| 下载CSV


编码器:对比了[2,3,5,9]、[2,3,5]及混合组合. 单一组合虽然在参数量与精度上各有侧重(前者1.38×106/69.3%,后者1.32×106/68.8%),但混合组合的优势更显著:在高分辨率层保留[2,3,5,9]以获取大感受野,低分辨率层采用[2,3,5]以缓解网格效应并缩减参数. 该混合方案以70.2%的mIoU实现了精度、速度与参数量的最优权衡.

解码器:对比常规U-Net解码器(移除CA+PA部分),模型的推理速度虽然达到110帧/s且参数量降至1.29 ×106,但mIoU衰减至64.6%. 这表明CA+PA能够有效引导跨通道与空间维度的特征交互,滤除冗余信息,以极小的算力开销换取了深、浅层特征的高效互补.

瓶颈层:基础编解码结构mIoU仅为65.9%. 单独引入Transformer(66.6%)或CNN(66.3%)因缺乏局部细粒度刻画或全局上下文感知而提升受限. 提出的Transformer+CNN融合架构以极低的参数开销(0.19×106的参数量),将mIoU提升至70.2%,证明了全局依赖与局部特征联合建模的强协同效应.

综上所述,分层空洞卷积组合、双注意力机制与混合瓶颈层三者的结合,实现了U-SAM在实时语义分割任务中的高精度与高效性.

2.6. U-SAM图像分割在喷墨印刷中的应用

在喷墨打印的RGB到CMYK色彩转换中,灰成分替换(gray component replacement, GCR)常以黑墨替代彩墨中的灰成分,以节约墨量并降低堆墨率. 传统静态的GCR策略通常无视图像内容进行全局统一处理,在色彩鲜艳或边缘突变区域极易引入暗斑与噪点,难以兼顾视觉质量与墨水损耗.

利用U-SAM的语义特征提取能力,提出区域级自适应的GCR方案. 对平坦背景区域(如天空)执行GCR转换,对不适宜替换的高频复杂区域保留原始转换模式. 图9中,$\Delta E $为色差,Pi为归一化的经验满覆盖耗墨量. 图9(b)中,左侧柱表示原图的归一化墨量. 右侧柱表示分区转换后的归一化墨量. 如图9所示,该分区转换方案在维持整体视觉质量与原图高度一致的前提下,总墨量降低约4%. 具体而言,彩色油墨消耗得到显著抑制(青色、品红色、黄色油墨用量分别降至原转换方式的94%、93%和94%),黑墨用量升至112%. 上述结果证明了U-SAM在实际印刷场景中的落地可行性,为兼顾高质量与低耗材的色彩转换提供了有效的数据驱动方案.

图 9

图 9   U-SAM图像分割在喷墨印刷中的应用

Fig.9   Application of U-SAM image segmentation in inkjet printing


3. 结 语

提出轻量、高效的实时语义分割网络U-SAM,通过引入多感受野融合、受约束的自注意力机制及差异化解码策略,在参数量、分割精度与推理速度之间取得了较好的平衡,有效提升了模型在小规模数据集场景下的泛化能力与细节恢复水平. 实验表明,U-SAM在训练数据较少、资源受限的边缘设备或对实时性要求高的场景中,具备良好的部署潜力与实际应用价值.

参考文献

何淼楹, 崔宇超

面向自动驾驶的交通场景语义分割

[J]. 计算机应用, 2021, 41 (Suppl.1): 25- 30

DOI:10.11772/j.issn.1001-9081.2020071114      [本文引用: 1]

HE Miaoying, CUI Yuchao

Semantic segmentation of traffic scenes for autonomous driving

[J]. Journal of Computer Applications, 2021, 41 (Suppl.1): 25- 30

DOI:10.11772/j.issn.1001-9081.2020071114      [本文引用: 1]

熊彬, 张双德

基于改进PSPNet的卫星遥感图像建筑物语义分割算法

[J]. 遥感信息, 2023, 38 (4): 73- 79

[本文引用: 1]

XIONG Bin, ZHANG Shuangde

Semantic segmentation algorithm for buildings in satellite remote sensing images based on improved PSPNet

[J]. Remote Sensing Information, 2023, 38 (4): 73- 79

[本文引用: 1]

HE K, ZHANG X, REN S, et al. Deep residual learning for image recognition [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016: 770–778.

[本文引用: 1]

LONG J, SHELHAMER E, DARRELL T. Fully convolutional networks for semantic segmentation [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. New York: IEEE, 2015: 3431–3440.

[本文引用: 1]

YANG M, YU K, ZHANG C, et al. DenseASPP for semantic segmentation in street scenes [C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018: 3684–3692.

[本文引用: 1]

WANG W, XIE E, LI X, et al

PVT v2: improved baselines with Pyramid Vision Transformer

[J]. Computational Visual Media, 2022, 8 (3): 415- 424

DOI:10.1007/s41095-022-0274-8      [本文引用: 1]

GAO R. Rethinking dilated convolution for real-time semantic segmentation [EB/OL]. (2021-11-18) [2025-03-28]. https://arxiv.org/abs/2111.09957.

[本文引用: 2]

GAO G, XU G, LI J, et al

FBSNet: a fast bilateral symmetrical network for real-time semantic segmentation

[J]. IEEE Transactions on Multimedia, 2022, 25: 3273- 3283

DOI:10.1109/tmm.2022.3157995      [本文引用: 4]

ZHOU Q, WANG L, GAO G, et al

Boundary-guided lightweight semantic segmentation with multi-scale semantic context

[J]. IEEE Transactions on Multimedia, 2024, 26: 7887- 7900

DOI:10.1109/TMM.2024.3372835      [本文引用: 1]

VASWANI A, SHAZEER N, PARMAR N, et al

Attention is all you need

[J]. Advances in Neural Information Processing Systems, 2017, 30: 6000- 6010

DOI:10.1007/978-3-031-84300-6_13      [本文引用: 1]

DOSOVITSKIY A, BEYER L, KOLESNIKOV A, et al. An image is worth 16x16 words: transformers for image recognition at scale [EB/OL]. (2020-10-22) [2025-03-23]. https://arxiv.org/abs/2010.11929.

[本文引用: 1]

HUANG Z, WANG X, HUANG L, et al. CCNet: criss-cross attention for semantic segmentation [C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Seoul: IEEE, 2020: 603–612.

[本文引用: 1]

CHEN L, FU Y, GU L, et al

Frequency-aware feature fusion for dense image prediction

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46 (12): 10763- 10780

DOI:10.1109/TPAMI.2024.3449959      [本文引用: 1]

DINH B D, NGUYEN T T, TRAN T T, et al. 1M parameters are enough? A lightweight CNN-based model for medical image segmentation [C]//Proceedings of the Asia Pacific Signal and Information Processing Association Annual Summit and Conference. Taipei: IEEE, 2023: 1279–1284.

[本文引用: 2]

ZHOU Z, RAHMAN SIDDIQUEE M M, TAJBAKHSH N, et al. UNet++: a nested U-Net architecture for medical image segmentation [C]//Deep Learning in Medical Image Analysis and Multimodal Learning for Clinical Decision Support. Cham: Springer, 2018: 3–11.

[本文引用: 1]

RONNEBERGER O, FISCHER P, BROX T. U-Net: convolutional networks for biomedical image segmentation [C]//Medical Image Computing and Computer-Assisted Intervention. Cham: Springer, 2015: 234–241.

[本文引用: 1]

OKTAY O, SCHLEMPER J, LE FOLGOC L, et al. Attention U-Net: learning where to look for the pancreas [EB/OL]. (2018-04-11) [2025-03-25]. https://arxiv.org/abs/1804.03999.

[本文引用: 1]

HAN Z, JIAN M, WANG G G

ConvUNeXt: an efficient convolution neural network for medical image segmentation

[J]. Knowledge-Based Systems, 2022, 253: 109512

DOI:10.1016/j.knosys.2022.109512      [本文引用: 1]

BADRINARAYANAN V, KENDALL A, CIPOLLA R

SegNet: a deep convolutional encoder-decoder architecture for image segmentation

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 39 (12): 2481- 2495

DOI:10.1109/TPAMI.2016.2644615      [本文引用: 1]

LI H, XIONG P, FAN H, et al. Dfanet: deep feature aggregation for real-time semantic segmentation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New York: IEEE, 2019: 9522–9531.

[本文引用: 1]

ZHAO H, QI X, SHEN X, et al. Icnet for real-time semantic segmentation on high-resolution images [C]// Proceedings of the European Conference on Computer Vision. Cham: Springer, 2018: 405–420.

[本文引用: 1]

FAN J, WANG F, CHU H, et al

MLFNet: multi-level fusion network for real-time semantic segmentation of autonomous driving

[J]. IEEE Transactions on Intelligent Vehicles, 2022, 8 (1): 756- 767

DOI:10.1109/wcnc61545.2025.10978834      [本文引用: 1]

HE J, LIANG S, WU X, et al

MGSeg: multiple granularity-based real-time semantic segmentation network

[J]. IEEE Transactions on Image Processing, 2021, 30: 7200- 7214

DOI:10.1109/TIP.2021.3102509      [本文引用: 1]

PASZKE A, CHAURASIA A, KIM S, et al. ENet: a deep neural network architecture for real-time semantic segmentation [EB/OL]. (2016-06-07) [2025-03-06]. https://arxiv.org/abs/1606.02147.

[本文引用: 1]

LI S, YAN Q, ZHOU X, et al

NDNet: spacewise multiscale representation learning via neighbor decoupling for real-time driving scene parsing

[J]. IEEE Transactions on Neural Networks and Learning Systems, 2024, 35 (6): 7884- 7898

DOI:10.1109/TNNLS.2022.3221745      [本文引用: 1]

LI G, YUN I, KIM J, et al. DABNet: depth-wise asymmetric bottleneck for real-time semantic segmentation [EB/OL]. (2019-07-25) [2025-02-15]. https://arxiv.org/abs/1907.11357.

[本文引用: 1]

LIU J, ZHOU Q, QIANG Y, et al. FDDWNet: a lightweight convolutional neural network for real-time semantic segmentation [C]//2020 IEEE International Conference on Acoustics, Speech and Signal Processing. Barcelona: IEEE, 2020: 2373–2377.

[本文引用: 2]

HU X, XU S, JING L

Lightweight attention-guided redundancy-reuse network for real-time semantic segmentation

[J]. IET Image Processing, 2023, 17 (9): 2649- 2658

DOI:10.1049/ipr2.12816      [本文引用: 1]

吴马靖, 张永爱, 林珊玲, 等

基于BiLevelNet的实时语义分割算法

[J]. 光电工程, 2024, 51 (5): 240030

DOI:10.12086/oee.2024.240030      [本文引用: 1]

WU Majing, ZHANG Yongai, LIN Shanling, et al

Real-time semantic segmentation algorithm based on BiLevelNet

[J]. Opto-Electronic Engineering, 2024, 51 (5): 240030

DOI:10.12086/oee.2024.240030      [本文引用: 1]

ZHANG T, ZHUANG Y, WANG G, et al

Multiscale semantic fusion-guided fractal convolutional object detection network for optical remote sensing imagery

[J]. IEEE Transactions on Geoscience and Remote Sensing, 2022, 60: 5608720

DOI:10.1109/tgrs.2021.3108476      [本文引用: 1]

XU G, LI J, GAO G, et al

Lightweight real-time semantic segmentation network with efficient transformer and CNN

[J]. IEEE Transactions on Intelligent Transportation Systems, 2023, 24 (12): 15897- 15906

DOI:10.1109/TITS.2023.3248089      [本文引用: 2]

/