基于特征门控融合与小波增强的双编码器息肉分割
Dual-encoder polyp segmentation with feature-gated fusion and wavelet enhancement
收稿日期: 2025-06-26
| 基金资助: |
|
Received: 2025-06-26
| Fund supported: | 国家自然科学基金资助项目(51365017,61463018);江西省自然科学基金资助项目(20192BAB205084);江西省教育厅科学技术研究重点项目(GJJ170491,GJJ2200848). |
作者简介 About authors
梁礼明(1967—),男,教授,硕士,从事机器学习和医学影像研究.orcid.org/0009-0004-5278-5249.E-mail:
针对结直肠息肉分割任务中病灶区域定位不准、边界细节缺失及小目标息肉易漏检等问题,提出基于特征门控融合与小波增强的双编码器息肉分割网络. 构建PVTv2与Hiera双编码器,提升全局语义感知能力及增强边缘表征能力. 设计特征门控融合模块,对双编码器提取的多层级特征进行自适应筛选和融合,提高网络对息肉区域的区分能力. 建立小波增强特征注入模块,利用小波变换分解高低频信息,强化边缘纹理表达并有效抑制噪声干扰,提升息肉区域的细粒度特征学习能力. 引入多尺度预测模块,结合全局平均池化与自适应加权融合策略,实现精细化分割,提高对形态多变病灶的适应性. 结果表明,所提网络能够为结直肠息肉的计算机辅助诊断提供有力支持.
关键词:
To address the problems of inaccurate lesion localization, missing boundary details, and small polyp omission in colorectal polyp segmentation, a dual-encoder network with feature-gated fusion and wavelet-enhanced modules was proposed. A dual-encoder architecture based on PVTv2 and Hiera was adopted to enhance global semantic awareness and edge representation. A feature-gated fusion module was designed to filter and combine the multi-level features extracted by two encoders adaptively, thereby better distinguishing polyp regions. A wavelet-enhanced injection module was introduced to decompose high-frequency and low-frequency information using wavelet transform, thus strengthening the edge texture expression and reduced noise, supporting fine-grained feature learning. A multi-scale prediction module was introduced by combining global average pooling and adaptive weighted fusion to achieve refined segmentation and improve adaptability to polyps with diverse shapes. Results show that the proposed network provides effective support for computer-aided diagnosis of colorectal polyps.
Keywords:
本文引用格式
梁礼明, 康婷, 陈康泉, 钟奕.
LIANG Liming, KANG Ting, CHEN Kangquan, ZHONG Yi.
结直肠癌是最常见的恶性疾病之一,其发病率和死亡率始终居高不下[1]. 研究表明,肠道细胞过度增殖会导致结直肠病变,而结直肠息肉正是这一病变的典型特征. 结直肠息肉可分为增生性和腺性,其中增生性息肉为良性,而腺性息肉则可能随着时间推移逐步恶化[2]. 早期腺性息肉可通过简单手术切除,患者生存率可高达95%,但一旦进入晚期,该比率将大幅下降. 因此,定期进行结直肠镜检查,早期发现并精准诊断结直肠腺性息肉,是有效预防肠道病变的重要手段[3]. 结直肠息肉图像呈现复杂多变的病理特征,息肉形态多样、大小不一、边缘模糊且病变区域与正常组织高度相似. 即便经验丰富的临床医生,由于主观因素影响,可能在相同图像分割结果上存在差异,进而导致漏检或误检[4-5]. 因此,临床上亟需自动化息肉识别与分割算法,以提高医生诊断效率.
鉴于传统方法存在的局限,卷积神经网络(convolutional neural network,CNN)作为深度学习核心技术,在医学图像分割领域取得显著进展[14]. 如全卷积网络[15]将深度网络引入语义分割,实现端到端像素级预测,相较传统方法显著提升分割精度. Ronneberger等[16]提出U-Net,通过U型结构与跳跃连接机制增强对边界和细节的恢复能力,成为医学图像分割领域典型框架. Lin等[17]进一步提出特征金字塔网络,提升模型对多尺度语义结构表征能力. 这些经典网络推动基于编码器–解码器结构的息肉分割方法不断演进,如Guo等[18]引入深度可分离卷积以提升分割效率;Jain等[19]基于反卷积构建改进型CNN以强化边界还原.
受限于感受野和网络结构,卷积神经网络在远距离依赖关系建模上存在不足,难以全面捕捉复杂病变全局语义信息. 为此,研究者借鉴自然语言处理领域Transformer结构优势,将其引入医学图像分割任务[20]. Transformer能够构建全局上下文关联,有效捕获长距离依赖特征,从而提升病变区域识别能力. Yin等[21]提出混合型Transformer架构RSAFormer,以增强局部与全局特征间协同建模能力. Wang等[22]设计金字塔结构视觉Transformer网络,实现更丰富的图像语义建模和多尺度特征提取. 尽管如此,这些基于Transformer的方法在局部信息处理方面仍面临挑战:缺乏类似卷积的空间归纳偏置,导致对边缘细节刻画能力不足,造成边界信息丢失[23];单一Transformer编码器在特征聚合策略、网络深度以及上下文建模能力方面存在一定限制,难以兼顾全局语义完整性与多尺度细节表达.
针对上述问题,提出特征门控融合与小波增强双编码器息肉分割网络,采用PVTv2(pyramid vision Transformer v2)[24]与Hiera(hierarchical Transformer)[25]双Transformer编码器架构,以弥补单一Transformer模型局限性. PVTv2通过金字塔特征提取结构,有效增强远距离特征交互能力,确保全局信息建模的完整性;而Hiera编码器则采用层次化注意力机制,加强多尺度特征聚合,提升息肉边界的细节刻画能力. 此外,设计多模块解码器以进一步优化分割过程,旨在通过融合不同尺度与不同类型的特征信息,增强对息肉区域的识别能力并提升分割精度.
本研究主要工作如下:1)结合PVTv2和Hiera,提升全局信息建模能力与局部细节刻画能力,实现更精准的息肉分割;2)构建特征门控融合模块,通过通道注意力筛选关键特征,优化全局与局部信息交互,提高息肉区域判别能力;3)设计小波增强特征注入模块,利用小波变换增强高低频特征表达,优化边缘细节建模,减少噪声干扰,提高分割精度;4)引入多尺度预测模块,提升不同尺度病灶检测能力;5)在多个公开数据集上进行实验评估,充分验证网络在不同数据分布下的准确性和广泛适用性.
1. 网络整体架构
1.1. 编码器设计
Hiera Backbone和PVTv2双分支Transformer编码器结构如图1所示. Hiera Backbone依托其层次化结构与多尺度特征提取机制,精细刻画息肉区域的局部细节信息,弥补PVTv2在细节刻画方面的不足,同时PVTv2强大的全局建模能力增强Hiera Backbone对长程依赖关系的理解,从而构建更精准、层次化的息肉特征表示.
图 1
图 1 基于特征门控融合与小波增强的双Transformer编码器息肉分割网络框架
Fig.1 Dual-Transformer encoder polyp segmentation framework based on feature-gated fusion and wavelet enhancement
1.1.1. PVTv2分支
为了增强模型对远程语义依赖的建模能力,在保持全局上下文理解能力的同时降低计算成本,引入PVTv2作为双编码器之一.
与原始Vision Transformer不同,PVTv2针对医学图像分割任务中的高分辨率输入场景做了3方面优化:1)采用卷积形式Patch Embedding模块,在保持图像拓扑结构连续性的同时,实现稳定的分块降维,有助于适配医学图像中常见的高分辨率输入特征;2)通过多阶段金字塔特征提取结构实现自上而下语义提炼与尺度压缩,使得网络能够在不同感受野下逐层建立丰富的全局表征;3)引入线性空间降维注意力(linear spatial-reduction attention,Linear SRA)模块,通过对key和value进行空间降维,显著降低注意力计算复杂度,使其在高分辨率图像中仍具备良好的可扩展性与实时性. Linear SRA数学表达式为
式中:
1.1.2. Hiera Backbone分支
Hiera作为第2编码器路径,专注于增强模型对复杂边界、多尺度结构与细粒度纹理的建模能力. Hiera采用多层级局部窗口注意力机制,将输入图像划分为固定大小的非重叠窗口,在每个局部区域内施加空间限制的自注意力操作,有效保持区域内空间一致性与上下文相关性. 该结构不仅提升对模糊边界和伪装区域的辨识能力,还通过堆叠式设计实现多尺度上下文的逐层融合,从而强化局部特征表达效率与结构完整性,进一步提升模型在复杂临床图像中的分割表现. 局部窗口注意力机制数学表达式为
式中:
1.2. 解码器设计
1.2.1. 特征门控融合模块
在结直肠息肉分割任务中,高质量特征表达对精准分割至关重要. PVTv2具备卓越的全局感知能力,能够捕捉息肉整体结构信息,而Hiera依托分层特征提取机制,在边界细节和局部纹理建模方面表现优越. 然而,由于2种编码器特征表达存在差异,直接拼接或简单上采样可能导致信息冗余,甚至削弱关键特征贡献,影响分割精度. 受文献[26]启发,提出特征门控融合(feature-gated fusion,FGF)模块,作为PVTv2和Hiera之间的桥梁,其结构如图2所示. FGF通过分离-聚合机制,自适应地筛选、重校准并融合2种编码器的互补信息,从而构建更加完整、层次丰富的特征表示,为后续分割任务提供更强的判别力和更精准的息肉区域感知能力.
图 2
1)编码器特征建模与增强. 分别对PVTv2输出特征
式中:
2)跨编码器引导与特征校准. 通过建立PVTv2特征对Hiera的引导关系,进行自适应校准,以去除冗余信息,得到输出
3)自适应融合与优化特征生成. 基于空间注意力机制,对PVTv2和Hiera的校准特征进行加权融合,确保在不同区域内最具判别力的特征得到充分利用. 具体而言,首先利用1×1卷积层计算特征的注意力权重,并采用Softmax函数对其进行归一化,以实现PVTv2和Hiera在各个像素点上的自适应权重调整. 依据计算所得的注意力权重,对校准特征进行加权求和,生成优化后的融合特征
式中:
1.2.2. 小波增强特征注入模块
图 3
给定输入特征图{
式中:
1.2.3. 多尺度预测模块
图 4
MSP模块由可学习权重的量化机制与多尺度融合策略协同构成. 具体而言,首先将小波增强特征注入模块的输出特征图
式中:
2. 实验结果的讨论与分析
2.1. 数据集及预处理
为验证网络在结直肠息肉分割任务中的有效性、泛化能力及准确性,基于CVC-ClinicDB、Kvasir-SEG、CVC-ColonDB和ETIS-LaribPolypDB这4个公开数据集进行实验. 在实验过程中,从CVC-ClinicDB随机抽取550张图像,并与Kvasir-SEG的900张图像组成训练集,其余图像与ETIS-LaribPolypDB及CVC-ColonDB的所有数据用于测试. 为保证训练过程的一致性,所有训练图像分辨率均调整为352×352. 各数据集详细信息及划分方式如表1所示.
表 1 数据集细节及划分
Tab.1
| 数据集 | 图像分辨率 | 训练数据 | 测试数据 | 数据类型 |
| CVC-ClinicDB | 384×288 | 550 | 62 | 图像 |
| Kvasir-SEG | 尺寸不固定 | 900 | 100 | 图像与掩码 |
| CVC-ColonDB | 574×500 | 0 | 380 | 图像 |
| ETIS | 0 | 196 | 图像 |
2.2. 实验环境与参数设置
实验基于Pytorch开源框架,在Windows10操作系统上进行. 硬件环境包括Intel Core i5-13600 CPU、16 GB内存以及NVIDIA GeForce RTX 4060Ti GPU(8 GB显存). 在训练过程中,损失函数由合并比损失函数与二进制交叉熵损失函数组合而成. 初始学习率设定为1×10−5,并采用50轮周期性衰减策略,衰减率为0.1. 优化器选用自调整矩阵估计优化器,批次大小设为4,动量参数设为0.9. 所有实验训练100个epoch,并采用{0.75,1.00,1.25}多尺度训练策略,以提升模型鲁棒性和泛化能力.
2.3. 评价标准
为全面量化不同网络模型在预测、学习及泛化能力方面的表现,所有实验均基于相同的数据集、学习率及优化策略进行评测. 具体而言,采用Dice系数、平均交并比(mean intersection over union,mIoU)、精确度(precision,PC)、召回率(sensitivity,SE)、平均绝对误差(mean absolute error,MAE)及F2得分作为核心评价指标,以全面衡量模型在结直肠息肉分割任务中的性能. 部分评价指标的计算公式如下:
式中:X为预测输出图像,Y为具有权威性标注的金指标,N为图片中像素点个数.
3. 实验结果
3.1. 网络性能客观对比实验
表 2 不同网络在CVC-ClinicDB和Kvasir上的对比
Tab.2
| 数据集 | 网络 | Dice | mIoU | SE | PC | F2 | MAE |
| CVC- ClinicDB | U-Net | 0.823 | 0.755 | 0.834 | 0.839 | 0.827 | 0.019 |
| Caranet | 0.934 | 0.890 | 0.944 | 0.940 | 0.939 | 0.006 | |
| MEGANet | 0.941 | 0.897 | 0.951 | 0.941 | 0.945 | 0.006 | |
| SSFormer-S | 0.918 | 0.875 | 0.905 | 0.939 | 0.910 | 0.007 | |
| MSRAFormer | 0.924 | 0.874 | 0.945 | 0.920 | 0.932 | 0.008 | |
| Polyp-PVT | 0.937 | 0.889 | 0.949 | 0.936 | 0.945 | 0.006 | |
| SAM2-UNet | 0.914 | 0.860 | 0.916 | 0.920 | 0.914 | 0.010 | |
| 本研究 | 0.948 | 0.904 | 0.952 | 0.948 | 0.950 | 0.006 | |
| Kvasir | U-Net | 0.818 | 0.746 | 0.856 | 0.857 | 0.827 | 0.055 |
| Caranet | 0.922 | 0.872 | 0.915 | 0.941 | 0.921 | 0.019 | |
| MEGANet | 0.916 | 0.866 | 0.913 | 0.939 | 0.912 | 0.025 | |
| SSFormer-S | 0.925 | 0.877 | 0.914 | 0.944 | 0.917 | 0.018 | |
| MSRAFormer | 0.923 | 0.873 | 0.915 | 0.952 | 0.917 | 0.024 | |
| Polyp-PVT | 0.917 | 0.864 | 0.913 | 0.947 | 0.914 | 0.023 | |
| SAM2-UNet | 0.902 | 0.847 | 0.904 | 0.931 | 0.901 | 0.029 | |
| 本研究 | 0.933 | 0.885 | 0.923 | 0.955 | 0.926 | 0.019 |
表 3 不同网络在CVC-ColonDB和ETIS上的对比
Tab.3
| 数据集 | 网络 | Dice | mIoU | SE | PC | F2 | MAE |
| CVC- ColonDB | U-Net | 0.512 | 0.444 | 0.523 | 0.621 | 0.510 | 0.061 |
| Caranet | 0.748 | 0.683 | 0.753 | 0.893 | 0.746 | 0.035 | |
| MEGANet | 0.795 | 0.717 | 0.844 | 0.831 | 0.803 | 0.040 | |
| SSFormer-S | 0.774 | 0.698 | 0.777 | 0.837 | 0.766 | 0.036 | |
| MSRAFormer | 0.782 | 0.707 | 0.803 | 0.874 | 0.787 | 0.028 | |
| Polyp-PVT | 0.808 | 0.727 | 0.821 | 0.849 | 0.809 | 0.031 | |
| SAM2-UNet | 0.729 | 0.656 | 0.744 | 0.786 | 0.731 | 0.036 | |
| 本研究 | 0.818 | 0.735 | 0.836 | 0.841 | 0.821 | 0.026 | |
| ETIS | U-Net | 0.398 | 0.335 | 0.482 | 0.439 | 0.429 | 0.036 |
| Caranet | 0.728 | 0.661 | 0.775 | 0.814 | 0.750 | 0.017 | |
| MEGANet | 0.741 | 0.667 | 0.861 | 0.706 | 0.781 | 0.037 | |
| SSFormer-S | 0.769 | 0.698 | 0.856 | 0.743 | 0.800 | 0.016 | |
| MSRAFormer | 0.750 | 0.679 | 0.811 | 0.745 | 0.777 | 0.013 | |
| Polyp-PVT | 0.787 | 0.706 | 0.867 | 0.774 | 0.820 | 0.013 | |
| SAM2-UNet | 0.682 | 0.602 | 0.748 | 0.668 | 0.710 | 0.020 | |
| 本研究 | 0.795 | 0.719 | 0.888 | 0.761 | 0.835 | 0.014 |
所提网络在CVC-ClinicDB、Kvasir-SEG、CVC-ColonDB和ETIS这4个公开数据集上均取得优越的分割性能,多个核心指标接近或达到最优,充分体现其在病灶区域定位、边界建模与小目标检测方面的综合优势. 具体地,在CVC-ClinicDB数据集中,网络在Dice(0.948)、mIoU(0.904)、SE(0.952)、PC(0.948)与F2(0.950)这5项核心指标上均取得最高值,表明网络具备精准的病灶区域建模能力与强语义一致性表达能力. 同时,最低的MAE值(0.006)显示出算法在像素级误差控制和边界还原方面表现出色,有效缓解了边界模糊问题.
在Kvasir数据集中,Dice(0.933)、mIoU(0.885)、SE(0.923)、PC(0.955)与F2(0.926)等指标上持续领先,显示出网络在高召回能力基础上兼顾分割精度,增强了对边缘细节感知与背景干扰的抑制. 尽管MAE略高于SSFormer-S(0.019 vs 0.018),但在整体性能(尤其是F2)上仍保持最优,反映了网络在边界处理和全局特征融合方面的有效性.
在CVC-ColonDB数据集中,由于图像质量低、结构形态复杂,小目标分布较多,分割任务更具挑战性. 本研究网络在Dice(0.818)、mIoU(0.735)与F2(0.821)上取得最优,展现出其对低对比度、非规则目标的结构建模能力. 此外,MAE(0.026)显著优于MEGANet(0.040)和Polyp-PVT(0.031),进一步验证了其在复杂边界感知与像素误差压缩方面的优势.
在ETIS数据集上,网络面临复杂背景与小目标双重挑战,但是仍在Dice(0.795)、mIoU(0.719)、SE(0.888)和F2(0.835)等关键指标上取得当前最佳成绩. SE指标优于MEGANet(0.861)与SSFormer-S(0.856),说明模型具备对微小息肉区域的高敏感性与高召回能力. 尽管PC略低于Polyp-PVT(0.761 vs 0.774),但是最低的MAE(0.014)指标进一步说明所提方法对边缘误差控制与噪声抑制具有强鲁棒性. 综上所述,网络在4个数据集上均展现出稳定且领先性能,分别从区域定位准确性、边界细节建模和小目标检测能力等方面有效缓解了传统方法的不足,验证了其在复杂临床环境下的良好适应性与泛化能力.
提出网络在CVC-ClinicDB、Kvasir、CVC-ColonDB和ETIS这4个数据集上的Dice系数随训练Epoch的变化趋势如图5所示. 结果表明,网络在CVC-ClinicDB和Kvasir数据集上的分割性能较优,最终Dice系数分别超过0.93和0.92,且在20~30个Epoch内已接近收敛,表明网络具备较快的学习能力和高精度分割能力;在CVC-ColonDB和ETIS数据集上,Dice系数最终稳定在0.81和0.78,尽管整体数值较低,但仍保持稳步上升,反映出良好的泛化性能;各数据集的Dice变化曲线较为平稳,无明显振荡,说明网络能够有效学习跨尺度特征,减少误分割和漏分割现象,保证分割稳定性. 整体来看,网络在训练过程中展现出良好的收敛性与性能一致性,能够在不同类型数据上稳定优化,提升了多场景下的分割表现.
图 5
3.2. 泛化性能实验
为进一步验证网络泛化能力,在锯齿状腺瘤分割任务上进行实验评估. 锯齿状腺瘤是一类特殊的息肉病变,其形态复杂、边界模糊且与正常肠道组织对比度低,使得现有分割方法在该任务上面临巨大挑战. 因此,选取Polyp和Serrated Adenoma公开数据集,对网络适应性和稳定性进行深入分析.
如表4所示,网络在Polyp与Serrated Adenoma数据集上均表现优异的分割性能. 在Polyp数据集中,Dice系数达到0.963,mIoU=0.930;在Serrated Adenoma数据集中,Dice=0.955,mIoU=0.915,表明模型在不同病灶类型上的分割能力具有高度一致性. 核心指标如SE均超过0.95,体现出网络在区域感知和边界细节恢复方面的优越性能. 此外,Serrated Adenoma数据集上MAE=0.056,保持较低水平,表明模型在减少假阳性与假阴性方面效果显著,增强了分割结果准确性和可靠性.
表 4 锯齿状腺瘤分割指标
Tab.4
| 数据集 | Dice | mIoU | SE | PC | F2 | MAE |
| Polyp | 0.963 | 0.930 | 0.963 | 0.964 | 0.963 | 0.044 |
| Serrated Adenoma | 0.955 | 0.915 | 0.951 | 0.961 | 0.952 | 0.056 |
图 6
3.3. 网络性能主观对比实验
可视化分割结果如图7和8所示. 为直观评估不同方法的分割质量,原始图像中的病变区域以蓝色方框标注,而分割结果则采用黄色(真阳性)、红色(假阳性)、绿色(假阴性)加以区分,以揭示模型对病灶区域的识别精度与误检情况. 传统CNN方法(U-Net、CaraNet、MEGANet)在大息肉分割上表现稳定,但在小目标检测、复杂背景和多息肉场景下存在边界模糊和漏检(如图7第6列,图8第1列). 其中,CaraNet虽引入注意力机制,但在背景噪声较强时仍易产生假阳性(如图7第7列). 基于Transformer的方法(SSFormer-S、MSRAFormer、PolypPVT)具备较强的全局信息建模能力,但对小目标息肉的边界刻画不足,导致部分息肉区域被错误排除或边缘过度平滑(如图7第8列、图8第7列). SAM2-UNet通过自适应采样增强关键区域关注度,在小目标分割上有所改善,但在复杂背景下仍存在背景干扰(如图7第8列),且在大病灶场景中易出现目标分割不完整(如图7第4列). 相比之下,网络融合PVTv2与Hiera双编码器,结合PVTv2全局信息建模与Hiera层次化局部特征提取,实现对病灶区域更精准地表征. 特征门控融合模块引入通道注意力机制,聚焦关键语义通道,有效抑制冗余信息干扰,增强网络对目标区域的敏感性,显著提升病灶定位的准确性与鲁棒性(如图7第1列、图8第2列). 小波增强特征注入模块利用小波分解拆解融合特征为低频结构和高频边缘,强化边界细节刻画,抑制复杂背景中的噪声和假阳性,提高分割准确性(如图7第4列、图8第4列). 多尺度预测模块结合全局池化与尺度自适应加权策略,引导各层特征融合以适配不同尺度息肉,增强对小目标结构的响应能力,减少因尺寸差异造成的漏检,提升小息肉的分割完整性与稳定性(如图7第2列、图8第7列). 综上所述,网络在全局建模、细节增强与多尺度优化3方面取得突破,在确保高精度分割的同时,具备更强的泛化能力,为医学影像分割任务提供一种精准、高效且适用于复杂场景的解决方案.
图 7
图 7 CVC-ClinicDB和Kvasir数据集上不同网络分割结果
Fig.7 Results of different network segmentations on CVC-ClinicDB and Kvasir datasets
图 8
图 8 ETIS和CVC-ColonDB数据集上不同网络分割结果
Fig.8 Results of different network segmentations on ETIS and CVC-ColonDB datasets
3.4. 消融实验
表 5 各模块在CVC-ClinicDB数据集上的消融结果
Tab.5
| 模型 | PVTv2 | Hiera | 解码器 | Dice | mIoU | F2 | ||
| FGF | WEFI | MSP | ||||||
| M1 | √ | √ | – | √ | √ | 0.931 | 0.880 | 0.934 |
| M2 | √ | √ | √ | – | √ | 0.917 | 0.861 | 0.910 |
| M3 | √ | √ | √ | √ | – | 0.937 | 0.892 | 0.940 |
| M4 | √ | – | √ | √ | √ | 0.934 | 0.889 | 0.941 |
| M5 | – | √ | √ | √ | √ | 0.883 | 0.832 | 0.888 |
| M6 | √ | √ | √ | √ | √ | 0.948 | 0.904 | 0.950 |
表 6 各模块在CVC-ColonDB数据集上的消融结果
Tab.6
| 模型 | PVTv2 | Hiera | 解码器 | Dice | mIoU | F2 | ||
| FGF | WEFI | MSP | ||||||
| M1 | √ | √ | – | √ | √ | 0.808 | 0.724 | 0.810 |
| M2 | √ | √ | √ | – | √ | 0.780 | 0.697 | 0.782 |
| M3 | √ | √ | √ | √ | – | 0.794 | 0.713 | 0.809 |
| M4 | √ | – | √ | √ | √ | 0.796 | 0.715 | 0.801 |
| M5 | – | √ | √ | √ | √ | 0.745 | 0.670 | 0.746 |
| M6 | √ | √ | √ | √ | √ | 0.818 | 0.735 | 0.821 |
消融实验结果表明,FGF模块能够在全局特征学习过程中有效筛选关键语义信息,结合局部特征的细粒度解析能力,构建全局与局部特征的高效互补机制,从而提升网络对病灶区域的定位准确性,带来mIoU与Dice指标的稳定提升;WEFI模块进一步优化特征表征能力,该模块能够分离低频背景特征与高频纹理特征,提升网络对不同尺度信息的感知能力,从而有效抑制噪声、增强纹理细节,最终提升F2得分;MSP模块通过对不同层级特征进行通道筛选和高效融合,提升多尺度信息融合精度与效率,增强对小尺寸与复杂形态息肉结构响应能力,使得Dice相似系数得到提升;引入双编码器结构不仅显著提升全局语义建模能力,还能保持高级语义信息的高效利用,进一步强化网络对复杂病变形态的表达能力. 综合消融实验结果可见,所设计的编码-解码结构在分割精度、特征表征能力及跨数据集泛化表现方面均展现出优越性能,为结直肠息肉分割任务提供一种更为高效且稳定的解决方案.
Grad-CAM(gradient-weighted class activation mapping)生成的可视化结果如图9所示. 从热力图分布可以观察到,网络能够精准关注息肉区域,并在不同测试样本上展现出一致且稳定的激活模式,充分证明其卓越的特征提取能力与空间表征能力. 具体而言,PVTv2编码器凭借其渐进式窗口注意力机制和多尺度特征提取能力,使得网络能够捕捉丰富的全局语义信息,确保对低对比度或背景复杂的息肉区域仍能保持较高的感知能力;Hiera编码器通过层次化特征提取结构增强局部细节建模能力,进一步弥补传统Transformer结构对局部信息敏感度不足的问题,使得模型在息肉边缘区域响应更为精细;FGF通过特征门控机制实现全局与局部特征的高效互补,有效提升目标区域响应一致性和显著性,增强网络定位能力;WEFI模块通过小波变换增强低频结构特征与高频纹理信息的互补关系,使得在息肉边缘区域响应更加锐利,进一步提升边界感知能力并有效抑制伪影干扰;MSP模块利用多尺度预测机制增强对不同空间尺度息肉结构的适应性,尤其在小尺寸息肉区域仍能维持良好的激活表现. 综合而言,Grad-CAM可视化分析充分证明网络在结直肠息肉分割任务中的精准性,同时进一步佐证各模块在增强网络表征能力、提高分割精度及泛化性方面的关键作用.
图 9
为评估各模块在临床部署场景下的可行性,进一步对FGF、WEFI和MSP参数量、计算复杂度与平均单张图像推理时间进行统计,如表7所示. 其中,FGF、WEFI和MSP分别仅引入0.151、0.037 与0.001 M参数,对整体模型体积影响极小;对应的GFLOPs分别为0.008、0.379与0.002,均处于较低水平;三者平均推理延迟均低于4 ms(分别为3.98 ms、2.17 ms与2.01 ms),表明所设计模块在保持分割精度提升的同时具备良好的计算效率与实用性,不会对临床实时性应用构成负担.
表 7 模块计算开销与推理延迟
Tab.7
| 模块 | 参数量/106 | 计算量 | 推理时间/ms |
| FGF | 0.151 | 0.008 | 3.98 |
| WEFI | 0.037 | 0.379 | 2.17 |
| MSP | 0.001 | 0.002 | 2.01 |
4. 结 语
本研究提出特征门控融合与小波增强的双编码器息肉分割网络,能够精准识别息肉区域并优化分割边界,有效提升检测准确性与泛化性. 网络采用PVTv2与Hiera双Transformer编码器,分别建模全局上下文与局部细节信息,增强息肉区域的特征表达能力. FGF模块通过通道注意力机制实现全局与局部特征的高效互补,强化区域定位. WEFI模块利用小波分解以提取多频特征,有效增强边界刻画并抑制背景干扰. MSP模块结合全局池化与自适应加权策略,实现多尺度特征的动态融合,增强对不同形态小息肉的感知能力. 在Kvasir和CVC-ClinicDB数据集上,所提网络在精准率(0.955和0.948)与召回率(0.923和0.952)方面均优于现有方法,展现出良好的分割精度和边界响应能力. 在CVC-ColonDB与ETIS数据集上的实验进一步验证了该网络在小息肉识别任务中依然能维持高精度与稳定性,表现出一定程度的鲁棒性和良好的泛化能力. 综上所述,提出的网络为结直肠息肉的自动化精准分割提供了高效可靠的解决方案,具备良好的临床应用潜力.
参考文献
DBMA-Net: a dual-branch multiattention network for polyp segmentation
[J].
Polyp segmentation using a hybrid vision transformer and a hybrid loss function
[J].
CTNet: contrastive transformer network for polyp segmentation
[J].
基于知识引导的缺血性脑卒中梗死区分割方法
[J].
Knowledge-guided infarct segmentation of ischemic stroke
[J].
稀疏分解和图拉普拉斯正则化的图像前景背景分割方法
[J].
Image foreground–background segmentation method based on sparse decomposition and graph Laplacian regularization
[J].
GA-Net: ghost convolution adaptive fusion skin lesion segmentation network
[J].
Polyp segmentation in medical imaging: challenges, approaches and future directions
[J].
PPNet: pyramid pooling based network for polyp segmentation
[J].
Boundary constraint network with cross layer feature integration for polyp segmentation
[J].
Boundary uncertainty aware network for automated polyp segmentation
[J].
Polyp segmentation with convolutional MLP
[J].
PolypSeg+: a lightweight context-aware network for real-time polyp segmentation
[J].
TMPSformer: an efficient hybrid Transformer-MLP network for polyp segmentation
[J].
CoInNet: a convolution-involution network with a novel statistical attention for automatic polyp segmentation
[J].
Edge-aware feature aggregation network for polyp segmentation
[J].
RSAFormer: a method of polyp segmentation with region self-attention transformer
[J].
Hybridvps: hybrid-supervised video polyp segmentation under low-cost labels
[J].
PVT v2: improved baselines with pyramid vision transformer
[J].
MGF-net: multi-channel group fusion enhancing boundary attention for polyp segmentation
[J].
EMFF-Net: edge-enhancement multi-scale feature fusion network
[J].
跨尺度跨维度的自适应Transformer网络应用于结直肠息肉分割
[J].
Application of adaptive Transformer network to colorectal polyp segmentation at scales and dimensions
[J].
MSRAformer: multiscale spatial reverse attention network for polyp segmentation
[J].
/
| 〈 |
|
〉 |

