浙江大学学报(工学版), 2026, 60(8): 1720-1729 doi: 10.3785/j.issn.1008-973X.2026.08.011

计算机技术

基于特征门控融合与小波增强的双编码器息肉分割

梁礼明,, 康婷, 陈康泉, 钟奕

江西理工大学 电气工程与自动化学院,江西 赣州 341000

Dual-encoder polyp segmentation with feature-gated fusion and wavelet enhancement

LIANG Liming,, KANG Ting, CHEN Kangquan, ZHONG Yi

School of Electrical Engineering and Automation, Jiangxi University of Science and Technology, Ganzhou 341000, China

收稿日期: 2025-06-26  

基金资助: 国家自然科学基金资助项目(51365017,61463018);江西省自然科学基金资助项目(20192BAB205084);江西省教育厅科学技术研究重点项目(GJJ170491,GJJ2200848).

Received: 2025-06-26  

Fund supported: 国家自然科学基金资助项目(51365017,61463018);江西省自然科学基金资助项目(20192BAB205084);江西省教育厅科学技术研究重点项目(GJJ170491,GJJ2200848).

作者简介 About authors

梁礼明(1967—),男,教授,硕士,从事机器学习和医学影像研究.orcid.org/0009-0004-5278-5249.E-mail:9119890012@jxust.edu.cn , E-mail:9119890012@jxust.edu.cn

摘要

针对结直肠息肉分割任务中病灶区域定位不准、边界细节缺失及小目标息肉易漏检等问题,提出基于特征门控融合与小波增强的双编码器息肉分割网络. 构建PVTv2与Hiera双编码器,提升全局语义感知能力及增强边缘表征能力. 设计特征门控融合模块,对双编码器提取的多层级特征进行自适应筛选和融合,提高网络对息肉区域的区分能力. 建立小波增强特征注入模块,利用小波变换分解高低频信息,强化边缘纹理表达并有效抑制噪声干扰,提升息肉区域的细粒度特征学习能力. 引入多尺度预测模块,结合全局平均池化与自适应加权融合策略,实现精细化分割,提高对形态多变病灶的适应性. 结果表明,所提网络能够为结直肠息肉的计算机辅助诊断提供有力支持.

关键词: 结直肠息肉分割 ; 双编码器网络 ; 特征门控融合 ; 小波增强 ; 多尺度预测 ; 边界细节增强

Abstract

To address the problems of inaccurate lesion localization, missing boundary details, and small polyp omission in colorectal polyp segmentation, a dual-encoder network with feature-gated fusion and wavelet-enhanced modules was proposed. A dual-encoder architecture based on PVTv2 and Hiera was adopted to enhance global semantic awareness and edge representation. A feature-gated fusion module was designed to filter and combine the multi-level features extracted by two encoders adaptively, thereby better distinguishing polyp regions. A wavelet-enhanced injection module was introduced to decompose high-frequency and low-frequency information using wavelet transform, thus strengthening the edge texture expression and reduced noise, supporting fine-grained feature learning. A multi-scale prediction module was introduced by combining global average pooling and adaptive weighted fusion to achieve refined segmentation and improve adaptability to polyps with diverse shapes. Results show that the proposed network provides effective support for computer-aided diagnosis of colorectal polyps.

Keywords: colorectal polyp segmentation ; dual-encoder network ; feature-gated fusion ; wavelet enhancement ; multi-scale prediction ; boundary detail refinement

PDF (2339KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

梁礼明, 康婷, 陈康泉, 钟奕. 基于特征门控融合与小波增强的双编码器息肉分割. 浙江大学学报(工学版)[J], 2026, 60(8): 1720-1729 doi:10.3785/j.issn.1008-973X.2026.08.011

LIANG Liming, KANG Ting, CHEN Kangquan, ZHONG Yi. Dual-encoder polyp segmentation with feature-gated fusion and wavelet enhancement. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(8): 1720-1729 doi:10.3785/j.issn.1008-973X.2026.08.011

结直肠癌是最常见的恶性疾病之一,其发病率和死亡率始终居高不下[1]. 研究表明,肠道细胞过度增殖会导致结直肠病变,而结直肠息肉正是这一病变的典型特征. 结直肠息肉可分为增生性和腺性,其中增生性息肉为良性,而腺性息肉则可能随着时间推移逐步恶化[2]. 早期腺性息肉可通过简单手术切除,患者生存率可高达95%,但一旦进入晚期,该比率将大幅下降. 因此,定期进行结直肠镜检查,早期发现并精准诊断结直肠腺性息肉,是有效预防肠道病变的重要手段[3]. 结直肠息肉图像呈现复杂多变的病理特征,息肉形态多样、大小不一、边缘模糊且病变区域与正常组织高度相似. 即便经验丰富的临床医生,由于主观因素影响,可能在相同图像分割结果上存在差异,进而导致漏检或误检[4-5]. 因此,临床上亟需自动化息肉识别与分割算法,以提高医生诊断效率.

传统结直肠息肉分割方法主要包括支持向量机、息肉结构形态统计、阈值对比分析以及人工选取病变特征等[6-9]. 尽管这些方法在特定条件下具备一定效果,但在实际应用中存在明显局限. 1)结直肠结构复杂,息肉常与周边组织相连,造成识别边界困难;2)息肉与背景组织对比度较低,容易导致分割模糊. 此外,传统方法严重依赖人工经验构建的低级特征(如几何形态[10]、强度分布[11]与体积信息[12]),难以适应病变形态多样的实际场景,加之现有公共数据集在样本多样性与数据量方面存在不足,进一步限制了模型性能提升[13].

鉴于传统方法存在的局限,卷积神经网络(convolutional neural network,CNN)作为深度学习核心技术,在医学图像分割领域取得显著进展[14]. 如全卷积网络[15]将深度网络引入语义分割,实现端到端像素级预测,相较传统方法显著提升分割精度. Ronneberger等[16]提出U-Net,通过U型结构与跳跃连接机制增强对边界和细节的恢复能力,成为医学图像分割领域典型框架. Lin等[17]进一步提出特征金字塔网络,提升模型对多尺度语义结构表征能力. 这些经典网络推动基于编码器–解码器结构的息肉分割方法不断演进,如Guo等[18]引入深度可分离卷积以提升分割效率;Jain等[19]基于反卷积构建改进型CNN以强化边界还原.

受限于感受野和网络结构,卷积神经网络在远距离依赖关系建模上存在不足,难以全面捕捉复杂病变全局语义信息. 为此,研究者借鉴自然语言处理领域Transformer结构优势,将其引入医学图像分割任务[20]. Transformer能够构建全局上下文关联,有效捕获长距离依赖特征,从而提升病变区域识别能力. Yin等[21]提出混合型Transformer架构RSAFormer,以增强局部与全局特征间协同建模能力. Wang等[22]设计金字塔结构视觉Transformer网络,实现更丰富的图像语义建模和多尺度特征提取. 尽管如此,这些基于Transformer的方法在局部信息处理方面仍面临挑战:缺乏类似卷积的空间归纳偏置,导致对边缘细节刻画能力不足,造成边界信息丢失[23];单一Transformer编码器在特征聚合策略、网络深度以及上下文建模能力方面存在一定限制,难以兼顾全局语义完整性与多尺度细节表达.

针对上述问题,提出特征门控融合与小波增强双编码器息肉分割网络,采用PVTv2(pyramid vision Transformer v2)[24]与Hiera(hierarchical Transformer)[25]双Transformer编码器架构,以弥补单一Transformer模型局限性. PVTv2通过金字塔特征提取结构,有效增强远距离特征交互能力,确保全局信息建模的完整性;而Hiera编码器则采用层次化注意力机制,加强多尺度特征聚合,提升息肉边界的细节刻画能力. 此外,设计多模块解码器以进一步优化分割过程,旨在通过融合不同尺度与不同类型的特征信息,增强对息肉区域的识别能力并提升分割精度.

本研究主要工作如下:1)结合PVTv2和Hiera,提升全局信息建模能力与局部细节刻画能力,实现更精准的息肉分割;2)构建特征门控融合模块,通过通道注意力筛选关键特征,优化全局与局部信息交互,提高息肉区域判别能力;3)设计小波增强特征注入模块,利用小波变换增强高低频特征表达,优化边缘细节建模,减少噪声干扰,提高分割精度;4)引入多尺度预测模块,提升不同尺度病灶检测能力;5)在多个公开数据集上进行实验评估,充分验证网络在不同数据分布下的准确性和广泛适用性.

1. 网络整体架构

1.1. 编码器设计

Hiera Backbone和PVTv2双分支Transformer编码器结构如图1所示. Hiera Backbone依托其层次化结构与多尺度特征提取机制,精细刻画息肉区域的局部细节信息,弥补PVTv2在细节刻画方面的不足,同时PVTv2强大的全局建模能力增强Hiera Backbone对长程依赖关系的理解,从而构建更精准、层次化的息肉特征表示.

图 1

图 1   基于特征门控融合与小波增强的双Transformer编码器息肉分割网络框架

Fig.1   Dual-Transformer encoder polyp segmentation framework based on feature-gated fusion and wavelet enhancement


1.1.1. PVTv2分支

为了增强模型对远程语义依赖的建模能力,在保持全局上下文理解能力的同时降低计算成本,引入PVTv2作为双编码器之一.

与原始Vision Transformer不同,PVTv2针对医学图像分割任务中的高分辨率输入场景做了3方面优化:1)采用卷积形式Patch Embedding模块,在保持图像拓扑结构连续性的同时,实现稳定的分块降维,有助于适配医学图像中常见的高分辨率输入特征;2)通过多阶段金字塔特征提取结构实现自上而下语义提炼与尺度压缩,使得网络能够在不同感受野下逐层建立丰富的全局表征;3)引入线性空间降维注意力(linear spatial-reduction attention,Linear SRA)模块,通过对key和value进行空间降维,显著降低注意力计算复杂度,使其在高分辨率图像中仍具备良好的可扩展性与实时性. Linear SRA数学表达式为

$ \text{LSRA}(\boldsymbol{x})=\text{Concat}\;(\mathbf{hea}{\mathbf{d}}_{0},\cdots ,\mathbf{hea}{\mathbf{d}}_{N-1}){\boldsymbol{W}}^{{\mathrm{o}}}. $

$ \begin{split} {\bf{head}}_{j}=& \mathrm{Att}\;\text{(}\boldsymbol{x}\boldsymbol{W}_{j}^{{\boldsymbol{Q}}},{\boldsymbol{S}}(\boldsymbol{x})\boldsymbol{W}_{j}^{{\boldsymbol{K}}}\text{,}{\boldsymbol{S}}(\boldsymbol{x}){{\boldsymbol{W}}}_{j}^{{\boldsymbol{V}}}\text{)},\;\\& j\in \{0,\cdots,N-1\}.\end{split} $

$ {\boldsymbol{S}}(\boldsymbol{x})=\text{LN\;(Avg}\;(\boldsymbol{x},p)\cdot \boldsymbol{W}_{}^{{\boldsymbol{S}}}\text{).} $

式中:$ \boldsymbol{x}\in {\mathbf{R}}^{H\times W\times {{C}_{}}} $为输入特征图;$ \mathbf{hea}{\mathbf{d}}_{j} $为第$ j $个注意力头的输出,$ j\in \{0, \cdots ,N-1\} $$ N $为注意力头总数;$ \text{Concat\;(}\cdot \text{)} $为通道级联;$ {\boldsymbol{W}}^{{\mathrm{o}}}\in {\mathbf{R}}^{{{C}_{{\mathrm{o}}}}\times {{C}_{{\mathrm{o}}}}} $为将级联特征映射到输出维度$ {C}_{{\mathrm{o}}} $的输出投影矩阵;$ \boldsymbol{W}_{j}^{{\boldsymbol{Q}}}、\boldsymbol{W}_{j}^{{\boldsymbol{K}}} $$ \boldsymbol{W}_{j}^{{\boldsymbol{V}}}\in {\mathbf{R}}^{C\times d} $分别为第$ j $个头query、key和value的投影;$ d= {C}_{{\mathrm{o}}}/N $为每头通道尺寸;$ \text{Att\;(}\cdot \text{)} $为缩放点积注意力函数;$ S(\boldsymbol{x}) $为输入$ \boldsymbol{x} $的空间缩减表示;$ \text{Avg}\;(\boldsymbol{x},p) $为对$ \boldsymbol{x} $进行$ p\times p $窗口的平均池化操作;$ \boldsymbol{W}_{}^{{\boldsymbol{S}}}\in {\mathbf{R}}^{C\times C} $为通道维度的投影矩阵;$ \text{LN\;(}\cdot \text{)} $为层归一化操作.

1.1.2. Hiera Backbone分支

Hiera作为第2编码器路径,专注于增强模型对复杂边界、多尺度结构与细粒度纹理的建模能力. Hiera采用多层级局部窗口注意力机制,将输入图像划分为固定大小的非重叠窗口,在每个局部区域内施加空间限制的自注意力操作,有效保持区域内空间一致性与上下文相关性. 该结构不仅提升对模糊边界和伪装区域的辨识能力,还通过堆叠式设计实现多尺度上下文的逐层融合,从而强化局部特征表达效率与结构完整性,进一步提升模型在复杂临床图像中的分割表现. 局部窗口注意力机制数学表达式为

$ \boldsymbol{Q}=\boldsymbol{x}{\boldsymbol{W}}_{\boldsymbol{Q}},\;\boldsymbol{K}=\boldsymbol{x}{\boldsymbol{W}}_{\boldsymbol{K}},\;\boldsymbol{V}=\boldsymbol{x}{\boldsymbol{W}}_{\boldsymbol{V}}. $

$ \text{Attention}\;(\boldsymbol{Q},\boldsymbol{K},\boldsymbol{V})=\text{Softmax}\left(\frac{\boldsymbol{Q}{\boldsymbol{K}}^{{\mathrm{T}}}}{\sqrt{d}}+\boldsymbol{B}\right)\boldsymbol{V}. $

式中:$ \boldsymbol{Q}、\boldsymbol{K} $$ \boldsymbol{V} $分别为查询、键和值矩阵,$ {\boldsymbol{W}}_{{\boldsymbol{Q}}} $$ {\boldsymbol{W}}_{{\boldsymbol{K}}} $$ {\boldsymbol{W}}_{{\boldsymbol{V}}}\in {\mathbf{R}}^{C\times d} $分别为可训练投影矩阵;$ \boldsymbol{B}\in {\mathbf{R}}^{{{M}^{\mathbf{2}}}\times {{M}^{\mathbf{2}}}} $为位置偏置矩阵,$ M\times M $为每个局部窗口的尺寸,Softmax用于归一化注意力权重.

1.2. 解码器设计
1.2.1. 特征门控融合模块

在结直肠息肉分割任务中,高质量特征表达对精准分割至关重要. PVTv2具备卓越的全局感知能力,能够捕捉息肉整体结构信息,而Hiera依托分层特征提取机制,在边界细节和局部纹理建模方面表现优越. 然而,由于2种编码器特征表达存在差异,直接拼接或简单上采样可能导致信息冗余,甚至削弱关键特征贡献,影响分割精度. 受文献[26]启发,提出特征门控融合(feature-gated fusion,FGF)模块,作为PVTv2和Hiera之间的桥梁,其结构如图2所示. FGF通过分离-聚合机制,自适应地筛选、重校准并融合2种编码器的互补信息,从而构建更加完整、层次丰富的特征表示,为后续分割任务提供更强的判别力和更精准的息肉区域感知能力.

图 2

图 2   特征门控融合模块

Fig.2   Feature gating fusion module


1)编码器特征建模与增强. 分别对PVTv2输出特征$ {\boldsymbol{X}}_{\mathrm{P}} $和Hiera输出特征$ {\boldsymbol{X}}_{\mathrm{H}} $进行特征交互,以发挥两者各自优势,得到增强后的特征$ \boldsymbol{X}_{\mathrm{P}}^{\mathrm{f}} $$ \boldsymbol{X}_{\mathrm{H}}^{\mathrm{f}} $. 在此过程中,PVTv2特征$ {\boldsymbol{X}}_{\mathrm{P}} $通过通道注意力机制强化全局信息表达,确保模型能够捕捉到目标区域的整体形态和语义信息;Hiera特征$ {\boldsymbol{X}}_{\mathrm{H}} $则通过通道注意力机制抑制无关区域噪声,突出边缘和局部纹理,使分割模型在复杂区域的边界表达更加清晰.

$ {\boldsymbol{X}}_{\mathrm{P}}^{\mathrm{f}}=\sigma \left({{\boldsymbol{W}}}_{2}\cdot \text{ReLU}\;\left({{\boldsymbol{W}}}_{1}\cdot \text{GAP}\;\left(\text{Concat}\;\left({\boldsymbol{X}}_{\mathrm{P}},{\boldsymbol{X}}_{\mathrm{H}}\right)\right)\right)\right)\cdot {\boldsymbol{X}}_{\mathrm{P}}, $

$ {\boldsymbol{X}}_{\mathrm{H}}^{\mathrm{f}}=\sigma \left({{\boldsymbol{W}}}_{2}\cdot \text{ReLU}\;\left({{\boldsymbol{W}}}_{1}\cdot \text{GAP}\;\left(\text{Concat}\;\left({\boldsymbol{X}}_{\mathrm{P}},{\boldsymbol{X}}_{\mathrm{H}}\right)\right)\right)\right)\cdot {\boldsymbol{X}}_{\mathrm{H}}. $

式中:$ \sigma $为Sigmoid激活函数;$ \text{GAP\;(}\cdot \text{)} $表示全局平均池化操作;$ {{\boldsymbol{W}}}_{1} $$ {{\boldsymbol{W}}}_{2} $为2层全连接层的权重,用于生成通道加权向量.

2)跨编码器引导与特征校准. 通过建立PVTv2特征对Hiera的引导关系,进行自适应校准,以去除冗余信息,得到输出$ \boldsymbol{X}_{\mathrm{H}}^{\mathrm{r}} $,同时利用Hiera特征补充PVTv2特征中的细节信息,得到输出$ \boldsymbol{X}_{\text{P}}^{\text{r}} $. 为此,采用残差校正策略,使2种编码器的输出在信息传递过程中相互优化,从而提升特征表达能力.

$ {\boldsymbol{X}}_{\mathrm{P}}^{\mathrm{r}}={\boldsymbol{X}}_{\mathrm{H}}^{\mathrm{f}}+{\boldsymbol{X}}_{\mathrm{P}}, $

$ \boldsymbol{X}_{\mathrm{H}}^{\mathrm{r}}=\boldsymbol{X}_{\mathrm{P}}^{\mathrm{f}}+{\boldsymbol{X}}_{\mathrm{H}}. $

3)自适应融合与优化特征生成. 基于空间注意力机制,对PVTv2和Hiera的校准特征进行加权融合,确保在不同区域内最具判别力的特征得到充分利用. 具体而言,首先利用1×1卷积层计算特征的注意力权重,并采用Softmax函数对其进行归一化,以实现PVTv2和Hiera在各个像素点上的自适应权重调整. 依据计算所得的注意力权重,对校准特征进行加权求和,生成优化后的融合特征$ {\boldsymbol{F}}_{\text{output}} $,为后续分割任务提供高质量输入.

$ \boldsymbol{W}_{\text{P}}^{\text{spatial}}=\text{Softmax}\left(\text{Conv1}\times \text{1}\left(\text{Concat}\left(\boldsymbol{X}_{\text{H}}^{\text{r}},\boldsymbol{X}_{\text{P}}^{\text{r}}\right)\right)\right), $

$ \boldsymbol{W}_{\text{H}}^{\text{spatial}}=\text{Softmax}\left(\text{Conv1}\times \text{1}\left(\text{Concat}\left(\boldsymbol{X}_{\text{H}}^{\text{r}},\boldsymbol{X}_{\text{P}}^{\text{r}}\right)\right)\right), $

$ {\boldsymbol{F}}_{\text{output}}=\boldsymbol{W}_{\text{P}}^{\text{spatial}}\cdot \boldsymbol{X}_{\text{P}}^{\text{r}}+\boldsymbol{W}_{\text{H}}^{\text{spatial}}\cdot \boldsymbol{X}_{\text{H}}^{\text{r}}. $

式中:$ \boldsymbol{W}_{\text{P}}^{\text{spatial}} $$ \boldsymbol{W}_{\text{H}}^{\text{spatial}} $分别为动态空间加权权重,$ \text{Conv1}\times \text{1(}\cdot \text{)} $为1×1卷积层操作.

1.2.2. 小波增强特征注入模块

Haar小波[27]作为最简单且计算效率极高的小波基,其本质是通过一组正交滤波器对图像进行多尺度分解,有效划分图像的低频(结构)与高频(边缘)分量. 受文献[27]和文献[28]结构设计启发,提出小波增强特征注入(wavelet-enhanced feature infusion,WEFI)模块,利用Haar小波进行多尺度特征分解,使低频信息保留全局结构,高频信息增强边界细节,同时采用级联式特征处理框架优化解码特征重构,提高小目标息肉的检测能力,并减少背景噪声干扰,其结构如图3所示.

图 3

图 3   小波增强特征注入模块

Fig.3   Wavelet-enhanced feature infusion module


给定输入特征图{$ {\boldsymbol{X}}_{{1}} $$ {\boldsymbol{X}}_{{2}} $$ {\boldsymbol{X}}_{{3}} $$ {\boldsymbol{X}}_{{4}} $},WEFI通过Haar小波将其分解为低频和高频分量,其中低频分量$ {\boldsymbol{X}}_{{\mathrm{LL}}} $负责保留全局结构信息,而高频分量{$ {\boldsymbol{X}}_{{\mathrm{LH}}} $$ {\boldsymbol{X}}_{{\mathrm{HL}}} $$ {\boldsymbol{X}}_{{\mathrm{HH}}} $}主要提取边界细节和纹理特征,从而有效分离全局信息和局部细节,使后续增强处理更加针对性,提高分割精度;对不同频率分量分别进行深度可分离卷积处理,以实现跨通道信息交互和特征提炼,在降低计算复杂度的同时提升特征表达能力;对增强后的特征通过逆小波变换进行重构,以恢复原始特征图的空间分布,生成高质量的增强特征{$ {\boldsymbol{X}}_{{1}W} $$ {\boldsymbol{X}}_{{2}W} $$ {\boldsymbol{X}}_{{3}W} $$ {\boldsymbol{X}}_{{4}W} $},依次选作参考目标,对非参考目标的特征图进行自适应平均池化或双线性插值,使其调整到与参考目标相同的分辨率,得到对齐后特征$ \boldsymbol{X}{}_{k}^{i},k\in \{1,2,3,4\} $$ i\in \{1,2,3,4\} $;将相同$ k $的对齐特征$ \boldsymbol{X}{}_{k}^{i} $进行逐点平滑处理,并利用Hadamard逐元素乘积进行特征融合,以进一步增强特征表达能力,最终输出优化后特征图{$ {\boldsymbol{Y}}_{{1}} $$ {\boldsymbol{Y}}_{{2}} $$ {\boldsymbol{Y}}_{{3}} $$ {\boldsymbol{Y}}_{{4}} $}.

$ \left\{{\boldsymbol{X}}_{{\mathrm{LL}}},{\boldsymbol{X}}_{{\mathrm{LH}}},{\boldsymbol{X}}_{{\mathrm{HL}}},{\boldsymbol{X}}_{{\mathrm{HH}}}\right\}=\text{WT}\left({\boldsymbol{X}}_{k}\right),\;k\in \{1,2,3,4\}. $

$ \begin{aligned}{\boldsymbol{X}}_{z}{}^{\prime}&=\text{PWConv}\;(\text{DWConv\;(}{\boldsymbol{X}}_{z}\text{)}),\\& z\in \left\{{\mathrm{LL}},{\mathrm{LH}},{\mathrm{HL}},{\mathrm{HH}}\right\}.\end{aligned} $

$ {\boldsymbol{X}}_{kW}=\text{IWT}\;\left({\boldsymbol{X}}_{{\mathrm{LL}}}{}^{\prime},{\boldsymbol{X}}_{{\mathrm{LH}}}{}^{\prime},{\boldsymbol{X}}_{{\mathrm{HL}}}{}^{\prime},{\boldsymbol{X}}_{{\mathrm{HH}}}{}^{\prime}\right),\;k\in \{1,2,3,4\}. $

$ \boldsymbol{X}_{k}^{i}=\left\{\begin{array}{*{20}{l}} {D}\left(\boldsymbol{X}_{iW}^{},\left({H}_{k},{W}_{k}\right)\right),& k \gt {i};\\{I}\left(\boldsymbol{X}_{iW}^{}\right),& k=i;\\{U}\left(\boldsymbol{X}_{iW}^{},\left({H}_{k},{W}_{k}\right)\right),& k \lt i.\end{array}\right. $

$ {\boldsymbol{Y}}_{k}={H}\left(\left[\theta \left(\boldsymbol{X}_{k}^{{1}}\right),\theta\left(\boldsymbol{X}_{k}^{{2}}\right),\theta\left(\boldsymbol{X}_{k}^{{3}}\right),\theta\left(\boldsymbol{X}_{k}^{{4}}\right)\right]\right). $

式中:$ \text{WT}\;(\cdot ) $为Haar小波变换操作,$ \text{DWConv}\;(\cdot ) $为逐通道卷积,$ \text{PWConv}\;(\cdot ) $为逐点卷积操作,$ \text{IWT}\;(\cdot ) $为逆小波变换操作,$ {D\;(}\cdot \text{)} $$ {I\;(}\cdot \text{)} $$ {U\;(}\cdot \text{)} $分别为自适应平均池化、恒等映射和双线性插值操作,使$ \boldsymbol{X}_{iW}^{} $$ {H}_{k}\times {W}_{k} $的分辨率,$ {H}_{k}\times {W}_{k} $为特征图$ {\boldsymbol{X}}_{kW} $的分辨率,$ \theta \; \text{ (}\cdot \text{)} $为平滑卷积,$ {H\;(}\cdot \text{)} $为哈达玛乘法.

1.2.3. 多尺度预测模块

单一尺度特征预测难以全面刻画息肉区域的结构变化,尤其在形态复杂或尺度差异显著的病灶分割任务中,固定尺度特征表达易导致目标遗漏或边界不完整. 为此,引入多尺度预测(multi-scale prediction,MSP)模块[29],以跨尺度特征聚合优化分割精度. 该模块通过不同解码阶段的预测结果自适应融合,增强模型对多尺度目标的感知能力,同时结合全局平均池化与自适应加权策略,确保分割结果在不同尺度息肉区域的稳定性和完整性,减少因目标尺度变化带来的分割误差,其结构如图4所示.

图 4

图 4   多尺度预测模块

Fig.4   Multi-scale prediction module


MSP模块由可学习权重的量化机制与多尺度融合策略协同构成. 具体而言,首先将小波增强特征注入模块的输出特征图$ {\boldsymbol{Y}}_{k},\;k\in \{1,2,3,4\} $,通过4组并行1×1卷积和上采样操作,生成不同阶段对应的显著性二值掩码$ {\boldsymbol{P}}_{k},\;k\in \left\{1,2,3,4\right\} $;同时特征图$ {\boldsymbol{Y}}_{k},\;k\in \{1,2,3,4\} $经过全局平均池化提取通道级统计信息,并通过2层线性变换和Sigmoid激活函数生成通道注意力权重$ \alpha $;然后结合多尺度融合策略进行加权融合,生成最终的预测掩膜. 该过程可以具体表示为经过全局平均池化提取通道级统计信息,并通过2层线性变换和Sigmoid激活函数生成通道注意力权重.

$ {\boldsymbol{O}}_{\text{mask}}=\sum\limits_{k=1}^{4}{{U}}_{{{P}_{k}}}\left({\boldsymbol{Y}}_{k}\right)\cdot {\alpha }_{k},\;\;k\in \{1,2,3,4\}. $

式中:$ {{U}}_{{{P}_{k}}}\;(\cdot ) $为将特征图上采样至目标分辨率的空间对齐操作,$ {\alpha }_{k} $为通过注意力机制学习得到的通道权重.

2. 实验结果的讨论与分析

2.1. 数据集及预处理

为验证网络在结直肠息肉分割任务中的有效性、泛化能力及准确性,基于CVC-ClinicDB、Kvasir-SEG、CVC-ColonDB和ETIS-LaribPolypDB这4个公开数据集进行实验. 在实验过程中,从CVC-ClinicDB随机抽取550张图像,并与Kvasir-SEG的900张图像组成训练集,其余图像与ETIS-LaribPolypDB及CVC-ColonDB的所有数据用于测试. 为保证训练过程的一致性,所有训练图像分辨率均调整为352×352. 各数据集详细信息及划分方式如表1所示.

表 1   数据集细节及划分

Tab.1  Details and division of dataset

数据集图像分辨率训练数据测试数据数据类型
CVC-ClinicDB384×28855062图像
Kvasir-SEG尺寸不固定900100图像与掩码
CVC-ColonDB574×5000380图像
ETIS1226×9960196图像

新窗口打开| 下载CSV


2.2. 实验环境与参数设置

实验基于Pytorch开源框架,在Windows10操作系统上进行. 硬件环境包括Intel Core i5-13600 CPU、16 GB内存以及NVIDIA GeForce RTX 4060Ti GPU(8 GB显存). 在训练过程中,损失函数由合并比损失函数与二进制交叉熵损失函数组合而成. 初始学习率设定为1×10−5,并采用50轮周期性衰减策略,衰减率为0.1. 优化器选用自调整矩阵估计优化器,批次大小设为4,动量参数设为0.9. 所有实验训练100个epoch,并采用{0.75,1.00,1.25}多尺度训练策略,以提升模型鲁棒性和泛化能力.

2.3. 评价标准

为全面量化不同网络模型在预测、学习及泛化能力方面的表现,所有实验均基于相同的数据集、学习率及优化策略进行评测. 具体而言,采用Dice系数、平均交并比(mean intersection over union,mIoU)、精确度(precision,PC)、召回率(sensitivity,SE)、平均绝对误差(mean absolute error,MAE)及F2得分作为核心评价指标,以全面衡量模型在结直肠息肉分割任务中的性能. 部分评价指标的计算公式如下:

$ {\mathrm{Dice}}=\frac{2\left| \boldsymbol{X}\cap \boldsymbol{Y}\right| }{\left| \boldsymbol{X}\right|+\left| \boldsymbol{Y}\right| }, $

$ {\mathrm{mIoU}}=\frac{\left| \boldsymbol{X}\cap \boldsymbol{Y}\right| }{\left| \boldsymbol{X}\right|+\left| \boldsymbol{Y}\right| -\left| \boldsymbol{X}\cap \boldsymbol{Y}\right| }, $

$ {\mathrm{MAE}}=\frac{1}{N}\sum\left| \boldsymbol{Y}-\boldsymbol{X}\right| . $

式中:X为预测输出图像,Y为具有权威性标注的金指标,N为图片中像素点个数.

3. 实验结果

3.1. 网络性能客观对比实验

为验证网络在结直肠息肉分割任务中的性能,对其与U-Net[16]、CaraNet[30]、MEGANet[31]、SSFormer-S[32]、MSRAFormer[33]、Polyp-PVT[24]以及SAM2-UNet[25]7种网络进行对比实验. 为确保对比实验的一致性,所有方法在相同数据预处理流程和损失函数下进行训练和测试. 实验结果如表23所示,表中加粗数值为对应指标下的最优结果.

表 2   不同网络在CVC-ClinicDB和Kvasir上的对比

Tab.2  Comparison of different networks on CVC-ClinicDB and Kvasir

数据集网络DicemIoUSEPCF2MAE
CVC-
ClinicDB
U-Net0.8230.7550.8340.8390.8270.019
Caranet0.9340.8900.9440.9400.9390.006
MEGANet0.9410.8970.9510.9410.9450.006
SSFormer-S0.9180.8750.9050.9390.9100.007
MSRAFormer0.9240.8740.9450.9200.9320.008
Polyp-PVT0.9370.8890.9490.9360.9450.006
SAM2-UNet0.9140.8600.9160.9200.9140.010
本研究0.9480.9040.9520.9480.9500.006
KvasirU-Net0.8180.7460.8560.8570.8270.055
Caranet0.9220.8720.9150.9410.9210.019
MEGANet0.9160.8660.9130.9390.9120.025
SSFormer-S0.9250.8770.9140.9440.9170.018
MSRAFormer0.9230.8730.9150.9520.9170.024
Polyp-PVT0.9170.8640.9130.9470.9140.023
SAM2-UNet0.9020.8470.9040.9310.9010.029
本研究0.9330.8850.9230.9550.9260.019

新窗口打开| 下载CSV


表 3   不同网络在CVC-ColonDB和ETIS上的对比

Tab.3  Comparison of different networks on CVC-ColonDB and ETIS

数据集网络DicemIoUSEPCF2MAE
CVC-
ColonDB
U-Net0.5120.4440.5230.6210.5100.061
Caranet0.7480.6830.7530.8930.7460.035
MEGANet0.7950.7170.8440.8310.8030.040
SSFormer-S0.7740.6980.7770.8370.7660.036
MSRAFormer0.7820.7070.8030.8740.7870.028
Polyp-PVT0.8080.7270.8210.8490.8090.031
SAM2-UNet0.7290.6560.7440.7860.7310.036
本研究0.8180.7350.8360.8410.8210.026
ETISU-Net0.3980.3350.4820.4390.4290.036
Caranet0.7280.6610.7750.8140.7500.017
MEGANet0.7410.6670.8610.7060.7810.037
SSFormer-S0.7690.6980.8560.7430.8000.016
MSRAFormer0.7500.6790.8110.7450.7770.013
Polyp-PVT0.7870.7060.8670.7740.8200.013
SAM2-UNet0.6820.6020.7480.6680.7100.020
本研究0.7950.7190.8880.7610.8350.014

新窗口打开| 下载CSV


所提网络在CVC-ClinicDB、Kvasir-SEG、CVC-ColonDB和ETIS这4个公开数据集上均取得优越的分割性能,多个核心指标接近或达到最优,充分体现其在病灶区域定位、边界建模与小目标检测方面的综合优势. 具体地,在CVC-ClinicDB数据集中,网络在Dice(0.948)、mIoU(0.904)、SE(0.952)、PC(0.948)与F2(0.950)这5项核心指标上均取得最高值,表明网络具备精准的病灶区域建模能力与强语义一致性表达能力. 同时,最低的MAE值(0.006)显示出算法在像素级误差控制和边界还原方面表现出色,有效缓解了边界模糊问题.

在Kvasir数据集中,Dice(0.933)、mIoU(0.885)、SE(0.923)、PC(0.955)与F2(0.926)等指标上持续领先,显示出网络在高召回能力基础上兼顾分割精度,增强了对边缘细节感知与背景干扰的抑制. 尽管MAE略高于SSFormer-S(0.019 vs 0.018),但在整体性能(尤其是F2)上仍保持最优,反映了网络在边界处理和全局特征融合方面的有效性.

在CVC-ColonDB数据集中,由于图像质量低、结构形态复杂,小目标分布较多,分割任务更具挑战性. 本研究网络在Dice(0.818)、mIoU(0.735)与F2(0.821)上取得最优,展现出其对低对比度、非规则目标的结构建模能力. 此外,MAE(0.026)显著优于MEGANet(0.040)和Polyp-PVT(0.031),进一步验证了其在复杂边界感知与像素误差压缩方面的优势.

在ETIS数据集上,网络面临复杂背景与小目标双重挑战,但是仍在Dice(0.795)、mIoU(0.719)、SE(0.888)和F2(0.835)等关键指标上取得当前最佳成绩. SE指标优于MEGANet(0.861)与SSFormer-S(0.856),说明模型具备对微小息肉区域的高敏感性与高召回能力. 尽管PC略低于Polyp-PVT(0.761 vs 0.774),但是最低的MAE(0.014)指标进一步说明所提方法对边缘误差控制与噪声抑制具有强鲁棒性. 综上所述,网络在4个数据集上均展现出稳定且领先性能,分别从区域定位准确性、边界细节建模和小目标检测能力等方面有效缓解了传统方法的不足,验证了其在复杂临床环境下的良好适应性与泛化能力.

提出网络在CVC-ClinicDB、Kvasir、CVC-ColonDB和ETIS这4个数据集上的Dice系数随训练Epoch的变化趋势如图5所示. 结果表明,网络在CVC-ClinicDB和Kvasir数据集上的分割性能较优,最终Dice系数分别超过0.93和0.92,且在20~30个Epoch内已接近收敛,表明网络具备较快的学习能力和高精度分割能力;在CVC-ColonDB和ETIS数据集上,Dice系数最终稳定在0.81和0.78,尽管整体数值较低,但仍保持稳步上升,反映出良好的泛化性能;各数据集的Dice变化曲线较为平稳,无明显振荡,说明网络能够有效学习跨尺度特征,减少误分割和漏分割现象,保证分割稳定性. 整体来看,网络在训练过程中展现出良好的收敛性与性能一致性,能够在不同类型数据上稳定优化,提升了多场景下的分割表现.

图 5

图 5   Dice系数变化趋势图

Fig.5   Dice coefficient variation trend


3.2. 泛化性能实验

为进一步验证网络泛化能力,在锯齿状腺瘤分割任务上进行实验评估. 锯齿状腺瘤是一类特殊的息肉病变,其形态复杂、边界模糊且与正常肠道组织对比度低,使得现有分割方法在该任务上面临巨大挑战. 因此,选取Polyp和Serrated Adenoma公开数据集,对网络适应性和稳定性进行深入分析.

表4所示,网络在Polyp与Serrated Adenoma数据集上均表现优异的分割性能. 在Polyp数据集中,Dice系数达到0.963,mIoU=0.930;在Serrated Adenoma数据集中,Dice=0.955,mIoU=0.915,表明模型在不同病灶类型上的分割能力具有高度一致性. 核心指标如SE均超过0.95,体现出网络在区域感知和边界细节恢复方面的优越性能. 此外,Serrated Adenoma数据集上MAE=0.056,保持较低水平,表明模型在减少假阳性与假阴性方面效果显著,增强了分割结果准确性和可靠性.

表 4   锯齿状腺瘤分割指标

Tab.4  Segmentation metrics of serrated adenoma

数据集DicemIoUSEPCF2MAE
Polyp0.9630.9300.9630.9640.9630.044
Serrated Adenoma0.9550.9150.9510.9610.9520.056

新窗口打开| 下载CSV


可视化结果如图6所示,网络在病灶区域的边界刻画更加清晰,能够在复杂背景和低对比度场景(如图6第5、6列)下依然保持精准的轮廓提取能力,避免现有方法可能出现的边缘模糊或目标黏连问题. 在多病灶场景(如图6第1、2列),网络能够同时检测多个病灶区域,并且能够保持区域完整性和连贯性,有效减少传统方法可能导致的分割断层现象. 此外,在结构复杂或细长形态的腺瘤(如图6第3、4列)分割中,网络展现出优越的细节建模能力,使得病灶形状能够被更加精准地刻画,而不会受到背景噪声干扰. 综上所述,网络不仅在常规结直肠息肉分割任务中表现突出,在更具挑战性的腺瘤分割任务中同样展现出良好的适应性与泛化能力.

图 6

图 6   锯齿状腺瘤分割结果

Fig.6   Segmentation results of serrated adenoma


3.3. 网络性能主观对比实验

可视化分割结果如图78所示. 为直观评估不同方法的分割质量,原始图像中的病变区域以蓝色方框标注,而分割结果则采用黄色(真阳性)、红色(假阳性)、绿色(假阴性)加以区分,以揭示模型对病灶区域的识别精度与误检情况. 传统CNN方法(U-Net、CaraNet、MEGANet)在大息肉分割上表现稳定,但在小目标检测、复杂背景和多息肉场景下存在边界模糊和漏检(如图7第6列,图8第1列). 其中,CaraNet虽引入注意力机制,但在背景噪声较强时仍易产生假阳性(如图7第7列). 基于Transformer的方法(SSFormer-S、MSRAFormer、PolypPVT)具备较强的全局信息建模能力,但对小目标息肉的边界刻画不足,导致部分息肉区域被错误排除或边缘过度平滑(如图7第8列、图8第7列). SAM2-UNet通过自适应采样增强关键区域关注度,在小目标分割上有所改善,但在复杂背景下仍存在背景干扰(如图7第8列),且在大病灶场景中易出现目标分割不完整(如图7第4列). 相比之下,网络融合PVTv2与Hiera双编码器,结合PVTv2全局信息建模与Hiera层次化局部特征提取,实现对病灶区域更精准地表征. 特征门控融合模块引入通道注意力机制,聚焦关键语义通道,有效抑制冗余信息干扰,增强网络对目标区域的敏感性,显著提升病灶定位的准确性与鲁棒性(如图7第1列、图8第2列). 小波增强特征注入模块利用小波分解拆解融合特征为低频结构和高频边缘,强化边界细节刻画,抑制复杂背景中的噪声和假阳性,提高分割准确性(如图7第4列、图8第4列). 多尺度预测模块结合全局池化与尺度自适应加权策略,引导各层特征融合以适配不同尺度息肉,增强对小目标结构的响应能力,减少因尺寸差异造成的漏检,提升小息肉的分割完整性与稳定性(如图7第2列、图8第7列). 综上所述,网络在全局建模、细节增强与多尺度优化3方面取得突破,在确保高精度分割的同时,具备更强的泛化能力,为医学影像分割任务提供一种精准、高效且适用于复杂场景的解决方案.

图 7

图 7   CVC-ClinicDB和Kvasir数据集上不同网络分割结果

Fig.7   Results of different network segmentations on CVC-ClinicDB and Kvasir datasets


图 8

图 8   ETIS和CVC-ColonDB数据集上不同网络分割结果

Fig.8   Results of different network segmentations on ETIS and CVC-ColonDB datasets


3.4. 消融实验

为量化各模块对网络性能的影响,在CVC-ClinicDB和CVC-ColonDB数据集上开展消融实验,比较6种模型变体. M1~M6分别代表不同编码器和解码器的模块组合. 实验结果如表56所示,最优指标以加粗标注,旨在验证各组件对分割性能的具体贡献.

表 5   各模块在CVC-ClinicDB数据集上的消融结果

Tab.5  Ablation results for each module on CVC-ClinicDB dataset

模型PVTv2Hiera解码器DicemIoUF2
FGFWEFIMSP
M10.9310.8800.934
M20.9170.8610.910
M30.9370.8920.940
M40.9340.8890.941
M50.8830.8320.888
M60.9480.9040.950

新窗口打开| 下载CSV


表 6   各模块在CVC-ColonDB数据集上的消融结果

Tab.6  Ablation results for each module on CVC-ColonDB dataset

模型PVTv2Hiera解码器DicemIoUF2
FGFWEFIMSP
M10.8080.7240.810
M20.7800.6970.782
M30.7940.7130.809
M40.7960.7150.801
M50.7450.6700.746
M60.8180.7350.821

新窗口打开| 下载CSV


消融实验结果表明,FGF模块能够在全局特征学习过程中有效筛选关键语义信息,结合局部特征的细粒度解析能力,构建全局与局部特征的高效互补机制,从而提升网络对病灶区域的定位准确性,带来mIoU与Dice指标的稳定提升;WEFI模块进一步优化特征表征能力,该模块能够分离低频背景特征与高频纹理特征,提升网络对不同尺度信息的感知能力,从而有效抑制噪声、增强纹理细节,最终提升F2得分;MSP模块通过对不同层级特征进行通道筛选和高效融合,提升多尺度信息融合精度与效率,增强对小尺寸与复杂形态息肉结构响应能力,使得Dice相似系数得到提升;引入双编码器结构不仅显著提升全局语义建模能力,还能保持高级语义信息的高效利用,进一步强化网络对复杂病变形态的表达能力. 综合消融实验结果可见,所设计的编码-解码结构在分割精度、特征表征能力及跨数据集泛化表现方面均展现出优越性能,为结直肠息肉分割任务提供一种更为高效且稳定的解决方案.

Grad-CAM(gradient-weighted class activation mapping)生成的可视化结果如图9所示. 从热力图分布可以观察到,网络能够精准关注息肉区域,并在不同测试样本上展现出一致且稳定的激活模式,充分证明其卓越的特征提取能力与空间表征能力. 具体而言,PVTv2编码器凭借其渐进式窗口注意力机制和多尺度特征提取能力,使得网络能够捕捉丰富的全局语义信息,确保对低对比度或背景复杂的息肉区域仍能保持较高的感知能力;Hiera编码器通过层次化特征提取结构增强局部细节建模能力,进一步弥补传统Transformer结构对局部信息敏感度不足的问题,使得模型在息肉边缘区域响应更为精细;FGF通过特征门控机制实现全局与局部特征的高效互补,有效提升目标区域响应一致性和显著性,增强网络定位能力;WEFI模块通过小波变换增强低频结构特征与高频纹理信息的互补关系,使得在息肉边缘区域响应更加锐利,进一步提升边界感知能力并有效抑制伪影干扰;MSP模块利用多尺度预测机制增强对不同空间尺度息肉结构的适应性,尤其在小尺寸息肉区域仍能维持良好的激活表现. 综合而言,Grad-CAM可视化分析充分证明网络在结直肠息肉分割任务中的精准性,同时进一步佐证各模块在增强网络表征能力、提高分割精度及泛化性方面的关键作用.

图 9

图 9   消融实验Grad-CAM图

Fig.9   Grad-CAM plot of ablation experiment


为评估各模块在临床部署场景下的可行性,进一步对FGF、WEFI和MSP参数量、计算复杂度与平均单张图像推理时间进行统计,如表7所示. 其中,FGF、WEFI和MSP分别仅引入0.151、0.037 与0.001 M参数,对整体模型体积影响极小;对应的GFLOPs分别为0.008、0.379与0.002,均处于较低水平;三者平均推理延迟均低于4 ms(分别为3.98 ms、2.17 ms与2.01 ms),表明所设计模块在保持分割精度提升的同时具备良好的计算效率与实用性,不会对临床实时性应用构成负担.

表 7   模块计算开销与推理延迟

Tab.7  Module cost and inference latency

模块参数量/106计算量推理时间/ms
FGF0.1510.0083.98
WEFI0.0370.3792.17
MSP0.0010.0022.01

新窗口打开| 下载CSV


4. 结 语

本研究提出特征门控融合与小波增强的双编码器息肉分割网络,能够精准识别息肉区域并优化分割边界,有效提升检测准确性与泛化性. 网络采用PVTv2与Hiera双Transformer编码器,分别建模全局上下文与局部细节信息,增强息肉区域的特征表达能力. FGF模块通过通道注意力机制实现全局与局部特征的高效互补,强化区域定位. WEFI模块利用小波分解以提取多频特征,有效增强边界刻画并抑制背景干扰. MSP模块结合全局池化与自适应加权策略,实现多尺度特征的动态融合,增强对不同形态小息肉的感知能力. 在Kvasir和CVC-ClinicDB数据集上,所提网络在精准率(0.955和0.948)与召回率(0.923和0.952)方面均优于现有方法,展现出良好的分割精度和边界响应能力. 在CVC-ColonDB与ETIS数据集上的实验进一步验证了该网络在小息肉识别任务中依然能维持高精度与稳定性,表现出一定程度的鲁棒性和良好的泛化能力. 综上所述,提出的网络为结直肠息肉的自动化精准分割提供了高效可靠的解决方案,具备良好的临床应用潜力.

参考文献

ZHAI C, YANG L, LIU Y, et al

DBMA-Net: a dual-branch multiattention network for polyp segmentation

[J]. IEEE Transactions on Instrumentation and Measurement, 2024, 73: 1- 16

[本文引用: 1]

GOCERI E

Polyp segmentation using a hybrid vision transformer and a hybrid loss function

[J]. Journal of Imaging Informatics in Medicine, 2024, 37 (2): 851- 863

[本文引用: 1]

XIAO B, HU J, LI W, et al

CTNet: contrastive transformer network for polyp segmentation

[J]. IEEE Transactions on Cybernetics, 2024, 54 (9): 5040- 5053

[本文引用: 1]

顾正宇, 赖菲菲, 耿辰, 等

基于知识引导的缺血性脑卒中梗死区分割方法

[J]. 浙江大学学报: 工学版, 2025, 59 (4): 814- 820

[本文引用: 1]

GU Zhengyu, LAI Feifei, GENG Chen, et al

Knowledge-guided infarct segmentation of ischemic stroke

[J]. Journal of Zhejiang University: Engineering Science, 2025, 59 (4): 814- 820

[本文引用: 1]

谭婷芳, 蔡万源, 蒋俊正

稀疏分解和图拉普拉斯正则化的图像前景背景分割方法

[J]. 浙江大学学报: 工学版, 2024, 58 (5): 979- 987

[本文引用: 1]

TAN Tingfang, CAI Wanyuan, JIANG Junzheng

Image foreground–background segmentation method based on sparse decomposition and graph Laplacian regularization

[J]. Journal of Zhejiang University: Engineering Science, 2024, 58 (5): 979- 987

[本文引用: 1]

ZHOU L, LIANG L, SHENG X

GA-Net: ghost convolution adaptive fusion skin lesion segmentation network

[J]. Computers in Biology and Medicine, 2023, 164: 107273

[本文引用: 1]

QAYOOM A, XIE J, ALI H

Polyp segmentation in medical imaging: challenges, approaches and future directions

[J]. Artificial Intelligence Review, 2025, 58 (6): 169

HU K, CHEN W, SUN Y Z, et al

PPNet: pyramid pooling based network for polyp segmentation

[J]. Computers in Biology and Medicine, 2023, 160: 107028

SHAO H, ZHANG Y, HOU Q. Polyper: boundary sensitive polyp segmentation [EB/OL]. (2023–12–14)[2025–03–09]. https://arxiv.org/abs/2312.08735.

[本文引用: 1]

YUE G, HAN W, JIANG B, et al

Boundary constraint network with cross layer feature integration for polyp segmentation

[J]. IEEE Journal of Biomedical and Health Informatics, 2022, 26 (8): 4090- 4099

[本文引用: 1]

YUE G, ZHUO G, YAN W, et al

Boundary uncertainty aware network for automated polyp segmentation

[J]. Neural Networks, 2024, 170: 390- 404

[本文引用: 1]

TRINH Q H. Meta-polyp: a baseline for efficient polyp segmentation [C]// 2023 IEEE 36th International Symposium on Computer-Based Medical Systems (CBMS). [S.l.]: IEEE, 2023: 742–747.

[本文引用: 1]

JIN Y, HU Y, JIANG Z, et al

Polyp segmentation with convolutional MLP

[J]. The Visual Computer, 2023, 39 (10): 4819- 4837

[本文引用: 1]

RATHEESH A, SOMAN P, NAIR M R, et al. Advanced algorithm for polyp detection using depth segmentation in colon endoscopy [C]// 2016 International Conference on Communication Systems and Networks (ComNet). [S.l.]: IEEE, 2016: 179–183.

[本文引用: 1]

WU H, ZHAO Z, ZHONG J, et al

PolypSeg+: a lightweight context-aware network for real-time polyp segmentation

[J]. IEEE Transactions on Cybernetics, 2022, 53 (4): 2610- 2621

[本文引用: 1]

RONNEBERGER O, FISCHER P, BROX T. U-Net: convolutional networks for biomedical image segmentation [C]// Medical Image Computing and Computer-Assisted Intervention–MICCAI 2015. [S.l.]: Springer, 2015: 234–241.

[本文引用: 2]

LIN T Y, DOLLÁR P, GIRSHICK R, et al. Feature pyramid networks for object detection [C]// 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Honolulu: IEEE, 2017: 936–944.

[本文引用: 1]

GUO P, LIU G, LIU H

TMPSformer: an efficient hybrid Transformer-MLP network for polyp segmentation

[J]. Mobile Networks and Applications, 2024, 29 (4): 1378- 1392

[本文引用: 1]

JAIN S, ATALE R, GUPTA A, et al

CoInNet: a convolution-involution network with a novel statistical attention for automatic polyp segmentation

[J]. IEEE Transactions on Medical Imaging, 2023, 42 (12): 3987- 4000

[本文引用: 1]

ZHOU T, ZHANG Y, CHEN G, et al

Edge-aware feature aggregation network for polyp segmentation

[J]. Machine Intelligence Research, 2025, 22 (1): 101- 116

[本文引用: 1]

YIN X, ZENG J, HOU T, et al

RSAFormer: a method of polyp segmentation with region self-attention transformer

[J]. Computers in Biology and Medicine, 2024, 172: 108268

[本文引用: 1]

WANG J, HUANG Q, TANG F, et al. Stepwise feature fusion: local guides global [C]// International Conference on Medical Image Computing and Computer-Assisted Intervention. Cham: Springer, 2022: 110–120.

[本文引用: 1]

LI W, XIONG X, LI S, et al

Hybridvps: hybrid-supervised video polyp segmentation under low-cost labels

[J]. IEEE Signal Processing Letters, 2023, 31: 111- 115

[本文引用: 1]

WANG W, XIE E, LI X, et al

PVT v2: improved baselines with pyramid vision transformer

[J]. Computational Visual Media, 2022, 8 (3): 415- 424

[本文引用: 2]

XIONG X, WU Z, TAN S, et al. SAM2-UNet: segment anything 2 makes strong encoder for natural and medical image segmentation [EB/OL]. (2024–08–16)[2025–03–09]. https://arxiv.org/abs/2408.08870.

[本文引用: 2]

HUANG Z, XIE F, QING W, et al

MGF-net: multi-channel group fusion enhancing boundary attention for polyp segmentation

[J]. Medical Physics, 2024, 51 (1): 407- 418

[本文引用: 1]

FINDER S E, AMOYAL R, TREISTER E, et al. Wavelet convolutions for large receptive fields [C]// European Conference on Computer Vision. Cham: Springer, 2024: 363–380.

[本文引用: 2]

GUAN X, ZHOU J, CHEN J, et al

EMFF-Net: edge-enhancement multi-scale feature fusion network

[J]. IEEE Access, 2025, 13: 25598- 25611

[本文引用: 1]

梁礼明, 何安军, 李仁杰, 等

跨尺度跨维度的自适应Transformer网络应用于结直肠息肉分割

[J]. 光学精密工程, 2023, 31 (18): 2700- 2712

[本文引用: 1]

LIANG Liming, HE Anjun, LI Renjie, et al

Application of adaptive Transformer network to colorectal polyp segmentation at scales and dimensions

[J]. Optics and Precision Engineering, 2023, 31 (18): 2700- 2712

[本文引用: 1]

LOU A G, GUAN S Y, KO H, et al. CaraNet: context axial reverse attention network for segmentation of small medical objects [EB/OL]. (2022–01–13)[2025–12–22]. https://arxiv.org/abs/2108.07368.

[本文引用: 1]

BUI N T, HOANG D H, NGUYEN Q T, et al. MEGANet: multi-scale edge-guided attention network for weak boundary polyp segmentation [EB/OL]. (2023–11–05)[2025–03–09]. https://arxiv.org/abs/2309.03329.

[本文引用: 1]

SHI W T, XU J, GAO P. Ssformer: a lightweight transformer for semantic segmentation [EB/OL]. (2022–08–03)[2025–12–22]. https://arxiv.org/abs/2309.03329.

[本文引用: 1]

WU C, LONG C, LI S, et al

MSRAformer: multiscale spatial reverse attention network for polyp segmentation

[J]. Computers in Biology and Medicine, 2022, 151: 106274

[本文引用: 1]

/