浙江大学学报(工学版), 2026, 60(9): 1942-1952 doi: 10.3785/j.issn.1008-973X.2026.09.011

计算机技术、自动控制技术

联合正交特征融合与大核可分离注意力的道路分割算法

汤毅杰,, 钟铭恩,, 袁彬淦, 范康, 谭佳威, 林志强

1. 厦门理工学院 机械与汽车工程学院,福建省客车先进设计与制造重点实验室,福建 厦门 361024

2. 清华大学 工程物理系,北京 100084

3. 厦门大学 航空航天学院,福建 厦门 361005

Road segmentation algorithm based on joint orthogonal feature fusion and large kernel separable attention

TANG Yijie,, ZHONG Mingen,, YUAN Bingan, FAN Kang, TAN Jiawei, LIN Zhiqiang

1. Key Laboratory of Advanced Design and Manufacturing for Buses in Fujian Province, School of Mechanical and Automotive Engineering, Xiamen University of Technology, Xiamen 361024, China

2. Department of Engineering Physics, Tsinghua University, Beijing 100084, China

3. School of Aerospace Engineering, Xiamen University, Xiamen 361005, China

通讯作者: 钟铭恩,男,教授. orcid.org/0000-0003-0775-7850. E-mail: zhongmingen@xmut.edu.cn

收稿日期: 2025-08-6  

基金资助: 福建省自然科学基金资助项目(2023J011439).

Received: 2025-08-6  

Fund supported: 福建省自然科学基金资助项目(2023J011439).

作者简介 About authors

汤毅杰(2000—),男,硕士生,从事机器视觉和智慧交通研究.orcid.org/0009-0008-6120-4484.E-mail:2421011030@stu.xmut.edu.cn , E-mail:2421011030@stu.xmut.edu.cn

摘要

针对航拍图像中的道路结构模糊、边缘不连贯等特点,提出轻量级道路分割算法ARSNet. 设计正交特征融合模块(OFFM),实现不同方向图像特征间的交互与增强. 构建上下文特征引导聚合模块,提升算法在道路边缘拓扑结构提取时的连贯性. 在特征空间池化操作中引入大核可分离注意力,加强对各种尺度和方向上的道路特征的协同感知能力. 基于神经网络权重幅值进行层自适应稀疏剪枝,将算法参数量降低到22.5×106,FLOPs控制在14.8×109. 在公开数据集Massachusetts与DeepGlobe上的实验结果表明,所提算法的道路分割精确度分别为78.12%和79.78%,召回率为79.63%和81.63%,像素交并比为64.85%和67.88%,平均路径长度相似度达到74.95%和75.53%. ARSNet在保持较高精度的前提下,推理速度达到178帧/s,整体性能优于所对比的主流算法.

关键词: 航拍图像 ; 道路分割 ; 正交特征融合 ; 上下文特征引导聚合 ; 大核可分离注意力 ; 模型剪枝

Abstract

A lightweight road segmentation algorithm for aerial imagery, termed ARSNet, was proposed to address the issue that roads in aerial images often suffer from structural ambiguity and discontinuous edges. An orthogonal feature fusion module (OFFM) was designed to achieve interaction and enhancement among features in different orientations. A context-guided feature aggregation module (C2f-CGA) was introduced to improve the continuity of road boundary and topological structure extraction. Large-kernel separable attention was introduced into the feature spatial pooling module in order to strengthen the collaborative perception of road features across various scales and directions. A layer-adaptive sparse pruning strategy based on weight magnitude was employed to reduce the number of parameters to 22.5×106 with FLOPs controlled at 14.8×109. Experiments conducted on the public Massachusetts and DeepGlobe datasets showed that ARSNet achieved precision of 78.12% and 79.78%, recall of 79.63% and 81.63%, intersection-over-union of 64.85% and 67.88%, and average path length similarity of 74.95% and 75.53%, respectively. ARSNet achieved an inference speed of 178 frames per second while maintaining high accuracy, consistently outperforming a series of state-of-the-art algorithms.

Keywords: aerial imagery ; road segmentation ; orthogonal feature fusion ; context feature-guided aggregation ; large kernel separable attention ; model pruning

PDF (1960KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

汤毅杰, 钟铭恩, 袁彬淦, 范康, 谭佳威, 林志强. 联合正交特征融合与大核可分离注意力的道路分割算法. 浙江大学学报(工学版)[J], 2026, 60(9): 1942-1952 doi:10.3785/j.issn.1008-973X.2026.09.011

TANG Yijie, ZHONG Mingen, YUAN Bingan, FAN Kang, TAN Jiawei, LIN Zhiqiang. Road segmentation algorithm based on joint orthogonal feature fusion and large kernel separable attention. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1942-1952 doi:10.3785/j.issn.1008-973X.2026.09.011

随着航拍图像智能感知技术在遥感领域的广泛应用,借助无人机在复杂城市环境中高效、精准地提取道路信息成为重要技术方案,对于提升道路资源管理效率、支持自动驾驶决策等都具有重要意义. 然而,由于航拍视角和拍摄高度的多变性,航拍图像中道路细节模糊、对比度较低,且易产生遮挡区域. 这些因素易导致道路图像分割结果呈现出细节缺失、结构连续性不佳的现象,从而引发误分割、漏分割等问题,尤其体现在狭窄道路分割任务上. 考虑到无人机的存储和计算资源相对有限,如何在实现道路高精度分割的同时尽可能减少算法对硬件资源的需求是值得深入研究的现实问题.

近年来,深度学习技术的快速发展为无人机航拍图像中的道路分割提供了新的技术路径. 已有工作围绕轻量化网络设计、拓扑结构约束和细节特征增强等方面开展探索. 例如,Qi等[1]提出的DSCNet通过引入简洁高效的拓扑约束模块,实现轻量化的神经网络结构. 王艳军等[2]提出基于DeeplabV3+框架进行改进的CAS-DeepNet,结合拓扑关联特征约束,引入边缘增强模块与重构的CS-ASPP结构,在多数城乡道路的分割任务中取得了良好表现. Dey等[3]提出UnetEdge,通过在解码器中融合边缘拓扑信息与空间上下文,并利用迁移学习整合多样化的道路形态特征,提升了对图像中遮挡区域的道路提取能力. Li等[4]提出的LCMorph则通过结合频率感知与形态感知机制,提高了在低对比度航拍图像中狭窄道路的提取精度. 尽管这些算法在道路结构完整性、细节提取等方面表现优异,且普遍优于NL-LinkNet[5]、SDUNet[6]等经典方法,但仍存在一些不足. 例如,DSCNet在低对比度区域分割精度有待提升;CAS-DeepNet的主干部分基于MobileNetV2构建,但整体结构依旧复杂,训练耗时较长,且边缘增强模块对城市区域中边界清晰的道路表现较优,却在部分边界模糊的农村场景中,边缘提取效果不够理想;UnetEdge在狭窄道路的结构连贯性方面仍有提升空间;LCMorph模型复杂度较高,不利于移动端部署. 可见,相关算法虽在不同方面有所突破,但在分割精度、结构连续性和模型复杂度之间仍难以兼顾.

针对上述问题,提出面向航拍图像的轻量化道路分割算法ARSNet,引入正交特征融合模块(orthogonal feature fusion module, OFFM)、上下文特征引导聚合模块(context-guided feature aggregation module, C2f-CGA)、大核可分离注意力空间池化模块(large separable kernel attention spatial pooling module, LSKASPM),以提升复杂背景下道路分割的精度与连贯性,同时满足轻量化部署需求. 结合基于神经网络权重幅值的层自适应稀疏剪枝技术(layer adaptive sparsity for magnitude-based pruning, LAMP)对网络结构进行优化[7]. 在公开数据集Massachusetts和DeepGlobe上验证所提出算法的性能.

1. 算法设计

1.1. 整体结构

ARSNet的整体框架如图1所示,主要由编码器、特征增强结构和解码器3部分构成. 编码器采用Encoder Block模块实现逐层下采样. 该模块引入残差结构[8-9],主分支在卷积操作后接入批归一化(batch normalization, BN)操作和ReLU激活函数,增强特征提取的非线性表达能力,在压缩空间维度的同时,最大程度地保留道路细节的语义信息,为后续的特征增强与解码过程提供更加丰富和高质量的特征表达. 解码器部分采用Decoder Block模块进行逐步上采样. 该模块通过融合转置卷积和残差连接机制,增强语义信息在上采样过程中的传递与重建能力,提升解码器对空间结构的还原精度. 在特征增强结构中,包含3大创新模块:正交特征融合模块OFFM用来提升在低对比度区域的语义感知能力;上下文特征引导聚合模块C2f-CGA用来增强对道路边缘连续性与拓扑结构的保持能力;大核可分离注意力空间池化模块LSKASPM用来进一步加强算法模型对道路细节特征的感知与表征能力. 这些模块在解码器融合过程中发挥关键作用,对编码器特征进行逐层增强,使其在与解码器的上采样输出特征融合时,能够提供更丰富、更可靠的语义与结构信息.

图 1

图 1   ARSNet整体结构

Fig.1   Overall structure of ARSNet


具体而言,解码器上一级输出首先经过上采样操作恢复空间分辨率,然后与编码器对应层经过特征增强后的特征图融合. F1~F4仅采用OFFM进行编码器特征增强,随后与解码器上采样输出进行加权融合,并通过注意力机制调节通道和空间位置的重要性,实现多尺度信息整合. F5采用正交特征增强融合模块(orthogonal context enhancement fusion module, OCEFM)进行特征深度增强. OCEFM模块遵循“先增强结构,再聚合上下文”的串行精炼策略:首先利用OFFM提取正交特征,强化低对比度区域语义;随后通过2层C2f-CGA提升道路边缘连续性及拓扑结构保持能力;接着使用3×3卷积整合特征并消除冗余;最后通过LSKASPM强化大感受野下的道路细节表征. 从而实现从低对比度感知、结构连续性保持到细节强化的层次化协同增强.

使用1个1×1卷积层将解码器输出的特征图映射为单通道的预测图,并利用Sigmoid激活函数获取二值化分割结果. 其他通用模块如卷积操作和激活函数借鉴文献[10]. C2f模块通过分支结构与跨层连接实现高效特征聚合,在兼顾计算效率的同时增强特征表达. 本研究仅借鉴C2f模块的核心思想,细节不再赘述.

1.2. 正交特征融合模块OFFM

注意力机制使算法模型能够更关注于任务相关特征信息. 传统做法是直接将图像特征输入自注意力机制中,导致在建模双向空间特征能力方面稍显不足. 针对该问题,提出正交特征融合模块OFFM,分别在水平与垂直2个方向上并行计算二者的交叉注意力[11]来显式建立多维空间特征之间的关联,从而有效建模道路的长距离连续性与边界方向性,并抑制非道路区域的干扰信息. 进一步地,OFFM通过正交方向的上下文交互,使低对比度区域能够借助相邻方向上判别性更强的特征建立长程依赖,提升弱纹理区域的语义表达. OFFM的具体结构如图2所示.详细工作过程如下.

图 2

图 2   正交特征融合模块结构图

Fig.2   Schematic diagram of orthogonal feature fusion module


1)对输入特征图FRH×W×C在高度方向上进行最大池化,生成水平池化特征FhR1×W×C,用来捕捉水平方向的道路边界特征;同时在宽度方向上进行最大池化,生成垂直池化特征FwRH×1×C,用以保留垂直方向的道路延伸信息.

2)将FhFw分别沿空间维度展平为RN×CRM×C,其中N=1×WM=1×H. 通过独立的线性投影分别生成QhKhVhRN×dQwKwVwRM×d,进行水平与垂直方向的相关性权重矩阵Wh→wRM×NWw→hRN×M的计算:

$ {{\boldsymbol{W}}_{{{\mathrm{h}}} \to {{\mathrm{w}}}}} = {{\mathrm{softmax}}}\;({{\boldsymbol{Q}}_{{\mathrm{w}}}} \times {\boldsymbol{K}}_{{\mathrm{h}}}^{{\mathrm{T}}}/\sqrt d ), $

$ {{\boldsymbol{W}}_{{{\mathrm{w}}} \to {{\mathrm{h}}}}} = {{\mathrm{softmax}}}\;({{\boldsymbol{Q}}_{{\mathrm{h}}}} \times {\boldsymbol{K}}_{{\mathrm{w}}}^{{\mathrm{T}}}/\sqrt d ). $

据此得到水平注意力特征F1RM×d和垂直注意力特征F2RN×d

$ {{\boldsymbol{F}}_{1}} = {{\boldsymbol{W}}_{{{\mathrm{h}}} \to {{\mathrm{w}}}}} \times {{\boldsymbol{V}}_{{\mathrm{h}}}}, $

$ {{\boldsymbol{F}}_2} = {{\boldsymbol{W}}_{{{\mathrm{w}}} \to {{\mathrm{h}}}}} \times {{\boldsymbol{V}}_{{\mathrm{w}}}}. $

式中:$ \sqrt d $为缩放因子,用于缓解随维度增大导致的内积幅度过大问题;softmax为归一化函数,其结果即为注意力权重矩阵Wh→wWw→h,二者分别表征水平方向与垂直方向特征之间的相关性强弱,权重值越大意味着对应特征在跨方向交互中贡献度越高.

3)将F1F2分别与经过卷积归一化的FwFh进行残差连接,生成增强特征G1RM×dG2RN×d,并进一步相乘融合,以建模水平与垂直方向特征的协同依赖关系.

4)利用1×1卷积对融合结果进行通道压缩与重构,得到输出特征FoutRH×W×C,保证其与输入特征通道数一致.

综上可知,OFFM分别在垂直方向和水平方向构建注意力,实现了跨方向特征的交互与协同增强. 借助多方向特征的互补建模,OFFM在低对比度区域能够有效强化语义信息表达,并提升弱纹理区域的特征判别能力,从而增强模型对道路目标的整体表征性能.

1.3. 上下文特征引导聚合模块C2f-CGA

为改善航拍图像中由建筑阴影、植被覆盖等复杂背景引起的道路分割结果拓扑结构连续性不足及狭窄道路分割误差较大的问题,设计C2f-CGA,具体结构如图3所示.

图 3

图 3   上下文特征引导聚合模块结构图

Fig.3   Schematic diagram of context-guided aggregation module


该模块以特征层F5经OFFM模块处理后得到的特征Fout为输入特征,通过由卷积Conv、BN和SiLU激活函数组成的CBS模块进行特征提取与归一化,然后经Split操作将特征划分为多支路. 主干部分串联3个CGA Block,以实现不同层次梯度特征的提取与融合. CGA Block核心组成为CGA Module. 该模块首先通过3×3可变形卷积(deformable convolution, DeConv)自适应调整动态感受野来捕捉不同尺度目标的局部特征,并利用21×21大核深度可分离卷积(depthwise separable convolution, DWConv)扩展感受野以捕捉更广泛的上下文特征. 将这2种特征在通道维度上进行拼接,并通过BN层和SiLU激活函数进行处理,同时引入压缩与激励(squeeze and excitation, SE)模块以建模通道间的依赖关系,从而增强有效特征的表达能力. 最后通过全局平均池化(global average pooling, GAP)和全连接层(fully connected layer, FC)提取全局上下文特征,生成特定权重向量来对局部特征与上下文特征进行加权融合. C2f-CGA结构能保留更多梯度信息,通过建立局部特征信息与周围上下文信息的联系,有效关联小尺度道路细节与整体结构,提高算法模型对道路形态结构完整性的建模能力,提升狭窄道路图像的分割精度.

1.4. 大核可分离注意力空间池化模块LSKASPM

为了适应航拍视角和拍摄高度的多变性,常采用空间池化(spatial pyramid pooling fast, SPPF)[12]策略来捕获不同尺度的上下文信息,提升算法对目标尺寸变化的鲁棒性. 然而,传统SPPF依赖3个连续5×5最大池化操作进行特征聚合,感受野范围有限,难以有效建模远距离像素间的全局语义关系,并且在应对航拍图像中常见的角度变化、几何形变及透视失真方面存在明显不足. 为了克服这些问题,在SPPF的基础上设计LSKASPM,具体结构如图4所示.该模块核心为2个级联的大核可分离注意力(large separable kernel attention, LSKA)[13]. LSKA通过组合大核深度可分离卷积DWConv与大核深度可分离扩张卷积(depthwise separable dilated convolution, DW-D-Conv)[13]来实现高效全局建模,并将二维卷积核分解为水平方向和垂直方向的2组一维卷积核,即DWConv(1×(2d−1))与DWConv((2d−1)×1)、DW-D-Conv(1×(k/d))与DW-D-Conv((k/d)×1). 其中,膨胀率d=2,卷积核尺寸k=11. 该取值参考文献[13]中的经验配置,并结合航拍场景中道路目标的细长结构特征与跨尺度分布需求加以确定. 此配置能够在保证足够大感受野、有效捕捉长距离上下文关系的同时,将计算复杂度控制在合理范围.

图 4

图 4   大核可分离注意力空间池化模块结构图

Fig.4   Schematic diagram of large separable kernel attention spatial pooling module


在此基础上,LSKASPM通过多分支结构与方向分解卷积,捕捉多尺度和多方向的上下文信息,对由几何形变和透视失真引起的特征偏移具有较强的适应性. 与此同时,由级联LSKA生成的全局注意力在权重分配时自适应强化结构稳定的道路特征,并作为引导对各分支特征进行选择性增强,从而保留与道路连通性一致的细节结构,并在一定程度上削弱局部畸变的干扰. 在对各分支输出的多尺度、多方向特征进行融合后,引入轻量级通道注意力机制(efficient channel attention, ECA)[14],利用局部一维卷积建模通道间依赖,有效突出与道路边界和细节相关的特征通道. 由此,LSKASPM在捕捉长距离上下文依赖的同时,与局部细节表征形成互补,提升了模型在道路目标细节表征上的敏感性与整体鲁棒性.

2. 实验与分析

2.1. 数据集

选用2个主流的无人机航拍道路公开数据集Massachusetts[15]和DeepGlobe[16]对算法进行性能测试. Massachusetts数据集是高质量的航空影像道路数据集,包含1 171张图像,覆盖马萨诸塞州的城市、郊区和农村地区. 原始图像的分辨率为1 m,尺寸为1 500×1 500像素. 按照官方划分为1 108张训练集、14张验证集和49张测试集. DeepGlobe道路数据集来源于2018年DeepGlobe道路提取挑战赛,包含来自泰国、印度和印度尼西亚的多种场景. 该数据集包括6 226张带标签的遥感图像,每张图像分辨率为0.5 m,尺寸为1 024×1 024像素,涵盖城市、农村、郊区、海滨及热带雨林等区域. 由于该数据集仅提供训练集标签,将其中4 358张用于训练,1 245张用于验证,623张用于测试.

2.2. 实验平台与参数设置

实验主机采用Intel Core i7-14700KF CPU和NVIDIA GeForce RTX 4090显卡,运行的操作系统为64位Windows11. 算法开发环境采用Python 3.11.7和PyTorch 2.1.2深度学习框架. 模型训练时采用SGD优化器,初始学习率设置为0.01,权重衰减率设置为5×10−4,学习率衰减策略选择线性衰减,批处理大小为4,线程数为2,最大训练轮次为300. 所有图像均缩放至512×512像素,并通过随机缩放、翻转、扭曲及颜色、饱和度和亮度调整进行增强. 为避免过拟合,引入早停策略:若验证损失在连续10个epoch内下降幅度小于1×10−4,则提前终止训练并回退至最佳权重. 在训练与验证中,采用二元交叉熵(binary cross entropy, BCE)与Dice损失的加权组合作为优化目标,其中权重设为0.4与0.6,以兼顾像素精度与细长道路连通性;在推理阶段,输出经Sigmoid激活函数转换为概率图,并统一以0.5作为阈值进行二值化,得到最终的道路提取结果.

2.3. 评价指标

2.3.1. 基于像素的评价指标

为评估不同道路提取方法的性能,采用精确度P(precision)、召回率R(recall)与交并比IoU (intersection over union)来计算不同道路提取模型的定量实验结果.

$ {P}{\text{ = }}\frac{{{\text{TP}}}}{{{\text{TP+FP}}}}, $

$ {R}{\text{ = }}\frac{{{\text{TP}}}}{{{\text{TP+FN}}}}, $

$ {\text{IoU = }}\frac{{{\text{TP}}}}{{{\text{TP+FP+FN}}}}. $

式中:P评估阳性预测的准确度,R量化正确识别的真阳性比例,IoU用来衡量预测与地面实况之间的重叠度,TP(true positive)为真阳性目标数,FP(false positive)为假阳性目标数,FN(false negative)为假阴性目标数.

2.3.2. 基于图的评价指标

实验使用平均路径长度相似度(average path length similarity, APLS)[17]来评估道路的拓扑正确性和连通性,计算公式为

$ \mathrm{APLS}=1-\frac{1}{N} \sum_{i=1}^N \min \left\{1, \frac{\left|L\left(a_i, b_i\right)-L\left(a_i^{\prime}, b_i^{\prime}\right)\right|}{L\left(a_i, b_i\right)}\right\} . $

式中:aibi为标签中可以经过道路到达的2个点,N为所有可能的路径数量,L(aibi)为路径(aibi)的长度,节点ai′和bi′分别为预测图中最接近aibi位置的点。

2.4. 与同类算法的性能对比实验

选取当前公开的算法作为实验对比对象,结果如表1所示. 结果表明:1)在Massachusetts和DeepGlobe这2个数据集上,ARSNet在R、IoU和APLS这3项核心指标上均取得最优表现. 其中,Massachusetts数据集上的R、IoU和APLS分别为79.63%、64.85%和74.95%;DeepGlobe数据集上分别为81.63%、67.88%和75.53%,显示出该模型在不同场景下对道路结构的精准建模与拓扑保持能力. 尽管P略低于RoadExNet和OARENet,但在2个数据集上分别达到78.12%和79.78%,整体性能更加均衡. 与表现突出的LightFormer算法相比,ARSNet在4项评价指标上均实现提升:在Massachusetts数据集上,PR、IoU和APLS分别提高0.60%、0.98%、0.64%和1.04%;在DeepGlobe数据集上,提升幅度分别为0.92%、0.30%、1.09%和1.11%. 特别是在IoU和APLS上的优势,进一步验证了ARSNet在复杂背景下的边界建模能力与拓扑连通性保持能力. 2)从模型复杂度来看,ARSNet的参数量为22.5×106,仅高于DSCNet的4.5×106、FRCFNet的12.3×106、LightFormer的13.7×106和UNetMamba的14.8×106,低于大多数主流方法,展现出较好的轻量化特性. ARSNet的FLOPs为14.8×109,在所有对比方法中最优,明显小于OARENet的99.9×109和LCMorph的294.6×109,同时低于LightFormer的23.9×109,计算开销更为经济. 在推理效率方面,ARSNet达到178帧/s,虽略低于211帧/s的DSCNet,但高于166帧/s的FRCFNet、169帧/s的CFRNet、171帧/s的UNetMamba以及172帧/s的LightFormer. 综合来看,ARSNet在保证分割精度最优的同时,实现了参数规模、计算量与推理速度的有效平衡,具备在无人机等资源受限平台上实时部署的可行性.

表 1   不同算法的性能对比结果

Tab.1  Performance comparison results of different algorithms

算法名称Massachusetts数据集DeepGlobe数据集参数量/106FLOPs/109FPS/(帧∙s−1)
P/%R/%IoU/%APLS/%P/%R/%IoU/%APLS/%
U-Net[18]77.2972.1359.4666.8473.2070.1059.0665.3726.4223.9158
SegNet[19]72.7977.4160.1166.9779.8475.9263.7965.6929.5170.5133
Deeplabv3+[20]75.4777.9762.2567.7678.2076.2462.3365.8654.783.293
D-LinkNet[21]74.5778.8561.7567.9873.5081.3863.3666.0531.133.6145
SDUNet77.5674.5761.3468.0578.4080.4365.9167.8480.2353.350
DSCNet75.8377.4762.2270.1877.0375.9162.7670.594.540.4211
RoadExNet[22]82.4672.8963.1068.8677.7677.1463.5169.3531.133.8138
OARENet[23]77.7975.2361.9667.0579.8876.7064.0469.8471.399.964
FRCFNet[24]76.5976.8463.4767.3477.4878.7365.0967.1112.337.8166
CFRNet[25]77.6377.0663.7772.2978.9378.8966.2871.5136.635.7169
UNetMamba[26]77.0778.3463.8973.1578.4379.3866.2272.2814.825.1171
LCMorph76.9378.5163.5578.5181.0266.3071.9294.6
LightFormer[27]77.5278.6564.2173.9178.8681.3366.7974.4213.723.9172
ARSNet(ours)78.1279.6364.8574.9579.7881.6367.8875.5322.514.8178

新窗口打开| 下载CSV


为进一步验证本研究方法在典型航拍场景下的道路分割性能,图56分别展示了ARSNet与现有主流方法在多种复杂环境下的分割可视化结果. 对比内容主要涵盖道路结构的连通性、边界清晰度及细节保留能力,从视觉层面对前述定量分析结果进行补充与印证.

图 5

图 5   不同算法在Massachusetts数据集上的分割结果对比

Fig.5   Comparison of segmentation results of different algorithms on Massachusetts dataset


图 6

图 6   不同算法在DeepGlobe数据集上的分割结果对比

Fig.6   Comparison of segmentation results of different algorithms on DeepGlobe dataset


图5结果表明:样例(a)为城市中心密集路网场景,道路结构繁复,目标尺度小且边界模糊. 对比发现,ARSNet相较于其他算法能更好地保持道路之间的连通性与边界完整性,呈现出较强的细节还原与结构保持能力. 样例(b)对应的是城市边缘的复杂背景区域,道路常被建筑阴影与植被等非道路目标遮挡,造成分割干扰. 对比结果显示,ARSNet能够更准确地提取被遮挡的道路结构,有效抑制误分割. 样例(c)为农村低对比度场景,道路与背景之间的亮度和纹理差异较小,容易被植被、土地区块等干扰信息掩盖. 即便在此类条件下,ARSNet依然能够清晰刻画道路轮廓,保持整体结构的完整性,展现出优异的抗干扰性与复杂场景适应性.

图6结果表明:样例(a)为城镇混合区域,存在较多断裂、狭窄道路以及局部遮挡. 与其他算法相比,ARSNet更好地保持了道路的连贯性与形态完整性,尤其在狭窄道路结构的还原上表现更加精准. 样例(b)对应的是典型的郊区与农业耕地混合场景,该区域背景纹理复杂,包含大量田块边界、植被分布和非道路线状结构. 可以观察到,ARSNet能有效区分道路与背景纹理,明显减少误分割、漏分割现象. 样例(c)为城乡过渡区域,图像整体对比度较低,道路边界模糊,区域区分度不高. 在此条件下,其余算法出现较为明显的漏分割现象,而ARSNet依旧稳定提取道路轮廓,保持其连续性和空间结构,体现出良好的鲁棒性与边缘保持能力.

值得注意的是,在阴影和植被等遮挡场景中,传统方法往往因道路边界模糊或中断而产生误分割与漏分割. ARSNet则借助OFFM在低对比度区域的特征增强作用,以及C2f-CGA的上下文聚合能力,有效恢复被遮挡道路的连续结构并抑制背景干扰. 图5(b)与图6(a)的结果进一步验证了该方法在复杂遮挡条件下的适应性和鲁棒性.

2.5. 消融实验

为探明所提出正交特征融合模块OFFM、上下文特征引导聚合模块C2f-CGA、大核可分离注意力空间池化模块LSKASPM对模型性能的提升作用,在基准模型的基础上进行分模块消融实验,结果如表2所示. 其中基准模型为仅由编码器与解码器构成的端到端分割网络,不包含任何额外的特征增强结构.

表 2   消融实验结果

Tab.2  Ablation experiment results

方法+OFFM+C2f-CGA+LSKASPMMassachusetts数据集DeepGlobe数据集参数量/106FLOPs/109
P/%R/%IoU/%APLS/%P/%R/%IoU/%APLS/%
基准模型×××77.3272.2659.7171.2973.8272.7660.9671.3328.124.3
a××78.3774.4561.8372.0275.8774.2263.5272.4229.724.8
b××78.1573.4262.3574.0875.7973.3863.9674.6734.827.6
c××78.5173.2262.3072.5379.5573.1663.6872.7428.924.7
d×78.5078.3264.0174.3177.9678.5566.7474.9836.628.5
e×78.5978.2763.8873.7780.0279.3666.9274.1931.226.5
f×78.5677.4564.8274.6179.9978.0767.9675.3836.328.4
g78.6579.9865.1275.3680.2181.9868.4175.9337.329.2

新窗口打开| 下载CSV


表2结果表明,引入OFFM后,Massachusetts数据集上的R由72.26%提升至74.45%,IoU由59.71%增至61.83%;DeepGlobe数据集上的R由72.76%提升至74.22%,IoU由60.96%提高至63.52%. 参数量仅由28.1×106增至29.7×106,FLOPs从24.3×109增至24.8×109,计算开销变化轻微. 对比方案g与移除OFFM的方案f,在2个数据集上的R和IoU均出现回落,说明该模块能在低对比度区域显著增强语义感知,并以较小代价带来稳定性能增益,体现了“先增强结构”的设计思路. 方案b的实验结果显示,Massachusetts数据集上的IoU与APLS分别提高2.64%和2.79%;DeepGlobe数据集上分别提高3.00%和3.34%,改进幅度在单模块中最为显著. 此时参数量增至34.8×106,FLOPs虽有所增加但仍处合理范围. 对比方案g与去除C2f-CGA的方案e,在2个数据集上的IoU与APLS均下降,表明跨尺度语义引导与上下文特征聚合能够有效改善道路的连通性与拓扑保持,验证了“再聚合上下文”的设计逻辑. 在引入LSKASPM的方案c中,Massachusetts数据集上的P由77.32%提高至78.51%,IoU增至62.30%;DeepGlobe数据集上的P由73.82%提升至79.55%,IoU达到63.68%. 参数量仅增加至28.9×106,FLOPs轻微上升至24.7×109,对计算负担影响有限. 对比方案g与移除LSKASPM的方案d,2个数据集上的P与IoU均下降,说明该模块能在几乎不增加额外开销的情况下,有效抑制误检并强化细节表征,印证了“最后强化细节”的设计策略.

为进一步验证所提出各模块对模型特征感知能力的具体影响,引入梯度类激活映射(gradient-weighted class activation mapping, Grad-CAM[28])方法对不同结构配置下的中间激活区域进行可视化分析. Grad-CAM作为基于梯度的类激活映射技术,能够突出模型在预测过程中最为关注的区域,对于解释深度神经网络的判别机制具有良好适用性. 以大核可分离注意力空间池化模块LSKASPM输出特征区域为例,相关可视化结果如图78所示.

图 7

图 7   在Massachusetts数据集上的模块消融实验可视化对比

Fig.7   Visual comparison of module ablation experiment on Massachusetts dataset


图 8

图 8   在DeepGlobe数据集上的模块消融实验可视化对比

Fig.8   Visual comparison of module ablation experiment on DeepGlobe dataset


图7结果表明,基准模型在道路区域的响应较为离散,存在明显的边缘模糊和细节漏感现象,尤其在低对比度背景与狭窄道路区域,特征激活不足,导致结构信息捕捉不完整. 方案a引入OFFM后,道路主干区域的激活强度明显增强,响应更加集中,边缘轮廓更为清晰,说明该模块能够强化浅层与深层特征的正交交互,从而改善低对比度场景下的语义表达. 方案b引入C2f-CGA后,模型对分支道路、交叉口及复杂拓扑的响应显著提升,特别是在断裂和重叠路网处,热力图表现出更强的细节感知和整体连贯性,验证了该模块在跨尺度语义引导与上下文聚合方面的优势. 方案c引入LSKASPM后,模型对细节的捕捉进一步改善,响应区域分布更加均匀,道路边界过渡平滑且轮廓清晰,表明大感受野可分离注意力机制在整合上下文信息、抑制噪声干扰方面的有效性. 方案d、方案e与方案f通过不同模块的组合在各层次上实现优势互补,而完整的方案g在全局结构和局部细节2个层面均展现出最佳表现.

图8结果表明,随着方案a至方案g的逐步演进,模型对道路区域的关注愈加集中和精准. 基准模型的激活区域不足,表现为道路与相邻建筑边界模糊、语义区分不清,且弯曲支路的拓扑连续性缺失. 引入各模块后,模型的特征表达能力逐步增强,高响应区域逐渐聚焦于真实道路区域,道路与建筑及植被之间的语义边界更加清晰;在交叉节点和狭窄支路处,激活信号保持良好的连续性与完整性. 整体而言,各模块在不同组合下均对道路特征的捕捉起到促进作用,而完整方案g实现对道路结构的准确感知与稳定建模,显著提升分割结果的精度与鲁棒性.

2.6. 模型轻量化剪枝实验

为降低模型参数量,提高模型在边缘设备上的部署适应性,进一步探讨多种剪枝策略下模型性能变化,相关实验结果见表3.在Massachusetts数据集上,PR、IoU与APLS分别下降0.53%、0.35%、0.27%和0.41%;在DeepGlobe数据集上,上述指标分别下降0.43%、0.35%、0.53%和0.40%. 整体来看,各项评价指标下降幅度较小,说明模型在剪枝后仍具备良好分割能力. 在模型复杂度方面,参数量压缩至原始模型的60.3%;同时,FLOPs由29.2×109降至14.8×109,约为原始模型的一半. 在保证性能稳定的前提下,有效提升模型轻量化水平,为后续在无人机等边缘计算平台上的部署带来友善性. 不难看出,采用LAMP剪枝方法可在有效压缩模型的同时,最大程度保留其分割性能.

表 3   不同剪枝方法性能对比结果

Tab.3  Performance comparison of different pruning methods

方法Massachusetts数据集DeepGlobe数据集参数量/106FLOPs/109
P/%R/%IoU/%APLS/%P/%R/%IoU/%APLS/%
未剪枝78.6579.9865.1275.3680.2181.9868.4175.9337.329.2
L1[29]74.6275.8861.4771.8376.3577.6864.5872.7822.514.9
Group norm[30]75.5876.9362.3872.0877.6378.7465.4773.5122.815.3
Group hessian[31]74.9676.3961.9571.9276.5378.3164.8972.8722.715.4
Group taylor[32]74.3575.4361.1871.6976.0277.3364.0872.2822.815.1
LAMP78.1279.6364.8574.9579.7881.6367.8875.5322.514.8

新窗口打开| 下载CSV


表4进一步给出采用LAMP剪枝方法时不同剪枝率对航拍图像道路分割性能的影响情况. 其中以IoU和APLS作为主要评价指标. IoU能够准确反映剪枝操作对预测结果与真实标注之间重叠程度的影响,尤其能够反映道路边界识别性能的变化;而APLS则衡量预测道路网络的拓扑连通性,更能体现道路整体结构的保持情况.可以看出,在Massachusetts数据集上,剪枝率处于0.1~0.4时,模型的IoU和APLS基本保持稳定,表明LAMP剪枝能有效去除冗余结构,具有良好的正则化作用. 然而,当剪枝率超过0.4时,2项指标均显著下降,说明过度剪枝削弱了模型的特征提取能力,从而影响分割精度. 相比之下,DeepGlobe数据集由于其道路图像场景复杂、背景多样且小目标比例较高,对剪枝操作更为敏感. 当剪枝率超过0.3后,模型的IoU和APLS便出现明显下降. 为兼顾模型的轻量化和分割性能,选取0.3为最佳剪枝率,并将剪枝后经过微调的模型作为最终部署模型.

表 4   LAMP剪枝方法下剪枝率与IoU、APLS关系对比

Tab.4  Comparison of pruning rate with IoU and APLS under LAMP pruning method

剪枝率Massachusetts数据集DeepGlobe数据集
IoU/%APLS/%IoU/%APLS/%
065.1275.3668.4175.93
0.165.0975.3168.2275.71
0.265.0575.2868.0375.59
0.364.8574.9567.8875.53
0.464.7174.8865.2173.86
0.562.3472.6361.3270.28
0.660.7570.8956.5566.98
0.754.8365.7850.0860.84
0.847.2658.4937.6349.85

新窗口打开| 下载CSV


3. 结 语

为更好地解决现有算法在分割精度、结构连续性与模型复杂度之间难以兼顾的问题,自主设计用于航拍图像道路分割的轻量高效算法模型ARSNet,以提升在航拍图像中对道路结构的识别能力与分割精度. 该模型引入正交特征融合模块OFFM来实现不同方向图像特征之间的交互与增强,提高在低对比度区域中道路信息的可分性. 构建上下文特征引导聚合模块C2f-CGA来建立小尺度道路细节与整体结构之间的有效关联,提升道路分割的拓扑结构完整性和局部准确性,在保证整体结构连续的同时,减小狭窄道路的分割误差. 设计大核可分离注意力空间池化模块LSKASPM来增强不同尺度与方向上的道路特征的协同作用,提高在道路细节上的提取精度. 此外,采用基于神经网络权重幅值的层自适应稀疏剪枝方法LAMP,有效去除冗余通道,在保持分割精度的同时优化模型规模与计算效率. 在无人机航拍公开数据集Massachusetts和DeepGlobe上进行的实验结果表明,ARSNet在航拍图像道路分割任务中相较于现有的主流算法均取得显著性能提升. 在未来工作中,可结合知识蒸馏[33-34]等模型压缩技术,进一步提升ARSNet的推理效率与精度;同时将算法模型拓展应用于城市道路中交通标线识别、交通违规检测及道路异常事件的实时识别等场景,为智慧城市交通监管与安全监测提供更加智能可靠的技术支持.

参考文献

QI Y, HE Y, QI X, et al. Dynamic snake convolution based on topological geometric constraints for tubu-lar structure segmentation [C]// IEEE/CVF International Conference on Computer Vision. Paris: IEEE, 2023: 6070-6079.

[本文引用: 1]

王艳军, 唐徐超, 王成, 等

基于道路拓扑关联特征的城乡道路面精细提取网络

[J]. 测绘学报, 2025, 54 (1): 75- 89

[本文引用: 1]

WANG Yanjun, TANG Xuchao, WANG Cheng, et al

Urban and rural road surface extraction network based on topological correlation features

[J]. Acta Geodaetica et Cartographica Sinica, 2025, 54 (1): 75- 89

[本文引用: 1]

DEY M, P

S P, AITHAL B H. UnetEdge: a transfer learning-based framework for road feature segmentation from high-resolution remote sensing images

[J]. Remote Sensing Applications: Society and Environment, 2024, 34: 101160

DOI:10.1016/j.rsase.2024.101160      [本文引用: 1]

LI X, YANG S, MENG F, et al

LCMorph: exploiting frequency cues and morphological perception for low-contrast road extraction in remote sensing images

[J]. Remote Sensing, 2025, 17 (2): 257

DOI:10.3390/rs17020257      [本文引用: 1]

WANG Y, SEO J, JEON T

NL-LinkNet: toward lighter but more accurate road extraction with nonlocal operations

[J]. IEEE Geoscience and Remote Sensing Letters, 2022, 19: 1- 5

[本文引用: 1]

YANG M, YUAN Y, LIU G

SDUNet: road extraction via spatial enhanced and densely connected UNet

[J]. Pattern Recognition, 2022, 126: 108549

DOI:10.1016/j.patcog.2022.108549      [本文引用: 1]

LEE J, PARK S, MO S, et al. Layer-adaptive sparsity for the magnitude-based pruning [EB/OL]. (2020-11-15)[2025-06-05]. https://arxiv.org/pdf/2010.07611.

[本文引用: 1]

YUAN T, HU B

REU-Net: a remote sensing image building segmentation network based on residual structure and the edge enhancement attention module

[J]. Applied Sciences, 2025, 15 (6): 3026

DOI:10.3390/app15063026      [本文引用: 1]

SUREKHA J N, NEHA G

SAR U-Net: spatial attention residual U-Net structure for water body segmentation from remote sensing satellite images

[J]. Multimedia Tools and Applications, 2023, 83 (15): 44425- 44454

DOI:10.1007/s11042-023-16965-8      [本文引用: 1]

TERVEN J, CORDOVA-ESPARZA D M, ROMERO-GONZALEZ J A

A comprehensive review of Yolo architectures in computer vision: from Yolov1 to Yolov8 and Yolo-NAS

[J]. Machine Learning and Knowledge Extraction, 2023, 5 (4): 1680- 1716

DOI:10.3390/make5040083      [本文引用: 1]

范康, 钟铭恩, 谭佳威, 等

联合语义分割和深度估计的交通场景感知算法

[J]. 浙江大学学报: 工学版, 2024, 58 (4): 684- 695

[本文引用: 1]

FAN Kang, ZHONG Mingen, TAN Jiawei, et al

Traffic scene perception algorithm based on joint semantic segmentation and depth estimation

[J]. Journal of Zhejiang University: Engineering Science, 2024, 58 (4): 684- 695

[本文引用: 1]

JIN Y H, GAN H Y, LI J, et al

ResEff-YOLO: accuracy enhancement of YOLOv8 through integration of ResNet, SPPF, and EfficientHead modules

[J]. International Core Journal of Engineering, 2025, 11 (2): 23- 34

[本文引用: 1]

LAU K W, PO L M, REHMAN Y A U

Large separable kernel attention: rethinking the large kernel attention design in CNN

[J]. Expert Systems with Applications, 2024, 236: 121352

DOI:10.1016/j.eswa.2023.121352      [本文引用: 3]

ZHANG X L, LU L, LUO H Y, et al

Improvement in pavement defect scenarios using an improved YOLOv10 with ECA attention, RefConv and WIoU

[J]. World Electric Vehicle Journal, 2025, 16 (6): 328

DOI:10.3390/wevj16060328      [本文引用: 1]

MNIH V. Machine Learning for aerial image labeling [D]. Toronto Q12: University of Toronto, 2013.

[本文引用: 1]

DEMIR I, KOPERSKI K, LINDENBAUM D, et al. Deepglobe 2018: A challenge to parse the earth through satellite images [C]// IEEE Conference on Computer Vision and Pattern Recognition Workshops. Salt Lake City: IEEE, 2018: 172–181.

[本文引用: 1]

VAN ETTEN A, LINDENBAUM D, BACASTOW T M. SpaceNet: a remote sensing dataset and challenge series [EB/OL]. (2019-07-15)[2025-06-05]. https://arxiv.org/abs/1807.01232.

[本文引用: 1]

RONNEBERGER O, FISCHER P, BROX T. U-Net: convolutional networks for biomedical image segmentation [C]// Medical Image Computing and Computer-Assisted Intervention. Cham: Springer, 2015: 234-241.

[本文引用: 1]

BADRINARAYANAN V, KENDALL A, CIPOLLA R, et al

SegNet: a deep convolutional encoder-decoder architecture for image segmentation

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017, 39 (12): 2481- 2495

[本文引用: 1]

CHEN L, ZHU Y, PAPANDREOU G, et al. Encoder-decoder with atrous separable convolution for semantic image segmentation [C]// European Conference on Computer Vision. Munich: IEEE, 2018: 801–818.

[本文引用: 1]

ZHOU L, ZHANG C, WU M, et al. D-linknet: Linknet with pretrained encoder and dilated convolution for high resolution satellite imagery road extraction [C]// IEEE Conference on Computer Vision and Pattern Recognition Workshop. Salt Lake City: IEEE, 2018: 182–186.

[本文引用: 1]

CHEN H, LI Z, WU J, et al

SemiRoadExNet: a semi-supervised network for road extraction from remote sensing imagery via adversarial learning

[J]. ISPRS Journal of Photogrammetry and Remote Sensing, 2023, 198: 169- 183

DOI:10.1016/j.isprsjprs.2023.03.012      [本文引用: 1]

YANG R, ZHONG Y, LIU Y, et al

Occlusion-aware road extraction network for high-resolution remote sensing imagery

[J]. IEEE Transactions on Geoscience and Remote Sensing, 2024, 62: 5619316

[本文引用: 1]

WANG H, BAI L, XUE D, et al

FRCFNet: feature reassembly and context information fusion network for road extraction

[J]. IEEE Geoscience and Remote Sensing Letters, 2024, 21: 2502805

[本文引用: 1]

XIONG Y, LI L, YUAN D, et al

CFRNet: road extraction in remote sensing images based on cascade fusion network

[J]. IEEE Geoscience and Remote Sensing Letters, 2024, 21: 6011705

[本文引用: 1]

ZHU E Z, CHEN Z, WANG D K, et al

UNetMamba: an efficient UNet-Like Mamba for semantic segmentation of high-resolution remote sensing images

[J]. IEEE Geoscience and Remote Sensing Letters, 2025, 22: 6001205

[本文引用: 1]

CHEN S H, YU L J, LIU Z, et al. LightFormer: a lightweight and efficient decoder for remote sensing image segmentation [EB/OL]. (2025-04-15)[2025-06-05]. https://arxiv.org/pdf/2504.10834.

[本文引用: 1]

CARRERAS J

Celiac disease Deep Learning image classification using convolutional neural networks

[J]. Journal of Imaging, 2024, 10 (8): 200

DOI:10.3390/jimaging10080200      [本文引用: 1]

刘洲峰, 吴文涛, 李环宇, 等

聚类和群智能优化算法的自动剪枝方法

[J]. 计算机工程与应用, 2025, 61 (11): 204- 215

[本文引用: 1]

LIU Zhoufeng, WU Wentao, LI Huanyu, et al

Automatic channel pruning method based on clustering and swarm intelligence optimization algorithm

[J]. Computer Engineering and Applications, 2025, 61 (11): 204- 215

[本文引用: 1]

FANG G, MA X, SONG M, et al. Depgraph: towards any structural pruning [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 16091-16101.

[本文引用: 1]

YU S X, YAO Z W, GHOLAMI A, et al. Hessian-aware pruning and optimal neural implant [C]// IEEE/CVF Winter Conference on Applications of Computer Vision. Waikoloa, HI: IEEE, 2022: 3665-3676.

[本文引用: 1]

MOLCHANOV P, MALLYA A, TYREE S, et al. Importance estimation for neural network pruning [C]// IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2019: 11264-11272.

[本文引用: 1]

SONG H X, XIE J P, DUAN Y Y, et al

CMKD-Net: a cross-modal knowledge distillation method for remote sensing image classification

[J]. Advances in Space Research, 2025, 75 (12): 8515- 8534

DOI:10.1016/j.asr.2025.04.009      [本文引用: 1]

HIMEUR Y, ABURAED N, ELHARROUSS O, et al

Applications of knowledge distillation in remote sensing: a survey

[J]. Information Fusion, 2025, 115: 102742

DOI:10.1016/j.inffus.2024.102742      [本文引用: 1]

/