浙江大学学报(工学版), 2026, 60(9): 1953-1961 doi: 10.3785/j.issn.1008-973X.2026.09.012

计算机技术、自动控制技术

基于空间自适应Transformer的人脸素描图像生成

万伟国,, 钟凯晨, 张迎梅, 姚丽, 包书鸿, 龚大伟

1. 江西财经大学 软件与物联网工程学院,江西 南昌 330032

2. 江西财经大学 教务处,江西 南昌 330013

3. 江西科技师范大学 智能制造学院,江西 南昌 330038

Face photo-to-sketch synthesis based on spatially adaptive Transformer

WAN Weiguo,, ZHONG Kaichen, ZHANG Yingmei, YAO Li, BAO Shuhong, GONG Dawei

1. School of Software and Internet of Things Engineering, Jiangxi University of Finance and Economics, Nanchang 330032, China

2. Office of Educational Administration, Jiangxi University of Finance and Economics, Nanchang 330013, China

3. School of Intelligent Manufacturing, Jiangxi Science and Technology Normal University, Nanchang 330038, China

收稿日期: 2025-07-16  

基金资助: 国家自然科学基金资助项目(62261025,62362032);江西省自然科学基金资助项目(20242BAB25076,20232BAB212015).

Received: 2025-07-16  

Fund supported: 国家自然科学基金资助项目(62261025,62362032);江西省自然科学基金资助项目(20242BAB25076,20232BAB212015).

作者简介 About authors

万伟国(1991—),男,副教授,博士,从事计算机视觉、图像处理研究.orcid.org/0000-0002-3537-979X.E-mail:wanweiguo@jxufe.edu.cn , E-mail:wanweiguo@jxufe.edu.cn

摘要

针对现有人脸素描图像生成方法存在的生成图像结构失真、纹理模糊及伪影残留等问题,提出基于空间自适应Transformer的生成网络(SAT-StyTR). 在编码器中构建双模态特征解耦模块(DFDM),通过并行的人脸内容与素描风格特征提取分支,实现跨模态特征的解耦表征. 设计行-列向量动态融合模块(VDFM),引入双向门控机制,以实现行、列向量的自适应特征融合,显著增强局部细节保留能力. 引入多尺度感知判别器(MSPD),利用层级式梯度监督机制在多语义粒度上优化素描图像纹理的真实感. 在CUHK、AR、XM2VTS和CUFSF数据集上的实验结果表明,所提方法在SSIM、PSNR、MSE、LPIPS和FID等指标上均优于Mamba-ST等现有方法,其FID值在4个数据集上比次优方法分别降低了19.3%、1.0%、15.5%和10.0%. 视觉对比分析进一步验证了所提方法的生成结果在五官轮廓等关键区域上具有更优的结构一致性与细节还原度.

关键词: 人脸素描图像生成 ; 空间自适应Transformer ; 双模态特征解耦 ; 行-列向量动态融合 ; 多尺度感知判别器(MSPD)

Abstract

A spatially adaptive Transformer-based generation network (SAT-StyTR) was proposed to address the issues of existing face photo-to-sketch synthesis methods, such as structural distortion, blurred textures, and artifact residue. A dual-modal feature disentanglement module (DFDM) was constructed in the encoder. The parallel branches of face content and sketch style feature extraction were employed in DFDM to achieve disentangled representation of cross-modal features. A row-column vector dynamic fusion module (VDFM) was designed, and a bidirectional gating mechanism was introduced in the VDFM to enable adaptive feature fusion of row-column vectors. Then the capability of local detail retention was significantly improved. A multi-scale perceptive discriminator (MSPD) was incorporated to optimize the realism of generated sketch textures at multiple semantic levels by leveraging the hierarchical gradient supervision mechanism. The experimental results on the CUHK, AR, XM2VTS and CUFSF datasets demonstrated that the proposed method outperformed existing methods such as Mamba-ST on SSIM, PSNR, MSE, LPIPS, and FID metrics, with its FID values improved by 19.3%, 1.0%, 15.5%, and 10.0% over those of the second-best method on the four datasets, respectively. Visual comparative analysis further validated that superior structural consistency and detail restoration were achieved in critical regions, such as facial contours.

Keywords: face photo-to-sketch synthesis ; spatially adaptive Transformer ; dual-modal feature disentanglement ; row-column vector dynamic fusion ; multi-scale perceptive discriminator (MSPD)

PDF (2412KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

万伟国, 钟凯晨, 张迎梅, 姚丽, 包书鸿, 龚大伟. 基于空间自适应Transformer的人脸素描图像生成. 浙江大学学报(工学版)[J], 2026, 60(9): 1953-1961 doi:10.3785/j.issn.1008-973X.2026.09.012

WAN Weiguo, ZHONG Kaichen, ZHANG Yingmei, YAO Li, BAO Shuhong, GONG Dawei. Face photo-to-sketch synthesis based on spatially adaptive Transformer. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1953-1961 doi:10.3785/j.issn.1008-973X.2026.09.012

人脸素描图像生成技术通过将人脸照片转化为结构化的素描图像,在数字娱乐、司法刑侦及医疗诊断等领域中展现出重要的应用价值[1-2]. 在数字娱乐领域,该技术能够快速生成个性化艺术图像,降低了用户的创作门槛;在司法刑侦中,通过跨模态匹配来解决低质量监控图像与数据库照片的匹配难题,提升了嫌疑人识别效率;在医疗诊断中,素描形式可以强化病理与生理特征(如皮肤病变、微表情)的视觉表达,从而辅助医生精准分析.

近年来,人脸素描图像生成技术取得了显著进展,但是照片与素描图像间的模态差异仍然对现有方法构成了挑战. 传统方法主要基于人工设计的特征与边缘检测算法构建生成框架,例如,Abdel-Aziz等[3]提出无监督边缘增强框架,通过多尺度边缘融合来优化生成过程;Galea等[4]设计局部-全局纹理描述符联合策略,结合跨模态特征匹配,提升了图像生成效果;Li等[5]引入自适应滤波器,通过噪声抑制来降低模态差异的影响. 基于边缘检测的传统人脸素描生成方法具有实现简单、计算效率高的优势,但是其依赖人工经验设计的特征提取算子与规则对复杂背景的干扰较为敏感,容易导致边缘信息丢失,在平衡高频细节与语义结构一致性方面存在局限性[6].

卷积神经网络(CNN)由于其自动特征提取能力,被广泛应用于人脸素描图像的生成. 早期研究中,Zhang等[7]率先构建基于全卷积神经网络的端到端转换框架,通过多级特征细化机制来实现自动化人脸素描图像生成;相较于传统纹理映射方法,其显著降低了对人工设计的特征及其提取规则的依赖性. 针对跨模态匹配的鲁棒性问题,Galea等[8]提出深度度量学习范式,通过约束照片与素描图像在特征空间中的语义一致性,有效提升了复杂场景下的身份匹配精度. 为了进一步解决双向转换中的特征解耦难题,Zhu等[9]设计协同生成对抗框架,创新地融合注意力机制与特征共享策略,在保持身份特征连贯性的同时实现了高质量风格迁移. 当前方法普遍采用CNN作为基础架构,其局部感知特性虽然能够有效捕捉面部细节特征,但是在全局上下文建模方面存在局限性,容易导致生成素描图像的结构失真问题. 这一瓶颈推动着研究者不断探索更强大的特征表达与长程依赖建模方法[10].

Transformer的全局自注意力机制有效突破了CNN的局部感受野限制,在建模人脸全局结构特征和捕获长距离依赖关系方面展现出显著优势. 研究者们提出多种融合策略:Zhu等[11]构建CNN与Transformer的混合架构,实现了多尺度全局结构与局部纹理的联合建模;Chen等[12]提出基于动态合成的非对称解耦学习框架,优化了跨模态风格迁移过程;Yu等[13]设计空间约束下的全局-局部自注意力机制,提升了特征计算效率;陈长武等[14]采用域自适应均值网络,实现了跨模态特征分布对齐;Shi等[15]基于StyTr2模型[16]提出基于自适应窗口注意力Transformer的半监督对抗网络框架,用于人脸素描图像生成任务,并采用拉普拉斯算子来增强人脸素描图像的细节信息. 基于Transformer的人脸素描图像生成方法在全局建模和风格迁移方面表现出较强的性能,但是其在局部细节保真度、计算效率及精细化风格控制方面仍须进一步突破[17].

针对现有方法在跨模态特征解耦与长程依赖建模的局限性,提出基于空间自适应Transformer的人脸素描生成网络(SAT-StyTR),通过双模态解耦-动态融合-多尺度优化的创新架构,系统地解决跨模态生成中的结构失真与纹理模糊的问题. 首先,构建双模态特征解耦模块(dual-modal feature disentanglement module, DFDM),通过并行分支结构显式分离人脸照片的语义内容与素描图像的风格特征,并利用空间自适应注意力机制动态校准跨模态特征分布,以缓解模态差异导致的边缘伪影问题. 其次,设计行-列向量动态融合模块(vector dynamic fusion module, VDFM)和双向门控机制,自适应聚合多尺度行、列向量特征,在保留五官轮廓、发丝纹理等关键细节的同时,增强生成图像的结构一致性. 最后,结合多尺度感知判别器(multi-scale perceptive discriminator, MSPD),通过并行部署大规模全局判别器与小尺度局部判别器,构建多粒度对抗监督机制,在约束面部轮廓与五官比例的结构一致性的同时强化细节的逼真度.

1. 本研究方法

1.1. 总体网络结构

所提方法的总体框架为基于编码器-特征融合-解码器架构的半监督生成对抗网络(generative adversarial network, GAN),如图1所示. 在双模态特征解耦编码阶段,采用并行双分支编码器,分别处理人脸照片与素描图像. 输入图像经分块卷积操作被嵌入为高维特征后,利用DFDM进行深度特征提取. 其中,内容分支利用动态注意力机制显式解耦语义内容特征,聚焦五官结构等全局语义;风格分支通过空间自适应机制校准跨模态特征分布,抑制边缘伪影并提取素描笔触、发丝纹理等风格信息. 在行-列向量动态融合阶段,将VDFM作为跨模态特征交互枢纽,通过像素级行-列空间注意力机制实现不同模态特征的双向交互和融合. 该模块引入双向门控机制,在Transformer架构下对行、列向量进行自适应加权融合,动态平衡局部细节与全局结构的特征贡献度,生成兼具结构一致性与风格表现力的融合特征. 最后,在轻量化对抗生成优化阶段,结合VGG19解码器与MSPD构建对抗优化框架. 解码器通过空间自适应上采样操作逐步重建人脸素描图像,并采用轻量化设计,以降低计算复杂度;判别器通过层级式梯度监督机制,在多尺度上引导生成器优化笔触真实性与风格协调性. 通过Transformer与GAN的协同优化,在提升训练与推理效率的同时,实现高分辨率、实时的图像生成,并兼顾细节精细度与自然结构连续性.

图 1

图 1   基于空间自适应Transformer的人脸素描图像生成网络(SAT-StyTR)示意图

Fig.1   Schematic of face photo-to-sketch synthesis network (SAT-StyTR) based on spatial adaptive Transformer


1.2. 双模态特征解耦模块

在双模态特征解耦编码阶段进行异构模态驱动的特征提取与动态空间注意力校准,以协同优化跨模态特征解耦过程.

针对人脸内容特征的细节保留与素描风格特征的抽象表达这2项冲突性需求,在DFDM中创新性地设计双分支异构池化结构,如图2所示,其中(a)为人脸内容特征提取分支,(b)为素描风格特征提取分支. 人脸内容分支通过级联最大池化操作(池化核尺寸由3×3逐级减小至2×2),在层级下采样的过程中保留边缘梯度突变信息与微观纹理特征,确保五官几何结构及皮肤细节的高保真表达. 素描风格分支采用多级平均池化策略(池化核尺寸由5×5逐级减小至3×3),利用渐进式特征平滑抑制局部噪声,聚焦笔触强度分布、明暗过渡等全局风格规律.

图 2

图 2   双模态特征解耦模块结构

Fig.2   Structure of dual-modal feature disentanglement module


为了进一步消除跨模态特征歧义,引入多尺度卷积耦合注意力机制[18],基于交替堆叠的大核卷积(13×13)与小核卷积(3×3)构建特征编码网络,前者通过大感受野来建模面部轮廓连续性等长程依赖关系,后者精细化捕获局部结构模式. 编码后的特征经空间归一化处理后生成像素级注意力权重图,并通过双线性插值实现与原始特征图的空间对齐,最终以逐像素重加权的方式实现特征动态校准,在增强对眉眼轮廓、鼻梁光影等关键语义区域响应强度的同时,自适应抑制背景干扰与模态特异性噪声. 该机制通过对特征表达空间的重构与增强,提升跨模态特征对齐的语义一致性,并保障局部细节的拓扑保形特性.

1.3. 行-列向量动态融合模块

针对跨模态特征融合中存在的空间语义错位问题,提出基于双向几何约束的像素级动态注意力融合机制. 该方法通过特征张量的行、列向量正交分解来建立空间约束关系,利用双向显著性权重实现特征的几何一致性重组.

令通过DFDM提取到的人脸内容特征和风格特征分别为X1X2. 首先,对异构特征进行通道拼接和自注意力建模;随后,通过线性投影分别将建模后的特征Xf与风格特征X2映射至同一特征空间. 该过程通过建立特征空间的正交投影约束,有效缓解了跨模态特征融合过程中的空间错位问题,具体表示为

$ {\boldsymbol{X}}_{\text{f}}=\mathrm{Linear}\,(\mathrm{SA}\,(\mathrm{Concat}\,({\boldsymbol{X}}_{1}, {\boldsymbol{X}}_{2}))), $

$ {\boldsymbol{X}}^{\prime}_{2}=\mathrm{Linear}\,({\boldsymbol{X}}_{2}). $

式中:Xf为维度对齐后的融合特征,Linear (·)为线性投影操作,SA (·)为自注意力操作,Concat (·)为通道维度拼接操作.

在空间语义建模阶段,对特征Xf$ {\boldsymbol{X}}^{\prime}_{2} $分别沿行、列向量方向构建多范数注意力分支. 以Xf为例,行向量分支基于L1/L2/L范数量化水平方向的特征响应强度,而列向量分支建模垂直方向的特征分布规律,进而建立人脸几何结构与素描笔触方向的双向关联.

$ {{A}}_{{i}}({\boldsymbol{X}}_{\text{f}})=\left\{\begin{array}{ll} {{\left|\left|{\boldsymbol{X}}_{\text{f}}\right|\right|}_{1}}/{{H}},& \text{type}={\overline{L}}_{1};\\{{\left|\left|{\boldsymbol{X}}_{\text{f}}\right|\right|}_{2}}/{{H}},& \text{type}={\overline{L}}_{2};\\\max \,({\boldsymbol{X}}_{\text{f}}),& \text{type}={L}_{\mathrm{\infty }}.\end{array} \right. $

式中:H为特征的总行数或总列数;type为范数类型,其中${\overline{L}}_{1}、{\overline{L}}_{2} $为经过方向性统计聚合与归一化的$ {{L}}_{1}、{{L}}_{1}$范数;Ai(·)为行向量或列向量注意力操作,i=1表示行向量,i=2表示列向量.

在特征动态融合过程中,引入指数增强型归一化策略,通过对注意力得分进行非线性放大与概率约束,强化高信息量区域的特征贡献,同时抑制面部平坦区域的冗余响应,具体表示为

$ {\alpha }_{i}=\frac{\exp \,({A}_{i}({\boldsymbol{X}}_{\text{f}}))}{\exp\, ({A}_{i}({\boldsymbol{X}}_{\text{f}}))+\exp\, ({A}_{i}({\boldsymbol{X}}^{\prime}_{2}))+\epsilon }, $

$ {\beta }_{i}=\frac{\exp \,({A}_{i}({\boldsymbol{X}}^{\prime}_{2}))}{\exp \,({A}_{i}({\boldsymbol{X}}_{\text{f}}))+\exp\, ({A}_{i}({\boldsymbol{X}}^{\prime}_{2}))+\epsilon }. $

式中:ϵ为常系数,αiβi (i=1, 2)为行向量或列向量的注意力权重系数.

VDFM通过双向特征融合与跨维度聚合来实现特征优化. 利用行、列向量权重将特征Xf$ {\boldsymbol{X}}^{\prime}_{2} $加权融合,分别得到行向量融合特征F1与列向量融合特征F2

$ {\boldsymbol{F}}_{\text{1}}={\alpha }_{1}\cdot {\boldsymbol{X}}_{\text{f}}+{\beta }_{1}\cdot {\boldsymbol{X}}^{\prime}_{2}, $

$ {\boldsymbol{F}}_{\text{2}}={\alpha }_{2}\cdot {\boldsymbol{X}}_{\text{f}}+{\beta }_{2}\cdot {\boldsymbol{X}}^{\prime}_{2}. $

最后,进行跨维度聚合,生成兼顾局部语义对齐与全局结构一致性的融合张量F

$ \boldsymbol{F}={\boldsymbol{F}}_{\text{1}}+{\boldsymbol{F}}_{\text{2}}. $

1.4. 多尺度感知判别器

针对GAN中全局语义约束与局部细节保真难以协同优化的核心挑战,采用基于特征金字塔架构的多粒度判别机制[19]. 区别于传统单尺度判别器,MSPD采用金字塔式多粒度判别架构,对输入图像进行逐级下采样操作,以生成多分辨率特征金字塔,并在各尺度独立部署子判别器来进行特征解耦分析. 其中,高分辨率分支聚焦于微观细节的真实性判别,低分辨率分支用于面部轮廓、五官比例等宏观语义的合理性验证,由此形成覆盖局部细节与全局语义的完备的特征监督体系.

图3所示,模块通过可微分下采样操作构建多尺度金字塔特征表达空间,其中每个子判别器由堆叠的卷积层与可选的实例或批量归一化层构成,支持自适应选择归一化策略,以平衡风格迁移稳定性与内容保真需求. 通过特征级联来聚合各尺度的判别结果,同时保留中间层特征图,用于计算感知损失,为生成器提供像素级梯度反馈,从而指导语义级分布校正. 此外,引入动态激活机制,通过可配置的Sigmoid门控机制,控制判别置信度的输出范围,增强模型对复杂光照条件和多样化艺术风格的适应性. 该设计通过跨尺度特征协同监督,迫使生成器同时满足低分辨率约束与高分辨率约束,显著提升生成的人脸素描图像在视觉一致性、细节丰富度及跨域泛化能力方面的综合表现.

图 3

图 3   多尺度感知判别器结构

Fig.3   Structure of multi-scale perceptive discriminator


1.5. 损失函数

1.5.1. 语义内容约束

在人脸素描图像生成任务中,生成图像与参考图像的结构一致性面临严峻挑战. 针对传统像素级损失函数难以约束高阶语义特征的问题,提出基于VGG19深层语义特征的内容损失函数LC,通过提取预训练网络的高阶特征,构建判别性语义空间,并利用特征空间欧氏距离来约束生成图像的几何拓扑结构. 内容损失函数表示为

$ {L}_{\text{C}}=\left|\left|\mathit{\Phi }({\boldsymbol{G}}_{\text{s}})-\mathit{\Phi }({\boldsymbol{I}}_{\text{c}})\right|\right|_{2}^{2}. $

式中:Φ(·)为特征提取操作,Gs为生成的素描图像,Ic为输入的人脸照片.

1.5.2. 风格分布对齐

为了确保生成素描图像的笔触风格与参考图在纹理分布上的一致性,提出基于统计特征对齐的风格损失LS,其核心思想是通过约束生成图像与参考图像特征的均值和标准差,而非通过传统Gram矩阵,来实现风格迁移. 风格损失函数表示为

$ {L}_{\text{S}}=\left|\left|\mu ({\boldsymbol{G}}_{\text{s}})-\mu ({\boldsymbol{I}}_{\text{s}})\right|\right|_{2}^{2}+\left|\left|\sigma ({\boldsymbol{G}}_{\text{s}})-\sigma ({\boldsymbol{I}}_{\text{s}})\right|\right|_{2}^{2}. $

式中:Is为输入的人脸素描图像;μ(·)和σ(·)分别为特征图的通道均值与标准差计算操作,用于表征风格分布.

1.5.3. 微观细节增强

针对生成的人脸素描图像中高频细节容易丢失的问题,提出基于拉普拉斯-高斯边缘检测算子的细节损失LD,通过强化边缘区域的高频信息来提升视觉清晰度. 细节损失函数表示为

$ {L}_{\text{D}}=\left|\left|\boldsymbol{m}\odot f(\text{lap}\,({\boldsymbol{G}}_{\text{s}}))-f(\text{lap}\,({\boldsymbol{I}}_{\text{c}}))\right|\right|_{2}^{2}. $

式中:lap (·)为拉普拉斯算子,用于提取图像二阶梯度特征;m为边缘区域的掩码,用于聚焦关键细节;f为高斯滤波器对特征的操作,用于抑制噪声干扰.

1.5.4. 身份特征保持

为了确保生成图像的身份辨识度,提出双路径身份损失函数,并结合像素级约束与深度语义特征对齐. 其中,像素级身份损失LID1和深度特征损失LID2表示为

$ {L}_{\text{ID1}}=\left|\left|{\boldsymbol{G}}_{\text{s}}-{\boldsymbol{I}}_{\text{c}}\right|\right|_{2}^{2}+\left|\left|{\boldsymbol{G}}_{\text{s}}-{\boldsymbol{I}}_{\text{s}}\right|\right|_{2}^{2}, $

$ {L}_{\text{ID2}}=\sum\limits_{i=1}^{5}\left(\left|\left|{\mathit{\Phi }}_{i}({\boldsymbol{G}}_{\text{s}})-{\mathit{\Phi }}_{i}({\boldsymbol{I}}_{\text{c}})\right|\right|_{2}^{2}+\left|\left|{\mathit{\Phi }}_{i}({\boldsymbol{G}}_{\text{s}})-{\mathit{\Phi }}_{i}({\boldsymbol{I}}_{\text{s}})\right|\right|_{2}^{2}\right). $

式中:Φi(·)为提取VGG19网络中第i层特征的操作. 多层特征融合确保了身份信息在局部细节与全局细节上均与输入信息一致.

1.5.5. 对抗优化驱动

引入多尺度梯度惩罚对抗损失,通过层级化判别器监督来提升生成图像的局部真实感,表示为

$ {L}_{\text{A}}=\frac{1}{3N}\sum\limits_{i=1}^{3}\sum\limits_{j=1}^{N}\left[-\ln \,({D}_{i}(\boldsymbol{G}({\boldsymbol{I}}_{\text{c},j})))\right]. $

式中:N为输入图像的数量,Di (·)为第i个判别器对图像的处理,G(Ic, j)为第j个输入的人脸照片所生成的素描图像. 多尺度监督迫使生成器同时关注低分辨率的整体结构与高分辨率的局部纹理.

综合以上损失函数,提出多层次加权损失约束框架,以实现对生成质量的精细化控制:

$ L={\lambda }_{\text{C}}{L}_{\text{C}}+{\lambda }_{\text{S}}{L}_{\text{S}}+{\lambda }_{\text{D}}{L}_{\text{D}}+{\lambda }_{\text{ID1}}{L}_{\text{ID1}}+{\lambda }_{\text{ID2}}{L}_{\text{ID2}}+{\lambda }_{\text{A}}{L}_{\text{A}}. $

式中:λCλSλDλID1λID2λA为各损失函数的权重系数,通过实验分别设置为7、18、200、70、1和1.

2. 实验结果与分析

2.1. 数据集与实验设置

在人脸素描数据集CUFS[20]和CUFSF[21]上进行实验验证. 其中,CUFS数据集包含606对人脸照片-素描图像对,由CUHK (188对)、AR (123对)和XM2VTS (295对) 3个子集构成,分别从中选取150、100以及100对作为训练集,其余作为测试集. 更具挑战性的CUFSF数据集包含1 194对样本,包含复杂光照条件导致的亮度不均与细节退化现象,采用其中的999对构建训练集.

对于模型训练,采用Adam优化器[22]构建生成对抗框架,为生成器和判别器分别设置差异化学习率:生成器的初始学习率为8×104;判别器的初始学习率为2×104,并采用渐进式学习率调度策略. 在训练过程中设计双阶段调控策略:在初始阶段(迭代次数<104)进行线性预热[23],动态抑制初始梯度异常;在成熟阶段(迭代次数$\geqslant $104)采用指数衰减机制[24],避免参数振荡并提升收敛效率. 实验基于NVIDIA RTX4090显卡单卡完成训练,迭代次数设置为5×104.

2.2. 定性评估

为了评估所提模型在人脸素描图像生成上的有效性,选取6种图像生成模型进行对比分析,包括pix2pix[25]、U-GAT-IT[26]、DCLGAN[27]、CAP-VSTNet[28]、Mamba-ST[29]及文献[15]提出的模型. 图4为不同方法生成结果的视觉对比图,其中(a)为输入的人脸照片,(i)为参考图像,(b)~(h)分别为pix2pix、U-GAT-IT、DCLGAN、文献[15]模型、CAP-VSTNet、MambaST和SAT-StyTR生成的图像. 相较于现有方法,所提算法在跨域特征保持与视觉合理性方面展现出显著的优势. 对比之下,pix2pix方法生成的人脸素描图像的分辨率较低,导致图像整体模糊. U-GAT-IT方法的结果存在关键面部细节缺失的问题,如图4中第3列第5行的图像所示,生成的素描图像丢失了法令纹与抬头纹的纹理细节. DCLGAN方法生成的素描图像出现了高频伪影,且在第4列第8行的图像中产生了与输入人脸照片无关的异常发型线条. 文献[15]模型生成的素描图像同样存在伪影的问题,且与真实素描图像的相似度较低. CAP-VSTNet方法因过度强调线条刻画而导致生成结果呈现非自然的手绘质感. MambaST方法因保留三维面部立体特征,未能充分学习素描图像的平面化表达特性. 相较之下,提出的SAT-StyTR方法在保持生成图像自然度的同时,实现了细粒度特征的精确还原,在细节还原和整体视觉效果方面表现出更优异的性能.

图 4

图 4   不同方法在CUHK、AR、XM2VTS和CUFSF数据集上的定性实验结果对比

Fig.4   Comparison of qualitative experimental results of different methods on CUHK, AR, XM2VTS, and CUFSF datasets


2.3. 定量评估

构建多维度图像质量评估体系,采用结构相似度(SSIM[30])、保真度(PSNR[31]、MSE[32])与感知质量(LPIPS[33]、FID[34])指标对生成结果进行全面验证. 其中,SSIM用于衡量生成图像与参考图像在亮度、对比度和局部结构上的相似度,以评估图像的结构保真性;PSNR和MSE衡量像素级差异,PSNR值越高、MSE值越低表示生成图像的保真度越高;LPIPS基于深度特征计算感知相似度,更符合人眼对图像差异的感知特性,值越低表示视觉效果越接近于参考图像;FID衡量生成图像与真实图像在高维特征空间分布上的差异,值越低说明生成图像在整体分布上与真实图像越接近. 通过这些指标,可以从像素、结构和感知3个层面全面量化生成图像的质量. 对比结果如表1所示,其中,最优结果以粗体显示,次优结果用下划线标出. 提出的SAT-StyTR方法在4个基准数据集上均展现出显著优势:在CUHK数据集上,其SSIM较pix2pix模型提升了1.4%,FID较次优方法降低了19.3%;在AR数据集上,SSIM、PSNR与MSE均达到最优,FID较次优方法降低了1.0%,表明生成图像在细节保真度与结构完整性之间实现了平衡. 针对跨域挑战,SAT-StyTR在XM2VTS与CUFSF数据集上的MSE值分别为73.19和91.74,较次优模型降低了1.0%和3.4%;FID较次优模型分别降低了15.5%和10.0%,验证了所提方法在素描笔触方向性与明暗过渡特性建模上的有效性. 实验结果表明,基于几何约束注意力与跨模态特征融合的SAT-StyTR生成的素描图像可以同时保持人脸拓扑精确性与素描艺术表现力.

表 1   不同方法在CUHK、AR、XM2VTS和CUFSF数据集上的定量指标对比

Tab.1  Comparison of quantitative metrics of different methods on CUHK, AR, XM2VTS, and CUFSF datasets

模型CUHK数据集AR数据集
SSIMPSNR/dBMSELPIPSFIDSSIMPSNR/dBMSELPIPSFID
pix2pix0.658730.7056.300.173189.080.594629.6871.830.215099.92
U-GAT-IT0.555129.7569.280.3206131.850.473429.2877.790.4122170.04
DCLGAN0.647930.4858.560.214972.460.612829.7870.460.189397.96
文献[15]模型0.650630.1264.260.189371.270.604729.8069.310.218082.45
CAP-VSTNet0.638930.4359.340.222882.410.577829.6571.060.2710117.35
Mamba-ST0.536529.6972.030.346075.400.604129.0681.170.237984.68
SAT-StyTR0.667630.8953.930.174557.510.621329.8967.880.204381.66
模型XM2VTS数据集CUFSF数据集
SSIMPSNR/dBMSELPIPSFIDSSIMPSNR/dBMSELPIPSFID
pix2pix0.452729.2278.110.251462.130.361528.3694.940.277054.89
U-GAT-IT0.435929.3076.700.4471137.140.398128.2796.950.273142.63
DCLGAN0.498329.2278.280.284791.560.375028.3595.120.258444.22
文献[15]模型0.497829.4773.950.273263.650.382328.2597.260.272532.56
CAP-VSTNet0.496829.2378.150.271079.810.365528.10100.650.290961.21
Mamba-ST0.453628.3794.810.344974.160.401528.2298.010.281849.03
SAT-StyTR0.511629.5273.190.243652.480.423628.5191.740.235629.30

新窗口打开| 下载CSV


2.4. 消融实验

2.4.1. 所提模块的有效性

通过渐进式消融实验验证各模块的协同优化效应,结果如表2所示. 当仅采用DFDM时,生成结果中的SSIM (0.6570)与LPIPS (0.1830)存在明显的局限;引入MSPD后,多尺度监督机制使SSIM值提升了1.6%,LPIPS降低了2.3%,但是PSNR的提升幅度有限;集成VDFM、形成完整模型SAT-StyTR后,双向几何约束机制消除了跨模态特征错位现象,SSIM提升至0.6692,PSNR达到30.89 dB,MSE为53.93,降低了4.9%,LPIPS达到了最优值0.174 5. 实验结果揭示了各模块间的递进增强关系:DFDM建立跨模态解耦基础,MSPD强化细节监督,而VDFM突破了动态融合瓶颈.

表 2   所提模块的消融实验结果

Tab.2  Ablation experiment results of proposed modules

方法SSIMPSNR/dBMSELPIPS
DFDM0.657030.4459.630.1830
DFDM+MSPD0.667730.7256.730.1788
SAT-StyTR0.669230.8953.930.1745

新窗口打开| 下载CSV


2.4.2. 双模态分支的有效性

通过架构消融实验验证DFDM中双分支设计的有效性,结果如表3所示. DFDM采用模态驱动的异构特征处理机制:素描分支通过5级渐进式平均池化(5×5→3×3),配合动态卷积网络(13×13大核与3×3小核交替堆叠),实现笔触噪声抑制与明暗分布建模;照片分支采用3级级联最大池化(3×3→2×2)并结合异构卷积组合,在保持边缘锐度的基础上,通过大核卷积捕获面部轮廓连续性,通过小核卷积提取细节. 表3数据表明,移除双模态分支结构的基准模型(w/o branch)因特征混淆导致跨模态语义失配,SSIM与LPIPS指标反映出显著的风格-内容失衡. 引入双模态分支架构(w/ branch) 后,SSIM值提升了10.9%,PSNR值提高了1.56 dB,验证了异构模态处理策略的有效性.

表 3   DFDM中双模态分支的有效性

Tab.3  Effectiveness of dual-modal branches in DFDM

方法SSIMPSNR/dBMSELPIPS
w/o branch0.461427.96104.160.4442
w/ branch0.511629.5273.190.2436

新窗口打开| 下载CSV


图5进一步展示了双模态分支消融实验的可视化结果,其中(a)~(d)分别为人脸照片、移除双分支结构的生成结果、保留双分支结构的生成结果以及参考素描图像. 移除双分支结构的生成结果存在双重缺陷,一方面无法准确再现素描的笔触风格,另一方面丢失了关键面部特征,例如,生成的素描图像中人物的鼻翼轮廓模糊. 提出的架构通过双分支协同作用,在素描风格学习与内容保真之间建立平衡,其中平均池化分支有效提取了方向性笔触特征,最大池化分支确保五官几何结构被精确再现. 机理分析表明,该设计通过建立跨模态特征校准通道,使生成过程既能继承照片的细节保真度,又能遵循素描艺术的表现规律.

图 5

图 5   双模态分支结构的消融实验可视化结果

Fig.5   Visualization results of ablation experiment on dual-modal branch structure


2.4.3. 大、小核卷积交替的有效性

验证DFDM中交替堆叠的大、小核卷积对模型性能提升的有效性,结果如表4所示. DFDM的特征编码网络摒弃了传统的单一卷积方案,创新地采用13×13大核卷积与3×3小核卷积交替堆叠结构. 该设计通过双重路径来优化特征表达,其中大核卷积对全局轮廓连续性进行建模,以维持结构完整性,小核卷积聚焦于局部纹理细节,以提升特征丰富度,二者协同抑制跨模态高频噪声的干扰. 实验数据表明,相较于常规的5×5和7×7卷积,提出的交替堆叠大、小核卷积使模型在客观评价指标上表现更优,验证了交替堆叠结构的有效性.

表 4   大、小核卷积交替结构的有效性

Tab.4  Effectiveness of alternating structure of large and small kernel convolutions

卷积核SSIMPSNR/dBMSELPIPS
5×50.508529.4873.660.2517
7×70.510729.2178.430.2485
13×13 & 3×30.511629.5273.190.2436

新窗口打开| 下载CSV


2.5. 模型泛化性

为了深入评估模型的泛化性,系统性地测试多种具有挑战性的场景,包括遮挡(如帽子大面积地遮挡前额与发际线)、非均匀光照(如背光导致图像严重欠曝)、非标准姿态(如大角度侧脸)以及非人脸图像(如宠物狗),实验结果如图6所示. 可以看出,SAT-StyTR模型在这些复杂条件下仍然能够生成结构清晰、细节丰富的高质量素描图像,其生成结果在发丝走向、面部轮廓结构等关键信息上较好地保持了原有的几何特征,在表情和纹理细节上也展现出良好的性能. 实验结果充分证明了所提模型在不同场景下的泛化能力.

图 6

图 6   所提模型在复杂场景下生成的素描图像

Fig.6   Synthesized sketches of proposed model under complex scenarios


2.6. 计算效率分析

为了评估不同方法的计算效率,对比不同方法的模型参数量Np和平均推理时间tinf,结果如表5所示. 可以看出,SAT-StyTR方法的平均推理时间比pix2pix和文献[15]模型更长,但是优于U-GAT-IT、DCLGAN、CAP-VSTNet、和Mamba-ST方法,且具有可接受的模型参数量. 综合前面的主、客观实验结果,所提方法在人脸素描图像生成效果和计算效率上达到了较好的平衡.

表 5   不同方法的参数量和平均推理时间对比

Tab.5  Comparison of parameter count and average inference time of different methods

模型Np/106tinf/s
pix2pix57.180.039
U-GAT-IT664.830.088
DCLGAN29.270.159
文献[15]模型58.900.035
CAP-VSTNet4.090.210
Mamba-ST40.020.076
SAT-StyTR83.740.041

新窗口打开| 下载CSV


3. 结 语

为了实现人脸素描生成过程中的跨模态特征耦合并抑制生成图像的结构失真问题,提出基于空间自适应Transformer的半监督生成对抗网络SAT-StyTR. 该方法通过双模态特征解耦模块分离人脸照片的内容特征与素描图像的风格特征;结合行-列向量动态融合模块,实现了跨模态特征的自适应重组;设计的多尺度感知判别器提升了模型对发丝纹理、五官轮廓等细粒度特征的生成质量. 实验表明,SAT-StyTR在FID、SSIM等关键指标上优于现有主流模型,验证了双模态解耦架构的有效性. 在理论层面上,空间自适应注意力机制为跨模态生成提供了可解释的特征交互范式;在方法层面上,轻量化的Transformer-GAN协同架构为高效图像生成提供了新的解决方案. 然而,目前的SAT-StyTR方法仍然存在不足. 在未来工作中,拟引入扩散模型或3D人脸重建技术,以增强素描生成结果的立体感,并提高对其艺术风格的可控性.

参考文献

GAO L, LIU F L, CHEN S Y, et al

SketchFaceNeRF: sketch-based facial generation and editing in neural radiance fields

[J]. ACM Transactions on Graphics, 2023, 42 (4): 159

[本文引用: 1]

翁丽芬, 李晨阳, 许华荣

基于GAN的分步合成人脸素描生成算法

[J]. 计算机辅助设计与图形学学报, 2023, 35 (9): 1363- 1373

DOI:10.3724/SP.J.1089.2023.19582      [本文引用: 1]

WENG Lifen, LI Chenyang, XU Huarong

Stepwise synthetic face sketch generation algorithm based on GAN

[J]. Journal of Computer-Aided Design & Computer Graphics, 2023, 35 (9): 1363- 1373

DOI:10.3724/SP.J.1089.2023.19582      [本文引用: 1]

ABDEL-AZIZ H G M, EBEID H M, MOSTAFA M G M. An unsupervised method for face photo-sketch synthesis and recognition [C]// Proceedings of the 7th International Conference on Information and Communication Systems. Irbid: IEEE, 2016: 221–226.

[本文引用: 1]

GALEA C, FARRUGIA R A. Face photo-sketch recognition using local and global texture descriptors [C]// Proceedings of the 24th European Signal Processing Conference. Budapest: IEEE, 2016: 2240–2244.

[本文引用: 1]

LI J, YU X, PENG C, et al

Adaptive representation-based face sketch-photo synthesis

[J]. Neurocomputing, 2017, 269: 152- 159

DOI:10.1016/j.neucom.2016.10.095      [本文引用: 1]

LIU Z S, SIU W C, CHAN H A. Learn to sketch: a fast approach for universal photo sketch [C]// Proceedings of the Asia-Pacific Signal and Information Processing Association Annual Summit and Conference. Tokyo: IEEE, 2021: 1450–1457.

[本文引用: 1]

ZHANG L, LIN L, WU X, et al. End-to-end photo-sketch generation via fully convolutional representation learning [C]// Proceedings of the 5th ACM on International Conference on Multimedia Retrieval. Shanghai: ACM, 2015: 627–634.

[本文引用: 1]

GALEA C, FARRUGIA R A

Forensic face photo-sketch recognition using a deep learning-based architecture

[J]. IEEE Signal Processing Letters, 2017, 24 (11): 1586- 1590

DOI:10.1109/LSP.2017.2749266      [本文引用: 1]

ZHU M, LI J, WANG N, et al

A deep collaborative framework for face photo-sketch synthesis

[J]. IEEE Transactions on Neural Networks and Learning Systems, 2019, 30 (10): 3096- 3108

DOI:10.1109/TNNLS.2018.2890018      [本文引用: 1]

曹林, 王震, 杜康宁, 等

基于层次对比生成对抗网络的非配对素描人脸合成

[J]. 中国科技论文, 2024, 19 (6): 715- 723

DOI:10.3969/j.issn.2095-2783.2024.06.011      [本文引用: 1]

CAO Lin, WANG Zhen, DU Kangning, et al

Unpaired sketch face synthesis based on hierarchical contrast generative adversarial network

[J]. China Sciencepaper, 2024, 19 (6): 715- 723

DOI:10.3969/j.issn.2095-2783.2024.06.011      [本文引用: 1]

ZHU M, LIANG C, WANG N, et al. A sketch-Transformer network for face photo-sketch synthesis [C]// Proceedings of the Thirtieth International Joint Conference on Artificial Intelligence. Montreal: IJCAI, 2021: 1352–1358.

[本文引用: 1]

CHEN C, YE M, QI M, et al. Sketch Transformer: asymmetrical disentanglement learning from dynamic synthesis [C]// Proceedings of the 30th ACM International Conference on Multimedia. Lisboa: ACM, 2022: 4012–4020.

[本文引用: 1]

YU W, ZHU M, WANG N, et al

An efficient Transformer based on global and local self-attention for face photo-sketch synthesis

[J]. IEEE Transactions on Image Processing, 2023, 32: 483- 495

DOI:10.1109/TIP.2022.3229614      [本文引用: 1]

陈长武, 曹林, 郭亚男, 等

基于域自适应均值网络的素描人脸识别方法

[J]. 计算机应用与软件, 2023, 40 (4): 107- 115

[本文引用: 1]

CHEN Changwu, CAO Lin, GUO Yanan, et al

Sketch face recognition based on domain adaptation mean network

[J]. Computer Applications and Software, 2023, 40 (4): 107- 115

[本文引用: 1]

SHI Z, WAN W

Transformer-based adversarial network for semi-supervised face sketch synthesis

[J]. Journal of Visual Communication and Image Representation, 2024, 102: 104204

DOI:10.1016/j.jvcir.2024.104204      [本文引用: 8]

DENG Y, TANG F, DONG W, et al. StyTr2: image style transfer with Transformers [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022: 11316–11326.

[本文引用: 1]

SUN J, LIU X, BÄCK T, et al

Learning adaptive differential evolution algorithm from optimization experiences by policy gradient

[J]. IEEE Transactions on Evolutionary Computation, 2021, 25 (4): 666- 680

DOI:10.1109/TEVC.2021.3060811      [本文引用: 1]

LI Y, CHEN X, YANG B, et al. DeepFacePencil: creating face images from freehand sketches [C]// Proceedings of the 28th ACM International Conference on Multimedia. Seattle: ACM, 2020: 991–999.

[本文引用: 1]

KARNEWAR A, WANG O. MSG-GAN: multi-scale gradients for generative adversarial networks [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 7796–7805.

[本文引用: 1]

WANG X, TANG X

Face photo-sketch synthesis and recognition

[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2009, 31 (11): 1955- 1967

DOI:10.1109/TPAMI.2008.222      [本文引用: 1]

ZHANG W, WANG X, TANG X. Coupled information-theoretic encoding for face photo-sketch recognition [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Colorado Springs: IEEE, 2011: 513–520.

[本文引用: 1]

KINGMA D P, BA J. Adam: a method for stochastic optimization [EB/OL]. (2017-01-30) [2025-07-15]. https://arxiv.org/abs/1412.6980.

[本文引用: 1]

XIONG R, YANG Y, HE D, et al. On layer normalization in the Transformer architecture [C]// Proceedings of the 37th International Conference on Machine Learning. [S.l.]: PMLR, 2020: 10524–10533.

[本文引用: 1]

GOODFELLOW I, BENGIO Y, COURVILLE A. Optimization for training deep models [M]// Deep learning. Cambridge: MIT Press, 2016: 291–293.

[本文引用: 1]

ISOLA P, ZHU J Y, ZHOU T, et al. Image-to-image translation with conditional adversarial networks [C]// Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Honolulu: IEEE, 2017: 5967–5976.

[本文引用: 1]

KIM J, KIM M, KANG H, et al. U-GAT-IT: unsupervised generative attentional networks with adaptive layer-instance normalization for image-to-image translation [EB/OL]. (2020-04-08) [2025-07-15]. https://arxiv.org/abs/1907.10830.

[本文引用: 1]

HAN J, SHOEIBY M, PETERSSON L, et al. Dual contrastive learning for unsupervised image-to-image translation [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. Nashville: IEEE, 2021: 746–755.

[本文引用: 1]

WEN L, GAO C, ZOU C. CAP-VSTNet: content affinity preserved versatile style transfer [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023: 18300–18309.

[本文引用: 1]

BOTTI F, ERGASTI A, ROSSI L, et al. Mamba-ST: state space model for efficient style transfer [EB/OL]. (2024-09-16) [2025-07-15]. https://arxiv.org/abs/2409.10385.

[本文引用: 1]

WANG Z, BOVIK A C, SHEIKH H R, et al

Image quality assessment: from error visibility to structural similarity

[J]. IEEE Transactions on Image Processing, 2004, 13 (4): 600- 612

DOI:10.1109/TIP.2003.819861      [本文引用: 1]

KORHONEN J, YOU J. Peak signal-to-noise ratio revisited: is simple beautiful? [C]// Proceedings of the Fourth International Workshop on Quality of Multimedia Experience. Melbourne: IEEE, 2012: 37–38.

[本文引用: 1]

MARMOLIN H

Subjective MSE measures

[J]. IEEE Transactions on Systems, Man, and Cybernetics, 1986, 16 (3): 486- 489

DOI:10.1109/TSMC.1986.4308985      [本文引用: 1]

KETTUNEN M, HÄRKÖNEN E, LEHTINEN J. E-LPIPS: robust perceptual image similarity via random transformation ensembles [EB/OL]. (2019-06-11) [2025-07-15]. https://arxiv.org/abs/1906.03973.

[本文引用: 1]

HEINONEN M, RANTANEN A, MIELIKÄINEN T, et al

FiD: a software for ab initio structural identification of product ions from tandem mass spectrometric data

[J]. Rapid Communications in Mass Spectrometry, 2008, 22 (19): 3043- 3052

DOI:10.1002/rcm.3701      [本文引用: 1]

/