基于空间自适应Transformer的人脸素描图像生成
Face photo-to-sketch synthesis based on spatially adaptive Transformer
收稿日期: 2025-07-16
| 基金资助: |
|
Received: 2025-07-16
| Fund supported: | 国家自然科学基金资助项目(62261025,62362032);江西省自然科学基金资助项目(20242BAB25076,20232BAB212015). |
作者简介 About authors
万伟国(1991—),男,副教授,博士,从事计算机视觉、图像处理研究.orcid.org/0000-0002-3537-979X.E-mail:
针对现有人脸素描图像生成方法存在的生成图像结构失真、纹理模糊及伪影残留等问题,提出基于空间自适应Transformer的生成网络(SAT-StyTR). 在编码器中构建双模态特征解耦模块(DFDM),通过并行的人脸内容与素描风格特征提取分支,实现跨模态特征的解耦表征. 设计行-列向量动态融合模块(VDFM),引入双向门控机制,以实现行、列向量的自适应特征融合,显著增强局部细节保留能力. 引入多尺度感知判别器(MSPD),利用层级式梯度监督机制在多语义粒度上优化素描图像纹理的真实感. 在CUHK、AR、XM2VTS和CUFSF数据集上的实验结果表明,所提方法在SSIM、PSNR、MSE、LPIPS和FID等指标上均优于Mamba-ST等现有方法,其FID值在4个数据集上比次优方法分别降低了19.3%、1.0%、15.5%和10.0%. 视觉对比分析进一步验证了所提方法的生成结果在五官轮廓等关键区域上具有更优的结构一致性与细节还原度.
关键词:
A spatially adaptive Transformer-based generation network (SAT-StyTR) was proposed to address the issues of existing face photo-to-sketch synthesis methods, such as structural distortion, blurred textures, and artifact residue. A dual-modal feature disentanglement module (DFDM) was constructed in the encoder. The parallel branches of face content and sketch style feature extraction were employed in DFDM to achieve disentangled representation of cross-modal features. A row-column vector dynamic fusion module (VDFM) was designed, and a bidirectional gating mechanism was introduced in the VDFM to enable adaptive feature fusion of row-column vectors. Then the capability of local detail retention was significantly improved. A multi-scale perceptive discriminator (MSPD) was incorporated to optimize the realism of generated sketch textures at multiple semantic levels by leveraging the hierarchical gradient supervision mechanism. The experimental results on the CUHK, AR, XM2VTS and CUFSF datasets demonstrated that the proposed method outperformed existing methods such as Mamba-ST on SSIM, PSNR, MSE, LPIPS, and FID metrics, with its FID values improved by 19.3%, 1.0%, 15.5%, and 10.0% over those of the second-best method on the four datasets, respectively. Visual comparative analysis further validated that superior structural consistency and detail restoration were achieved in critical regions, such as facial contours.
Keywords:
本文引用格式
万伟国, 钟凯晨, 张迎梅, 姚丽, 包书鸿, 龚大伟.
WAN Weiguo, ZHONG Kaichen, ZHANG Yingmei, YAO Li, BAO Shuhong, GONG Dawei.
近年来,人脸素描图像生成技术取得了显著进展,但是照片与素描图像间的模态差异仍然对现有方法构成了挑战. 传统方法主要基于人工设计的特征与边缘检测算法构建生成框架,例如,Abdel-Aziz等[3]提出无监督边缘增强框架,通过多尺度边缘融合来优化生成过程;Galea等[4]设计局部-全局纹理描述符联合策略,结合跨模态特征匹配,提升了图像生成效果;Li等[5]引入自适应滤波器,通过噪声抑制来降低模态差异的影响. 基于边缘检测的传统人脸素描生成方法具有实现简单、计算效率高的优势,但是其依赖人工经验设计的特征提取算子与规则对复杂背景的干扰较为敏感,容易导致边缘信息丢失,在平衡高频细节与语义结构一致性方面存在局限性[6].
卷积神经网络(CNN)由于其自动特征提取能力,被广泛应用于人脸素描图像的生成. 早期研究中,Zhang等[7]率先构建基于全卷积神经网络的端到端转换框架,通过多级特征细化机制来实现自动化人脸素描图像生成;相较于传统纹理映射方法,其显著降低了对人工设计的特征及其提取规则的依赖性. 针对跨模态匹配的鲁棒性问题,Galea等[8]提出深度度量学习范式,通过约束照片与素描图像在特征空间中的语义一致性,有效提升了复杂场景下的身份匹配精度. 为了进一步解决双向转换中的特征解耦难题,Zhu等[9]设计协同生成对抗框架,创新地融合注意力机制与特征共享策略,在保持身份特征连贯性的同时实现了高质量风格迁移. 当前方法普遍采用CNN作为基础架构,其局部感知特性虽然能够有效捕捉面部细节特征,但是在全局上下文建模方面存在局限性,容易导致生成素描图像的结构失真问题. 这一瓶颈推动着研究者不断探索更强大的特征表达与长程依赖建模方法[10].
Transformer的全局自注意力机制有效突破了CNN的局部感受野限制,在建模人脸全局结构特征和捕获长距离依赖关系方面展现出显著优势. 研究者们提出多种融合策略:Zhu等[11]构建CNN与Transformer的混合架构,实现了多尺度全局结构与局部纹理的联合建模;Chen等[12]提出基于动态合成的非对称解耦学习框架,优化了跨模态风格迁移过程;Yu等[13]设计空间约束下的全局-局部自注意力机制,提升了特征计算效率;陈长武等[14]采用域自适应均值网络,实现了跨模态特征分布对齐;Shi等[15]基于StyTr2模型[16]提出基于自适应窗口注意力Transformer的半监督对抗网络框架,用于人脸素描图像生成任务,并采用拉普拉斯算子来增强人脸素描图像的细节信息. 基于Transformer的人脸素描图像生成方法在全局建模和风格迁移方面表现出较强的性能,但是其在局部细节保真度、计算效率及精细化风格控制方面仍须进一步突破[17].
针对现有方法在跨模态特征解耦与长程依赖建模的局限性,提出基于空间自适应Transformer的人脸素描生成网络(SAT-StyTR),通过双模态解耦-动态融合-多尺度优化的创新架构,系统地解决跨模态生成中的结构失真与纹理模糊的问题. 首先,构建双模态特征解耦模块(dual-modal feature disentanglement module, DFDM),通过并行分支结构显式分离人脸照片的语义内容与素描图像的风格特征,并利用空间自适应注意力机制动态校准跨模态特征分布,以缓解模态差异导致的边缘伪影问题. 其次,设计行-列向量动态融合模块(vector dynamic fusion module, VDFM)和双向门控机制,自适应聚合多尺度行、列向量特征,在保留五官轮廓、发丝纹理等关键细节的同时,增强生成图像的结构一致性. 最后,结合多尺度感知判别器(multi-scale perceptive discriminator, MSPD),通过并行部署大规模全局判别器与小尺度局部判别器,构建多粒度对抗监督机制,在约束面部轮廓与五官比例的结构一致性的同时强化细节的逼真度.
1. 本研究方法
1.1. 总体网络结构
所提方法的总体框架为基于编码器-特征融合-解码器架构的半监督生成对抗网络(generative adversarial network, GAN),如图1所示. 在双模态特征解耦编码阶段,采用并行双分支编码器,分别处理人脸照片与素描图像. 输入图像经分块卷积操作被嵌入为高维特征后,利用DFDM进行深度特征提取. 其中,内容分支利用动态注意力机制显式解耦语义内容特征,聚焦五官结构等全局语义;风格分支通过空间自适应机制校准跨模态特征分布,抑制边缘伪影并提取素描笔触、发丝纹理等风格信息. 在行-列向量动态融合阶段,将VDFM作为跨模态特征交互枢纽,通过像素级行-列空间注意力机制实现不同模态特征的双向交互和融合. 该模块引入双向门控机制,在Transformer架构下对行、列向量进行自适应加权融合,动态平衡局部细节与全局结构的特征贡献度,生成兼具结构一致性与风格表现力的融合特征. 最后,在轻量化对抗生成优化阶段,结合VGG19解码器与MSPD构建对抗优化框架. 解码器通过空间自适应上采样操作逐步重建人脸素描图像,并采用轻量化设计,以降低计算复杂度;判别器通过层级式梯度监督机制,在多尺度上引导生成器优化笔触真实性与风格协调性. 通过Transformer与GAN的协同优化,在提升训练与推理效率的同时,实现高分辨率、实时的图像生成,并兼顾细节精细度与自然结构连续性.
图 1
图 1 基于空间自适应Transformer的人脸素描图像生成网络(SAT-StyTR)示意图
Fig.1 Schematic of face photo-to-sketch synthesis network (SAT-StyTR) based on spatial adaptive Transformer
1.2. 双模态特征解耦模块
在双模态特征解耦编码阶段进行异构模态驱动的特征提取与动态空间注意力校准,以协同优化跨模态特征解耦过程.
针对人脸内容特征的细节保留与素描风格特征的抽象表达这2项冲突性需求,在DFDM中创新性地设计双分支异构池化结构,如图2所示,其中(a)为人脸内容特征提取分支,(b)为素描风格特征提取分支. 人脸内容分支通过级联最大池化操作(池化核尺寸由3×3逐级减小至2×2),在层级下采样的过程中保留边缘梯度突变信息与微观纹理特征,确保五官几何结构及皮肤细节的高保真表达. 素描风格分支采用多级平均池化策略(池化核尺寸由5×5逐级减小至3×3),利用渐进式特征平滑抑制局部噪声,聚焦笔触强度分布、明暗过渡等全局风格规律.
图 2
为了进一步消除跨模态特征歧义,引入多尺度卷积耦合注意力机制[18],基于交替堆叠的大核卷积(13×13)与小核卷积(3×3)构建特征编码网络,前者通过大感受野来建模面部轮廓连续性等长程依赖关系,后者精细化捕获局部结构模式. 编码后的特征经空间归一化处理后生成像素级注意力权重图,并通过双线性插值实现与原始特征图的空间对齐,最终以逐像素重加权的方式实现特征动态校准,在增强对眉眼轮廓、鼻梁光影等关键语义区域响应强度的同时,自适应抑制背景干扰与模态特异性噪声. 该机制通过对特征表达空间的重构与增强,提升跨模态特征对齐的语义一致性,并保障局部细节的拓扑保形特性.
1.3. 行-列向量动态融合模块
针对跨模态特征融合中存在的空间语义错位问题,提出基于双向几何约束的像素级动态注意力融合机制. 该方法通过特征张量的行、列向量正交分解来建立空间约束关系,利用双向显著性权重实现特征的几何一致性重组.
令通过DFDM提取到的人脸内容特征和风格特征分别为X1、X2. 首先,对异构特征进行通道拼接和自注意力建模;随后,通过线性投影分别将建模后的特征Xf与风格特征X2映射至同一特征空间. 该过程通过建立特征空间的正交投影约束,有效缓解了跨模态特征融合过程中的空间错位问题,具体表示为
式中:Xf为维度对齐后的融合特征,Linear (·)为线性投影操作,SA (·)为自注意力操作,Concat (·)为通道维度拼接操作.
在空间语义建模阶段,对特征Xf与
式中:H为特征的总行数或总列数;type为范数类型,其中
在特征动态融合过程中,引入指数增强型归一化策略,通过对注意力得分进行非线性放大与概率约束,强化高信息量区域的特征贡献,同时抑制面部平坦区域的冗余响应,具体表示为
式中:ϵ为常系数,αi和βi (i=1, 2)为行向量或列向量的注意力权重系数.
VDFM通过双向特征融合与跨维度聚合来实现特征优化. 利用行、列向量权重将特征Xf与
最后,进行跨维度聚合,生成兼顾局部语义对齐与全局结构一致性的融合张量F:
1.4. 多尺度感知判别器
针对GAN中全局语义约束与局部细节保真难以协同优化的核心挑战,采用基于特征金字塔架构的多粒度判别机制[19]. 区别于传统单尺度判别器,MSPD采用金字塔式多粒度判别架构,对输入图像进行逐级下采样操作,以生成多分辨率特征金字塔,并在各尺度独立部署子判别器来进行特征解耦分析. 其中,高分辨率分支聚焦于微观细节的真实性判别,低分辨率分支用于面部轮廓、五官比例等宏观语义的合理性验证,由此形成覆盖局部细节与全局语义的完备的特征监督体系.
如图3所示,模块通过可微分下采样操作构建多尺度金字塔特征表达空间,其中每个子判别器由堆叠的卷积层与可选的实例或批量归一化层构成,支持自适应选择归一化策略,以平衡风格迁移稳定性与内容保真需求. 通过特征级联来聚合各尺度的判别结果,同时保留中间层特征图,用于计算感知损失,为生成器提供像素级梯度反馈,从而指导语义级分布校正. 此外,引入动态激活机制,通过可配置的Sigmoid门控机制,控制判别置信度的输出范围,增强模型对复杂光照条件和多样化艺术风格的适应性. 该设计通过跨尺度特征协同监督,迫使生成器同时满足低分辨率约束与高分辨率约束,显著提升生成的人脸素描图像在视觉一致性、细节丰富度及跨域泛化能力方面的综合表现.
图 3
1.5. 损失函数
1.5.1. 语义内容约束
在人脸素描图像生成任务中,生成图像与参考图像的结构一致性面临严峻挑战. 针对传统像素级损失函数难以约束高阶语义特征的问题,提出基于VGG19深层语义特征的内容损失函数LC,通过提取预训练网络的高阶特征,构建判别性语义空间,并利用特征空间欧氏距离来约束生成图像的几何拓扑结构. 内容损失函数表示为
式中:Φ(·)为特征提取操作,Gs为生成的素描图像,Ic为输入的人脸照片.
1.5.2. 风格分布对齐
为了确保生成素描图像的笔触风格与参考图在纹理分布上的一致性,提出基于统计特征对齐的风格损失LS,其核心思想是通过约束生成图像与参考图像特征的均值和标准差,而非通过传统Gram矩阵,来实现风格迁移. 风格损失函数表示为
式中:Is为输入的人脸素描图像;μ(·)和σ(·)分别为特征图的通道均值与标准差计算操作,用于表征风格分布.
1.5.3. 微观细节增强
针对生成的人脸素描图像中高频细节容易丢失的问题,提出基于拉普拉斯-高斯边缘检测算子的细节损失LD,通过强化边缘区域的高频信息来提升视觉清晰度. 细节损失函数表示为
式中:lap (·)为拉普拉斯算子,用于提取图像二阶梯度特征;m为边缘区域的掩码,用于聚焦关键细节;f为高斯滤波器对特征的操作,用于抑制噪声干扰.
1.5.4. 身份特征保持
为了确保生成图像的身份辨识度,提出双路径身份损失函数,并结合像素级约束与深度语义特征对齐. 其中,像素级身份损失LID1和深度特征损失LID2表示为
式中:Φi(·)为提取VGG19网络中第i层特征的操作. 多层特征融合确保了身份信息在局部细节与全局细节上均与输入信息一致.
1.5.5. 对抗优化驱动
引入多尺度梯度惩罚对抗损失,通过层级化判别器监督来提升生成图像的局部真实感,表示为
式中:N为输入图像的数量,Di (·)为第i个判别器对图像的处理,G(Ic, j)为第j个输入的人脸照片所生成的素描图像. 多尺度监督迫使生成器同时关注低分辨率的整体结构与高分辨率的局部纹理.
综合以上损失函数,提出多层次加权损失约束框架,以实现对生成质量的精细化控制:
式中:λC、λS、λD、λID1、λID2和λA为各损失函数的权重系数,通过实验分别设置为7、18、200、70、1和1.
2. 实验结果与分析
2.1. 数据集与实验设置
2.2. 定性评估
为了评估所提模型在人脸素描图像生成上的有效性,选取6种图像生成模型进行对比分析,包括pix2pix[25]、U-GAT-IT[26]、DCLGAN[27]、CAP-VSTNet[28]、Mamba-ST[29]及文献[15]提出的模型. 图4为不同方法生成结果的视觉对比图,其中(a)为输入的人脸照片,(i)为参考图像,(b)~(h)分别为pix2pix、U-GAT-IT、DCLGAN、文献[15]模型、CAP-VSTNet、MambaST和SAT-StyTR生成的图像. 相较于现有方法,所提算法在跨域特征保持与视觉合理性方面展现出显著的优势. 对比之下,pix2pix方法生成的人脸素描图像的分辨率较低,导致图像整体模糊. U-GAT-IT方法的结果存在关键面部细节缺失的问题,如图4中第3列第5行的图像所示,生成的素描图像丢失了法令纹与抬头纹的纹理细节. DCLGAN方法生成的素描图像出现了高频伪影,且在第4列第8行的图像中产生了与输入人脸照片无关的异常发型线条. 文献[15]模型生成的素描图像同样存在伪影的问题,且与真实素描图像的相似度较低. CAP-VSTNet方法因过度强调线条刻画而导致生成结果呈现非自然的手绘质感. MambaST方法因保留三维面部立体特征,未能充分学习素描图像的平面化表达特性. 相较之下,提出的SAT-StyTR方法在保持生成图像自然度的同时,实现了细粒度特征的精确还原,在细节还原和整体视觉效果方面表现出更优异的性能.
图 4
图 4 不同方法在CUHK、AR、XM2VTS和CUFSF数据集上的定性实验结果对比
Fig.4 Comparison of qualitative experimental results of different methods on CUHK, AR, XM2VTS, and CUFSF datasets
2.3. 定量评估
构建多维度图像质量评估体系,采用结构相似度(SSIM[30])、保真度(PSNR[31]、MSE[32])与感知质量(LPIPS[33]、FID[34])指标对生成结果进行全面验证. 其中,SSIM用于衡量生成图像与参考图像在亮度、对比度和局部结构上的相似度,以评估图像的结构保真性;PSNR和MSE衡量像素级差异,PSNR值越高、MSE值越低表示生成图像的保真度越高;LPIPS基于深度特征计算感知相似度,更符合人眼对图像差异的感知特性,值越低表示视觉效果越接近于参考图像;FID衡量生成图像与真实图像在高维特征空间分布上的差异,值越低说明生成图像在整体分布上与真实图像越接近. 通过这些指标,可以从像素、结构和感知3个层面全面量化生成图像的质量. 对比结果如表1所示,其中,最优结果以粗体显示,次优结果用下划线标出. 提出的SAT-StyTR方法在4个基准数据集上均展现出显著优势:在CUHK数据集上,其SSIM较pix2pix模型提升了1.4%,FID较次优方法降低了19.3%;在AR数据集上,SSIM、PSNR与MSE均达到最优,FID较次优方法降低了1.0%,表明生成图像在细节保真度与结构完整性之间实现了平衡. 针对跨域挑战,SAT-StyTR在XM2VTS与CUFSF数据集上的MSE值分别为73.19和91.74,较次优模型降低了1.0%和3.4%;FID较次优模型分别降低了15.5%和10.0%,验证了所提方法在素描笔触方向性与明暗过渡特性建模上的有效性. 实验结果表明,基于几何约束注意力与跨模态特征融合的SAT-StyTR生成的素描图像可以同时保持人脸拓扑精确性与素描艺术表现力.
表 1 不同方法在CUHK、AR、XM2VTS和CUFSF数据集上的定量指标对比
Tab.1
| 模型 | CUHK数据集 | AR数据集 | |||||||||
| SSIM | PSNR/dB | MSE | LPIPS | FID | SSIM | PSNR/dB | MSE | LPIPS | FID | ||
| pix2pix | 30.70 | 56.30 | 89.08 | 29.68 | 71.83 | 99.92 | |||||
| U-GAT-IT | 29.75 | 69.28 | 131.85 | 29.28 | 77.79 | 170.04 | |||||
| DCLGAN | 30.48 | 58.56 | 72.46 | 29.78 | 70.46 | 97.96 | |||||
| 文献[15]模型 | 30.12 | 64.26 | 71.27 | 29.80 | 69.31 | 82.45 | |||||
| CAP-VSTNet | 30.43 | 59.34 | 82.41 | 29.65 | 71.06 | 117.35 | |||||
| Mamba-ST | 29.69 | 72.03 | 75.40 | 29.06 | 81.17 | 84.68 | |||||
| SAT-StyTR | 30.89 | 53.93 | 57.51 | 29.89 | 67.88 | 81.66 | |||||
| 模型 | XM2VTS数据集 | CUFSF数据集 | |||||||||
| SSIM | PSNR/dB | MSE | LPIPS | FID | SSIM | PSNR/dB | MSE | LPIPS | FID | ||
| pix2pix | 29.22 | 78.11 | 62.13 | 28.36 | 94.94 | 54.89 | |||||
| U-GAT-IT | 29.30 | 76.70 | 137.14 | 28.27 | 96.95 | 42.63 | |||||
| DCLGAN | 29.22 | 78.28 | 91.56 | 28.35 | 95.12 | 44.22 | |||||
| 文献[15]模型 | 29.47 | 73.95 | 63.65 | 28.25 | 97.26 | 32.56 | |||||
| CAP-VSTNet | 29.23 | 78.15 | 79.81 | 28.10 | 100.65 | 61.21 | |||||
| Mamba-ST | 28.37 | 94.81 | 74.16 | 28.22 | 98.01 | 49.03 | |||||
| SAT-StyTR | 29.52 | 73.19 | 52.48 | 28.51 | 91.74 | 29.30 | |||||
2.4. 消融实验
2.4.1. 所提模块的有效性
通过渐进式消融实验验证各模块的协同优化效应,结果如表2所示. 当仅采用DFDM时,生成结果中的SSIM (
表 2 所提模块的消融实验结果
Tab.2
| 方法 | SSIM | PSNR/dB | MSE | LPIPS |
| DFDM | 30.44 | 59.63 | ||
| DFDM+MSPD | 30.72 | 56.73 | ||
| SAT-StyTR | 30.89 | 53.93 |
2.4.2. 双模态分支的有效性
通过架构消融实验验证DFDM中双分支设计的有效性,结果如表3所示. DFDM采用模态驱动的异构特征处理机制:素描分支通过5级渐进式平均池化(5×5→3×3),配合动态卷积网络(13×13大核与3×3小核交替堆叠),实现笔触噪声抑制与明暗分布建模;照片分支采用3级级联最大池化(3×3→2×2)并结合异构卷积组合,在保持边缘锐度的基础上,通过大核卷积捕获面部轮廓连续性,通过小核卷积提取细节. 表3数据表明,移除双模态分支结构的基准模型(w/o branch)因特征混淆导致跨模态语义失配,SSIM与LPIPS指标反映出显著的风格-内容失衡. 引入双模态分支架构(w/ branch) 后,SSIM值提升了10.9%,PSNR值提高了1.56 dB,验证了异构模态处理策略的有效性.
表 3 DFDM中双模态分支的有效性
Tab.3
| 方法 | SSIM | PSNR/dB | MSE | LPIPS |
| w/o branch | 27.96 | 104.16 | ||
| w/ branch | 29.52 | 73.19 |
图5进一步展示了双模态分支消融实验的可视化结果,其中(a)~(d)分别为人脸照片、移除双分支结构的生成结果、保留双分支结构的生成结果以及参考素描图像. 移除双分支结构的生成结果存在双重缺陷,一方面无法准确再现素描的笔触风格,另一方面丢失了关键面部特征,例如,生成的素描图像中人物的鼻翼轮廓模糊. 提出的架构通过双分支协同作用,在素描风格学习与内容保真之间建立平衡,其中平均池化分支有效提取了方向性笔触特征,最大池化分支确保五官几何结构被精确再现. 机理分析表明,该设计通过建立跨模态特征校准通道,使生成过程既能继承照片的细节保真度,又能遵循素描艺术的表现规律.
图 5
图 5 双模态分支结构的消融实验可视化结果
Fig.5 Visualization results of ablation experiment on dual-modal branch structure
2.4.3. 大、小核卷积交替的有效性
验证DFDM中交替堆叠的大、小核卷积对模型性能提升的有效性,结果如表4所示. DFDM的特征编码网络摒弃了传统的单一卷积方案,创新地采用13×13大核卷积与3×3小核卷积交替堆叠结构. 该设计通过双重路径来优化特征表达,其中大核卷积对全局轮廓连续性进行建模,以维持结构完整性,小核卷积聚焦于局部纹理细节,以提升特征丰富度,二者协同抑制跨模态高频噪声的干扰. 实验数据表明,相较于常规的5×5和7×7卷积,提出的交替堆叠大、小核卷积使模型在客观评价指标上表现更优,验证了交替堆叠结构的有效性.
表 4 大、小核卷积交替结构的有效性
Tab.4
| 卷积核 | SSIM | PSNR/dB | MSE | LPIPS |
| 5×5 | 29.48 | 73.66 | ||
| 7×7 | 29.21 | 78.43 | ||
| 13×13 & 3×3 | 29.52 | 73.19 |
2.5. 模型泛化性
为了深入评估模型的泛化性,系统性地测试多种具有挑战性的场景,包括遮挡(如帽子大面积地遮挡前额与发际线)、非均匀光照(如背光导致图像严重欠曝)、非标准姿态(如大角度侧脸)以及非人脸图像(如宠物狗),实验结果如图6所示. 可以看出,SAT-StyTR模型在这些复杂条件下仍然能够生成结构清晰、细节丰富的高质量素描图像,其生成结果在发丝走向、面部轮廓结构等关键信息上较好地保持了原有的几何特征,在表情和纹理细节上也展现出良好的性能. 实验结果充分证明了所提模型在不同场景下的泛化能力.
图 6
图 6 所提模型在复杂场景下生成的素描图像
Fig.6 Synthesized sketches of proposed model under complex scenarios
2.6. 计算效率分析
表 5 不同方法的参数量和平均推理时间对比
Tab.5
| 模型 | Np/106 | tinf/s |
| pix2pix | 57.18 | 0.039 |
| U-GAT-IT | 664.83 | 0.088 |
| DCLGAN | 29.27 | 0.159 |
| 文献[15]模型 | 58.90 | 0.035 |
| CAP-VSTNet | 4.09 | 0.210 |
| Mamba-ST | 40.02 | 0.076 |
| SAT-StyTR | 83.74 | 0.041 |
3. 结 语
为了实现人脸素描生成过程中的跨模态特征耦合并抑制生成图像的结构失真问题,提出基于空间自适应Transformer的半监督生成对抗网络SAT-StyTR. 该方法通过双模态特征解耦模块分离人脸照片的内容特征与素描图像的风格特征;结合行-列向量动态融合模块,实现了跨模态特征的自适应重组;设计的多尺度感知判别器提升了模型对发丝纹理、五官轮廓等细粒度特征的生成质量. 实验表明,SAT-StyTR在FID、SSIM等关键指标上优于现有主流模型,验证了双模态解耦架构的有效性. 在理论层面上,空间自适应注意力机制为跨模态生成提供了可解释的特征交互范式;在方法层面上,轻量化的Transformer-GAN协同架构为高效图像生成提供了新的解决方案. 然而,目前的SAT-StyTR方法仍然存在不足. 在未来工作中,拟引入扩散模型或3D人脸重建技术,以增强素描生成结果的立体感,并提高对其艺术风格的可控性.
参考文献
SketchFaceNeRF: sketch-based facial generation and editing in neural radiance fields
[J].
基于GAN的分步合成人脸素描生成算法
[J].DOI:10.3724/SP.J.1089.2023.19582 [本文引用: 1]
Stepwise synthetic face sketch generation algorithm based on GAN
[J].DOI:10.3724/SP.J.1089.2023.19582 [本文引用: 1]
Adaptive representation-based face sketch-photo synthesis
[J].DOI:10.1016/j.neucom.2016.10.095 [本文引用: 1]
Forensic face photo-sketch recognition using a deep learning-based architecture
[J].DOI:10.1109/LSP.2017.2749266 [本文引用: 1]
A deep collaborative framework for face photo-sketch synthesis
[J].DOI:10.1109/TNNLS.2018.2890018 [本文引用: 1]
基于层次对比生成对抗网络的非配对素描人脸合成
[J].DOI:10.3969/j.issn.2095-2783.2024.06.011 [本文引用: 1]
Unpaired sketch face synthesis based on hierarchical contrast generative adversarial network
[J].DOI:10.3969/j.issn.2095-2783.2024.06.011 [本文引用: 1]
An efficient Transformer based on global and local self-attention for face photo-sketch synthesis
[J].DOI:10.1109/TIP.2022.3229614 [本文引用: 1]
基于域自适应均值网络的素描人脸识别方法
[J].
Sketch face recognition based on domain adaptation mean network
[J].
Transformer-based adversarial network for semi-supervised face sketch synthesis
[J].DOI:10.1016/j.jvcir.2024.104204 [本文引用: 8]
Learning adaptive differential evolution algorithm from optimization experiences by policy gradient
[J].DOI:10.1109/TEVC.2021.3060811 [本文引用: 1]
Face photo-sketch synthesis and recognition
[J].DOI:10.1109/TPAMI.2008.222 [本文引用: 1]
Image quality assessment: from error visibility to structural similarity
[J].DOI:10.1109/TIP.2003.819861 [本文引用: 1]
Subjective MSE measures
[J].DOI:10.1109/TSMC.1986.4308985 [本文引用: 1]
FiD: a software for ab initio structural identification of product ions from tandem mass spectrometric data
[J].DOI:10.1002/rcm.3701 [本文引用: 1]
/
| 〈 |
|
〉 |

