浙江大学学报(工学版), 2026, 60(10): 2215-2226 doi: 10.3785/j.issn.1008-973X.2026.10.014

计算机技术与控制工程

面向去噪与用户偏好建模的多模态推荐模型

马文煜,, 夏鸿斌,, 王晓锋

1. 江南大学 人工智能与计算机学院,江苏 无锡 214122

2. 江南大学 人机融合软件与媒体技术江苏省高校重点实验室,江苏 无锡 214122

3. 鹏城实验室,广东 深圳 518055

Multi-modal recommendation model for denoising and user preference modeling

MA Wenyu,, XIA Hongbin,, WANG Xiaofeng

1. School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi 214122, China

2. Jiangsu Key University Laboratory of Software and Media Technology under Human-Computer Cooperation, Jiangnan University, Wuxi 214122, China

3. Pengcheng Laboratory, Shenzhen 518055, China

通讯作者: 夏鸿斌,男,教授,博导. orcid.org/0000-0003-4314-5878. E-mail:hbxia@163.com

收稿日期: 2025-08-16  

基金资助: 国家自然科学基金资助项目(61972182).

Received: 2025-08-16  

Fund supported: 国家自然科学基金资助项目(61972182).

作者简介 About authors

马文煜(2000—),男,硕士生,从事推荐系统研究.orcid.org/0009-0008-4579-2124.E-mail:6233115016@stu.jiangnan.edu.cn , E-mail:6233115016@stu.jiangnan.edu.cn

摘要

多模态推荐通过融合图像与文本信息提升推荐性能,但仍面临模态噪声干扰与用户偏好刻画不足2大挑战. 针对上述问题,提出面向去噪与用户偏好建模的多模态推荐模型(DPRec). 模型构建多模态双重去噪机制,在频域对信号级噪声进行自适应滤除,同时引入基于ID引导的门控单元抑制语义级冗余信息,从而提升模态特征表达质量与稳定性. 在结构建模方面,引入物品-物品图与用户-物品图以刻画高阶关联关系,增强多模态语义传播能力. 在偏好建模方面,设计用户动态偏好推断机制,融合长期兴趣表示与上下文信息,对不同模态分配自适应权重,实现个性化表达更新. 同时结合对比学习策略约束协同行为表示与偏好表示在统一语义空间内对齐,增强特征一致性与表示鲁棒性. 实验结果表明,DPRec在4个公开数据集上优于基线方法,NDCG@20平均提升约4.22%.

关键词: 多模态推荐 ; 图神经网络 ; 模态去噪 ; 用户偏好建模 ; 对比学习

Abstract

Multimodal recommendation improves performance by integrating visual and textual information, but it still faces two major challenges: modality noise interference and insufficient user preference modeling. To address these issues, a denoising and preference-aware multimodal recommendation model, DPRec, was proposed. A dual denoising mechanism was constructed to enhance feature quality. In the frequency domain, signal-level noise was adaptively filtered, while an ID-guided gating unit was introduced to suppress semantic-level redundancy, thereby improving the stability and expressiveness of multimodal representations. For structural modeling, both item-item and user-item graphs were incorporated to capture higher-order relationships and strengthen multimodal semantic propagation. For preference modeling, a dynamic user preference inference mechanism was designed. Long-term interest representations were combined with contextual information, and adaptive weights were assigned to different modalities to achieve personalized representation updates. In addition, a contrastive learning strategy was applied to align collaborative behavior representations and preference representations within a unified semantic space, which enhanced feature consistency and robustness. Experimental results showed that DPRec outperformed baseline methods on four public datasets, achieving an average improvement of approximately 4.22% in NDCG@20.

Keywords: multimodal recommendation ; graph neural networks ; modality denoising ; user preference modeling ; contrastive learning

PDF (4149KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

马文煜, 夏鸿斌, 王晓锋. 面向去噪与用户偏好建模的多模态推荐模型. 浙江大学学报(工学版)[J], 2026, 60(10): 2215-2226 doi:10.3785/j.issn.1008-973X.2026.10.014

MA Wenyu, XIA Hongbin, WANG Xiaofeng. Multi-modal recommendation model for denoising and user preference modeling. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(10): 2215-2226 doi:10.3785/j.issn.1008-973X.2026.10.014

近年来,推荐系统(recommender system, RS)已广泛应用于电商、短视频、社交媒体等场景[1-2],通过挖掘用户行为数据实现个性化推送. 随着内容载体从文本拓展至图像、音频、视频等多模态形式[3-4],传统依赖单一模态的方法在建模用户兴趣与物品特征时面临局限. 多模态推荐(multimodal recommender system, MRS)因此兴起,旨在融合不同模态的信息以提升推荐性能.

多模态推荐的早期探索,如VBPR[5],率先利用卷积神经网络提取视觉特征,并将其融入经典的协同过滤框架,证明了模态信息对推荐的价值. 随着图卷积网络(graph convolutional network, GCN)的发展,用户-物品交互被自然建模为二分图,显著增强了推荐系统的建模能力. 以LightGCN[6]为代表的模型在用户-物品二分图上有效捕捉高阶协同信号,其成功启发了研究者将其应用于多模态场景,并在此基础上提出了MMGCN[7]、DualGNN[8]、LATTICE[9]等方法. 尽管这些基于图模型的方法在融合协同信号与模态信息上表现出巨大潜力,但其有效性仍受限于2个关键挑战.

1)多模态数据中固有的多层级噪声干扰问题. 模态信息在增强物品表示能力的同时,也引入了与推荐任务不相关的信号级与语义级噪声. 例如,图像中的模糊边缘、文本中的冗余词句属于信号级噪声,而各类与用户偏好无关的背景细节则构成语义级噪声. 现有方法在融合过程中往往对这2类噪声等价处理,从而影响了模型对关键信息的捕捉. 虽然部分工作尝试通过注意力机制[9]或知识蒸馏[10]间接提升信息相关性,或如DA-MRS[11]从内容和反馈双侧进行去噪对齐,但它们大多缺乏对噪声来源与类别的细分,难以实现针对性的噪声抑制.

2)现有方法在用户偏好的动态性建模方面存在局限. 用户的兴趣并非静态不变,而是随情境不断演化. 在多模态场景下,这种动态性不仅体现在对不同物品的兴趣变化,更突出地表现为对不同信息模态的依赖变化. 例如,同一用户在浏览服装时可能更关注视觉模态,而在选购电子产品时则更依赖文本描述. 尽管已有工作如DiffMM[12]引入了模态感知机制、PGL[13]利用图的局部结构信息来增强个性化,但多数方法仍倾向于为用户学习一个静态的全局偏好表示,未能精准刻画用户模态偏好随上下文动态转移的特性,导致推荐的个性化程度不足.

为了解决以上问题,本研究提出面向去噪与用户偏好建模的多模态推荐模型(multi-modal recommendation model for denoising and user preference modeling, DPRec). 首先,模型提出多模态双重去噪模块,分别处理信号级和语义级噪声. 在频域自适应滤除信号噪声的同时,借助ID引导的门控机制去除语义噪声,从而有效降低多模态特征中的噪声干扰. 其次,构建物品-物品图与用户-物品图,捕捉模态内外的高阶关系,增强特征表达能力. 在此基础上,用户动态偏好建模模块结合用户长期兴趣与当前上下文,动态推断不同模态的偏好权重,实现多模态信息的加权融合. 最后,引入对比学习机制对齐协同行为与偏好特征,统一语义空间,进一步提升推荐效果.

1. 相关工作

1.1. 多模态去噪

在多模态推荐中,有效处理模态内容固有的噪声对模型性能至关重要. 现有方法大致可分为隐式抑制与显式过滤2类. 隐式方法通过间接手段降低噪声影响,例如,基于注意力机制的方法LATTICE[9]通过为不同特征分配自适应权重来弱化无关信息;知识蒸馏方法如SGFD[10]则借助教师模型的稳定表示,引导学生模型在训练过程中减少噪声干扰. 这些方法虽有一定效果,但并未直接从数据层面移除噪声. 因此,近期的研究焦点转向了设计显式的净化模块. 其中的代表性工作,如MGCN[14]提出的行为引导净化器和DA-MRS[11]基于跨视图一致性的去噪策略,均通过主动识别并过滤冗余信息来提升表示的纯净度,证实了显式去噪的有效性.

然而,现有去噪技术普遍将模态噪声视为一个同质化的整体,忽略了噪声的多层次特性. 鉴于此,本研究提出双重去噪模块,旨在对不同层级的噪声进行针对性抑制,以实现更精细化的特征去噪.

1.2. 用户偏好建模

精准地建模用户偏好是推荐系统的核心. 传统方法如矩阵分解学习一个静态的向量来表示用户的长期、平均兴趣. 随着深度学习的发展,研究者开始关注用户兴趣的动态性. 一些工作利用循环神经网络(recurrent neural network, RNN)或Transformer捕捉用户行为序列中的时序依赖,以预测用户的下一个行为.

在多模态和图模型背景下,用户偏好建模有了新的发展. DiffMM[12]基于扩散模型对用户-物品交互图进行重建,并结合模态感知机制以提升上下文理解能力. PGL[13]强调利用图的局部结构信息来提升个性化建模. MILK[15]则提出模态不变性学习框架,以在不同模态间保持用户偏好表示的一致性. 这些方法极大地丰富了用户表示的信息. 然而,在多模态场景下,用户偏好的动态性不仅体现在兴趣随物品变化而转移,还体现在对不同模态的依赖会随情境而改变. 目前对此专门建模的研究仍然有限. 本研究设计了用户动态偏好建模机制,结合用户长期兴趣与当前上下文,动态推断其对不同模态的偏好权重.

1.3. 对比学习

对比学习(contrastive learning, CL)通过构建正负样本对以学习更具辨别力的特征,已成为缓解推荐系统数据稀疏性问题的有效范式. 在通用的图推荐场景中,其核心在于如何构造不同的数据视图. 一类方法是基于图结构增强,如SGL[16]通过随机丢弃节点或边来产生不同视图. 另一类方法则追求简化,如SimGCL[17]直接在特征空间中添加噪声来构造对比对,避免了复杂的图操作.

在多模态推荐中,对比学习的主要任务从视图增强转向跨模态对齐. 例如,SLMRec[18]通过特征遮蔽之类的自监督任务提升模型鲁棒性;BM3[19]聚焦于模态内与模态间的双重对齐;MENTOR[20]设计多层次自监督任务以实现更精细的特征协同. 本研究则从用户-模态交互关系出发,直接对比用户与模态特征,以在语义空间中建立紧密的一致性,从而实现更高效的跨模态融合.

2. 模型介绍

2.1. 总体框架

提出面向去噪与用户偏好建模的多模态推荐模型DPRec,整体架构如图1所示. DPRec主要包括以下几个模块:1)多模态双重去噪模块,利用频域自适应滤波器去除信号级噪声,并结合ID引导的门控机制剔除语义级冗余信息;2)多模态图学习模块,通过构建物品-物品同质图与用户-物品异质图,捕捉模态间的高阶语义关联;3)用户动态偏好建模模块,融合用户长期兴趣与当前上下文信息,推理多模态偏好并进行加权融合;4)对比学习模块,对齐用户行为与偏好特征,统一语义空间.

图 1

图 1   DPRec模型结构

Fig.1   Structure of DPRec model


2.2. 问题定义

用户集合表示为$ U=\{{u}_{1},{u}_{2},\cdots ,{u}_{|U|}\} $,物品集合表示为$ I=\{{i}_{1},{i}_{2},\cdots ,{i}_{|I|}\} $. 用户的ID特征和物品的ID特征共同表示为$ {\boldsymbol{E}}_{\text{id}}=[{\boldsymbol{E}}_{\text{u},\text{id}}\| {\boldsymbol{E}}_{\text{i,id}}] \in {{R}}^{d\times (|U|+|I|)} $,其中$ d $为特征维度. 用户的模态特征为$ {\boldsymbol{E}}_{\text{u,}m}\in {{R}}^{d\times |U|} $,物品的模态特征为$ {\boldsymbol{E}}_{\text{i,}m}\in {{R}}^{{{d}_{m}}\times |I|} $. 这里,$ m\in M $表示模态,$ M=\{v,t\} $为视觉模态和文本模态的集合,$ {d}_{m} $为模态特征的维度. 用户-物品交互数据由矩阵$ \boldsymbol{R}\in {\{0,1\}}^{|U|\times |I|} $表示,其中$ {R}_{u,i}=1 $表明用户$ u $点击了物品$ i $,否则$ {R}_{u,i}=0 $. 交互矩阵$ \boldsymbol{R} $可被表示为用户-物品二分图$ G=(V,E) $,其中节点集合$ V=U\cup I $,边集合$ E=\{(u,i)\mid u\in U,i\in I,{R}_{u,i}=1\} $. 多模态推荐旨在准确预测用户偏好,并据此对每个用户的物品进行排序.

2.3. 多模态双重去噪

多模态特征在丰富物品表示的同时,也引入了2类性质不同的噪声. 第1类是信号级噪声,它源于数据采集与表示过程,与具体任务无关,例如图像的传感器噪声或文本的拼写错误. 第2类是语义级噪声,它特定于推荐任务,指模态特征中与特定用户偏好不相关的部分. 例如,对于仅关注商品材质的用户,其图像中关于颜色和款式的特征即构成语义噪声,可能干扰模型对核心偏好的准确学习. 因此,本研究提出多模态双重去噪模块,分别在频域与语义层面抑制噪声干扰.

2.3.1. 频域信号去噪

为了滤除模态特征中的信号级干扰,借鉴了信号处理中的频域分析方法. 将每个物品的模态特征向量视为一个一维信号,并对其应用快速傅里叶变换(fast Fourier transform, FFT),以在频域中进行噪声抑制. 首先,整个物品模态特征矩阵$ {\boldsymbol{E}}_{\text{i,}m} $经由一个线性层进行初步变换,以统一到共享的特征维度:

$ \boldsymbol{E}_{\mathrm{i}, m}^{\prime}=\boldsymbol{W}_1 \boldsymbol{E}_{\mathrm{i}, m}+\boldsymbol{b}_1 . $

式中:$ {\boldsymbol{W}}_{1}\in {{R}}^{d\times {{d}_{m}}} $$ {\boldsymbol{b}}_{1}\in {{R}}^{d} $,均为可学习的权重参数. 随后,将${\boldsymbol{ E}}'_{\text{i,}m} $矩阵中的的每一列视为一个长度为$ d $的信号,通过对矩阵特征维度应用FFT,将其变换至频域,得到其频谱表示矩阵$ {\boldsymbol{F}}_{\text{i,}m} $

$ \boldsymbol{F}_{\mathrm{i}, m}=\operatorname{FFT}\left(\boldsymbol{E}_{\mathrm{i}, m}^{\prime}, \text { axis }=0\right) \in \mathbf{C}^{k \times|I|} . $

式中:$ \text{axis}=0 $指明FFT沿特征维度进行,输出的频谱矩阵的每一列都是一个复数向量,其长度$ k=d/2+1 $. 在频域中,一个可学习的、模态特定的复数滤波器$ {\boldsymbol{W}}_{\text{filter,}m}\in {{C}}^{k} $与频谱矩阵进行逐元素相乘. 该操作能自适应地衰减由噪声主导的频率分量,以实现滤波:

$ \tilde{\boldsymbol{F}}_{\mathrm{i}, m}=\boldsymbol{W}_{\text {filter}, m} \odot \boldsymbol{F}_{\mathrm{i}, m} . $

最后,通过逆快速傅里叶变换(inverse fast Fourier transform, IFFT)将滤波后的频谱矩阵$ {{{\boldsymbol{F}}}}_{\text{i,}m} $重构回原始特征空间,获得信号级去噪后的特征矩阵$ {\boldsymbol{E}}^{\prime\prime}_{\text{i,}m} $

$ \boldsymbol{E}_{\mathrm{i}, m}^{\prime \prime}=\operatorname{IFFT}\left(\tilde{\boldsymbol{F}}_{\mathrm{i}, m}, \operatorname{axis}=0\right) . $

2.3.2. 语义去噪

在信号级去噪的基础上,结合ID对齐策略构建了语义去噪机制,以进一步滤除特定于推荐任务的语义噪声. 该机制的核心思想是利用物品的ID特征作为语义引导信号,来对齐并提纯不同模态的信息. 具体地,该机制通过门控网络,依据经信号去噪的模态特征$ {\boldsymbol{E}}^{\prime\prime}_{\text{i,}m} $计算出语义相关性门控,并将其作用于原始ID特征,以实现对模态特征的自适应去噪与对齐,最终得到新表示$ {\boldsymbol{E}}^{\prime\prime\prime}_{\text{i,}m} $. 对于视觉和文本模态,该过程可表述如下:

$ \boldsymbol{E}_{\mathrm{i}, \mathrm{v}}^{\prime \prime \prime} =\boldsymbol{E}_{\mathrm{i}, \mathrm{id}} \odot \sigma\left(\boldsymbol{W}_{\mathrm{v}} \boldsymbol{E}_{\mathrm{i}, \mathrm{v}}^{\prime \prime}+\boldsymbol{b}_{\mathrm{v}}\right), $

$ \boldsymbol{E}_{\mathrm{i}, \mathrm{t}}^{\prime \prime \prime} =\boldsymbol{E}_{\mathrm{i}, \mathrm{id}} \odot \sigma\left(\boldsymbol{W}_{\mathrm{t}} \boldsymbol{E}_{\mathrm{i}, \mathrm{t}}^{\prime \prime}+\boldsymbol{b}_{\mathrm{t}}\right) . $

式中:$ {\boldsymbol{E}}_{\text{i,id}}\in {{R}}^{d\times |I|} $为物品的ID特征,$ \sigma $为Sigmoid函数,$ {\boldsymbol{W}}_{\text{v}},{\boldsymbol{W}}_{\text{t}}\in {{R}}^{d\times d} $$ {\boldsymbol{b}}_{\text{v}},{\boldsymbol{b}}_{\text{t}}\in {{R}}^{d} $均为模态特定的可学习参数. 该门控网络通过逐元素乘法实现对特征的自适应过滤,以保证输出与输入维度一致.

2.4. 多模态图学习

受GCN在捕捉高阶特征能力上的启发[6-7],本研究设计了一个多模态图学习模块. 该模块包括物品-物品图与用户-物品图2部分:前者从模态内建模物品间的语义相关性,捕捉视觉或文本特征的语义结构;后者从交互视角建模用户与物品的协同信号,反映用户偏好与物品特征的互动关系. 两者结合,使模型同时利用语义与协同信息,获得更具表达力的特征表示.

图 2

图 2   特征增强模块

Fig.2   Feature enhancement module


2.4.1. 物品-物品图

为了显式地建模物品间的模态内语义关系,针对每一种模态$ m $构建相应的物品-物品图. 首先,图的邻接关系由物品特征的相似性确定. 任意2个物品$ i $$ j $在模态$ m $下的连接权重通过其特征向量$ \boldsymbol{e}_{i}^{m} $$ \boldsymbol{e}_{j}^{m} $的余弦相似度计算得出:

$ \boldsymbol{S}_{i,j}^{m}=\dfrac{{({\boldsymbol{e}_{i}^{m}})}^{{\mathrm{T}}}\boldsymbol{e}_{j}^{m}}{\parallel \boldsymbol{e}_{i}^{m}\parallel\;\; \parallel \boldsymbol{e}_{j}^{m}\parallel }. $

为了保留最显著的关联并构建稀疏图,对每个物品仅保留其$ \text{Top}{\text{-}}k $个最相似的邻居,生成稀疏邻接矩阵$ {{\hat{\boldsymbol{S}}}}^{m} $

$ \hat{\boldsymbol{S}}_{i, j}^m=\left\{\begin{array}{ll}\boldsymbol{S}_{i, j}^m, & \boldsymbol{S}_{i, j}^m \in \mathrm{Top}{\text{-}}k\left(\left\{\boldsymbol{S}_{i, p}^m \mid p \in {I}\right\}\right) ;\\0, & \text { 其他. }\end{array} \right. $

随后,为了稳定信息传播过程,采用对称归一化处理$ {{\hat{\boldsymbol{S}}}}^{m} $,得到最终的邻接矩阵$ {{\overline{\boldsymbol{S}}}}^{m} $

$ \overline{\boldsymbol{S}}^m=\left(\boldsymbol{D}^m\right)^{-\tfrac{1}{2}} \hat{\boldsymbol{S}}^m\left(\boldsymbol{D}^m\right)^{-\tfrac{1}{2}} . $

式中:$ {\boldsymbol{D}}^{m} $$ {{\hat{\boldsymbol{S}}}}^{m} $的对角度矩阵. 图结构构建完成后,通过图卷积操作聚合邻居信息,以更新物品的模态特征. 该过程旨在将图的结构信息融入物品特征中,其形式化定义如下:

$ \overline{\boldsymbol{E}}_{\mathrm{i}, m}=\overline{\boldsymbol{S}}^m \boldsymbol{E}_{\mathrm{i}, m}^{\prime \prime \prime}. $

进一步地,基于用户-物品交互矩阵$ \boldsymbol{R} $与更新后的物品特征,生成用户侧的特征$ {{\overline{\boldsymbol{E}}}}_{\text{u,}m} $

$ \overline{\boldsymbol{E}}_{\mathrm{u}, m}=\boldsymbol{R} \overline{\boldsymbol{E}}_{\mathrm{i}, m} . $

最终,将用户侧特征$ {{\overline{\boldsymbol{E}}}}_{\text{u},m} $与物品侧特征$ {{\overline{\boldsymbol{E}}}}_{\text{i,}m} $进行拼接,得到该模态下的最终交互特征$ {{\overline{\boldsymbol{E}}}}_{m}={{\overline{\boldsymbol{E}}}}_{\text{u,}m}||{{\overline{\boldsymbol{E}}}}_{\text{i,}m} $.

2.4.2. 用户-物品图

为了进一步捕获用户与物品之间的高阶协同关系,并使其具备模态感知能力,构建了用户-物品异质图集合$ {G}=\{{G}_{c}\mid c\in \{\text{id},v,t\}\} $. 该集合中的所有图共享由交互矩阵$ \boldsymbol{R} $决定的统一拓扑结构,但每个图$ {G}_{c} $的节点分别由其对应来源(ID、视觉或文本)的初始特征进行初始化.

受LightGCN[6]简化图卷积思想的启发,在每个图$ {G}_{c} $上执行轻量化的信息传播. 在第$ l $层传播中,特征更新规则定义如下:

$ \boldsymbol{E}_{\text{u,}c}^{(l)}=\sum \limits_{i\in {{N}}_{u}}\frac{1}{\sqrt{|{{N}}_{u}|}\sqrt{|{{N}}_{i}|}}\boldsymbol{E}_{\text{i,}c}^{(l-1)}, $

$ \boldsymbol{E}_{\text{i,}c}^{(l)}=\sum \limits_{u\in {{N}}_{i}}\frac{1}{\sqrt{|{{N}}_{i}|}\sqrt{|{{N}}_{u}|}}\boldsymbol{E}_{\text{u,}c}^{(l-1)}. $

式中:$ {{N}}_{u} $$ {{N}}_{i} $分别表示用户$ u $和物品$ i $的一阶邻居集合. 初始节点特征$ \boldsymbol{E}_{c}^{(0)} $由初始用户特征与物品特征拼接构成. 对于多模态通道$ c\in \{v,t\} $,物品侧采用物品-物品图输出的增强特征$ {{\overline{\boldsymbol{E}}}}_{\text{i,}c} $,用户侧则使用初始化的随机特征.

经过$ L $层的信息传播后,聚合所有层的特征并取其平均值,作为最终的节点特征:

$ {{\tilde{\boldsymbol{E}}}}_{\text{u,}c}=\frac{1}{L+1}\sum \limits_{l=0}^{L}{{\boldsymbol{E}}}_{\text{u,}c}^{(l)},  $

$ {{\tilde{\boldsymbol{E}}}}_{\text{i,}c}=\frac{1}{L+1}\sum \limits_{l=0}^{L}\boldsymbol{E}_{\text{i,}c}^{(l)}. $

最终得到的特征$ {{{\boldsymbol{E}}}}_{\text{u,}c} $$ {{{\boldsymbol{E}}}}_{\text{i,}c} $融合了图中的高阶邻域信息,并将作为输入传递给后续模块.

2.5. 用户动态偏好建模

精准的用户建模是实现个性化推荐的核心. 传统方法通常为用户学习一个静态的特征向量,用以概括其长期兴趣. 然而在多模态场景下,用户的偏好并非恒定:例如,用户在浏览服装时可能更依赖视觉信息,在研究电子产品时则更关注文本描述. 这种偏好随上下文动态变化的特性,是静态用户表示难以捕捉的. 为了刻画此种动态性,并在CMDL[21]启发下,设计了一种用户动态偏好建模机制. 如图2所示,该机制引导多模态信息的融合,以建模用户兴趣的动态性.

2.5.1. 模态共享语义的提取

为了构建能够反映用户偏好变化的上下文,模型首先须对用户与物品的联合模态表示进行聚合. 其设计思想是,一个交互上下文的不同模态内容应围绕一个统一的语义核心. 因此,模块通过共享注意力机制对包含用户与物品联合表示的$ {{\overline{\boldsymbol{E}}}}_{m} $进行处理,以提取统一的语义核心,作为后续推断的基础. 该机制首先通过全连接层与Softmax函数计算各模态表示$ {{\overline{\boldsymbol{E}}}}_{m} $的注意力权重$ {\alpha }_{m} $

$ \alpha_m=\operatorname{softmax}\left(\boldsymbol{q}^{{\mathrm{T}}} \tanh \left(\boldsymbol{W}_2 \overline{\boldsymbol{E}}_m+\boldsymbol{b}_2\right)\right) . $

式中:查询向量$ \boldsymbol{q}\in {{R}}^{d} $及参数$ {\boldsymbol{W}}_{2}\in {{R}}^{d\times d} $$ {\boldsymbol{b}}_{2}\in {{R}}^{d} $在所有模态间共享,从而实现从全局视角对模态重要性的评估. 随后,通过加权求和得到上下文的模态共享语义$ {\boldsymbol{E}}_{\text{core}} $

$ \boldsymbol{E}_{\text {core }}=\sum_{m \in {M}} \alpha_m \overline{\boldsymbol{E}}_m \text {. } $

2.5.2. 动态偏好推断与加权融合

在获得统一的上下文语义$ {\boldsymbol{E}}_{\text{core}} $后,模块的关键步骤是结合用户的长期兴趣表达,推断其在当前上下文中的动态模态偏好. 具体来说,模块将代表用户长期兴趣的协同行为特征$ {{{\boldsymbol{E}}}}_{\text{id}} $与反映当前上下文的特征$ {\boldsymbol{E}}_{\text{core}} $进行拼接,构成一个用户-物品交互向量$ {\boldsymbol{C}}_{{\mathrm{u,i}}} $

$ {\boldsymbol{C}}_{\text{u,i}}={{{\boldsymbol{E}}}}_{\text{id}}||{\boldsymbol{E}}_{\text{core}}. $

该向量随后被输入一个前馈网络,以生成动态偏好门控$ {\boldsymbol{P}}_{m} $

$ {\boldsymbol{P}}_{m}=\sigma ({\boldsymbol{W}}_{3}{\boldsymbol{C}}_{{\mathrm{u}},{\mathrm{i}}}+{\boldsymbol{b}}_{3}). $

式中:$ {\boldsymbol{W}}_{3}\in {{R}}^{d\times 2d} $$ {\boldsymbol{b}}_{3}\in {{R}}^{d} $为可训练参数. 该门控向量$ {\boldsymbol{P}}_{m} $量化了用户在当前情境下对不同信息模态的偏好程度. 最后,模型利用此动态偏好,对多模态信息执行加权融合. 其策略如下:

$ {\boldsymbol{E}}_{\text{mul}}={\boldsymbol{E}}_{\text{core}}+\frac{1}{|{M}|}\sum \limits_{m\in {M}}\left({{\overline{\boldsymbol{E}}}}_{m}-{\boldsymbol{E}}_{\text{core}}\right)\odot {\boldsymbol{P}}_{m}. $

该策略以共享语义$ {\boldsymbol{E}}_{\text{core}} $为基准,利用推断出的用户偏好$ {\boldsymbol{P}}_{m} $,对各模态与共享语义之间的残差信息进行动态加权. 如此,最终的融合表示$ {\boldsymbol{E}}_{\text{mul}} $不仅包含了内容的客观核心,也融入了用户视角下的主观偏好.

2.6. 对比学习

前述模块已分别捕获协同行为和用户偏好模态特征,但两者在来源与结构上的差异,易导致语义空间不一致,影响特征能力. 为此,设计基于对比学习的辅助任务,从表示层和语义层实现特征对齐,促进交互行为特征与偏好特征协同.

2.6.1. 用户偏好与协同行为对齐

对于用户或物品特征,协同行为特征$ {{{\boldsymbol{E}}}}_{\text{id}} $和偏好特征$ {\boldsymbol{E}}_{\text{mul}} $分别刻画历史交互和内容偏好,但在语义空间中可能存在偏移. 为了促使两者一致,引入infoNCE[22]对比损失:

$ L_{\text{align}}^{(\text{u})}=\sum \limits_{u\in {U}}-\log \frac{\mathbf{\exp }\;(\widetilde{\boldsymbol{e}}_{u,\text{id}}^{{\rm{T}} }{\boldsymbol{e}}_{u,{{\mathrm{mul}}}}/\tau )}{\sum \limits_{{u}^{\prime}\in {U}}\mathbf{\exp }\;(\widetilde{\boldsymbol{e}}_{u,\text{id}}^{{\rm{T}} }{\boldsymbol{e}}_{{{{u}}^{\prime}},\text{mul}}/\tau )}. $

式中:$ \tau $为温度系数,用于控制相似度分布的平滑度:较小$ \tau $使分布更尖锐,模型更关注难负样本;较大$ \tau $使分布平滑,提升整体稳定性. 此外,物品侧采用相同策略,整体对齐损失为$ {L}_{\text{align}}=L_{\text{align}}^{(\text{u})}+L_{\text{align}}^{(\text{i})} $.

2.6.2. 用户偏好与聚合模态特征对齐

以往方法仅在实体级进行特征对齐,难以充分捕获用户潜在偏好. 为此,本研究在偏好分布层面引入对齐机制,以增强推荐的语义一致性与预测能力. 具体地,定义聚合反馈特征$ {{\tilde{\boldsymbol{E}}}}_{\text{i,f}}={{\tilde{\boldsymbol{E}}}}_{\text{i,v}}+{{\tilde{\boldsymbol{E}}}}_{\text{i,t}} $. 随后,将其与用户偏好特征进行对比,以计算用户在全体物品上的偏好分布:

$ {\boldsymbol{P}}_{\text{mul}}=\text{softmax}\;(\boldsymbol{e}_{\text{u,mul}}^{{\rm{T}} }{\widetilde{\boldsymbol{e}}}_{\text{i,f}}), $

$ {\boldsymbol{P}}_{\text{id}}=\text{softmax}\;(\boldsymbol{e}_{\text{u,mul}}^{{\rm{T}} }{\widetilde{\boldsymbol{e}}}_{\text{i,id}}). $

为了衡量2种分布的一致性,采用双向KL散度定义偏好对齐损失,通过对称约束使两者在整体分布上保持严格一致:

$ {L}_{\text{prefer}}=\text{KL}({\boldsymbol{P}}_{\text{mul}}\| {\boldsymbol{P}}_{\text{id}})+\text{KL}({\boldsymbol{P}}_{\text{id}}\| {\boldsymbol{P}}_{\text{mul}}). $

2.7. 模型预测和优化

基于用户和物品的ID特征与模态偏好特征,两者的最终表示分别定义为

$ {\boldsymbol{e}}_{\text{u}}={{{\boldsymbol{e}}}}_{\text{u,id}}+{\boldsymbol{e}}_{\text{u,mul}}, $

$ {\boldsymbol{e}}_{\text{i}}={{{\boldsymbol{e}}}}_{\text{i,id}}+{\boldsymbol{e}}_{{\mathrm{i}},\text{mul}}. $

用户$ u $对物品$ i $的偏好得分通过两者的内积进行计算$ {\hat{y}}_{\text{ui}}=\boldsymbol{e}_{\text{u}}^{\text{T}}{\boldsymbol{e}}_{\text{i}} $.

为了优化推荐效果,引入贝叶斯个性化排序[23](Bayesian personalized ranking, BPR)作为主要优化目标. BPR假设用户在交互过的物品上应表现出更高的偏好预测分数,在未交互过的物品上表现出更低的预测分数. 其损失函数形式为

$ {L}_{\text{bpr}}=-\sum \limits_{(u,i,j)\in D}\ln \;\sigma ({\hat{y}}_{ui}-{\hat{y}}_{uj}). $

式中:$ D=\{(u,i,j)\mid {R}_{ui}=1, {R}_{uj}=0\} $表示训练样本中的三元组集合. 最终,模型的总损失由BPR损失、对齐损失和偏好保持损失共同构成:

$ L={L}_{\text{bpr}}+{\lambda }_{1}{L}_{\text{align}}+{\lambda }_{2}{L}_{\text{prefer}}+\lambda |\varTheta |_{2}^{2}. $

式中:$ {\lambda }_{1} $$ {\lambda }_{2} $为权重超参数,用于平衡其损失对总目标的影响;$ \varTheta $为模型可学习参数集合;$ \lambda $为正则化系数,用于控制参数规模.

2.8. 复杂度分析

DPRec的时间复杂度可以分为4个部分. 首先,在模态去噪阶段,须将原始模态特征从维度$ {d}_{m} $投影到统一维度$ d $,复杂度为$ O(\sum \limits_{m\in M}|I|{d}_{m}d) $. 随后在统一空间中进行FFT/IFFT与门控操作,复杂度分别为$ O(|I|d\log d) $)$ O\left(\left| I\right| d\right) $. 其次,在图学习阶段,物品-物品图的邻居关系在训练前已离线构建完成,因此无需在训练过程中重复计算相似度. 训练时仅须基于该图进行消息传播,并与用户-物品交互图的传播一起考虑,其复杂度为$ O\left(\left| I\right| kd+\left| E\right| d\right) $,其中$ k $表示物品-物品图中的近邻数量. 在用户偏好建模阶段,本模型采用轻量卷积传播,其复杂度与交互边数线性相关,约为$ O\left(\left| E\right| d\right) $. 最后,在对比学习阶段,主要开销来自向量内积与Softmax归一化,复杂度为$ O\left(\left(\left| U\right|+|I|\right)d\right) $. 综上,DPRec的总体时间复杂度可近似为:

3. 实验与结果

3.1. 数据集

本研究在4个多模态数据集上进行实验,包括亚马逊公共数据集[24]中的Baby、Sports、Clothing这3个独立子集,以及短视频平台数据集MicroLens[25],以验证模型在不同模态场景下的泛化性能. 为了保证数据质量,筛选后每位用户至少保留5条有效交互记录. 多模态特征采用公开预提取版本[26],其中文本特征为384维,视觉特征为4096维. 数据集按 8∶1∶1比例划分为训练集、验证集和测试集,各数据集统计信息如表1所示. 其中, spa为数据稀疏程度.

表 1   亚马逊数据集信息

Tab.1  Statistics of Amazon dataset

数据集$ |U| $$ |I| $$ |E| $spa/%
Baby19445705016079299.88
Sports355981835729633799.95
Clothing393872303327867799.91
MicroLens981291722870517499.97

新窗口打开| 下载CSV


3.2. 评价指标

采用$ \text{Recall}@K $$ \text{NDCG}@K $这2个标准指标对推荐性能进行评估,用于衡量生成的$ \text{Top} $-K推荐列表的准确性和排序效果. $ \text{Recall}@K $表示推荐列表中命中的正样本占用户实际正样本总数的比例,定义如下:

$ \text{Recall}@K=\frac{|\text{RI}\cap \text{Rec}@K|}{|\text{RI}|}. $

式中:$ \text{RI} $表示测试集中目标用户实际交互过的商品集合,$ \text{Rec}@K $表示模型为该用户生成的$ \text{Top} $-K推荐列表. $ \text{NDCG}@K $用于评价推荐结果的排序效果,衡量相关商品在推荐列表中的排名位置,定义如下:

$ \text{NDCG}@K=\frac{\sum \limits_{i=1}^{K}\dfrac{{{\mathrm{rel}}}_{i}}{{\log }_{2}\;(i+1)}}{\text{IDCG}@K}. $

式中:${{\mathrm{ rel}}}_{i} $为推荐列表中第$ i $个商品的相关性得分,$ \text{IDCG}@K $表示在理想情况下所有相关商品按最优顺序排列的$ \text{DCG} $值. 在实验中,$ K $的取值设置为10和20.

3.3. 实验设置

在MMRec框架[26]上实现所提模型及各对比方法,保证在统一配置下进行公平对比. 用户与物品ID特征维度初始化为64. 模型参数采用Xavier初始化,优化器选择Adam. 批大小设置为2048. 对比学习损失权重$ {\lambda }_{1} $$ {\lambda }_{2} $通过网格搜索从$ \{0.000\;1, 0.001,\;0.01,\;0.1\} $中选取. 用户-物品图的卷积层数$ L $取值于$ \{1,2,3,4\} $,物品-物品图的卷积层数固定为1层,其$ \text{Top}{\text{-}}k $参数取值于$ \{10,20,30,40\} $. 模型训练最多迭代1000个epoch,若验证集上$ \text{Recall}@20 $在连续20个epoch内无提升,则提前终止训练. 所有实验在配备NVIDIA RTX 4090D GPU的服务器上运行.

3.4. 对比模型

为了验证所提方法的有效性,选取以下推荐模型作为对比.

1)协同过滤模型. (a) BPR[23]:基于矩阵分解的方法,提出BPR成对学习损失对用户偏好进行排序优化. (b) LightGCN[6]:一种简化的图卷积网络,它去除了特征变换与非线性激活,仅通过邻域聚合来学习协同信号.

2) 多模态推荐模型. (a) VBPR[4]:在BPR的损失框架中引入由卷积神经网络提取的物品视觉特征,以建模用户的视觉偏好. (b) MMGCN[7]:通过在不同模态的子图上分别执行图卷积,然后融合各模态学习到的表示来进行推荐. (c) BM3[19]:引入自监督学习,通过构建模态间的对比视图来增强用户和物品的多模态表示. (d) MGCN[14]:去噪原始模态特征,并自适应地捕获用户交互关系以进行建模. (e) DiffMM[12]:将去噪扩散模型引入多模态推荐,借助模拟用户偏好从噪声中逐步恢复的过程,提升表示学习能力. (f) LGMRec[27]:通过混合图卷积网络,同时聚合节点的局部邻域信息和全局图结构信息来学习用户和物品表示. (g) DA-MRS[11]: 提出多模态推荐去噪与对齐框架,通过消除多模态内容与用户反馈噪声并实现精细对齐来提升推荐效果. (h) TMLP[28]:一种基于多层感知机的模型,它将用户、物品及多模态特征拼接后输入网络以学习非线性交互.

3.5. 实验结果

表2所示为各方法在4个数据集上的性能对比. 其中,${R}@K $${N}@K $分别表示$\text{Recall}@K $$\text{NDCG}@K $,黑体表示最优性能. DPRec在4个多模态数据集上均取得了显著的性能提升. 以NDCG@20为例,相较最强基线模型,DPRec在Baby、Sports、Clothing和MicroLens数据集上分别相对提升了4.23%、3.11%、4.52%和5.02%. 这一性能提升主要得益于模型中4个模块的有效配合:双重去噪机制在信号级和语义级有效滤除噪声,图结构建模挖掘了模态内外的高阶关系,动态偏好建模捕捉用户兴趣的变化,对比学习对齐进一步强化了用户动态偏好的表达一致性,从而提升多模态特征融合的效果.

表 2   各方法在4个数据集上的性能对比

Tab.2  Performance comparison of different methods on four datasets

数据集BabySportsClothingMicroLens
R@10R@20N@10N@20R@10R@20N@10N@20R@10R@20N@10N@20R@10R@20N@10N@20
BPR0.03570.05750.01920.02490.04320.06530.02410.02980.01870.02790.01030.01260.06240.09590.03220.0408
LightGCN0.04790.07540.02570.03280.05690.08640.03130.03870.03400.05260.01880.02360.07200.10750.03760.0467
VBPR0.04230.06630.02230.02840.05580.08560.03070.03840.04230.06630.02230.02840.06770.10260.03510.0441
MMGCN0.03780.06150.02000.02610.03700.06050.01930.02540.03780.06150.02000.02610.04210.07010.02070.0279
BM30.05640.08830.03010.03830.06560.09800.03550.04380.04220.06210.02310.02810.06060.09810.03040.0400
MGCN0.06200.09640.03390.04270.07290.11060.03970.04960.06410.09450.03470.04280.07560.11340.03870.0484
DiffMM0.06250.09750.03230.04110.06810.10170.03700.04580.05230.07770.02760.03440.07300.11410.03680.0472
LGMRec0.06440.10020.03490.04400.07200.10680.03900.04800.05550.08280.03020.03710.07480.11320.03900.0489
DA-MRS0.06500.09940.03460.04350.07510.11250.04020.04980.06470.09630.03530.04330.07580.11660.03880.0492
TMLP0.06710.10160.03600.04490.07690.11520.04160.05150.06510.09630.03480.04310.07700.11790.03940.0498
DPRec0.06810.10610.03660.04680.07890.11640.04330.05310.06930.10110.03710.04520.08160.12230.04200.0523

新窗口打开| 下载CSV


从表中可以观察到,多模态推荐模型整体优于传统的协同过滤方法. 例如,多模态模型VBPR的效果优于其对应基线模型BPR. 然而,不同多模态模型在各数据集上的表现存在一定差异,且部分方法在处理不同程度的数据稀疏时表现不够稳定. 例如,DiffMM在Baby和Sports数据集上的表现优于MGCN,但在Clothing数据集上则表现不佳.

与早期的MMGCN相比,近年来注重特征去噪的模型(如MGCN、DA-MRS以及本研究提出的DPRec)整体表现更为优异. 尤其是在Clothing和MicroLens这类视觉特征丰富但噪声较高的数据集上,这类方法的优势更加突出. 这表明,在多模态信息愈加复杂的场景下,特征去噪已成为提升推荐性能的关键.

从整体结果来看,基于图结构的推荐模型普遍优于矩阵分解类方法,说明用户-物品交互图中的高阶信息传播在提升推荐性能方面具有明显优势. 例如,LightGCN通过简化的图卷积操作在三组数据集上都优于BPR,说明图神经网络在整合模态信息方面具有较强能力.

3.6. 消融实验

为了验证DPRec中各模块及模态信息的有效性,设计了2组消融实验,分别评估各功能模块和多模态信息对整体性能的贡献.

3.6.1. 模块消融

单独移除DPRec中的5个核心模块,构建5个变体模型,用以分析各模块对推荐效果的影响. 1) DPRecfft:移除频域信号去噪,仅保留语义去噪. 2)DPRecde:移除双重去噪模块,仅利用原始模态特征进行推荐. 3)DPRecii:移除物品-物品同质图,仅基于用户-物品交互信息进行推荐. 4)DPRecup:移除用户动态偏好建模,不再生成融合用户偏好的特征表示. 5)DPReccl:移除对比学习模块,缺少协同行为和偏好特征的对比损失.

图3所示为DPRec和5个变体的模块消融实验结果. 可以观察到,去噪模块的移除均会带来性能下降. 其中,DPRecfft的退化表明频域信号去噪对特征纯净度有贡献. 相比之下,DPRecde的下降幅度更大,说明双重去噪的联合设计整体效果更佳. DPRecii的缺失同样造成推荐效果减弱,表明物品-物品同质图在挖掘模态内高阶关系、丰富用户和物品表示方面具有重要价值. 与此同时,DPRecup的性能下降反映了动态偏好建模在捕捉用户兴趣变化方面发挥着关键作用. 最后,DPReccl各指标的下降幅度最小,表明虽然对比学习不是唯一核心,但在对齐协同行为与偏好特征方面依然发挥了积极作用.

图 3

图 3   DPRec和5个变体的模块消融

Fig.3   Module ablation study of DPRec and its five variants


3.6.2. 模态消融

为了进一步分析不同模态信息的作用,还设计了2种模态消融变体. 1)DPRect:移除文本模态,仅保留视觉信息进行推荐. 2)DPRecv:移除视觉模态,仅保留文本信息进行推荐.

图4所示为DPRec和2个变体的模态消融实验结果. 可观察到,DPRect和DPRecv的表现均不及完整DPRec,说明在推荐过程中,同时引入文本与视觉2种模态信息,能够更充分地补充用户兴趣表达,从而带来更好的推荐效果. 其中,DPRecv的性能略优于DPRect,表明文本信息相较视觉信息在当前数据集上对推荐结果的影响更大. 这进一步表明了多模态信息之间能够相互补充,而DPRec在多模态特征融合上展现出一定的有效性,能够更好地提升模型推荐表现.

图 4

图 4   DPRec和2个变体的模态消融

Fig.4   Modal ablation study of DPRec and its two variants


3.7. 运行效率分析

表3所示展示了DPRec与主流推荐模型(BPR、LightGCN、BM3、DiffMM)在4个数据集上的显存占用与训练效率对比结果. 可以看出,DPRec的显存开销虽较BPR和LightGCN略有增加,但显著低于DiffMM,体现出更优的资源利用效率. 在训练时间方面,DPRec同样表现出明显优势,尤其在Baby与Sports数据集上,每轮训练耗时仅为DiffMM的约60%;即使在交互关系更复杂的MicroLens数据集上,DPRec依然保持了较高的运行效率. 综上,DPRec在保持推荐效果的同时,仍能兼顾合理的计算与存储效率.

表 3   DPRec与基线模型运行效率比较

Tab.3  Efficiency comparison between DPRec and baseline models

数据集BabySportsClothingMicrolens
Memory/GBTime/(s·epoch−1)Memory/GBTime/(s·epoch−1)Memory/GBTime/(s·epoch−1)Memory/GBTime/(s·epoch−1)
BPR0.860.171.510.351.740.421.521.06
LightGCN0.870.241.520.531.760.581.531.92
BM31.240.352.461.283.021.382.152.27
DiffMM1.982.813.719.604.4210.453.9416.24
DPRec1.861.213.343.573.823.513.3711.87

新窗口打开| 下载CSV


3.8. 超参数敏感性实验
3.8.1. 用户-物品图层数

为了探索用户-物品图的层数对模型性能的影响,在Baby、Sports、Clothing这3个数据集上将层数$ L $从1增加到4进行实验.

表4所示为用户-物品图层数对模型性能的影响. 结果表明,随着$ L $的增加,DPRec的推荐性能先提升后趋于平稳,当$ L=2 $时达到最佳. 较小的层数可能导致信息聚合不足,无法有效捕捉多阶邻居特征,从而限制表示能力;而过多的层数则可能引入噪声信息,甚至导致表示过平滑,削弱模型判别能力. 因此,选择合适的层数对于有效表示用户与物品之间的多阶关系具有重要意义.

表 4   用户-物品图层数对模型性能的影响

Tab.4  Impact of user-item graph layer depth on model performance

LBabySportsClothing
R@20N@20R@20N@20R@20N@20
10.09800.04310.10880.04910.09680.0437
20.10610.04680.11640.05310.10110.0452
30.10330.04580.11090.04100.10040.0455
40.10290.04530.11010.04990.09730.0426

新窗口打开| 下载CSV


3.8.2. 物品-物品图Top-k参数

为了探究物品-物品图中邻居选择范围对模型性能的影响,本研究在Baby、Sports、Clothing这3个数据集上将Top-k参数从10增加到40进行实验.

表5所示为物品-物品图 Top-k参数对模型性能的影响. 结果表明,随着k的增大,DPRec的推荐性能逐渐下降,当k=10时达到最佳. 较小的k能够构建一个高精度的稀疏图,确保信息仅在最相关的物品节点间传播. 反之,随着k增大,图中不可避免地引入低质量的噪声边,这不仅稀释了核心邻居的信号强度,还加剧了过平滑风险,使得物品表示逐渐趋同,最终损害推荐性能. 因此,合理选择Top-k参数对于提升物品-物品关系建模的有效性具有重要意义.

表 5   物品-物品图 Top-k参数对模型性能的影响

Tab.5  Impact of Top-k parameter in item-item graph on model performance

kBabySportsClothing
R@20N@20R@20N@20R@20N@20
100.10410.04610.11610.05230.10080.0445
200.10300.04590.11250.05050.09880.0442
300.10320.04550.10940.04880.09310.0415
400.10280.04530.10800.04830.09190.0409

新窗口打开| 下载CSV


3.8.3. 对比学习权重

在Baby 和Clothing数据集上对损失权重$ {\lambda }_{1} $$ {\lambda }_{2} $进行敏感性实验. 将其取值设为$ \{0.000\;1, 0.001, 0.01, 0.1\} $,并在验证集上评估不同组合的性能,结果以热力图展示.

图5所示为Baby和Clothing数据集上不同对比学习权重的性能对比. 实验结果表明,当$ {\lambda }_{1} $$ {\lambda }_{2} $均较小时,辅助对比损失的引导作用不足,导致性能明显下降;随着权重增大,性能呈现先升后降的趋势,例如在Baby数据集上,当$ {\lambda }_{1}={\lambda }_{2}=0.001 $时,Recall@20和NDCG@20分别达到0.10610.0468的峰值,而在权重进一步增大时性能开始回落. Clothing数据集呈现类似趋势,其中NDCG@20在$ {\lambda }_{1}={\lambda }_{2}=0.000\;1 $时达到0.0454的最高值. 整体来看,中等权重区域表现最佳,且$ {\lambda }_{1} $的变化对性能波动影响更为显著,这表明在主损失与辅助损失之间保持合理平衡对于性能提升至关重要.

图 5

图 5   Baby和Clothing数据集上不同对比学习权重的性能对比

Fig.5   Performance comparison of different contrastive learning weights on Baby and Clothing datasets


3.9. 示例分析

为了进一步分析DPRec在性能提升中的作用,对LightGCN和DPRec学到的用户与物品表示进行对比可视化,数据中随机选取了2000个用户与2000个物品. 首先,采用t分布随机域嵌入(t-distributed stochastic neighbor embedding, t-SNE)将高维特征映射至二维空间,并对结果进行归一化,使其分布于单位圆内,其中二维表示记为$ ({f}_{1},{f}_{2}) $. 随后,将每个样本映射至极坐标系,记其角度为$ \theta $,并利用高斯核密度估计计算角度分布的概率密度函数$ p(\theta ) $,以刻画特征在不同方向上的分布情况.

图67所示分别为LightGCN、DPRec学到的用户与物品表示. 结果表明,LightGCN学到的用户与物品表示在单位圆上呈现局部高度聚集,即部分区域特征密度较高,而其他区域较为稀疏. 这种分布特征可能导致模型对特定兴趣或特征存在偏好,限制了其泛化能力. 相较之下,DPRec学到的表示在单位圆上的分布更加均匀,特征密度变化平滑. 更均匀的表示分布有助于模型全面捕获用户兴趣和物品特征,从而提升推荐的准确性与多样性.

图 6

图 6   LightGCN学到的用户与物品表示

Fig.6   User and item representations learned by LightGCN


图 7

图 7   DPRec学到的用户与物品表示

Fig.7   User and item representations learned by DPRec


4. 结 语

提出面向去噪与用户偏好建模的多模态推荐模型,旨在解决模态噪声干扰和用户偏好建模2个关键问题. 具体而言,设计了双重去噪模块,通过在频域进行自适应滤波和利用ID引导的门控机制,分别处理信号级与语义级噪声,以提升模态特征的纯净度. 通过构建物品同质图与用户-物品异质图,捕捉项目之间及用户与项目间的高阶关系. 基于图结构,动态偏好建模模块结合用户的长期兴趣与当前上下文,推断出用户的动态模态偏好,并据此对多模态信息进行加权融合. 最后,采用对比学习方法对齐协同行为与用户偏好,统一其语义表示空间,提升推荐效果.

未来的工作将聚焦推荐系统中的冷启动问题,进一步探索本模型在模态去噪和用户偏好建模方面的泛化能力,使其在新物品缺乏交互或用户行为稀疏的情况下,仍能提取有效特征并准确推测用户兴趣,以提升冷启动阶段的推荐性能.

参考文献

ADOMAVICIUS G, TUZHILIN A

Toward the next generation of recommender systems: a survey of the state-of-the-art and possible extensions

[J]. IEEE Transactions on Knowledge and Data Engineering, 2005, 17 (6): 734- 749

DOI:10.1109/TKDE.2005.99      [本文引用: 1]

HUANG L W, JIANG B T, LV S Y, et al

Survey on deep learning based recommender systems

[J]. Chinese Journal of Computers, 2018, 41 (7): 1619- 1647

[本文引用: 1]

DING Y, LAI Z, MOK P Y, et al

Computational technologies for fashion recommendation: a survey

[J]. ACM Computing Surveys, 2024, 56 (5): 1- 45

[本文引用: 1]

XU B B, CEN K T, HUANG J J, et al

A survey on graph convolutional neural network

[J]. Chinese Journal of Computers, 2020, 43 (5): 755- 780

DOI:10.31219/osf.io/9wk3y      [本文引用: 2]

HE R, MCAULEY J. VBPR: visual Bayesian personalized ranking from implicit feedback [C]// Proceedings of the AAAI Conference on Artificial Intelligence. Phoenix: AAAI Press, 2016: 1444–1449.

[本文引用: 1]

HE X, DENG K, WANG X, et al. LightGCN: simplifying and powering graph convolution network for recommendation [C]// Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval. [S.l.]: ACM, 2020: 639–648.

[本文引用: 4]

WEI Y, WANG X, NIE L, et al. MMGCN: multi-modal graph convolution network for personalized recommendation of micro-video [C]// Proceedings of the 27th ACM International Conference on Multimedia. Nice: ACM, 2019: 1437–1445.

[本文引用: 3]

WANG Q, WEI Y, YIN J, et al

DualGNN: dual graph neural network for multimedia recommendation

[J]. IEEE Transactions on Multimedia, 2023, 25: 1074- 1084

DOI:10.1109/TMM.2021.3138298      [本文引用: 1]

ZHANG J, ZHU Y, LIU Q, et al. Mining latent structures for multimedia recommendation [C]// Proceedings of the 29th ACM International Conference on Multimedia. [S.l.]: ACM, 2021: 3872–3880.

[本文引用: 3]

LIU F, CHEN H, CHENG Z, et al. Semantic-guided feature distillation for multimodal recommendation [C]// Proceedings of the 31st ACM International Conference on Multimedia. Ottawa: ACM, 2023: 6567–6575.

[本文引用: 2]

XV G, LI X, XIE R, et al. Improving multi-modal recommender systems by denoising and aligning multi-modal content and user feedback [C]// Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. Barcelona: ACM, 2024: 3645–3656.

[本文引用: 3]

JIANG Y, XIA L, WEI W, et al. DiffMM: multi-modal diffusion model for recommendation [C]// Proceedings of the 32nd ACM International Conference on Multimedia. Melbourne: ACM, 2024: 7591–7599.

[本文引用: 3]

YU P, TAN Z, LU G, et al. Mind individual information! principal graph learning for multimedia recommendation [C]// Proceedings of the AAAI Conference on Artificial Intelligence. Philadelphia: AAAI Press, 2025: 13096–13105.

[本文引用: 2]

YU P, TAN Z, LU G, et al. Multi-view graph convolutional network for multimedia recommendation [C]// Proceedings of the 31st ACM International Conference on Multimedia. Ottawa: ACM, 2023: 6576–6585.

[本文引用: 2]

BAI H, WU L, HOU M, et al. Multimodality invariant learning for multimedia-based new item recommendation [C]// Proceedings of the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval. Washington DC: ACM, 2024: 677–686.

[本文引用: 1]

WU J, WANG X, FENG F, et al. Self-supervised graph learning for recommendation [C]// Proceedings of the 44th International ACM SIGIR Conference on Research and Development in Information Retrieval. [S.l.]: ACM, 2021: 726–735.

[本文引用: 1]

YU J, YIN H, XIA X, et al. Are graph augmentations necessary? simple graph contrastive learning for recommendation [C]// Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval. New York: ACM, 2022: 1294–1303.

[本文引用: 1]

TAO Z, LIU X, XIA Y, et al

Self-supervised learning for multimedia recommendation

[J]. IEEE Transactions on Multimedia, 2023, 25: 5107- 5116

DOI:10.1109/TMM.2022.3187556      [本文引用: 1]

ZHOU X, ZHOU H, LIU Y, et al. Bootstrap latent representations for multi-modal recommendation [C]// Proceedings of the ACM Web Conference 2023. Austin: ACM, 2023: 845–854.

[本文引用: 2]

XU J, CHEN Z, YANG S, et al

MENTOR: multi-level self-supervised learning for multimodal recommendation

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39 (12): 12908- 12917

DOI:10.1609/aaai.v39i12.33408      [本文引用: 1]

LIN X, LIU R, CAO Y, et al

Contrastive modality-disentangled learning for multimodal recommendation

[J]. ACM Transactions on Information Systems, 2025, 43 (3): 1- 31

[本文引用: 1]

VAN DEN OORD A, LI Y, VINYALS O. Representation learning with contrastive predictive coding [EB/OL]. (2018–07–10) [2026–04–11]. https://arxiv.org/abs/1807.03748.

[本文引用: 1]

RENDLE S, FREUDENTHALER C, GANTNER Z, et al. BPR: Bayesian personalized ranking from implicit feedback [EB/OL]. (2012–05–11) [2026–04–11]. https://arxiv.org/abs/1205.2618.

[本文引用: 2]

HE R, MCAULEY J. Ups and downs: modeling the visual evolution of fashion trends with one-class collaborative filtering [C]// Proceedings of the 25th International Conference on World Wide Web. New York: ACM 2016: 507–517.

[本文引用: 1]

NI Y, CHENG Y, LIU X, et al. A content-driven micro-video recommendation dataset at scale [EB/OL]. (2023–09–27) [2026–04–11]. https://arxiv.org/abs/2309.15379.

[本文引用: 1]

ZHOU X. MMRec: simplifying multimodal recommendation [C]// Proceedings of the 5th ACM International Conference on Multimedia in Asia Workshops. Tainan: ACM, 2023: 1–2.

[本文引用: 2]

GUO Z, LI J, LI G, et al

LGMRec: local and global graph learning for multimodal recommendation

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2024, 38 (8): 8454- 8462

[本文引用: 1]

HUANG J, QIN J, YU Y, et al

Beyond graph convolution: multimodal recommendation with topology-aware MLPs

[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39 (11): 11808- 11816

[本文引用: 1]

/