面向去噪与用户偏好建模的多模态推荐模型
Multi-modal recommendation model for denoising and user preference modeling
通讯作者:
收稿日期: 2025-08-16
| 基金资助: |
|
Received: 2025-08-16
| Fund supported: | 国家自然科学基金资助项目(61972182). |
作者简介 About authors
马文煜(2000—),男,硕士生,从事推荐系统研究.orcid.org/0009-0008-4579-2124.E-mail:
多模态推荐通过融合图像与文本信息提升推荐性能,但仍面临模态噪声干扰与用户偏好刻画不足2大挑战. 针对上述问题,提出面向去噪与用户偏好建模的多模态推荐模型(DPRec). 模型构建多模态双重去噪机制,在频域对信号级噪声进行自适应滤除,同时引入基于ID引导的门控单元抑制语义级冗余信息,从而提升模态特征表达质量与稳定性. 在结构建模方面,引入物品-物品图与用户-物品图以刻画高阶关联关系,增强多模态语义传播能力. 在偏好建模方面,设计用户动态偏好推断机制,融合长期兴趣表示与上下文信息,对不同模态分配自适应权重,实现个性化表达更新. 同时结合对比学习策略约束协同行为表示与偏好表示在统一语义空间内对齐,增强特征一致性与表示鲁棒性. 实验结果表明,DPRec在4个公开数据集上优于基线方法,NDCG@20平均提升约4.22%.
关键词:
Multimodal recommendation improves performance by integrating visual and textual information, but it still faces two major challenges: modality noise interference and insufficient user preference modeling. To address these issues, a denoising and preference-aware multimodal recommendation model, DPRec, was proposed. A dual denoising mechanism was constructed to enhance feature quality. In the frequency domain, signal-level noise was adaptively filtered, while an ID-guided gating unit was introduced to suppress semantic-level redundancy, thereby improving the stability and expressiveness of multimodal representations. For structural modeling, both item-item and user-item graphs were incorporated to capture higher-order relationships and strengthen multimodal semantic propagation. For preference modeling, a dynamic user preference inference mechanism was designed. Long-term interest representations were combined with contextual information, and adaptive weights were assigned to different modalities to achieve personalized representation updates. In addition, a contrastive learning strategy was applied to align collaborative behavior representations and preference representations within a unified semantic space, which enhanced feature consistency and robustness. Experimental results showed that DPRec outperformed baseline methods on four public datasets, achieving an average improvement of approximately 4.22% in NDCG@20.
Keywords:
本文引用格式
马文煜, 夏鸿斌, 王晓锋.
MA Wenyu, XIA Hongbin, WANG Xiaofeng.
为了解决以上问题,本研究提出面向去噪与用户偏好建模的多模态推荐模型(multi-modal recommendation model for denoising and user preference modeling, DPRec). 首先,模型提出多模态双重去噪模块,分别处理信号级和语义级噪声. 在频域自适应滤除信号噪声的同时,借助ID引导的门控机制去除语义噪声,从而有效降低多模态特征中的噪声干扰. 其次,构建物品-物品图与用户-物品图,捕捉模态内外的高阶关系,增强特征表达能力. 在此基础上,用户动态偏好建模模块结合用户长期兴趣与当前上下文,动态推断不同模态的偏好权重,实现多模态信息的加权融合. 最后,引入对比学习机制对齐协同行为与偏好特征,统一语义空间,进一步提升推荐效果.
1. 相关工作
1.1. 多模态去噪
在多模态推荐中,有效处理模态内容固有的噪声对模型性能至关重要. 现有方法大致可分为隐式抑制与显式过滤2类. 隐式方法通过间接手段降低噪声影响,例如,基于注意力机制的方法LATTICE[9]通过为不同特征分配自适应权重来弱化无关信息;知识蒸馏方法如SGFD[10]则借助教师模型的稳定表示,引导学生模型在训练过程中减少噪声干扰. 这些方法虽有一定效果,但并未直接从数据层面移除噪声. 因此,近期的研究焦点转向了设计显式的净化模块. 其中的代表性工作,如MGCN[14]提出的行为引导净化器和DA-MRS[11]基于跨视图一致性的去噪策略,均通过主动识别并过滤冗余信息来提升表示的纯净度,证实了显式去噪的有效性.
然而,现有去噪技术普遍将模态噪声视为一个同质化的整体,忽略了噪声的多层次特性. 鉴于此,本研究提出双重去噪模块,旨在对不同层级的噪声进行针对性抑制,以实现更精细化的特征去噪.
1.2. 用户偏好建模
精准地建模用户偏好是推荐系统的核心. 传统方法如矩阵分解学习一个静态的向量来表示用户的长期、平均兴趣. 随着深度学习的发展,研究者开始关注用户兴趣的动态性. 一些工作利用循环神经网络(recurrent neural network, RNN)或Transformer捕捉用户行为序列中的时序依赖,以预测用户的下一个行为.
1.3. 对比学习
2. 模型介绍
2.1. 总体框架
提出面向去噪与用户偏好建模的多模态推荐模型DPRec,整体架构如图1所示. DPRec主要包括以下几个模块:1)多模态双重去噪模块,利用频域自适应滤波器去除信号级噪声,并结合ID引导的门控机制剔除语义级冗余信息;2)多模态图学习模块,通过构建物品-物品同质图与用户-物品异质图,捕捉模态间的高阶语义关联;3)用户动态偏好建模模块,融合用户长期兴趣与当前上下文信息,推理多模态偏好并进行加权融合;4)对比学习模块,对齐用户行为与偏好特征,统一语义空间.
图 1
2.2. 问题定义
用户集合表示为
2.3. 多模态双重去噪
多模态特征在丰富物品表示的同时,也引入了2类性质不同的噪声. 第1类是信号级噪声,它源于数据采集与表示过程,与具体任务无关,例如图像的传感器噪声或文本的拼写错误. 第2类是语义级噪声,它特定于推荐任务,指模态特征中与特定用户偏好不相关的部分. 例如,对于仅关注商品材质的用户,其图像中关于颜色和款式的特征即构成语义噪声,可能干扰模型对核心偏好的准确学习. 因此,本研究提出多模态双重去噪模块,分别在频域与语义层面抑制噪声干扰.
2.3.1. 频域信号去噪
为了滤除模态特征中的信号级干扰,借鉴了信号处理中的频域分析方法. 将每个物品的模态特征向量视为一个一维信号,并对其应用快速傅里叶变换(fast Fourier transform, FFT),以在频域中进行噪声抑制. 首先,整个物品模态特征矩阵
式中:
式中:
最后,通过逆快速傅里叶变换(inverse fast Fourier transform, IFFT)将滤波后的频谱矩阵
2.3.2. 语义去噪
在信号级去噪的基础上,结合ID对齐策略构建了语义去噪机制,以进一步滤除特定于推荐任务的语义噪声. 该机制的核心思想是利用物品的ID特征作为语义引导信号,来对齐并提纯不同模态的信息. 具体地,该机制通过门控网络,依据经信号去噪的模态特征
式中:
2.4. 多模态图学习
图 2
2.4.1. 物品-物品图
为了显式地建模物品间的模态内语义关系,针对每一种模态
为了保留最显著的关联并构建稀疏图,对每个物品仅保留其
随后,为了稳定信息传播过程,采用对称归一化处理
式中:
进一步地,基于用户-物品交互矩阵
最终,将用户侧特征
2.4.2. 用户-物品图
为了进一步捕获用户与物品之间的高阶协同关系,并使其具备模态感知能力,构建了用户-物品异质图集合
受LightGCN[6]简化图卷积思想的启发,在每个图
式中:
经过
最终得到的特征
2.5. 用户动态偏好建模
2.5.1. 模态共享语义的提取
为了构建能够反映用户偏好变化的上下文,模型首先须对用户与物品的联合模态表示进行聚合. 其设计思想是,一个交互上下文的不同模态内容应围绕一个统一的语义核心. 因此,模块通过共享注意力机制对包含用户与物品联合表示的
式中:查询向量
2.5.2. 动态偏好推断与加权融合
在获得统一的上下文语义
该向量随后被输入一个前馈网络,以生成动态偏好门控
式中:
该策略以共享语义
前述模块已分别捕获协同行为和用户偏好模态特征,但两者在来源与结构上的差异,易导致语义空间不一致,影响特征能力. 为此,设计基于对比学习的辅助任务,从表示层和语义层实现特征对齐,促进交互行为特征与偏好特征协同.
对于用户或物品特征,协同行为特征
式中:
以往方法仅在实体级进行特征对齐,难以充分捕获用户潜在偏好. 为此,本研究在偏好分布层面引入对齐机制,以增强推荐的语义一致性与预测能力. 具体地,定义聚合反馈特征
为了衡量2种分布的一致性,采用双向KL散度定义偏好对齐损失,通过对称约束使两者在整体分布上保持严格一致:
基于用户和物品的ID特征与模态偏好特征,两者的最终表示分别定义为
用户
为了优化推荐效果,引入贝叶斯个性化排序[23](Bayesian personalized ranking, BPR)作为主要优化目标. BPR假设用户在交互过的物品上应表现出更高的偏好预测分数,在未交互过的物品上表现出更低的预测分数. 其损失函数形式为
式中:
式中:
DPRec的时间复杂度可以分为4个部分. 首先,在模态去噪阶段,须将原始模态特征从维度
3. 实验与结果
3.1. 数据集
表 1 亚马逊数据集信息
Tab.1
| 数据集 | spa/% | |||
| Baby | 99.88 | |||
| Sports | 99.95 | |||
| Clothing | 99.91 | |||
| MicroLens | 99.97 |
3.2. 评价指标
采用
式中:
式中:
3.3. 实验设置
在MMRec框架[26]上实现所提模型及各对比方法,保证在统一配置下进行公平对比. 用户与物品ID特征维度初始化为64. 模型参数采用Xavier初始化,优化器选择Adam. 批大小设置为
3.4. 对比模型
为了验证所提方法的有效性,选取以下推荐模型作为对比.
2) 多模态推荐模型. (a) VBPR[4]:在BPR的损失框架中引入由卷积神经网络提取的物品视觉特征,以建模用户的视觉偏好. (b) MMGCN[7]:通过在不同模态的子图上分别执行图卷积,然后融合各模态学习到的表示来进行推荐. (c) BM3[19]:引入自监督学习,通过构建模态间的对比视图来增强用户和物品的多模态表示. (d) MGCN[14]:去噪原始模态特征,并自适应地捕获用户交互关系以进行建模. (e) DiffMM[12]:将去噪扩散模型引入多模态推荐,借助模拟用户偏好从噪声中逐步恢复的过程,提升表示学习能力. (f) LGMRec[27]:通过混合图卷积网络,同时聚合节点的局部邻域信息和全局图结构信息来学习用户和物品表示. (g) DA-MRS[11]: 提出多模态推荐去噪与对齐框架,通过消除多模态内容与用户反馈噪声并实现精细对齐来提升推荐效果. (h) TMLP[28]:一种基于多层感知机的模型,它将用户、物品及多模态特征拼接后输入网络以学习非线性交互.
3.5. 实验结果
如表2所示为各方法在4个数据集上的性能对比. 其中,
表 2 各方法在4个数据集上的性能对比
Tab.2
| 数据集 | Baby | Sports | Clothing | MicroLens | |||||||||||||||
| R@10 | R@20 | N@10 | N@20 | R@10 | R@20 | N@10 | N@20 | R@10 | R@20 | N@10 | N@20 | R@10 | R@20 | N@10 | N@20 | ||||
| BPR | |||||||||||||||||||
| LightGCN | |||||||||||||||||||
| VBPR | |||||||||||||||||||
| MMGCN | |||||||||||||||||||
| BM3 | |||||||||||||||||||
| MGCN | |||||||||||||||||||
| DiffMM | |||||||||||||||||||
| LGMRec | |||||||||||||||||||
| DA-MRS | |||||||||||||||||||
| TMLP | |||||||||||||||||||
| DPRec | |||||||||||||||||||
从表中可以观察到,多模态推荐模型整体优于传统的协同过滤方法. 例如,多模态模型VBPR的效果优于其对应基线模型BPR. 然而,不同多模态模型在各数据集上的表现存在一定差异,且部分方法在处理不同程度的数据稀疏时表现不够稳定. 例如,DiffMM在Baby和Sports数据集上的表现优于MGCN,但在Clothing数据集上则表现不佳.
与早期的MMGCN相比,近年来注重特征去噪的模型(如MGCN、DA-MRS以及本研究提出的DPRec)整体表现更为优异. 尤其是在Clothing和MicroLens这类视觉特征丰富但噪声较高的数据集上,这类方法的优势更加突出. 这表明,在多模态信息愈加复杂的场景下,特征去噪已成为提升推荐性能的关键.
从整体结果来看,基于图结构的推荐模型普遍优于矩阵分解类方法,说明用户-物品交互图中的高阶信息传播在提升推荐性能方面具有明显优势. 例如,LightGCN通过简化的图卷积操作在三组数据集上都优于BPR,说明图神经网络在整合模态信息方面具有较强能力.
3.6. 消融实验
为了验证DPRec中各模块及模态信息的有效性,设计了2组消融实验,分别评估各功能模块和多模态信息对整体性能的贡献.
3.6.1. 模块消融
单独移除DPRec中的5个核心模块,构建5个变体模型,用以分析各模块对推荐效果的影响. 1) DPRecfft:移除频域信号去噪,仅保留语义去噪. 2)DPRecde:移除双重去噪模块,仅利用原始模态特征进行推荐. 3)DPRecii:移除物品-物品同质图,仅基于用户-物品交互信息进行推荐. 4)DPRecup:移除用户动态偏好建模,不再生成融合用户偏好的特征表示. 5)DPReccl:移除对比学习模块,缺少协同行为和偏好特征的对比损失.
如图3所示为DPRec和5个变体的模块消融实验结果. 可以观察到,去噪模块的移除均会带来性能下降. 其中,DPRecfft的退化表明频域信号去噪对特征纯净度有贡献. 相比之下,DPRecde的下降幅度更大,说明双重去噪的联合设计整体效果更佳. DPRecii的缺失同样造成推荐效果减弱,表明物品-物品同质图在挖掘模态内高阶关系、丰富用户和物品表示方面具有重要价值. 与此同时,DPRecup的性能下降反映了动态偏好建模在捕捉用户兴趣变化方面发挥着关键作用. 最后,DPReccl各指标的下降幅度最小,表明虽然对比学习不是唯一核心,但在对齐协同行为与偏好特征方面依然发挥了积极作用.
图 3
图 3 DPRec和5个变体的模块消融
Fig.3 Module ablation study of DPRec and its five variants
3.6.2. 模态消融
为了进一步分析不同模态信息的作用,还设计了2种模态消融变体. 1)DPRect:移除文本模态,仅保留视觉信息进行推荐. 2)DPRecv:移除视觉模态,仅保留文本信息进行推荐.
如图4所示为DPRec和2个变体的模态消融实验结果. 可观察到,DPRect和DPRecv的表现均不及完整DPRec,说明在推荐过程中,同时引入文本与视觉2种模态信息,能够更充分地补充用户兴趣表达,从而带来更好的推荐效果. 其中,DPRecv的性能略优于DPRect,表明文本信息相较视觉信息在当前数据集上对推荐结果的影响更大. 这进一步表明了多模态信息之间能够相互补充,而DPRec在多模态特征融合上展现出一定的有效性,能够更好地提升模型推荐表现.
图 4
3.7. 运行效率分析
如表3所示展示了DPRec与主流推荐模型(BPR、LightGCN、BM3、DiffMM)在4个数据集上的显存占用与训练效率对比结果. 可以看出,DPRec的显存开销虽较BPR和LightGCN略有增加,但显著低于DiffMM,体现出更优的资源利用效率. 在训练时间方面,DPRec同样表现出明显优势,尤其在Baby与Sports数据集上,每轮训练耗时仅为DiffMM的约60%;即使在交互关系更复杂的MicroLens数据集上,DPRec依然保持了较高的运行效率. 综上,DPRec在保持推荐效果的同时,仍能兼顾合理的计算与存储效率.
表 3 DPRec与基线模型运行效率比较
Tab.3
| 数据集 | Baby | Sports | Clothing | Microlens | |||||||
| Memory/GB | Time/(s·epoch−1) | Memory/GB | Time/(s·epoch−1) | Memory/GB | Time/(s·epoch−1) | Memory/GB | Time/(s·epoch−1) | ||||
| BPR | 0.86 | 0.17 | 1.51 | 0.35 | 1.74 | 0.42 | 1.52 | 1.06 | |||
| LightGCN | 0.87 | 0.24 | 1.52 | 0.53 | 1.76 | 0.58 | 1.53 | 1.92 | |||
| BM3 | 1.24 | 0.35 | 2.46 | 1.28 | 3.02 | 1.38 | 2.15 | 2.27 | |||
| DiffMM | 1.98 | 2.81 | 3.71 | 9.60 | 4.42 | 10.45 | 3.94 | 16.24 | |||
| DPRec | 1.86 | 1.21 | 3.34 | 3.57 | 3.82 | 3.51 | 3.37 | 11.87 | |||
3.8. 超参数敏感性实验
3.8.1. 用户-物品图层数
为了探索用户-物品图的层数对模型性能的影响,在Baby、Sports、Clothing这3个数据集上将层数
如表4所示为用户-物品图层数对模型性能的影响. 结果表明,随着
表 4 用户-物品图层数对模型性能的影响
Tab.4
| L | Baby | Sports | Clothing | |||||
| R@20 | N@20 | R@20 | N@20 | R@20 | N@20 | |||
| 1 | ||||||||
| 2 | ||||||||
| 3 | ||||||||
| 4 | ||||||||
3.8.2. 物品-物品图Top-k参数
为了探究物品-物品图中邻居选择范围对模型性能的影响,本研究在Baby、Sports、Clothing这3个数据集上将Top-k参数从10增加到40进行实验.
如表5所示为物品-物品图 Top-k参数对模型性能的影响. 结果表明,随着k的增大,DPRec的推荐性能逐渐下降,当k=10时达到最佳. 较小的k能够构建一个高精度的稀疏图,确保信息仅在最相关的物品节点间传播. 反之,随着k增大,图中不可避免地引入低质量的噪声边,这不仅稀释了核心邻居的信号强度,还加剧了过平滑风险,使得物品表示逐渐趋同,最终损害推荐性能. 因此,合理选择Top-k参数对于提升物品-物品关系建模的有效性具有重要意义.
表 5 物品-物品图 Top-k参数对模型性能的影响
Tab.5
| k | Baby | Sports | Clothing | |||||
| R@20 | N@20 | R@20 | N@20 | R@20 | N@20 | |||
| 10 | ||||||||
| 20 | ||||||||
| 30 | ||||||||
| 40 | ||||||||
3.8.3. 对比学习权重
在Baby 和Clothing数据集上对损失权重
如图5所示为Baby和Clothing数据集上不同对比学习权重的性能对比. 实验结果表明,当
图 5
图 5 Baby和Clothing数据集上不同对比学习权重的性能对比
Fig.5 Performance comparison of different contrastive learning weights on Baby and Clothing datasets
3.9. 示例分析
为了进一步分析DPRec在性能提升中的作用,对LightGCN和DPRec学到的用户与物品表示进行对比可视化,数据中随机选取了
图 6
图 6 LightGCN学到的用户与物品表示
Fig.6 User and item representations learned by LightGCN
图 7
4. 结 语
提出面向去噪与用户偏好建模的多模态推荐模型,旨在解决模态噪声干扰和用户偏好建模2个关键问题. 具体而言,设计了双重去噪模块,通过在频域进行自适应滤波和利用ID引导的门控机制,分别处理信号级与语义级噪声,以提升模态特征的纯净度. 通过构建物品同质图与用户-物品异质图,捕捉项目之间及用户与项目间的高阶关系. 基于图结构,动态偏好建模模块结合用户的长期兴趣与当前上下文,推断出用户的动态模态偏好,并据此对多模态信息进行加权融合. 最后,采用对比学习方法对齐协同行为与用户偏好,统一其语义表示空间,提升推荐效果.
未来的工作将聚焦推荐系统中的冷启动问题,进一步探索本模型在模态去噪和用户偏好建模方面的泛化能力,使其在新物品缺乏交互或用户行为稀疏的情况下,仍能提取有效特征并准确推测用户兴趣,以提升冷启动阶段的推荐性能.
参考文献
Toward the next generation of recommender systems: a survey of the state-of-the-art and possible extensions
[J].DOI:10.1109/TKDE.2005.99 [本文引用: 1]
Survey on deep learning based recommender systems
[J].
Computational technologies for fashion recommendation: a survey
[J].
A survey on graph convolutional neural network
[J].DOI:10.31219/osf.io/9wk3y [本文引用: 2]
DualGNN: dual graph neural network for multimedia recommendation
[J].DOI:10.1109/TMM.2021.3138298 [本文引用: 1]
Self-supervised learning for multimedia recommendation
[J].DOI:10.1109/TMM.2022.3187556 [本文引用: 1]
MENTOR: multi-level self-supervised learning for multimodal recommendation
[J].DOI:10.1609/aaai.v39i12.33408 [本文引用: 1]
Contrastive modality-disentangled learning for multimodal recommendation
[J].
LGMRec: local and global graph learning for multimodal recommendation
[J].
Beyond graph convolution: multimodal recommendation with topology-aware MLPs
[J].
/
| 〈 |
|
〉 |

