[论文解读] Latent Structure Mining with Contrastive Modality Fusion for Multimedia Recommendation
本文提出了一种名为 MICRO 的新型多媒体推荐框架,通过模态感知图结构学习从多模态特征中挖掘潜在的物品-物品关系,并利用对比学习目标增强多模态融合。通过联合优化模态特定的物品关系与跨模态对齐,MICRO 在三个真实世界数据集上的推荐准确率优于现有最先进方法。
Recent years have witnessed growing interests in multimedia recommendation, which aims to predict whether a user will interact with an item with multimodal contents. Previous studies focus on modeling user-item interactions with multimodal features included as side information. However, this scheme is not well-designed for multimedia recommendation. Firstly, only collaborative item-item relationships are implicitly modeled through high-order item-user-item co-occurrences. We argue that the latent semantic item-item structures underlying these multimodal contents could be beneficial for learning better item representations and assist the recommender models to comprehensively discover candidate items. Secondly, previous studies disregard the fine-grained multimodal fusion. Although having access to multiple modalities might allow us to capture rich information, we argue that the simple coarse-grained fusion by linear combination or concatenation in previous work is insufficient to fully understand content information and item relationships.To this end, we propose a latent structure MIning with ContRastive mOdality fusion method (MICRO for brevity). To be specific, we devise a novel modality-aware structure learning module, which learns item-item relationships for each modality. Based on the learned modality-aware latent item relationships, we perform graph convolutions that explicitly inject item affinities to modality-aware item representations. Then, we design a novel contrastive method to fuse multimodal features. These enriched item representations can be plugged into existing collaborative filtering methods to make more accurate recommendations. Extensive experiments on real-world datasets demonstrate the superiority of our method over state-of-the-art baselines.
研究动机与目标
- 为解决现有多媒体推荐方法在利用多模态物品特征中的潜在语义结构方面存在不足的问题。
- 克服简单线性或拼接融合在整合多模态信息方面的不足。
- 显式建模每种模态内的物品-物品关系,以丰富物品表征。
- 开发一种对比学习框架,将模态特定的表征与多模态融合后的表征对齐,实现更细粒度的融合。
- 将增强后的物品表征集成到协同过滤模型中,以提升推荐性能。
提出的方法
- 引入一种模态感知结构学习模块,通过将成对相似性建模为距离度量,学习每种模态下的物品-物品关系。
- 应用图卷积网络,将学习到的模态感知物品亲和力注入到模态特定的物品表征中。
- 设计一种对比学习框架,将每个物品的模态感知表征与多模态融合表征对齐,以促进一致性。
- 对比目标通过最大化单模态表征与最终多模态融合表征之间的一致性,提升嵌入的鲁棒性与判别性。
- 将增强后的物品表征集成到协同过滤模型中,以提升推荐性能。
- 采用联合目标端到端训练模型,该目标结合了结构学习、对比学习与协同过滤。
实验结果
研究问题
- RQ1从多模态特征中提取的潜在物品-物品关系是否能提升多媒体推荐中的物品表征学习?
- RQ2一种将模态特定表征与多模态融合表征对齐的对比学习框架,是否能带来更优的多模态信息融合?
- RQ3模态感知结构学习在捕捉不同模态间物品语义关系方面的有效性如何?
- RQ4所提方法在多大程度上优于现有的最先进多媒体推荐模型?
- RQ5各组件(结构学习与对比融合)对整体推荐性能的贡献分别是什么?
主要发现
- MICRO 在三个真实世界多媒体推荐数据集上达到最先进性能,在排名与准确率指标上均优于现有方法。
- 消融实验表明,模态感知结构学习与对比融合框架均显著提升了推荐性能。
- 该模型在不同评估指标上均表现出一致的性能提升,表明其具备鲁棒性与泛化能力。
- 对比学习组件有效实现了模态特定表征与多模态融合表征的对齐,提升了特征质量。
- 学习到的物品关系集成显著提升了物品嵌入的准确性与语义意义。
- 该方法在处理冷启动物品方面表现出强有效性,得益于丰富的多模态内容与结构关系建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。