Skip to main content
QUICK REVIEW

[论文解读] Personalized Showcases: Generating Multi-Modal Explanations for Recommendations

Yan An, Zhankui He|arXiv (Cornell University)|Jun 30, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出个性化展示(personalized showcases)这一新任务,通过结合用户特定的图像与自然语言,生成多模态推荐解释。利用对比学习对齐视觉与文本输出,所提出的PC²L框架相较于纯文本基线模型,能够生成更具多样性、表现力和视觉对齐性的解释,在来自Google Local的大规模数据集上得到验证。

ABSTRACT

Existing explanation models generate only text for recommendations but still struggle to produce diverse contents. In this paper, to further enrich explanations, we propose a new task named personalized showcases, in which we provide both textual and visual information to explain our recommendations. Specifically, we first select a personalized image set that is the most relevant to a user's interest toward a recommended item. Then, natural language explanations are generated accordingly given our selected images. For this new task, we collect a large-scale dataset from Google Local (i.e.,~maps) and construct a high-quality subset for generating multi-modal explanations. We propose a personalized multi-modal framework which can generate diverse and visually-aligned explanations via contrastive learning. Experiments show that our framework benefits from different modalities as inputs, and is able to produce more diverse and expressive explanations compared to previous methods on a variety of evaluation metrics.

研究动机与目标

  • 为解决纯文本推荐解释中缺乏多样性和视觉对齐性的问题。
  • 通过整合个性化视觉内容与自然语言,丰富推荐解释。
  • 开发一种能够生成多样化、视觉对齐且用户特定的解释的框架。
  • 构建一个高质量、大规模的多模态数据集,用于个性化解释生成。
  • 通过跨模态对比学习提升模型泛化能力与用户参与度。

提出的方法

  • 提出一项新任务——个性化展示,为推荐生成视觉与文本双重解释。
  • 从Google Local(地图)构建大规模多模态数据集Gest,包含商户评论、图像和用户资料。
  • 通过人工标注高质量的图像-句子对,并训练基于CLIP的分类器,将标签传播至整个数据集。
  • 设计个性化跨模态对比学习(PC²L)框架,利用难负样本采样,对齐生成的文本与所选图像。
  • 引入个性化对比损失,基于用户评论相似性重新加权负样本,以提升个性化程度。
  • 使用CLIP嵌入作为多模态编码器,并定义基于CLIP的度量标准,评估图像集与生成解释之间的视觉对齐性。

实验结果

研究问题

  • RQ1结合图像与文本的多模态解释是否能提升推荐解释的多样性与信息量?
  • RQ2在个性化推荐的条件文本生成过程中,如何有效对齐视觉与文本模态?
  • RQ3对比学习在多模态设置下在多大程度上提升了生成解释的多样性与表现力?
  • RQ4用户特定的图像选择是否能提升生成解释的相关性与个性化程度?
  • RQ5所提出的PC²L框架在生成解释方面,相较于纯文本基线与非对比学习的多模态基线,表现如何?

主要发现

  • 与纯文本基线及非对比学习基线相比,PC²L框架在解释多样性与视觉对齐性方面均有显著提升。
  • 人工评估证实,PC²L生成的解释比现有方法更具表现力与吸引力。
  • 自动评估显示,PC²L在多个指标上优于基线模型,包括ROUGE、BLEU以及基于CLIP的视觉对齐分数。
  • 由于对比学习机制,模型生成的重复性与通用性短语(如“食物很棒”)更少。
  • 个性化对比损失通过利用用户评论相似性重新加权负样本,进一步提升了模型性能。
  • 所构建的Gest数据集包含95,270名用户,平均每家商户拥有35.63张图像,支持高质量的多模态训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。