Skip to main content
QUICK REVIEW

[论文解读] Contrastive Learning for Interactive Recommendation in Fashion

Karin Sevegnani, Arjun Seshadri|arXiv (Cornell University)|Jul 25, 2022
Recommender Systems and Techniques被引用 4
一句话总结

该论文提出 WhisperLite,一种基于对比学习的模型,能够根据用户提供的自然语言请求推荐个性化时尚商品,且无需依赖用户历史数据。通过利用 CLIP 嵌入表示,并结合二元交叉熵损失与对比损失的复合损失函数,WhisperLite 在真实世界时尚数据集上实现了最先进性能,并在人类评估中展现出相较于随机基线的更优相关性。

ABSTRACT

Recommender systems and search are both indispensable in facilitating personalization and ease of browsing in online fashion platforms. However, the two tools often operate independently, failing to combine the strengths of recommender systems to accurately capture user tastes with search systems' ability to process user queries. We propose a novel remedy to this problem by automatically recommending personalized fashion items based on a user-provided text request. Our proposed model, WhisperLite, uses contrastive learning to capture user intent from natural language text and improves the recommendation quality of fashion products. WhisperLite combines the strength of CLIP embeddings with additional neural network layers for personalization, and is trained using a composite loss function based on binary cross entropy and contrastive loss. The model demonstrates a significant improvement in offline recommendation retrieval metrics when tested on a real-world dataset collected from an online retail fashion store, as well as widely used open-source datasets in different e-commerce domains, such as restaurants, movies and TV shows, clothing and shoe reviews. We additionally conduct a user study that captures user judgements on the relevance of the model's recommended items, confirming the relevancy of WhisperLite's recommendations in an online setting.

研究动机与目标

  • 为解决时尚电商中独立推荐系统与搜索工具之间的差距,通过支持从自由格式用户文本请求中生成个性化推荐。
  • 在不依赖历史点击流或购买数据的前提下,从自然语言描述中建模用户意图,尤其适用于冷启动用户。
  • 在用户请求存在噪声、模糊或矛盾,以及造型师标注数据中存在标签噪声的情况下,提升推荐质量。
  • 通过真实世界和开源数据集验证模型在多样化领域中的泛化能力。
  • 通过在 Amazon Mechanical Turk 上开展的人工研究,评估模型在真实场景下的表现。

提出的方法

  • WhisperLite 将预训练的 CLIP 图像和文本编码器与微调后的前馈神经网络结合,将用户文本请求与时尚商品特征映射到共享嵌入空间。
  • 模型使用复合损失函数进行训练,该函数结合了用于项目相关性预测的二元交叉熵损失和用于对齐相关文本-商品对的对比损失。
  • 对比学习用于在嵌入空间中拉近正样本对(相关文本请求与商品)并推远负样本对(无关组合)。
  • 该方法避免微调 CLIP 模型的底层层,而是将其冻结,仅训练顶层两个感知机,以保留泛化能力并减少噪声干扰。
  • 模型在多个数据集上进行离线评估,并通过在 MTurk 上招募合格工作者进行的在线人工研究进行评估,评分采用五分制衡量推荐相关性。
  • 消融研究将 WhisperLite 与全量微调基线模型(Whisper)进行比较,结果表明冻结 CLIP 层可提升在噪声较多的真实世界数据上的性能。

实验结果

研究问题

  • RQ1在无历史用户数据的前提下,对比学习方法能否有效将自由格式用户文本请求映射到相关时尚商品推荐?
  • RQ2微调策略选择(全量微调 vs. 部分微调)在噪声多、真实世界时尚推荐数据上的性能影响如何?
  • RQ3所提出的模型在包括服装、电影、餐厅和鞋子等多样化电商业务领域中的泛化能力如何?
  • RQ4在在线环境中,人类用户对 WhisperLite 生成的推荐相关性感知如何,相较于随机基线表现如何?
  • RQ5在复杂或模糊的用户请求下,使用 CLIP 嵌入表示并结合对比损失是否能提升检索性能?

主要发现

  • 在人工评估中,WhisperLite 显著优于随机基线,平均相关性评分分别为 k=3 时 0.52、k=5 时 0.72、k=7 时 0.59,均远高于随机基线约 0.31–0.38 的得分。
  • 模型表现更一致且可靠,体现在人工评估中误差条更小,尤其在 k=5 和 k=7 时,其标准差低于随机基线的均值。
  • 在真实世界数据集 WhisperD 上,WhisperLite 表现优于全量微调基线模型 Whisper,表明冻结 CLIP 低层可防止噪声引起的特征学习退化。
  • WhisperLite 在跨领域任务中泛化能力出色,在开源数据集(如 Yelp、Amazon 服装、Amazon 电影)上均取得优异表现,其性能更接近于 Amazon 电影数据集,而非更具挑战性的 WhisperD 数据集。
  • 复合损失函数(结合二元交叉熵与对比损失)有效提升了检索指标,尤其在处理模糊或不完整用户请求时表现突出。
  • 人工研究证实,用户认为 WhisperLite 的推荐更具相关性和连贯性,所有 k 值下均更偏好模型输出而非随机建议。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。