[论文解读] A Multimodal Recommender System for Large-scale Assortment Generation in E-commerce
本文提出了一种多模态推荐系统,通过结合ResNet-50的深度视觉特征与PolyLDA的文本属性,为电子商务平台生成连贯且视觉上协调的家具组合。该系统在组合多样性与风格兼容性方面优于仅使用视觉特征的模型,在在线A/B测试中,同时使用两种模态时用户参与度显著提升。
E-commerce platforms surface interesting products largely through product recommendations that capture users' styles and aesthetic preferences. Curating recommendations as a complete complementary set, or assortment, is critical for a successful e-commerce experience, especially for product categories such as furniture, where items are selected together with the overall theme, style or ambiance of a space in mind. In this paper, we propose two visually-aware recommender systems that can automatically curate an assortment of living room furniture around a couple of pre-selected seed pieces for the room. The first system aims to maximize the visual-based style compatibility of the entire selection by making use of transfer learning and topic modeling. The second system extends the first by incorporating text data and applying polylingual topic modeling to infer style over both modalities. We review the production pipeline for surfacing these visually-aware recommender systems and compare them through offline validations and large-scale online A/B tests on Overstock. Our experimental results show that complimentary style is best discovered over product sets when both visual and textual data are incorporated.
研究动机与目标
- 为解决在电子商务中生成大规模、视觉上协调的家具组合的挑战,特别是针对客厅家具等高决策成本产品。
- 克服仅依赖视觉特征的推荐系统局限性,此类系统往往因过度依赖视觉相似性而产生冗余、不互补的选择。
- 探究将文本产品属性与视觉特征结合,能否提升推荐组合的风格兼容性与多样性。
- 开发一种可扩展、可投入生产的系统,通过基于种子的推荐机制,有效支持冷启动用户与新品上架。
- 通过离线指标与真实电子商务平台上的大规模在线A/B测试,验证多模态学习的有效性。
提出的方法
- 系统利用预训练的ResNet-50进行迁移学习,从产品图像中提取深度视觉特征,构建视觉词袋表示。
- 通过在视觉特征激活值上应用潜在狄利克雷分配(LDA),对视觉趋势进行建模,以发现产品之间的风格分组。
- 使用贪心算法求解约束版本的二次背包问题(QKP),以在预算与种子约束下,选择最大化成对视觉兼容性的商品。
- 多模态变体通过应用多语言LDA(PolyLDA)联合建模视觉与文本特征,实现跨模态风格发现。
- 将产品标题、描述与标签等文本属性嵌入与视觉特征相同的潜在空间,以支持联合主题建模。
- 最终推荐集合通过选择在主题上与种子商品对齐,并在视觉与文本空间中均具有最大兼容性的商品生成。
实验结果
研究问题
- RQ1视觉感知推荐系统是否能生成比仅使用视觉特征的系统更连贯、更多样化的家具组合?
- RQ2在推荐组合中引入文本产品属性是否能提升视觉兼容性与风格多样性?
- RQ3通过PolyLDA联合建模视觉与文本特征,与单模态主题建模相比,在捕捉风格趋势方面表现如何?
- RQ4在真实电子商务环境中,多模态方法在多大程度上提升了用户参与度?
- RQ5该系统在无需历史交互数据的情况下,能否有效处理冷启动用户与新品?
主要发现
- 多模态变体在组合兼容性上的平均Jaccard分数达到0.0027,显著高于仅使用视觉特征的变体的0.0015,表明视觉兼容性更优。
- 多模态系统的最大Jaccard分数达到0.0362,超过仅使用视觉特征的变体(0.0220)的两倍以上,证明其在生成高度兼容组合方面能力更强。
- 多模态组合涵盖更广泛的主题范围——最多达20个主题,而仅使用视觉特征的组合通常仅限于1至4个主题,表明多样性更高。
- 与LDA相比,PolyLDA生成了更丰富且更具代表性的主题分布,产品更倾向于作为多个主题的混合体,而非被单一或少数几个主题主导。
- 系统融合多个主题的能力导致了更互补、更少冗余的选择,而仅使用视觉特征的模型常推荐外观相似的商品。
- 在线A/B测试结果证实,多模态系统显著提升了用户参与度指标,验证了在真实部署中联合视觉-文本建模的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。