Skip to main content
QUICK REVIEW

[论文解读] Transformers with multi-modal features and post-fusion context for e-commerce session-based recommendation

Gabriel de Souza Pereira Moreira, Sara Rabhi|arXiv (Cornell University)|Jul 11, 2021
Recommender Systems and Techniques被引用 9
一句话总结

本文提出了一种基于混合Transformer的集成模型,用于电商会话推荐,通过多模态特征融合将表格化交互事件与预训练的文本和图像嵌入相结合。该方法结合了自回归(Transformer-XL)和自编码(XLNet)两种训练目标,在SIGIR 2021电商数据挑战赛中取得了最先进性能,私有测试集上的MRR为0.482,F1得分为0.578。

ABSTRACT

Session-based recommendation is an important task for e-commerce services, where a large number of users browse anonymously or may have very distinct interests for different sessions. In this paper we present one of the winning solutions for the Recommendation task of the SIGIR 2021 Workshop on E-commerce Data Challenge. Our solution was inspired by NLP techniques and consists of an ensemble of two Transformer architectures - Transformer-XL and XLNet - trained with autoregressive and autoencoding approaches. To leverage most of the rich dataset made available for the competition, we describe how we prepared multi-model features by combining tabular events with textual and image vectors. We also present a model prediction analysis to better understand the effectiveness of our architectures for the session-based recommendation.

研究动机与目标

  • 解决电商场景中用户匿名且会话短时动态带来的会话推荐挑战。
  • 通过将多模态特征——表格化事件、产品描述和图像嵌入——整合到统一的深度学习框架中,提升推荐准确性。
  • 探究同时使用自回归和自编码目标训练的Transformer架构在会话推荐中的有效性。
  • 分析模型在会话长度、商品流行度和价格方面的行为表现,识别冷启动和流行度偏差等关键失败模式。

提出的方法

  • 模型集成结合了两种Transformer架构:使用自回归语言建模训练的Transformer-XL,以及使用掩码语言建模训练的XLNet。
  • 通过融合表格化用户交互事件(如点击、购买)与产品描述的预训练文本嵌入及视觉编码器生成的图像嵌入,构建多模态特征。
  • 特征工程包括对商品频率进行上限控制,以缓解流行度偏差并提升对稀有商品的泛化能力。
  • 最终预测通过两种Transformer模型的集成平均生成,推理过程基于每个会话的前半部分预测后半部分。
  • 模型评估采用验证集和私有测试集上的MRR与F1分数,并对会话长度、商品流行度和价格进行了消融研究。

实验结果

研究问题

  • RQ1在电商会话推荐中,使用自回归和自编码目标训练的Transformer架构有多有效?
  • RQ2与仅使用表格特征的模型相比,多模态特征(文本、视觉和表格)在多大程度上提升了推荐性能?
  • RQ3模型性能如何随会话长度变化?为何长会话的MRR下降?
  • RQ4商品流行度在预测准确性中起什么作用?模型如何处理稀有或未见商品?
  • RQ5商品价格如何影响预测准确性?是否存在基于价格的推荐偏差?

主要发现

  • 集成模型在私有测试集上取得了0.482的MRR和0.578的F1得分,优于竞赛中非深度学习基线模型。
  • 长会话的MRR下降,表明会话多样性增加(嵌入的会话内相似度降低)使得下一项预测更具挑战性。
  • 模型表现出显著的流行度偏差:互动次数为1–4次的商品MRR仅为0.0009,表明对稀有商品的预测性能极差。
  • 互动次数超过50次的商品MRR显著更高,证实高频商品更容易预测。
  • 对‘新品’(预训练或微调阶段未见过的产品)的预测MRR为0,凸显了新商品的冷启动问题。
  • 低价商品(第1–4档)的MRR较低,可能由于更高的流行度偏差,因为更贵的商品被更频繁地互动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。