Skip to main content
QUICK REVIEW

[论文解读] An Attentive Inductive Bias for Sequential Recommendation beyond the Self-Attention

Yehjin Shin, Jeongwhan Choi|arXiv (Cornell University)|Dec 16, 2023
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

该论文提出 BSARec,一种新颖的序列推荐模型,通过整合基于傅里叶变换的注意力归纳偏置和可学习频率重校准器,缓解了基于 Transformer 的序列推荐中的过平滑问题,从而在 6 个基准数据集上实现了优于 7 个最先进基线模型的推荐性能。

ABSTRACT

Sequential recommendation (SR) models based on Transformers have achieved remarkable successes. The self-attention mechanism of Transformers for computer vision and natural language processing suffers from the oversmoothing problem, i.e., hidden representations becoming similar to tokens. In the SR domain, we, for the first time, show that the same problem occurs. We present pioneering investigations that reveal the low-pass filtering nature of self-attention in the SR, which causes oversmoothing. To this end, we propose a novel method called $ extbf{B}$eyond $ extbf{S}$elf-$ extbf{A}$ttention for Sequential $ extbf{Rec}$ommendation (BSARec), which leverages the Fourier transform to i) inject an inductive bias by considering fine-grained sequential patterns and ii) integrate low and high-frequency information to mitigate oversmoothing. Our discovery shows significant advancements in the SR domain and is expected to bridge the gap for existing Transformer-based SR models. We test our proposed approach through extensive experiments on 6 benchmark datasets. The experimental results demonstrate that our model outperforms 7 baseline methods in terms of recommendation performance. Our code is available at https://github.com/yehjin-shin/BSARec.

研究动机与目标

  • 探究基于 Transformer 的序列推荐模型性能下降的根本原因。
  • 识别自注意力机制的低通滤波特性是导致序列推荐中过平滑的关键因素。
  • 通过频域建模引入注意力归纳偏置,提升模型泛化能力。
  • 通过显式整合高频行为模式(如短期趋势)来缓解过平滑问题。
  • 构建一个统一框架,平衡序列推荐中长期用户兴趣(低频)与短期偏好(高频)

提出的方法

  • 利用傅里叶变换从用户交互序列中提取频域表征,注入基于周期性和序列模式的归纳偏置。
  • 引入可学习频率重校准器,应用高通滤波以强调瞬态的短期用户行为,同时保留长期兴趣。
  • 将傅里叶变换后的表征与原始自注意力机制结合,保持全局依赖建模能力的同时降低过平滑现象。
  • 设计一种频域感知损失函数,促使模型保留对捕捉动态用户兴趣至关重要的高频分量。
  • 采用双路径架构,其中频域捕捉归纳偏置,注意力机制建模长程依赖。
  • 对用户交互序列进行谱分解,分离并分别处理低频分量(稳定偏好)和高频分量(趋势偏好)

实验结果

研究问题

  • RQ1基于 Transformer 的序列推荐模型中的自注意力机制是否表现出低通滤波特性,从而导致过平滑?
  • RQ2通过傅里叶变换注入注意力归纳偏置,能否提升模型泛化能力和推荐准确率?
  • RQ3对频率分量进行高通滤波在多大程度上能缓解序列推荐中的过平滑问题?
  • RQ4低频与高频信息的融合在多大程度上影响模型捕捉长期与短期用户偏好的能力?
  • RQ5所提出的 BSARec 框架是否在多样化的序列推荐基准中优于现有的自注意力基模型?

主要发现

  • 基于 Transformer 的序列推荐模型中的自注意力机制表现出低通滤波特性,导致隐藏表征过平滑,丢失细粒度序列模式。
  • 所提出的 BSARec 模型在 6 个基准数据集上均达到最先进性能,推荐准确率优于 7 个现有基线方法。
  • 频率重校准器能有效捕捉高频行为模式(如短期趋势),提升模型对用户兴趣变化的响应能力。
  • 通过傅里叶变换引入的归纳偏置增强了模型泛化能力,同时保留了长期偏好与瞬态用户行为。
  • 消融实验证实,注意力归纳偏置与高通滤波组件对性能提升均至关重要,两者对最终结果均有显著贡献。
  • 模型在包括 Amazon-Beauty、ML-1M 等多样化数据集上表现出鲁棒性,证实其在不同领域中的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。