Skip to main content
QUICK REVIEW

[論文レビュー] AdaMCT: Adaptive Mixture of CNN-Transformer for Sequential Recommendation

Juyong Jiang, Zhang, Peiyan|arXiv (Cornell University)|May 18, 2022
Recommender Systems and Techniques被引用数 4
ひとこと要約

AdaMCTは、畳み込みニューラルネットワーク(CNN)とトランスフォーマーのアーキテクチャを組み合わせることで、順序付き推薦における長期的・短期的ユーザーの好みを共同でモデル化する画期的な適応的ミックスチャネルモデルを提案する。畳み込みフィルタを用いた局所性のインダクティブバイアスの統合と、スケール・アウェアな適応的ミキシングにSqueeze-Excitation Attentionを採用することで、効率性と複数の関連アイテムへのパーソナライズドな注目を高め、最先端の性能を達成する。

ABSTRACT

Sequential recommendation (SR) aims to model users dynamic preferences from a series of interactions. A pivotal challenge in user modeling for SR lies in the inherent variability of user preferences. An effective SR model is expected to capture both the long-term and short-term preferences exhibited by users, wherein the former can offer a comprehensive understanding of stable interests that impact the latter. To more effectively capture such information, we incorporate locality inductive bias into the Transformer by amalgamating its global attention mechanism with a local convolutional filter, and adaptively ascertain the mixing importance on a personalized basis through layer-aware adaptive mixture units, termed as AdaMCT. Moreover, as users may repeatedly browse potential purchases, it is expected to consider multiple relevant items concurrently in long-/short-term preferences modeling. Given that softmax-based attention may promote unimodal activation, we propose the Squeeze-Excitation Attention (with sigmoid activation) into SR models to capture multiple pertinent items (keys) simultaneously. Extensive experiments on three widely employed benchmarks substantiate the effectiveness and efficiency of our proposed approach. Source code is available at https://github.com/juyongjiang/AdaMCT.

研究の動機と目的

  • 順序付き推薦における長期的で安定した関心と、動的な短期的好みの両方をモデル化する課題に対処すること。
  • 学習可能なミックス機構を通じて、長期的・短期的好みのパーソナライズドで適応的な統合を可能にすること。
  • ソフトマックスベースの注目メカニズムの限界を克服し、同時に複数の関連アイテムを捉えることで、順序依存関係のモデリングを向上させること。
  • 畳み込みフィルタを用いてトランスフォーマーに局所性のインダクティブバイアスを統合しつつ、グローバル注目能力を保持すること。
  • 実世界の順序付き推薦ベンチマークにおいて、高い効率性と効果性を達成すること。

提案手法

  • AdaMCTは、局所的畳み込みブランチ($\mathcal{L}_{\text{Conv}}$)とグローバル自己注意ブランチ($\mathcal{G}_{\text{Trm}}$)を組み合わせたハイブリッドアーキテクチャを採用し、順序パターンをモデル化する。
  • レイヤー・アウェアな適応的ミックスユニットが、各レイヤーおよび各ユーザーごとに、CNNとトランスフォーマー・ブランチからの表現を動的に重み付け($\alpha$, $\beta$)して統合する。
  • 標準のソフトマックス注目メカニズムに代わり、Squeeze-Excitation Attention(SEAtt)を導入することで、複数アイテムの活性化が可能になり、複数の関連アイテムのモデリングが向上する。
  • 特徴の重要度を再キャリブレーションするため、還元比 $r$ と非線形活性化($\Phi$)を備えた学習可能なゲートメカニズムを採用する。
  • 標準の推薦損失関数を用いてエンド・ツー・エンドで学習され、最終出力は各アイテムごとのパーソナライズドな推薦スコアとなる。
  • カーネルサイズ $k$、ヘッド数 $h$、モデル次元 $d_{\text{model}}$ などのハイパーパrameterは、アブレーションスタディを通じて最適化される。

実験結果

リサーチクエスチョン

  • RQ1長期的・短期的ユーザー好みを、お互いに補い合う形で統合的にモデル化する方法は何か?
  • RQ2CNNとトランスフォーマーのコンポonentを適応的かつパーソナライズドに統合することで、順序付き推薦の性能が向上するか?
  • RQ3標準のソフトマックス注目メカニズムをSqueeze-Excitation Attentionに置き換えることで、複数の関連アイテムを捉える能力が向上するか?
  • RQ4CNNによる局所性のインダクティブバイアスの統合は、純粋なトランスフォーマー・モデルと比較して性能にどのように寄与するか?
  • RQ5順序付き推薦における、モデル効率性(FLOPs、メモリ、推論時間)と性能のトレードオフは何か?

主な発見

  • AdaMCTは3つの公開ベンチマークでSOTA性能を達成し、ToysデータセットではNDCG@10が0.3511、Sportsデータセットでは0.3444を記録した。
  • Toysデータセットでは、Caserと比較して91%、SASRecと比較して79%のFLOPs削減が達成され、パラメータ数はたった0.41Mにとどまった。
  • Toysデータセットでは、Caserと比較して学習コストが84%削減され、推論コストが79%削減された。
  • アブレーションスタディの結果、カーネルサイズ $k=3$ および還元比 $r=1$ が最良の性能を示し、GELU活性化関数がReLUやSwishを上回った。
  • 可視化結果から、AdaMCTはベースラインモデルよりも一貫性があり、パーソナライズドなアイテム相関パターンを学習していることが確認された。
  • 適応的係数の可視化から、モデルがユーザーおよびレイヤーごとに動的に注目重みを調整しており、パーソナライズドな好みのダイナミクスを反映していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。