Skip to main content
QUICK REVIEW

[論文レビュー] MOI-Mixer: Improving MLP-Mixer with Multi Order Interactions in Sequential Recommendation

Hojoon Lee, Dongyoon Hwang|arXiv (Cornell University)|Aug 17, 2021
Recommender Systems and Techniques参考文献 38被引用数 4
ひとこと要約

この論文では、高次特徴相互作用を明示的に捉えるために、マルチオーダー相互作用(MOI)層を導入した順序推薦モデルMOI-Mixerを提案する。標準のMLP層を任意の順序の相互作用をモデル化しつつ線形計算量を維持するMOI層に置き換えることで、MOI-MixerはTransformerベースのモデルと同等の性能を達成するが、二次的な計算コストを伴わない。特に長序列設定において顕著な効果を示す。

ABSTRACT

Successful sequential recommendation systems rely on accurately capturing the user's short-term and long-term interest. Although Transformer-based models achieved state-of-the-art performance in the sequential recommendation task, they generally require quadratic memory and time complexity to the sequence length, making it difficult to extract the long-term interest of users. On the other hand, Multi-Layer Perceptrons (MLP)-based models, renowned for their linear memory and time complexity, have recently shown competitive results compared to Transformer in various tasks. Given the availability of a massive amount of the user's behavior history, the linear memory and time complexity of MLP-based models make them a promising alternative to explore in the sequential recommendation task. To this end, we adopted MLP-based models in sequential recommendation but consistently observed that MLP-based methods obtain lower performance than those of Transformer despite their computational benefits. From experiments, we observed that introducing explicit high-order interactions to MLP layers mitigates such performance gap. In response, we propose the Multi-Order Interaction (MOI) layer, which is capable of expressing an arbitrary order of interactions within the inputs while maintaining the memory and time complexity of the MLP layer. By replacing the MLP layer with the MOI layer, our model was able to achieve comparable performance with Transformer-based models while retaining the MLP-based models' computational benefits.

研究の動機と目的

  • MLPベースとTransformerベースのモデルの間の性能格差を、MLPの計算上の利点にもかかわらず解消すること。
  • 明示的な高次特徴相互作用が、順序推薦における性能格差を埋める可能性があるかどうかを調査すること。
  • 任意の順序の相互作用を捉えるが、線形メモリおよび時間計算量を維持する新しいレイヤーを設計すること。
  • 長序列モデリングにおけるチャネルミキシング操作における高次相互作用の有効性を評価すること。

提案手法

  • PARAFACにインspiredされたテンソル分解アプローチを用いて、入力特徴間の任意の順序の相互作用をモデル化するマルチオーダー相互作用(MOI)レイヤーを提案する。
  • MOIレイヤーをMLP-Mixerアーキテクチャに統合し、トークンミキシングおよびチャネルミキシングの両コンponentで標準のMLPレイヤーを置き換える。
  • 相互作用の順序をハイパーパrameter kで制御できる、パラメータ効率の良い設計を採用し、特徴相互作用の柔軟なモデリングを可能にする。
  • 勾配の流れと学習の安定性を保つために、ハダマード積とリサidual接続を採用する。
  • アブレーション結果に基づき、MOIレイヤーのハダマード積の後にLayerNormを適用することで、他の正規化配置よりも優れた性能を示したため、その配置を採用した。
  • 位置エンベッディングを適応したが、MOIレイヤーが固有のシーケンス順序感受性を有するため、効果がなかった。

実験結果

リサーチクエスチョン

  • RQ1明示的な高次特徴相互作用が、MLPベースとTransformerベースのモデルの間の性能格差を埋めることができるか?
  • RQ2チャネルミキシングレイヤーで高次相互作用をモデル化することで、推薦精度が向上するか?
  • RQ3自己注意機構と同等の複雑な相互作用を捉えつつ、線形計算複雑性を維持できるか?
  • RQ4相互作用の順序(k)が、アーキテクチャの異なるコンponentにおけるモデル性能に与える影響は何か?
  • RQ5シーケンス順序を内蔵的に尊重するMLPベースのモデルでは、位置エンベッディングが必要か?

主な発見

  • ML-1mデータセットにおいて、MOI-MixerはNDCG@10が0.4873を達成し、ベースラインのMLP-Mixerを上回り、最先端のTransformerベースのモデルと同等の性能を示した。
  • チャネルミキシングレイヤーにおける2次相互作用(k=2)が最良の性能を示し、順序の上昇がさらに続くと性能が低下した。
  • トークンミキサーでMLPレイヤーを単一の線形レイヤーに置き換えると、NDCG@10はわずか0.3%低下するが、計算量が二次的になるためスケーラビリティが制限される。
  • BERT4RecやgMLPとは異なり、シーケンス長が1000に達するまで、FLOPsとVRAM使用量が線形に増加する。
  • MOIレイヤーのハダマード積の後に正規化を適用すると最も優れた性能が得られ、Layer ScaleやL2正規化は効果がなく、むしろ性能を低下させる傾向にあった。
  • 位置エンベッディングは性能向上に寄与しなかった。MOIレイヤーがその相互作用機構により既にシーケンス順序を捉えているためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。