Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation Strategies for Improving Sequential Recommender Systems

Joo-yeong Song, Bongwon Suh|arXiv (Cornell University)|Mar 26, 2022
Recommender Systems and Techniques被引用数 5
ひとこと要約

本稿では、深層学習に基づく順序推薦システムの性能向上を目的として、ノイズ挿入、再冗長性挿入、アイテムマスキング、同義語置換の4つの直接的シーケンスレベルのデータ拡張戦略を提案する。実験の結果、これらの手法は特に訓練データが限られた状況で顕著な性能向上を示し、一般化性能が向上し、先行手法と比較して競争力のある結果を得られる。

ABSTRACT

Sequential recommender systems have recently achieved significant performance improvements with the exploitation of deep learning (DL) based methods. However, although various DL-based methods have been introduced, most of them only focus on the transformations of network structure, neglecting the importance of other influential factors including data augmentation. Obviously, DL-based models require a large amount of training data in order to estimate parameters well and achieve high performances, which leads to the early efforts to increase the training data through data augmentation in computer vision and speech domains. In this paper, we seek to figure out that various data augmentation strategies can improve the performance of sequential recommender systems, especially when the training dataset is not large enough. To this end, we propose a simple set of data augmentation strategies, all of which transform original item sequences in the way of direct corruption and describe how data augmentation changes the performance. Extensive experiments on the latest DL-based model show that applying data augmentation can help the model generalize better, and it can be significantly effective to boost model performances especially when the amount of training data is small. Furthermore, it is shown that our proposed strategies can improve performances to a better or competitive level to existing strategies suggested in the prior works.

研究の動機と目的

  • 訓練データが限られた状況において、データ拡張が深層学習に基づく順序推薦システムの性能向上に寄与するかどうかを調査すること。
  • 腐敗に基づく変換によって、元のアイテムシーケンスを直接操作する、シンプルでありながら効果的なデータ拡張戦略のセットを提案すること。
  • 異なる拡張手法が複数のデータセットおよびモデルアーキテクチャにおいて、モデルの一般化性能に与える影響を評価すること。
  • データ拡張が、特にコールドスタート状況において、普遍的な前処理手法として順序推薦システムの性能を向上させられることを示すこと。

提案手法

  • ノイズ挿入(ランダムにアイテムを挿入)、再冗長性挿入(アイテムを複製)、アイテムマスキング(アイテムを特別なトークンに置換)、および同義語置換(共起に基づき意味的に類似したアイテムに置換)の4つの直接的シーケンスレベルのデータ拡張戦略を提案。
  • これらの戦略を、最先端の順序推薦モデルに入力する前に、元のユーザーアクセスシーケンスを変更することで適用。
  • スライディングウィンドウ(SW)とサブセット選択(SS)をベースラインとして比較し、SWはより安定した改善を示した。
  • Recall@KおよびMRR@Kなどの標準的評価指標を用いて、複数のデータセット(例:MovieLens-1M、Amazon Games)における性能を測定。
  • 拡張サイズが性能に与える影響を分析するためのアブレーションスタディを実施し、元のシーケンスあたりの拡張サンプル数を変化させた。
  • モデルアーキテクチャを固定し、拡張によってのみ訓練データを変更することで、前処理の影響を明確に分離。

実験結果

リサーチクエスチョン

  • RQ1データ拡張は、深層学習に基づく順序推薦システムの性能向上に寄与するか?
  • RQ2異なるデータ拡張戦略は、特に低データ条件下でモデルの一般化性能や性能にどのように影響するか?
  • RQ3データ拡張のサイズは性能向上に影響を及ぼすか?また、性能が飽和するポイントはどこか?
  • RQ4提案された直接的シーケンスマニピュレーション戦略は、部分列選択に基づく先行手法と比較してどう異なるか?

主な発見

  • データ拡張は、特に訓練データが少ない状況でモデル性能を顕著に向上させ、ノイズ挿入を用いることで、Amazon Gamesデータセットで10%のデータサイズで最大+34.6%の性能向上を達成した。
  • 性能向上はデータ拡張のサイズに比例し、データセットサイズが増加するにつれて収益が減少する傾向にあり、大規模データでは限界効果が顕著になる。
  • ノイズ挿入(NI)とスライディングウィンドウ(SW)戦略は、複数のデータセットで一貫して顕著な改善を示し、NIは10%のデータサイズでAmazon Gamesで+34.6%の向上を達成した。
  • アイテムマスキング(IM)と同義語置換(SR)は結果がばらつきやすく、IMは情報損失のため性能が低かったが、SRは中程度の向上を示した。
  • フルデータセットの100%でも、データ拡張は測定可能な改善を示しており(例:MovieLens-1MでMRR@10が+2.5%)、大規模データ環境でも継続的な利点があることが示された。
  • 提案手法は、先行の部分列ベース手法と同等またはそれ以上の性能を達成しており、普遍的な前処理手法としての有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。