[論文レビュー] A Generic Network Compression Framework for Sequential Recommender Systems
本稿では、順序付きレコメンデーションシステムのモデル圧縮を目的として、埋め込み行列およびソフトマックス行列のブロック単位の適応的分解と、深層ニューラルネットワークにおけるレイヤー単位のパラメータ共有を活用する汎用フレームワークCpRecを提案する。本手法は、実世界のデータセットにおいて最大4–8倍のモデル圧縮を達成し、トレーニング・インファレンスが高速化され、精度は向上または同等水準を維持する。
Sequential recommender systems (SRS) have become the key technology in capturing user's dynamic interests and generating high-quality recommendations. Current state-of-the-art sequential recommender models are typically based on a sandwich-structured deep neural network, where one or more middle (hidden) layers are placed between the input embedding layer and output softmax layer. In general, these models require a large number of parameters (such as using a large embedding dimension or a deep network architecture) to obtain their optimal performance. Despite the effectiveness, at some point, further increasing model size may be harder for model deployment in resource-constraint devices, resulting in longer responding time and larger memory footprint. To resolve the issues, we propose a compressed sequential recommendation framework, termed as CpRec, where two generic model shrinking techniques are employed. Specifically, we first propose a block-wise adaptive decomposition to approximate the input and softmax matrices by exploiting the fact that items in SRS obey a long-tailed distribution. To reduce the parameters of the middle layers, we introduce three layer-wise parameter sharing schemes. We instantiate CpRec using deep convolutional neural network with dilated kernels given consideration to both recommendation accuracy and efficiency. By the extensive ablation studies, we demonstrate that the proposed CpRec can achieve up to 4$\sim$8 times compression rates in real-world SRS datasets. Meanwhile, CpRec is faster during training\inference, and in most cases outperforms its uncompressed counterpart.
研究の動機と目的
- リソース制約のあるデバイスへの展開を妨げる順序付きレコメンデーションシステム(SRS)における大規模モデルの課題に対処すること。
- メモリ消費量を低減し、トレーニングおよびインファレンスを高速化するが、レコメンデーション精度を損なわないこと。
- 特定のアーキテクチャに限定されない、さまざまなディープラーニングベースのSRSモデルに適用可能な汎用フレームワークの開発。
- アイテムの長尾分布と隠れ層における構造的パラメータ共有を活用することで、従来の圧縮技術の限界を克服すること。
- 下流タスクに一般化しやすいコンactモデルを事前学習することで、効率的な転移学習を可能にすること。
提案手法
- SRSにおけるアイテムの長尾分布を活用し、入力埋め込みおよび出力ソフトマックス行列のブロック単位の適応的分解を適用して近似する。
- 隣接ブロック、クロスブロック、クロスレイヤーの3種類のレイヤー単位のパラメータ共有戦略を導入し、深層隠れ層のパラメータを削減する。
- 精度と効率のバランスを取るために、dilated convolutional neural networks(例:NextItNet)をベースアーキテクチャとして採用する。
- ブロック単位の分解とレイヤー単位の共有を統合した包括的なフレームワークを構築し、最適な圧縮とパフォーマンスを実現する。
- モジュール型かつ拡張性を備えた設計として、GRU4Recなどの他のSRSモデルとも統合可能である。
- Hit@20、MRR@5、HR@5などの標準指標を用いて実世界のデータセット上で評価し、圧縮および速度に関するアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1埋め込みおよびソフトマックス行列の適応的分解は、レコメンデーション精度を損なわず、モデルサイズを顕著に削減できるか?
- RQ2異なるレイヤー単位のパラメータ共有戦略は、SRSモデルの深層隠れ層の圧縮にどの程度効果的か?
- RQ3提案された圧縮フレームワークは、パフォーマンスを劣化させることなく、トレーニングおよびインファレンスの速度をどの程度向上できるか?
- RQ4CpRecは、NextItNet や GRU4Rec などの異なるSRSアーキテクチャに一般化可能か?
- RQ5圧縮モデルは、元の大きなモデルと比較して、転移学習の場面でも性能を維持または向上できるか?
主な発見
- CpRecは、実世界のSRSデータセットにおいて最大4–8倍の圧縮率を達成し、モデルサイズを顕著に削減した。
- ブロック単位およびレイヤー単位の圧縮を統合したBio-NextItNetバージョンは、最高の圧縮比を達成し、元のNextItNetと比較して精度およびトレーニング速度の両面で優れた性能を示した。
- 隣接ブロックパラメータ共有戦略(Ab-NextItNet)は、精度と圧縮のバランスが最良であり、パラメータを50%削減しながらも、性能を維持または向上させた。
- クロスレイヤーパラメータ共有戦略(Cl-NextItNet)は、最高の圧縮率を達成したが、精度の著しい低下を引き起こし、パフォーマンスのトレードオフが不適切であることが示された。
- CpRecベースのモデルは、トレーニングおよびインファレンスが高速化され、ColdRecでは事前学習時間が元のモデルの約1/5にまで短縮された。
- 転移学習の場面では、パラメータ共有を施したCpRecモデル(例:CpRec-Ab)が、元のNextItNetと比較してMRR@5およびHR@5が高く、パラメータ数は3150万(元の31%)にまで削減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。