Skip to main content
QUICK REVIEW

[論文レビュー] Ranking Distillation: Learning Compact Ranking Models With High Performance for Recommender System

Jiaxi Tang, Ke Wang|arXiv (Cornell University)|Sep 19, 2018
Recommender Systems and Techniques参考文献 41被引用数 20
ひとこと要約

本稿では、レコメンデーションシステムなどの順序付けタスクにおいて、大きな教師モデルの順序付け行動を模倣するように訓練されるコンパクトな学生モデルを学習する、ランクイング蒸留(RD)という知識蒸留技術を紹介する。真のラベルと教師モデルの上位K件の順序付けの両方を活用することで、教師モデルの性能にほぼ匹敵する性能を、モデルサイズの半分未塔で達成し、効果性を損なわず推論効率を著しく向上させることができる。

ABSTRACT

We propose a novel way to train ranking models, such as recommender systems, that are both effective and efficient. Knowledge distillation (KD) was shown to be successful in image recognition to achieve both effectiveness and efficiency. We propose a KD technique for learning to rank problems, called \emph{ranking distillation (RD)}. Specifically, we train a smaller student model to learn to rank documents/items from both the training data and the supervision of a larger teacher model. The student model achieves a similar ranking performance to that of the large teacher model, but its smaller model size makes the online inference more efficient. RD is flexible because it is orthogonal to the choices of ranking models for the teacher and student. We address the challenges of RD for ranking problems. The experiments on public data sets and state-of-the-art recommendation models showed that RD achieves its design purposes: the student model learnt with RD has a model size less than half of the teacher model while achieving a ranking performance similar to the teacher model and much better than the student model learnt without RD.

研究の動機と目的

  • 大規模なレコメンデーションシステムにおいて顕著な順序付けタスクにおける効果性と推論効率のトレードオフを解消すること。
  • 分類タスクで実証済みの知識蒸留を、クラス予測ではなく相対的順序の決定が目的の順序付け問題に適応すること。
  • 小さな学生モデルが大きな教師モデルの性能に一致できるようにする、柔軟でモデルに依存しない蒸留フレームワークを設計すること。
  • 真のラベルと教師モデルの順序付け出力の両方の監視をバランスさせ、一般化性能を確保すること。
  • 最先端の順序付けモデルを用いて実世界のデータセット上で評価し、モデル圧縮と性能維持の両立を実証すること。

提案手法

  • 本手法は、真の関連性ラベルに基づく損失と、より大きな教師モデルが生成する相対的順序に基づく損失の両方を最小化するように、より小さな学生モデルを訓練する。
  • 教師モデルは各クエリに対してアイテムのソフトな順序付け出力を生成し、学生モデルはこの出力から上位K件の相対的順序を再現するように学習する。
  • 教師モデルが上位にランク付けしたアイテムに高い重みを付けることで、蒸留の忠実度を向上させるハイブリッド重み付け方式を提案する。
  • 蒸留損失は、学生モデルと教師モデルの順序付け確率分布間のKLダイバージェンスを組み合わせており、特に上位にランク付けされたアイテムの相対的順序を維持することに焦点を当てる。
  • アーキテクチャに依存しないアプローチであるため、深層ニューラルネットワークを含む任意の教師-学生ペアの順序付けモデルに適用可能である。
  • 真のラベルと教師の監視の信頼度を動的にバランスさせるために、損失の重み付き組み合わせを用いることで、一般化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1分類とは異なり相対的順序の決定が目的の順序付け問題に、知識蒸留を効果的に適応できるか?
  • RQ2教師モデルの順序付け出力を、性能を維持しつつ、より小さな学生モデルを効果的に監視する方法は何か?
  • RQ3順序付けタスクにおける蒸留の性能を最適化するため、教師の上位K件の順位に適用する重み付け方式として、どの方法が最も効果的か?
  • RQ4学生モデルが教師モデルに比べて著しく小さく、かつ推論が高速であるにもかかわらず、どの程度教師モデルに匹敵する性能を達成できるか?
  • RQ5本手法は、蒸留なしで訓練された学生モデルと比較して、モデルサイズと順序付け効果性の両面で優れているか?

主な発見

  • ランクイング蒸留で訓練された学生モデルは、教師モデルの半分未満のモデルサイズでありながら、教師モデルとほぼ同等の順序付け性能を達成した。
  • Gowallaデータセットでは、最良のRDバージョン(ハイブリッド重み付け)がP@10: 0.0878、nDCG@10: 0.1283、MAP: 0.0969を達成し、蒸留なしで訓練された学生モデルを顕著に上回った。
  • Foursquareデータセットでは、ハイブリッド重み付け方式によりP@10が0.0424(均等重み付け時)から0.0444に向上し、nDCG@10とMAPに対しても同様の向上が見られた。
  • 位置重要度重み付け方式は、均等重み付けや個別モデル重み付けを上回り、教師モデルが上位にランク付けしたアイテムが蒸留においてより情報量が多いことを示した。
  • 位置重要度と順位差の両方を組み合わせたハイブリッド重み付け戦略が、両方のデータセットで最良の結果をもたらし、監視のバランスを適切にとれていることを確認した。
  • 異なる順序付けモデルとデータセットにわたり、本手法は強力な一般化性能を示し、実世界の推薦シナリオにおける柔軟性と頑健性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。