Skip to main content
QUICK REVIEW

[論文レビュー] GRN: Generative Rerank Network for Context-wise Recommendation

Yufei Feng, Binbin Hu|arXiv (Cornell University)|Apr 2, 2021
Recommender Systems and Techniques参考文献 32被引用数 4
ひとこと要約

GRNは、最終順序付けリスト内の文脈的相互作用を二段階アプローチでモデル化する生成的再順序付けフレームワークを提案する。評価者としてBi-LSTMと自己注意機構を用いたモデルがアイテム間相互作用確率を予測し、生成者としてGRUとポインタネットを用いたモデルが方策勾配に基づき文脈に配慮した再順序付けを学習する。実世界の淘宝での展開において、PVとIPVでそれぞれ5.2%および6.1%の向上を達成した。

ABSTRACT

Reranking is attracting incremental attention in the recommender systems, which rearranges the input ranking list into the final rank-ing list to better meet user demands. Most existing methods greedily rerank candidates through the rating scores from point-wise or list-wise models. Despite effectiveness, neglecting the mutual influence between each item and its contexts in the final ranking list often makes the greedy strategy based reranking methods sub-optimal. In this work, we propose a new context-wise reranking framework named Generative Rerank Network (GRN). Specifically, we first design the evaluator, which applies Bi-LSTM and self-attention mechanism to model the contextual information in the labeled final ranking list and predict the interaction probability of each item more precisely. Afterwards, we elaborate on the generator, equipped with GRU, attention mechanism and pointer network to select the item from the input ranking list step by step. Finally, we apply cross-entropy loss to train the evaluator and, subsequently, policy gradient to optimize the generator under the guidance of the evaluator. Empirical results show that GRN consistently and significantly outperforms state-of-the-art point-wise and list-wise methods. Moreover, GRN has achieved a performance improvement of 5.2% on PV and 6.1% on IPV metric after the successful deployment in one popular recommendation scenario of Taobao application.

研究の動機と目的

  • 最終順序付けリスト内の文脈的依存関係を無視するgreedy再順序付け手法の性能が最適でない問題に対処すること。
  • 最終順序付けリストにおけるアイテム同士の相互影響とその周囲の文脈をモデル化し、より正確な相互作用確率予測を実現すること。
  • 順序的および関係的アイテム文脈を考慮して、ユーザーの関与度を最適化する文脈に配慮した再順序付け戦略を学習すること。
  • 淘宝のホームページのような低遅延で実稼働される推薦システムに、文脈に配慮した再順序付けを効果的に展開できること。

提案手法

  • 評価者では、最終順序付けリスト内の順序的依存関係を捉えるためにBi-LSTMを用い、相互作用確率の精緻化を図るために自己注意機構を用いる。
  • 生成者では、入力リストから段階的にアイテムを選択するためにGRUと注意メカニズムを用い、ポインタネットにより入力リストの順列を生成する。
  • 評価者の訓練には交差エントロピー損失が使用され、生成者の最適化には評価者が予測する報酬に基づく方策勾配が用いられる。
  • フレームワークは二段階で訓練される:まず、ラベル付きの最終リストに基づいて評価者を訓練し、次に、評価者の報酬に基づいて方策勾配を用いて生成者をファインチューニングする。
  • 生成者は訓練済みの評価者から文脈的知識を抽出することで、文脈的に最適な順序付けを生成するよう学習する。
  • 直接エッジでの推論とリクエストスケジューリングによる事前トリガー機構により、生産環境での低遅延を実現する。

実験結果

リサーチクエスチョン

  • RQ1最終リスト内のアイテム同士の相互影響をモデル化することで、文脈に配慮した再順序付け戦略がgreedy再順序付けを上回ることができるか?
  • RQ2方策勾配を用いて学習された生成者により、ポイントワイズまたはリストワイズモデルに比べてより優れた最終順序付けを効果的に得られるか?
  • RQ3実世界の産業的環境において、文脈的相互作用確率を統合することで推薦性能がどの程度向上するか?
  • RQ4提案されたフレームワークは、淘宝のホームページのような低遅延生産環境に効率的に展開可能か?

主な発見

  • GRNは、ベンチマークデータセットおよび産業的データセットの両方で、最先端のポイントワイズおよびリストワイズ再順序付け手法を常に上回る性能を示した。
  • 産業的Recデータセットでは、展開済みのベースラインPRMに対してPVで5.2%、IPVで6.1%の向上を達成した。
  • 淘宝の「あなたに似た商品」シナリオにおけるオンラインA/Bテストにより、GRNの優位性が確認され、ユーザー関与度指標に顕著な向上が見られた。
  • 生成者の文脈に配慮した戦略により、繰り返しのカテゴリによるユーザーの疲れを軽減し、より多様で魅力的な推薦が実現された。
  • 平均的なオンライン推論遅延は32ミリ秒であり、エッジデプロイとリクエストスケジューリングにより30ミリ秒の遅延削減が達成された。
  • アブレーションスタディにより、GRN G(文脈モデリングを完全に統合)はGRN G(-DR)を上回ることを確認し、包括的な文脈統合の重要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。