Skip to main content
QUICK REVIEW

[論文レビュー] Sequential Evaluation and Generation Framework for Combinatorial Recommender System

Fan Wang, Xiaomin Fang|arXiv (Cornell University)|Feb 1, 2019
Recommender Systems and Techniques参考文献 42被引用数 8
ひとこと要約

本稿では、組み合わせ的レコメンデーションシステム向けに、全体の効用(例:合計クリック数)を予測するニューラルエバレイターを訓練し、ヒューリスティックサーチまたは強化学習を用いて高品質な順序を生成する、新たな評価・生成フレームワークを提案する。このフレームワークは、強力なベースライン比で2.44%の相対的向上を達成し、オンライン性能が最先端水準に達しており、リスト内相関関係の優れたモデリングと、実際のA/Bテスト結果と相関が極めて高い(r = 0.9680)エバレイターを用いた信頼性の高いオフライン評価を実現している。

ABSTRACT

In the combinatorial recommender systems, multiple items are fed to the user at one time in the result page, where the correlations among the items have impact on the user behavior. In this work, we model the combinatorial recommendation as the problem of generating a sequence(ordered list) of items from a candidate set, with the target of maximizing the expected overall utility(e.g. total clicks) of the sequence. Toward solving this problem, we propose the Evaluation-Generation framework. On the one hand of this framework, an evaluation model is trained to evaluate the expected overall utility, by fully considering the user, item information and the correlations among the co-exposed items. On the other hand, generation policies based on heuristic searching or reinforcement learning are devised to generate potential high-quality sequences, from which the evaluation model select one to expose. We propose effective model architectures and learning metrics under this framework. We also offer series of offline tests to thoroughly investigate the performance of the proposed framework, as supplements to the online experiments. Our results show obvious increase in performance compared with the previous solutions.

研究の動機と目的

  • 既存の多様性のある順序付け手法が、硬直的で手作業で設計された相関仮定に依存しており、信頼できる評価基準が欠如しているという限界に対処すること。
  • 推薦順序に同時に露出するアイテム間の複雑で非一様な関係を捉えることで、リスト内相関関係をより効果的にモデル化すること。
  • オンライン性能を信頼性高く予測できる実用的なオフライン評価フレームワークを開発し、高コストなA/Bテストへの依存を減らすこと。
  • グリーディに段階的にアイテムを選択するのではなく、順序全体の全体的な効用を最適化すること。
  • 数億人のユーザーを対象とする大規模システムにおいて、スケーラブルに実世界に展開可能な組み合わせ的レコメンデーションの実装を可能にすること。

提案手法

  • フレームワークは2つのコンponentsから構成される:深層ニューラルネットワークを用いて、ユーザー、アイテム、およびアイテム間相関特徴を統合し、シーケンスの期待される全体的効用を予測するエバレイター・モデル。
  • ジェネレーターは、ヒューリスティックサーチ(例:グリーディサンプリング)または強化学習(例:Q学習)を用いたシーケンスデコード方針により、候補アイテム集合から候補シーケンスを生成する。
  • エバレイターは複数の生成されたシーケンスを評価し、予測された効用が最も高いものを露出対象として選択することで、生成と評価のフィードバックループを実現する。
  • エバレイターにはBi-GRNNアーキテクチャが用いられ、実際のオンラインA/Bテスト結果と0.9680の高い相関を達成し、その予測能力を検証した。
  • オフライン評価は段階的バリデーションにより実施:まずエバレイターの予測精度を評価し、次にシミュレーテッドおよび実際のフィードバックを用いてジェネレーターのパフォーマンスを評価する。
  • フレームワークは、エバレイターからの合成フィードバックと実際のクリックデータを併用したオフポリシーモードの強化学習設定で訓練・検証され、耐障害性と一般化性能が確保された。

実験結果

リサーチクエスチョン

  • RQ1ニューラルエバレイターは、高コストなA/Bテストへの依存を減らすために、組み合わせ的レコメンデーションシーケンスのオンラインパフォーマンスを正確に予測できるか?
  • RQ2学習済み効用エバレイターに従って、強化学習およびヒューリスティックサーチが、高効用のアイテムシーケンスをどれほど効果的に生成できるか?
  • RQ3提案フレームワークは、単純な多様性やサブモジュラリティ仮定を越えて、複雑なリスト内相関関係をどの程度捉えられるか?
  • RQ4本フレームワークは、明示的な多様性正則化を実装していないにもかかわらず、実世界の展開において全体の効用とカテゴリカバレッジの両方を向上できるか?
  • RQ5特に強化学習ベースの設定において、ノイズや動的なオンライン環境にさらされたジェネレーター方策は、どの程度耐性を示すか?

主な発見

  • Bi-GRNNエバレイターは400回の実験において、実際のオンラインA/Bテスト結果と相関係数0.9680を達成し、MLP(0.2282)を大きく上回り、シミュレーションの代理としての信頼性を裏付けた。
  • GRNNベースのジェネレーターとBi-GRNNセレクタを組み合わせたエバレイター・ジェネレーター・フレームワークは、GRNNオンリーベースライン比で2.44%の相対的向上を達成した。
  • 強化学習手法(SetToSeq + RL)は、エバレイター・ジェネレーター・フレームワークと同等のパフォーマンスを示したが、ノイズの多いオンラインポリシーのため、時折不安定な挙動を示した。
  • フレームワークはGRNNベースライン比でカテゴリカバレッジを0.62%向上させ、明示的な多様性正則化なしに多様性の向上が図れたことを示した。
  • エバレイターの高い予測精度により、効果的なオフラインバリデーションが可能となり、多数のオンラインA/Bテストを実施する必要が減りながらも、結果予測の信頼性を維持できた。
  • 本フレームワークは、1日数億人のアクティブユーザーを対象とする生産環境システムに成功裏に展開され、スケーラビリティと実世界での有効性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。