[論文レビュー] Top-K Off-Policy Correction for a REINFORCE Recommender System
本論文は、REINFORCEを用いて大規模な産業用レコメンデーションシステムにおける安定的でスケーラブルな方策勾配学習を可能にする、新しいtop-Kのオフポリシー補正手法を提案する。複数の行動ポリシーからのログフィードバックに起因するデータバイアスを補正し、複数アイテム同時推薦を考慮することで、長期的なユーザー参加度が向上し、ライブYouTube実験でViewTimeが0.85%増加し、再生動画数が0.53%増加した。
Industrial recommender systems deal with extremely large action spaces -- many millions of items to recommend. Moreover, they need to serve billions of users, who are unique at any point in time, making a complex user state space. Luckily, huge quantities of logged implicit feedback (e.g., user clicks, dwell time) are available for learning. Learning from the logged feedback is however subject to biases caused by only observing feedback on recommendations selected by the previous versions of the recommender. In this work, we present a general recipe of addressing such biases in a production top-K recommender system at Youtube, built with a policy-gradient-based algorithm, i.e. REINFORCE. The contributions of the paper are: (1) scaling REINFORCE to a production recommender system with an action space on the orders of millions; (2) applying off-policy correction to address data biases in learning from logged feedback collected from multiple behavior policies; (3) proposing a novel top-K off-policy correction to account for our policy recommending multiple items at a time; (4) showcasing the value of exploration. We demonstrate the efficacy of our approaches through a series of simulations and multiple live experiments on Youtube.
研究の動機と目的
- 複数の過去のポリシーからのログフィードバックに起因するデータバイアスを、非定常的行動を伴う複数のポリシーから生じるものとして解消する。
- 実世界の本番環境で数百万ものアイテムを含むアクション空間を扱えるよう、REINFORCE方策勾配アルゴリズムをスケーリングする。
- 複数のアイテムを同時に推薦するtop-Kレコメンデーションシステムに特化した、新しいtop-Kオフポリシー補正メカニズムを開発する。
- 探索と分散低減技術の効果が、長期的なユーザー満足度と参加度を向上させることを示す。
- シミュレーションおよびYouTubeレコメンデーションシステムにおける大規模な本番実験を通じて、手法の有効性を検証する。
提案手法
- 深層ニューラルネットワークによる関数近似を用いて、数百万ものアイテムを含む巨大なアクション空間を持つニューラル候補生成器にREINFORCEアルゴリズムを適応させる。
- ログポリシーをモデル化し、重要度サンプリングを用いてログフィードバックを再重み付けすることで、非一様なデータ収集に起因するバイアスを低減するオフポリシー補正を適用する。
- 本稿で提唱する新しいtop-Kオフポリシー補正により、K個のアイテムを同時に推薦する際のポリシー勾配更新を修正し、トップ1を超える関連アイテムに対して非ゼロの確率質量を保証する。
- 重要度重みのキャップ(c = e³)を含む分散低減技術を実装し、高報酬・低確率行動への過剰適合を防ぐ。
- 学習済みログポリシーを用いて行動ポリシーを推定することで、ログされた暗黙的フィードバックにおける選択バイアスを正確に補正可能にする。
- TRPOスタイルの制約と正規化重要度サンプリングを適用し、さらに学習の安定性を高め、収束性を改善する。
実験結果
リサーチクエスチョン
- RQ1REINFORCEは、数百万ものアイテムを含むアクション空間を持つ本番レコメンデーションシステムに、どのようにスケーリング可能か?
- RQ2標準的なオフポリシー補正はtop-Kレコメンデーション設定でどの程度失敗し、どのように改善できるか?
- RQ3top-Kオフポリシー補正は、ViewTime や再生動画数といったユーザー参加度指標にどのような影響を与えるか?
- RQ4K や重要度重みのキャップといったハイパーパrameterが、学習済みポリシーの性能と安定性に与える影響はいかほどか?
- RQ5オフポリシー補正による探索は、長期的なユーザー満足度に測定可能な向上をもたらすか?
主な発見
- top-Kオフポリシー補正により、ライブYouTube実験でViewTimeが0.85%、再生動画数が0.53%有意に増加した。
- K=1を用いたtop-K補正は、ベースラインのK=16と比較してViewTimeを0.66%低下させた。これは、top-1に特化した学習よりも複数アイテム補正の利点が明確に示された。
- K=8に設定した場合、ViewTimeが+0.15%有意に向上した。これは、探索と活用の最適なバランスが得られていることを示唆する。
- 重要度重みのキャップをc=e³からc=e⁵に引き上げたところ、ViewTimeが0.52%低下した。これは、キャップが高分散・低確率行動への過剰適合を防ぐことを示している。
- 標準的なオフポリシー補正では、トップ1の正確性に偏ったポリシーが得られたが、top-K補正ではより滑らかで、全体的なtop-Kレコメンデーション品質が向上した。
- シミュレーションおよび本番実験の両方で、K個のアイテムの同時推薦を考慮することで、トップ1に特化した手法と比較して、全体のページ体験が著しく向上することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。