Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcing User Retention in a Billion Scale Short Video Recommender System

Qingpeng Cai, Shuchang Liu|arXiv (Cornell University)|Feb 3, 2023
Recommender Systems and Techniques被引用数 4
ひとこと要約

本論文では、ユーザーのリテンションを最適化する強化学習フレームワークであるRLURを提案する。このフレームワークは、無限時間枠のリクエストベースのマルコフ決定過程としてリテンションをモデル化し、Kuaishouの10億規模のショートビデオ推薦システムでライブに実装された。長期間にわたるリテンションフィードバックの不確実性やバイアス、遅延の問題に対処するため、新規の正規化手法とデュアル・クリティック学習目的関数を導入し、ユーザーのリテンションとDAUの両面で一貫した向上を達成した。

ABSTRACT

Recently, short video platforms have achieved rapid user growth by recommending interesting content to users. The objective of the recommendation is to optimize user retention, thereby driving the growth of DAU (Daily Active Users). Retention is a long-term feedback after multiple interactions of users and the system, and it is hard to decompose retention reward to each item or a list of items. Thus traditional point-wise and list-wise models are not able to optimize retention. In this paper, we choose reinforcement learning methods to optimize the retention as they are designed to maximize the long-term performance. We formulate the problem as an infinite-horizon request-based Markov Decision Process, and our objective is to minimize the accumulated time interval of multiple sessions, which is equal to improving the app open frequency and user retention. However, current reinforcement learning algorithms can not be directly applied in this setting due to uncertainty, bias, and long delay time incurred by the properties of user retention. We propose a novel method, dubbed RLUR, to address the aforementioned challenges. Both offline and live experiments show that RLUR can significantly improve user retention. RLUR has been fully launched in Kuaishou app for a long time, and achieves consistent performance improvement on user retention and DAU.

研究の動機と目的

  • 従来のポイントワイズまたはリストワイズモデルでは効果的に捉えきれない、ショートビデオ推薦における長期的ユーザーリテンション最適化の課題に対処すること。
  • ユーザーのリテンションを、セッション間の累積的帰還時間の最小化を目的とする無限時間枠のリクエストベースのマルコフ決定過程としてモデル化すること。
  • 標準的な強化学習アルゴリズムの直接適用を阻害する、リテンションフィードバックの遅延、不確実性、バイアスの課題を克服すること。
  • 実世界の展開においてアプリ起動頻度とユーザーリテンションを向上させる、スケーラブルで安定的かつ効果的なRLベースのポリシーを開発すること。
  • オフライン評価と長期にわたるライブA/B実験を通じて、本手法の有効性を検証すること。

提案手法

  • 推奨問題を、エージェント(推薦システム)が長期的ユーザー還帰を最適化するためにランク付け重みを選択する無限時間枠のリクエストベースのMDPとして定式化する。
  • 帰還時間を予測し、リテンション報酬信号の分散を低減する新規の正規化手法を導入し、学習の安定性を向上させる。
  • セッション単位のリテンション報酬を評価するリテンションクリティックと、各リクエストのフィードバック(視聴時間、いいねなど)を評価する即時報酬クリティックを組み合わせたデュアル・クリティック学習目的関数を設計する。
  • 視聴時間、いいね、コメントなど8つの異なるフィードバック信号のランク付け重みを表す8次元の連続的アクション空間を採用する。
  • ガウス分布の平均と分散を出力するポリシー・ネットワーク(エイド)を用い、学習中の探索を可能にする。
  • ハイパーパrameterを調整して安定性と性能を最適化した重み付き損失関数を用い、リテンションクリティックと即時報酬クリティックを統合してポリシーを学習する。
Figure 1. The infinite horizon request-based MDP and the framework of RLUR
Figure 1. The infinite horizon request-based MDP and the framework of RLUR

実験結果

リサーチクエスチョン

  • RQ1実世界のショートビデオ推薦システムにおいて、長期的ユーザーリテンションを最適化するために強化学習を効果的に適用できるか?
  • RQ2ユーザーのリテンションフィードバックにおける長期間の遅延、不確実性、バイアスをどのように軽減することで、安定した強化学習学習を可能にするか?
  • RQ3セッション単位のリテンションとリクエスト単位のフィードバックを統合したデュアル・クリティックアプローチは、単一クリティックまたはナイーブな強化学習手法と比較して、ポリシー学習をどのように改善するか?
  • RQ4提案された正規化手法は、リテンション報酬信号の分散を低減させ、学習収束を向上させるか?
  • RQ5RLURポリシーの長期的影響は、DAUやユーザーリテンションといった主要ビジネス指標にどのように現れるか?

主な発見

  • オフライン評価において、RLURは2.036(CEM)および2.009(TD3)を上回る1.892時間の帰還時間(累積的)を達成した。
  • ライブ実験では、100日後にアプリ起動頻度が0.450%向上し、CEMベースラインと比較してDAUで0.2%の差を示した。
  • 1日後のリテンションは0.053%、7日後には0.063%向上し、10億規模プラットフォームの文脈で統計的有意性を示した。
  • 性能向上は一貫的かつ段階的に進行し、特に80日目から100日目までの間で急激な改善が観察され、安定的かつ収束した学習を示した。
  • RLURは時間経過とともに持続的な向上を示し、劣化が認められず、生産環境での実装における強靭性とスケーラビリティを確認した。
  • アブレーションスタディの結果、提案された正規化手法とデュアル・クリティック構成が不可欠であることが判明。γ=0.9のナイーブなRLUR(naive)は、完全なRLURモデルに比べて性能が劣った。
Figure 2. Live performance gap of each day.
Figure 2. Live performance gap of each day.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。