Skip to main content
QUICK REVIEW

[論文レビュー] Constrained Reinforcement Learning for Short Video Recommendation

Qingpeng Cai, Ruohan Zhan|arXiv (Cornell University)|May 26, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、短時間動画推薦において長期視聴時間の最適化と、共有やダウンロードなどの補助的ユーザー行動の強力なパフォーマンスを両立させる2段階の制約付き強化学習フレームワークを提案する。まず補助的反応に対してポリシーを事前学習し、その後、それらのポリシーに近いように制約を課したメインポリシーを学習することで、視聴時間と行動指標の間で優れたバランスを達成し、ライブ実験で教師ありベースライン比で視聴時間+0.336%、共有数+3.324%の向上を達成した。

ABSTRACT

The wide popularity of short videos on social media poses new opportunities and challenges to optimize recommender systems on the video-sharing platforms. Users provide complex and multi-faceted responses towards recommendations, including watch time and various types of interactions with videos. As a result, established recommendation algorithms that concern a single objective are not adequate to meet this new demand of optimizing comprehensive user experiences. In this paper, we formulate the problem of short video recommendation as a constrained Markov Decision Process (MDP), where platforms want to optimize the main goal of user watch time in long term, with the constraint of accommodating the auxiliary responses of user interactions such as sharing/downloading videos. To solve the constrained MDP, we propose a two-stage reinforcement learning approach based on actor-critic framework. At stage one, we learn individual policies to optimize each auxiliary response. At stage two, we learn a policy to (i) optimize the main response and (ii) stay close to policies learned at the first stage, which effectively guarantees the performance of this main policy on the auxiliaries. Through extensive simulations, we demonstrate effectiveness of our approach over alternatives in both optimizing the main goal as well as balancing the others. We further show the advantage of our approach in live experiments of short video recommendations, where it significantly outperforms other baselines in terms of watch time and interactions from video views. Our approach has been fully launched in the production system to optimize user experiences on the platform.

研究の動機と目的

  • 短時間動画推薦において、視聴時間(密集型)と希少な行動(例:共有、ダウンロード)といった複数のユーザー反応信号を同時に最適化する課題に対処すること。
  • 長期的視聴時間を最優先しつつ、共有やダウンロードといった補助的反応が無視されないよう保証する強化学習フレームワークを開発すること。
  • 単一目的の強化学習や重み付き和報酬手法では、反応頻度や割引の違いに対応できないという限界を克服すること。
  • 実世界の生産レコメンデーションシステムへの導入に適した実用的でスケーラブルな手法を設計すること。

提案手法

  • 視聴時間を主目的とし、行動信号を制約とする、短時間動画推薦を制約付きマルコフ意思決定過程(CMDP)として定式化する。
  • 2段階の訓練プロセスを採用:まず、個々のA3Cポリシーを、共有やダウンロードといった各補助的反応を別々に最適化するように訓練する。
  • 反応ごとに特化した価値ネットワークと個別割引因子を用いることで、希少な信号と密集した信号を正確に評価し、反応タイプ間の干渉を回避する。
  • 2段階目では、累積視聴時間を最大化するようにメインポリシーを学習するが、近隣制約により補助的ポリシーから離れすぎないように正則化する。
  • アクター更新に近隣正則化項を用いたソフト制約を適用し、メインポリシーが補助的ポリシーからあまりに離れないように保証する。
  • 複数の反応特化型クリティックからの価値推定を組み合わせるルールを採用し、メインポリシーの学習をガイドする。

実験結果

リサーチクエスチョン

  • RQ1制約付き強化学習フレームワークは、短時間動画推薦において、長期視聴時間と複数の補助的ユーザー行動信号のバランスを効果的にとれるか?
  • RQ2個別割引因子を備えた反応特化型価値ネットワークは、反応頻度や時間的構造が異なる状況で、どのようにポリシー学習を改善するか?
  • RQ3補助的ポリシーを事前学習し、メインポリシーをそれらに近づけるように制約を課すことで、主目的と補助目的の両方で、共同最適化よりも優れたパフォーマンスが得られるか?
  • RQ42段階アプローチは、標準的なA3CやRCPOに比べて、ライブデプロイ環境でどれほど優れているか?
  • RQ5密集した視聴時間の最適化と同時に、共有やダウンロードといった希少な行動信号についても、強力なパフォーマンスを維持できるか?

主な発見

  • 提案された2段階の制約付きA3C手法は、ライブ実験で教師ありLTRベースライン比で視聴時間+0.336%、共有数+3.324%の相対的向上を達成した。
  • A3CやRCPO-A3Cに比べ、補助指標のバランスが著しく優れており、共有数は+3.324%、ダウンロード数は+1.785%増加し、視聴時間の向上も維持した。
  • 学習曲線から、行動最適化ポリシーに近づくことで、共有数のパフォーマンスが迅速に向上したことが示され、効果的な制約の実装が確認された。
  • 各反応ごとに分離した価値ネットワークを導入することで、特に希少信号において学習の安定性と正確性が向上し、個別割引因子の導入と信号干渉の低減が可能になった。
  • 単純な組み合わせ手法に比べ、視聴時間の価値推定で0.191%、行動信号推定で0.143%の向上を達成し、設計選択の妥当性が裏付けられた。
  • 本手法は快手(Kuaishou)で完全にプロダクション環境にデプロイされており、実世界でのスケーラビリティと有効性が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。