[論文レビュー] DEAR: Deep Reinforcement Learning for Online Advertising Impression in Recommender Systems
本稿では、広告挿入意思決定(広告を挿入するか、どの広告を選ぶか、どこに挿入するか)を同時に最適化することで、長期的な収益を最大化するとともにユーザ体験を維持する、深層強化学習フレームワークDEARを提案する。この手法は、計算コストを低く抑えながら、3つの意思決定を同時に処理できる新規なDQNアーキテクチャを採用し、実世界のショートビデオデータにおいて顕著な性能向上を達成した。
With the recent prevalence of Reinforcement Learning (RL), there have been tremendous interests in utilizing RL for online advertising in recommendation platforms (e.g., e-commerce and news feed sites). However, most RL-based advertising algorithms focus on optimizing ads' revenue while ignoring the possible negative influence of ads on user experience of recommended items (products, articles and videos). Developing an optimal advertising algorithm in recommendations faces immense challenges because interpolating ads improperly or too frequently may decrease user experience, while interpolating fewer ads will reduce the advertising revenue. Thus, in this paper, we propose a novel advertising strategy for the rec/ads trade-off. To be specific, we develop an RL-based framework that can continuously update its advertising strategies and maximize reward in the long run. Given a recommendation list, we design a novel Deep Q-network architecture that can determine three internally related tasks jointly, i.e., (i) whether to interpolate an ad or not in the recommendation list, and if yes, (ii) the optimal ad and (iii) the optimal location to interpolate. The experimental results based on real-world data demonstrate the effectiveness of the proposed framework.
研究の動機と目的
- レコメンデーションシステムにおける広告収益の最大化とユーザ体験の維持というトレードオフを解消すること。
- 広告挿入意思決定(挿入可否、広告選定、挿入位置)を統合的に決定する統一フレームワークの開発。
- 従来のDQNアーキテクチャが3つの相互に依存する意思決定のうち部分的なみだけを処理するという限界を克服すること。
- 複数の関連する行動を同時に評価できるスケーラブルな深層強化学習ソリューションを設計し、妥当な時間計算量を実現すること。
- ショートビデオプラットフォームの実世界データを用いてフレームワークを検証し、ベースライン手法を上回る性能を示すこと。
提案手法
- 広告挿入問題を、状態、行動、遷移、報酬、割引率を有するマルコフ決定過程(MDP)としてモデル化する。
- 推薦リストとユーザ状態を入力とし、広告挿入意思決定のすべての組み合わせのQ値を出力する、新規なディープQネットワーク(DQN)アーキテクチャを提案する。
- 行動空間は、3つの関連する意思決定を含むように構造化されている:広告挿入可否(はい/いいえ)、候補広告群からの選定、リスト内での挿入位置。
- 報酬関数は、広告収益(R^ad)とユーザ体験への影響(R^ex)を、トレードオフをバランスさせるためのハイパーパrameter α で重み付けして組み合わせる。
- 学習の安定化のため、標準的なDQNと同様に経験再生とターゲットネットワークを用いるが、多次元行動空間に適応させた。
- このアーキテクチャにより、従来のアプローチがO(|A|·L)の評価を必要とするのに対し、すべての行動組み合わせを効率的に評価できる。
実験結果
リサーチクエスチョン
- RQ1深層強化学習フレームワークは、推薦リスト内での広告挿入意思決定(挿入可否、広告選定、挿入位置)を同時に最適化できるか?
- RQ2提案されたDEARフレームワークは、従来の手法と比較して、広告収益とユーザ体験への影響のバランスをどのようにとるか?
- RQ3広告収益とユーザ体験の間のトレードオフを調整するハイパーパrameter α を変化させた場合、全体のパフォーマンスにどのような影響を与えるか?
- RQ4新規なDQNアーキテクチャは、3つの意思決定のうち部分的なみだけを処理する従来のDQN設計と比較して、どのように異なるか?
- RQ5提案されたフレームワークは、実世界のショートビデオ推薦データにおいて、どの程度パフォーマンスを向上させるか?
主な発見
- DEARは実世界のショートビデオデータにおいて累積報酬10.96を達成し、すべてのベースライン手法を顕著に上回った。
- 最も強力なベースライン(DEAR-5)と比較して12.58%の性能向上を達成し、p値が0.000であったため、高い統計的有意性が示された。
- モジュールのアブレーションスタディの結果、DEARの各モジュールがパフォーマンス向上に寄与していることが判明し、DEAR-1はベースライン比で10.32%の向上を達成した。
- パラメータ感度分析の結果、αを増加させることでユーザ体験(R^ex)が向上するが、広告収益(R^ad)は減少することが示され、最適な全体的パフォーマンスはα=1で達成された。
- 提案されたDQNアーキテクチャにより、O(|A|·L)の全評価を必要とせず、3つの行動の同時意思決定が効率的に行えるようになった。これにより実用的導入が可能になった。
- 結果から、3つの広告挿入意思決定を統合的に最適化することで、個別に最適化するよりもより高い長期的報酬が得られることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。