[論文レビュー] Deep Reinforcement Learning for Sponsored Search Real-time Bidding
本稿では、広告掲載のリアルタイム入札(SS-RTB)における非定常的環境(日ごとの入札ダイナミクスの変化)に対処する、堅牢な深層強化学習フレームワークRMDPを提案する。入札を時間単位の集計レベルでモデル化し、モデルによる制御アプローチを採用することで、広告主の利益を向上させ、オンラインA/Bテストにおいてベースライン手法比でPUR_AMT/COSTを平均35.04%向上させた。ROIおよびCVRの向上も顕著であった。
Bidding optimization is one of the most critical problems in online advertising. Sponsored search (SS) auction, due to the randomness of user query behavior and platform nature, usually adopts keyword-level bidding strategies. In contrast, the display advertising (DA), as a relatively simpler scenario for auction, has taken advantage of real-time bidding (RTB) to boost the performance for advertisers. In this paper, we consider the RTB problem in sponsored search auction, named SS-RTB. SS-RTB has a much more complex dynamic environment, due to stochastic user query behavior and more complex bidding policies based on multiple keywords of an ad. Most previous methods for DA cannot be applied. We propose a reinforcement learning (RL) solution for handling the complex dynamic environment. Although some RL methods have been proposed for online advertising, they all fail to address the "environment changing" problem: the state transition probabilities vary between two days. Motivated by the observation that auction sequences of two days share similar transition patterns at a proper aggregation level, we formulate a robust MDP model at hour-aggregation level of the auction data and propose a control-by-model framework for SS-RTB. Rather than generating bid prices directly, we decide a bidding model for impressions of each hour and perform real-time bidding accordingly. We also extend the method to handle the multi-agent problem. We deployed the SS-RTB system in the e-commerce search auction platform of Alibaba. Empirical experiments of offline evaluation and online A/B test demonstrate the effectiveness of our method.
研究の動機と目的
- 入札ダイナミクスが非常に確率的で、日ごとに顕著に異なる広告掲載におけるリアルタイム入札の有効な解決策が不足している問題に対処すること。
- 環境の遷移確率が日ごとに変化する状況においても失敗する、静的環境ダイナミクスを仮定する従来の強化学習手法の限界を克服すること。
- 異なる日においても一貫した遷移パターンを捉えることのできる、時間集計レベルにおける堅牢なMDPモデルを設計すること。
- 各時間帯に応じて入札モデルを選択する直接的インプレッション単位の入札ではなく、モデルによる制御フレームワークを構築することで、スケーラビリティとパフォーマンスを向上させること。
- 複数の広告主が同時に入札する現実の広告プラットフォームにおけるマルチエージェント競合状況に対応できるように、手法を拡張すること。
提案手法
- 時間単位での入札シーケンスを集計し、異なる日においても安定した遷移パターンを実現する、時間レベルにおける堅牢なマルコフ決定過程(RMDP)を定式化する。
- 集計された入札データとインプレッション特徴量に基づき、最適な入札モデルを各時間帯に選択する入札ポリシーを学習するため、ディープQネットワーク(DQN)を用いる。
- 入札意思決定を2段階に分解する:(1) 時間帯ごとの入札モデルの選択、(2) 選択されたモデルを用いたリアルタイム入札。
- ポリシー学習とリアルタイム実行を分離するモデルベース制御戦略を導入することで、日ごとの環境変化に対する一般化性と頑健性を向上させる。
- 複数の広告主が競合する状況を想定し、M-RMDPを用いてマルチエージェント状況への拡張を実現する。
- DQN学習中の探索と活用のバランスを図るため、減衰するε-greedy探索戦略を適用する。
実験結果
リサーチクエスチョン
- RQ1入札パターンが日ごとに顕著に変化する広告掲載のリアルタイム入札において、深層強化学習モデルが非定常的ダイナミクスを効果的に扱えるか?
- RQ2インプレッションレベルではなく時間レベルで環境をモデル化することで、入札ポリシーの頑健性とパフォーマンスが向上するか?
- RQ3各時間帯に応じて入札モデルを選択するモデルによる制御フレームワークは、直接的インプレッション単位入札に比べ、長期的な広告主利益を上回るか?
- RQ4複数の広告主がリアルタイム入札で競合するマルチエージェント環境において、本手法はどの程度の性能を示すか?
- RQ5本手法は、ベースライン入札戦略と比較して、PUR_AMT/COST、ROI、CVRといった主要指標をどの程度改善するか?
主な発見
- 10個の広告におけるオンラインA/Bテストにおいて、RMDPモデルはキーワード入札(KB)ベースライン比でPUR_AMT/COSTを平均35.04%向上させた。
- ROIは平均21.38%、CVRは平均23.11%向上し、主たる目的を超える広範なパフォーマンス向上を示した。
- PPCは平均5.16%のわずかな向上を示し、クリック単価を削減しながらもコンversionsと収益を増加させていることが示唆された。
- マルチエージェント環境におけるオンライン評価では、M-RMDPはKBおよびRMDPを上回り、PUR_AMT/COSTで13.01%、CVRで12.62%の向上を達成した。
- 収束解析により、安定した学習が確認された:DQN損失は約1億5000万バッチにわたり減少し、目的指標(PUR_AMT)は着実に向上し、安定化した。
- 結果から、時間集計に基づくRMDPモデルが「環境が変化する」問題を効果的に緩和し、非定常的入札ダイナミクスにおいても頑健なポリシー学習を可能にすることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。