Skip to main content
QUICK REVIEW

[論文レビュー] Sustainable Online Reinforcement Learning for Auto-bidding

Zhiyu Mou, Yusen Huo|arXiv (Cornell University)|Oct 13, 2022
Auction Theory and Applications被引用数 5
ひとこと要約

本稿では、実世界広告システム(RAS)において自動入札ポリシーを直接学習することで、仮想システム(VAS)とRASの間の不一致(Inconsistencies Between Online and Offline, IBOO)を克服する持続可能なオンライン強化学習(SORL)フレームワークを提案する。Lipschitz滑らかさを持つQ関数と安全で効率的な探索(SER)ポリシーを活用することで、SORLは安定的かつ安全にRASとオンラインで相互作用可能であり、分散抑制型保守的Q学習(V-CQL)手法により、強力なポリシー学習が可能になる。実世界のA/Bテストでは、SORLが最先端手法を上回り、購入数が14.79%増加し、ROIが12.90%向上した。

ABSTRACT

Recently, auto-bidding technique has become an essential tool to increase the revenue of advertisers. Facing the complex and ever-changing bidding environments in the real-world advertising system (RAS), state-of-the-art auto-bidding policies usually leverage reinforcement learning (RL) algorithms to generate real-time bids on behalf of the advertisers. Due to safety concerns, it was believed that the RL training process can only be carried out in an offline virtual advertising system (VAS) that is built based on the historical data generated in the RAS. In this paper, we argue that there exists significant gaps between the VAS and RAS, making the RL training process suffer from the problem of inconsistency between online and offline (IBOO). Firstly, we formally define the IBOO and systematically analyze its causes and influences. Then, to avoid the IBOO, we propose a sustainable online RL (SORL) framework that trains the auto-bidding policy by directly interacting with the RAS, instead of learning in the VAS. Specifically, based on our proof of the Lipschitz smooth property of the Q function, we design a safe and efficient online exploration (SER) policy for continuously collecting data from the RAS. Meanwhile, we derive the theoretical lower bound on the safety of the SER policy. We also develop a variance-suppressed conservative Q-learning (V-CQL) method to effectively and stably learn the auto-bidding policy with the collected data. Finally, extensive simulated and real-world experiments validate the superiority of our approach over the state-of-the-art auto-bidding algorithm.

研究の動機と目的

  • 自動入札における実世界広告システム(RAS)と仮想広告システム(VAS)の間の不一致(IBOO)という深刻な問題に対処すること。VASでは、実世界の広告システムを正確にシミュレートできない。
  • VASで学習したポリシーとその実世界での展開との間のパフォーマンスギャップを解消し、RASで直接的かつ安全なオンライン学習を可能にすること。
  • 理論的裏付けのある安全な探索戦略を開発し、オンライン相互作用中にリスクを最小限に抑えつつパフォーマンスを維持すること。
  • オンラインで収集されたデータを効果的に活用できる安定的で保守的な学習手法(V-CQL)を提案すること。

提案手法

  • IBOOを、主にVASにおけるカスケードオークションアーキテクチャと静的市場価格の不正確なモデル化に起因するVASとRASのギャップとして形式的に定義する。
  • RASにおけるQ関数のLipschitz滑らかさを証明し、オンライン探索における理論的セーフティ保証を可能にする。
  • ハイパーパrameter λ(セーフティ)と σ(探索効率)を用いて、探索とセーフティのバランスを取る安全で効率的な探索(SER)ポリシーを設計する。
  • オンライン相互作用中に最小限のリスクを確保するためのSERポリシーのセーフティの理論的下限を導出する。
  • オンラインで収集したデータを用いて分散を低減し、サンプル効率を向上させる、安定的なオフライン強化学習手法である分散抑制型保守的Q学習(V-CQL)を提案する。
  • SERとV-CQLをSORLフレームワークに統合し、RASで継続的かつ安全かつ高性能なポリシー学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1VASで学習した自動入札ポリシーが実世界広告システム(RAS)に展開された際、IBOO問題がどれほどパフォーマンスを低下させるか。
  • RQ2RASで直接オンライン学習を実施することで、IBOO問題を解消し、VASでのオフライン学習に比べてポリシーのパフォーマンスを向上させられるか。
  • RQ3高リスクな実世界広告環境において、安全で安定したオンライン探索を保証する理論的・アルゴリズム的メカニズムは何か。
  • RQ4オンラインで収集したデータを用いた場合、提案手法V-CQLは標準的なオフライン強化学習手法に比べて、学習の安定性とパフォーマンスをどのように向上させるか。
  • RQ5SORLフレームワークは、最先端の自動入札アルゴリズムに比べて、実世界のA/Bテストで優れたパフォーマンスを達成できるか。

主な発見

  • 実世界のA/Bテストにおいて、SORLは[36]のマルチエージェント手法に比べ、購入数が14.79%増加し、ROIが12.90%向上し、顕著なパフォーマンス向上を示した。
  • SORLは最先端のUSCBポリシーをすべての指標で上回った:BuyCntで+3.20%、ROIで+3.75%、CPAで-3.91%。これは、より高い効率性とコスト効率を示している。
  • 実世界での展開において、SORLはベースラインのマルチエージェント手法に比べ、BuyCntが14.79%増加し、ROIが12.90%向上した。
  • SERポリシーは安定的かつ安全な探索を実現し、理論的セーフティバウンドが実証結果で裏付けられ、オンライン学習中の最小限のリスクを確保した。
  • V-CQLは分散を効果的に抑制し、学習の安定性を向上させ、SERを介して収集されたオンラインデータからの信頼性のあるポリシー更新を可能にした。
  • SORLフレームワークはIBOO問題を効果的に解決し、RASで直接オンライン学習を行うことが、従来のVASベースの学習に比べて実現可能かつ優れていることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。