Skip to main content
QUICK REVIEW

[論文レビュー] Autobidders with Budget and ROI Constraints: Efficiency, Regret, and Pacing Dynamics

Brendan Lucier, Sarath Pattathil|arXiv (Cornell University)|Jan 30, 2023
Auction Theory and Applications被引用数 7
ひとこと要約

本稿では、バンドイットフィードバック下で、確率1で予算およびROI制約を満たしつつ、消える個々の後悔を達成する勾配ベースの自動入札アルゴリズムを提案する。すべての自動入札者がこのアルゴリズムを使用する場合、均衡への収束がなくても、第1価格、第2価格、または中間の入札形式のいずれであっても、市場は最適期待流動福利の少なくとも半分を達成する。

ABSTRACT

We study a game between autobidding algorithms that compete in an online advertising platform. Each autobidder is tasked with maximizing its advertiser's total value over multiple rounds of a repeated auction, subject to budget and return-on-investment constraints. We propose a gradient-based learning algorithm that is guaranteed to satisfy all constraints and achieves vanishing individual regret. Our algorithm uses only bandit feedback and can be used with the first- or second-price auction, as well as with any "intermediate" auction format. Our main result is that when these autobidders play against each other, the resulting expected liquid welfare over all rounds is at least half of the expected optimal liquid welfare achieved by any allocation. This holds whether or not the bidding dynamics converges to an equilibrium.

研究の動機と目的

  • 繰り返しオンライン入札において、予算およびROI制約を満たしつつ、消える個々の後悔を達成する自動入札アルゴリズムの設計。
  • 均衡への収束がなくても、強力な集計的市場効率を保証すること——具体的には、最適期待流動福利の少なくとも半分を達成すること。
  • バンドイットフィードバック下で動作し、第1価格、第2価格、または中間の入札形式と両立可能であること。
  • 標準でないベンチマークに対する個々の後悔保証を提供し、オンライン入札における制約付きの既知の不可能性結果を回避すること。
  • 均衡への収束に依存せず、自動入札者の動的学習経路を分析することで、頑健な性能保証を得ること。

提案手法

  • アルゴリズムは、予算およびROI乗数の両方に対して双対に基づく勾配更新を用い、制約付き最適化により実行可能性を維持する。
  • バンドイットフィードバックメカニズムを採用し、各ラウンドで支払いと勝利/敗北の結果のみを必要とし、完全な評価情報は不要である。
  • 現在の乗数と最適乗数の相対的性能に基づいてラウンドを区間ごとに分割する、新規な分析フレームワークを導入する。
  • 現在の双対変数と最適双対変数の二乗距離にテレスコピック引数を適用し、後悔の増加を抑えられる。
  • 探索と活用のバランスを取るために、時間の逆平方根に比例する適応的ステップサイズを用いる。
  • 重み付き最適化により、予算およびROI制約の両方の後悔バウンドを統合し、全体の後悔バウンドを最小化するパラメータβを選び込む。

実験結果

リサーチクエスチョン

  • RQ1バンドイットフィードバック下で、予算およびROI制約を満たしつつ、消える個々の後悔を達成できる自動入札アルゴリズムは存在するか?
  • RQ2すべての自動入札者が均衡に収束しない学習ベースのアルゴリズムを使用する場合、市場効率(流動福利の観点から)の最悪ケースはどの程度か?
  • RQ3均衡への収束に依存せず、個々の後悔と強力な集計的福利の保証を両立できる単一のアルゴリズムは存在するか?
  • RQ4広告主の評価の相関構造に応じて、アルゴリズムの性能はどのように変化するか?
  • RQ5標準のO(√T)レートを上回る後悔バウンドを達成できるか、同時に強力な集計的福利保証を維持できるか?

主な発見

  • 提案されたアルゴリズムは、すべてのラウンドにおける期待流動福利が、最適期待流動福利の少なくとも半分以上であることを保証する。これは、純粋ナッシュ均衡に対しても達成可能な最良のバウンドである。
  • 標準でないベンチマークに対する消える個々の後悔を達成し、制約付きオンライン入札における既知の不可能性結果を回避する。
  • 後悔バウンドはO((P_T^R + 1)^{1/4} T^{7/8} + √(1 + P_T^B) T^{3/4}) であり、P_T^R および P_T^B はそれぞれROIおよび予算制約の時間的全変動量を表す。
  • アルゴリズムは、期待値ではなく確率1で予算およびROI制約を満たすことを保証する。
  • 広告主の評価の相関構造にかかわらず、および第1価格、第2価格、または中間の入札形式のいずれに対しても、解析が成立する。
  • 集計的福利の保証は、均衡への収束に依存せず、学習経路そのものから直接導出されるため、非収束ダイナミクスに対しても頑健である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。