Skip to main content
QUICK REVIEW

[论文解读] Autobidders with Budget and ROI Constraints: Efficiency, Regret, and Pacing Dynamics

Brendan Lucier, Sarath Pattathil|arXiv (Cornell University)|Jan 30, 2023
Auction Theory and Applications被引用 7
一句话总结

本文提出了一种基于梯度的自动出价算法,在概率为1的前提下同时满足预算和投资回报率(ROI)约束,且在bandit反馈下实现趋于零的个体遗憾。当所有自动出价者均使用该算法时,无论出价动态是否收敛至均衡,市场在第一价格、第二价格或中间拍卖形式下,均能实现至少最优预期可变现福利的一半。

ABSTRACT

We study a game between autobidding algorithms that compete in an online advertising platform. Each autobidder is tasked with maximizing its advertiser's total value over multiple rounds of a repeated auction, subject to budget and return-on-investment constraints. We propose a gradient-based learning algorithm that is guaranteed to satisfy all constraints and achieves vanishing individual regret. Our algorithm uses only bandit feedback and can be used with the first- or second-price auction, as well as with any "intermediate" auction format. Our main result is that when these autobidders play against each other, the resulting expected liquid welfare over all rounds is at least half of the expected optimal liquid welfare achieved by any allocation. This holds whether or not the bidding dynamics converges to an equilibrium.

研究动机与目标

  • 设计一种自动出价算法,使其在重复在线拍卖中同时满足预算和ROI约束,并实现趋于零的个体遗憾。
  • 确保强聚合市场效率——具体而言,无论出价动态是否收敛至均衡,均能实现至少最优预期可变现福利的一半。
  • 在bandit反馈下运行,并兼容第一价格、第二价格或中间拍卖形式。
  • 针对非标准基准提供个体遗憾保证,避免在线出价中已知的不可能性结果。
  • 分析自动出价者的动态学习路径,而非依赖于均衡收敛,以获得稳健的性能保证。

提出的方法

  • 该算法对预算和ROI乘数均采用基于对偶的梯度更新,通过约束优化保持可行性。
  • 采用bandit反馈机制,每轮仅需知晓结果(是否中签及支付金额),而无需完整的估值信息。
  • 该方法提出了一套新颖的分析框架,根据当前与最优乘数的相对表现,将轮次划分为若干区间。
  • 通过在当前与最优对偶变量之间的平方距离上应用伸缩求和(telescoping)论证,以限制遗憾的增长。
  • 采用自适应步长(时间的平方根倒数),在对偶空间中平衡探索与利用。
  • 通过加权优化将预算与ROI约束的遗憾边界相结合,其中参数β被选择以最小化总体遗憾边界。

实验结果

研究问题

  • RQ1在bandit反馈下,自动出价算法能否在同时满足预算和ROI约束的前提下实现趋于零的个体遗憾?
  • RQ2当所有自动出价者均使用一种不收敛至均衡的学习型算法时,市场在最坏情况下的市场效率(以可变现福利衡量)是多少?
  • RQ3能否设计一种单一算法,同时保证个体遗憾与强聚合福利保证,而无需依赖均衡收敛?
  • RQ4算法性能如何依赖于广告商估值之间的相关性结构?
  • RQ5在保持强聚合福利保证的前提下,能否将遗憾边界改进至优于标准的O(√T)速率?

主要发现

  • 所提出的算法保证了所有轮次的期望可变现福利至少为最优期望可变现福利的一半,这一界限在纯纳什均衡下也是最优的。
  • 该算法在非标准基准下实现了趋于零的个体遗憾,避免了在线出价中已知的不可能性结果。
  • 遗憾边界为O((P_T^R + 1)^{1/4} T^{7/8} + √(1 + P_T^B) T^{3/4}),其中P_T^R和P_T^B分别为ROI和预算约束随时间的总变差。
  • 该算法以概率1确保满足预算和ROI约束,而不仅是在期望意义上。
  • 该分析适用于广告商估值之间的任意相关性结构,以及任意中间拍卖形式,包括第一价格和第二价格拍卖。
  • 聚合福利保证直接源于学习路径,而非均衡收敛,因此对非收敛动态具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。