[论文解读] Online Ad Procurement in Non-stationary Autobidding Worlds
本文提出了一种原始-对偶在线学习算法,用于在非平稳自动出价环境中,基于Bandit反馈和不确定的长期约束,对广告活动杠杆进行动态优化。该算法在多种非平稳世界(包括随机、对抗性、污染、周期性和遍历性)中均实现了低遗憾,且无需事先了解底层数据生成过程,从而在现实世界的在线广告平台中实现了稳健的广告商决策能力。
Today's online advertisers procure digital ad impressions through interacting with autobidding platforms: advertisers convey high level procurement goals via setting levers such as budget, target return-on-investment, max cost per click, etc.. Then ads platforms subsequently procure impressions on advertisers' behalf, and report final procurement conversions (e.g. click) to advertisers. In practice, advertisers may receive minimal information on platforms' procurement details, and procurement outcomes are subject to non-stationary factors like seasonal patterns, occasional system corruptions, and market trends which make it difficult for advertisers to optimize lever decisions effectively. Motivated by this, we present an online learning framework that helps advertisers dynamically optimize ad platform lever decisions while subject to general long-term constraints in a realistic bandit feedback environment with non-stationary procurement outcomes. In particular, we introduce a primal-dual algorithm for online decision making with multi-dimension decision variables, bandit feedback and long-term uncertain constraints. We show that our algorithm achieves low regret in many worlds when procurement outcomes are generated through procedures that are stochastic, adversarial, adversarially corrupted, periodic, and ergodic, respectively, without having to know which procedure is the ground truth. Finally, we emphasize that our proposed algorithm and theoretical results extend beyond the applications of online advertising.
研究动机与目标
- 解决在有限反馈和非平稳市场条件下,在线广告中动态、高维杠杆优化的挑战。
- 开发一种统一算法,在无需事先了解数据生成过程的情况下,可在多种类型的非平稳采购环境中表现良好。
- 在仅能观测结果(而非完整函数值)的Bandit反馈下,确保长期约束(如预算、投资回报率)的满足。
- 将现实世界的广告采购建模为具有函数值Bandit反馈和不确定约束的在线约束优化问题。
- 将理论保证扩展至包括随机、对抗性和周期性变化结果在内的非平稳世界。
提出的方法
- 将广告采购问题建模为具有Bandit反馈和不确定约束的在线约束优化问题,将杠杆决策视为多维变量。
- 提出一种原始-对偶算法,通过维护约束的对偶变量,并使用自适应步长的投影梯度更新。
- 通过在候选杠杆配置上使用指数权重的随机探索策略,实现探索与利用之间的平衡。
- 利用Hoeffding引理和凸分析,将遗憾边界表示为函数变化、约束违反和决策直径的函数。
- 推导出在函数平滑性和有界梯度的一般假设下,遗憾边界随时间T亚线性增长,且独立于特定的非平稳过程。
- 采用基于单位球面上均匀采样的平滑技术,以在缺乏完整函数反馈时估计梯度。
实验结果
研究问题
- RQ1是否一种单一的在线学习算法可在无需事先了解数据生成过程的情况下,在多种非平稳采购环境中实现低遗憾?
- RQ2广告商如何在仅具有Bandit反馈的条件下,动态优化多个广告活动杠杆,同时满足长期预算和投资回报率约束?
- RQ3在不确定、时变约束和部分反馈下,对在线优化可提供哪些理论保证?
- RQ4原始-对偶方法如何适应在非平稳环境中处理函数值反馈和多维决策变量?
- RQ5该算法能否同时在对抗性、随机性和周期性变化环境中保持低遗憾?
主要发现
- 所提出的算法在时间T内实现亚线性遗憾,且在包括随机、对抗性和周期性结果在内的通用非平稳条件下,遗憾上界为O(√T)。
- 该算法可随时间保持低约束违反,其累积约束违反的理论边界也随T亚线性增长。
- 该算法的遗憾边界不依赖于非平稳过程类型的先验知识,使其在多种现实广告市场动态中均具有鲁棒性。
- 该算法的性能独立于非平稳性的具体性质——无论结果是i.i.d.、对抗性还是周期性变化。
- 理论分析证实,即使在对抗性污染和遍历性非平稳过程中,该算法仍能保持低遗憾。
- 该方法可推广至在线广告之外,为不确定性和部分反馈下的在线优化提供通用框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。