Skip to main content
QUICK REVIEW

[论文解读] Dynamic Knapsack Optimization Towards Efficient Multi-Channel Sequential Advertising

Xiaotian Hao, Zhaoqing Peng|arXiv (Cornell University)|Jun 29, 2020
Advanced Bandit Algorithms Research被引用 9
一句话总结

该论文提出 MSBCB,一种双层优化框架,将多通道序列广告建模为动态背包问题,在预算约束下最大化长期累计收入。通过将出价策略学习与预算分配解耦,并采用理论保障的奖励塑造与动作空间缩减,MSBCB 在淘宝的真实在线 A/B 测试中,相较于最先进基线,实现了 10.08% 的收入提升和 10.31% 的 ROI 改进。

ABSTRACT

In E-commerce, advertising is essential for merchants to reach their target users. The typical objective is to maximize the advertiser's cumulative revenue over a period of time under a budget constraint. In real applications, an advertisement (ad) usually needs to be exposed to the same user multiple times until the user finally contributes revenue (e.g., places an order). However, existing advertising systems mainly focus on the immediate revenue with single ad exposures, ignoring the contribution of each exposure to the final conversion, thus usually falls into suboptimal solutions. In this paper, we formulate the sequential advertising strategy optimization as a dynamic knapsack problem. We propose a theoretically guaranteed bilevel optimization framework, which significantly reduces the solution space of the original optimization space while ensuring the solution quality. To improve the exploration efficiency of reinforcement learning, we also devise an effective action space reduction approach. Extensive offline and online experiments show the superior performance of our approaches over state-of-the-art baselines in terms of cumulative revenue.

研究动机与目标

  • 解决现有广告系统仅关注即时收入而忽略长期用户转化效果所导致的次优性能问题。
  • 将序列化、多通道广告过程建模为动态背包问题,以兼顾累积用户级价值与预算约束。
  • 通过将联合出价与预算分配问题分解为双层优化框架,降低其不可行解空间。
  • 通过动作空间缩减与理论保障的奖励塑造,提升下层优化中强化学习的效率。
  • 通过离线分析与真实世界电商平台上的大规模在线 A/B 测试,实证验证该框架的优越性。

提出的方法

  • 将序列广告问题建模为动态背包问题,对每个用户在多通道曝光下的长期价值与成本进行估计。
  • 提出一种双层优化框架:上层优化用户间的预算分配,下层学习最优的单用户出价策略。
  • 为下层强化学习推导出理论上保证最优的奖励函数,以对齐长期累计收入最大化目标。
  • 引入一种动作空间缩减技术,以提升样本效率并加速下层策略学习。
  • 采用两阶段训练流程:首先,基于缩减后的动作空间,通过强化学习学习单用户出价策略;其次,利用估计的用户价值优化全局预算分配。
  • 在淘宝上部署该框架,实现基于用户级价值预测的实时出价调整与动态预算分配。

实验结果

研究问题

  • RQ1双层优化框架能否有效降低多通道序列广告中联合出价与预算分配的解空间?
  • RQ2如何建模并优化长期用户转化效果,以超越短视的单步收入最大化?
  • RQ3在动态广告环境中,强化学习中的何种奖励塑造策略能确保长期收入最大化的理论保障?
  • RQ4动作空间缩减在单用户出价策略学习中,能在多大程度上提升样本效率与收敛速度?
  • RQ5在真实世界部署中,该框架是否相较于生产基线,实现了累积收入与 ROI 的统计显著提升?

主要发现

  • MSBCB 相较于交叉熵方法(CEM)——即生产控制模型——实现了 10.08% 的相对收入提升与 10.31% 的 ROI 提升。
  • 与对照组相比,该框架使转化率提升 6.04%,页面浏览量提升 15.37%,表明用户参与度更广且定位更精准。
  • 在 1.358 亿名用户与 72,147 个广告商品上的在线 A/B 测试,验证了 MSBCB 在真实电商环境中的鲁棒性与可扩展性。
  • 每日 ROI 提升曲线持续稳定优于 CEM 基线,验证了前瞻性策略的长期有效性。
  • 动作空间缩减技术显著提升了样本效率,使下层强化学习组件实现更快收敛。
  • 理论分析证实,下层优化中推导出的奖励函数可在预算约束下确保收敛至最优长期收入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。