Skip to main content
QUICK REVIEW

[论文解读] DEAR: Deep Reinforcement Learning for Online Advertising Impression in Recommender Systems

Xiangyu Zhao, Changsheng Gu|arXiv (Cornell University)|Sep 9, 2019
Digital Marketing and Social Media被引用 8
一句话总结

本文提出DEAR,一种深度强化学习框架,可联合优化推荐列表中的广告插入决策——是否插入广告、选择哪则广告以及插入位置——以在保持用户体验的同时最大化长期收益。该方法采用一种新颖的DQN架构,以较低的计算开销同时处理所有三项决策,在真实短视频数据上实现了显著的性能提升。

ABSTRACT

With the recent prevalence of Reinforcement Learning (RL), there have been tremendous interests in utilizing RL for online advertising in recommendation platforms (e.g., e-commerce and news feed sites). However, most RL-based advertising algorithms focus on optimizing ads' revenue while ignoring the possible negative influence of ads on user experience of recommended items (products, articles and videos). Developing an optimal advertising algorithm in recommendations faces immense challenges because interpolating ads improperly or too frequently may decrease user experience, while interpolating fewer ads will reduce the advertising revenue. Thus, in this paper, we propose a novel advertising strategy for the rec/ads trade-off. To be specific, we develop an RL-based framework that can continuously update its advertising strategies and maximize reward in the long run. Given a recommendation list, we design a novel Deep Q-network architecture that can determine three internally related tasks jointly, i.e., (i) whether to interpolate an ad or not in the recommendation list, and if yes, (ii) the optimal ad and (iii) the optimal location to interpolate. The experimental results based on real-world data demonstrate the effectiveness of the proposed framework.

研究动机与目标

  • 解决推荐系统中最大化广告收益与维持用户体验之间的权衡问题。
  • 开发一个统一框架,联合确定广告插入决策:是否插入广告、选择哪则广告以及插入位置。
  • 克服现有DQN架构仅处理三项相互依赖决策中部分决策的局限性。
  • 设计一种可扩展的深度强化学习解决方案,能够以合理的计算复杂度同时评估多个相关动作。
  • 在短视频平台的真实数据上验证该框架,证明其性能优于基线方法。

提出的方法

  • 该框架将广告插入问题建模为一个马尔可夫决策过程(MDP),包含状态、动作、转移、奖励和折扣因子组件。
  • 提出一种新颖的深度Q网络(DQN)架构,以推荐列表和用户状态作为输入,输出所有广告插入决策组合的Q值。
  • 动作空间被设计为包含三个相互关联的决策:是否插入广告(是/否)、从候选广告集中选择广告,以及在列表中的插入位置。
  • 奖励函数结合了广告收益(R^ad)和用户体验影响(R^ex),并通过超参数α加权以平衡权衡。
  • 使用经验回放和目标网络进行训练,以稳定学习过程,类似于标准DQN,但针对多维动作空间进行了适配。
  • 该架构可实现对所有动作组合的高效评估,而无需像传统方法那样进行O(|A|·L)次评估。

实验结果

研究问题

  • RQ1能否通过深度强化学习框架联合优化推荐列表中的广告插入决策——是否插入广告、选择哪则广告以及插入位置?
  • RQ2与现有方法相比,所提出的DEAR框架在广告收益与用户体验影响之间如何实现平衡?
  • RQ3在广告收益与用户体验之间权衡的超参数α取不同值时,对整体性能有何影响?
  • RQ4与仅处理三项决策中部分决策的传统DQN设计相比,所提出的DQN架构表现如何?
  • RQ5该框架在真实短视频推荐数据上的性能提升程度如何?

主要发现

  • 在真实短视频数据上,DEAR实现了10.96的累积奖励,显著优于所有基线方法。
  • 与最强基线方法(DEAR-5)相比,性能提升了12.58%,p值为0.000,表明具有高度统计显著性。
  • 消融实验表明,DEAR中的每个模块均对性能有显著贡献,其中DEAR-1相比基线实现了10.32%的性能提升。
  • 参数敏感性分析显示,增加α可提升用户体验(R^ex),但会降低广告收益(R^ad),最优整体性能出现在α=1时。
  • 所提出的DQN架构实现了对所有三项动作的高效联合决策,无需进行O(|A|·L)次的穷举评估,从而支持实际部署。
  • 结果表明,联合优化广告插入决策可带来比孤立优化更优的长期奖励。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。