Skip to main content
QUICK REVIEW

[论文解读] Recommendation System-based Upper Confidence Bound for Online Advertising

Nhan Nguyen-Thanh, Dana Marinca|arXiv (Cornell University)|Sep 9, 2019
Advanced Bandit Algorithms Research参考文献 11被引用 8
一句话总结

本文提出 UCB-RS,一种混合强化学习方法,将用户-用户协同过滤整合到上限置信度(UCB)算法中,以提升在线广告中的产品推荐效果。通过利用历史用户交互数据估算奖励置信度区间,UCB-RS 在 RecoGym 环境下于大规模、非平稳动作空间中,相较 UCB1 和 EXP3S 实现了 20–40% 的点击率提升。

ABSTRACT

In this paper, the method UCB-RS, which resorts to recommendation system (RS) for enhancing the upper-confidence bound algorithm UCB, is presented. The proposed method is used for dealing with non-stationary and large-state spaces multi-armed bandit problems. The proposed method has been targeted to the problem of the product recommendation in the online advertising. Through extensive testing with RecoGym, an OpenAI Gym-based reinforcement learning environment for the product recommendation in online advertising, the proposed method outperforms the widespread reinforcement learning schemes such as $ε$-Greedy, Upper Confidence (UCB1) and Exponential Weights for Exploration and Exploitation (EXP3).

研究动机与目标

  • 解决在线广告推荐系统中非平稳用户行为与巨大动作空间带来的挑战。
  • 通过融合强化学习与推荐系统技术,弥合离线推荐指标与真实在线性能之间的差距。
  • 在多臂赌博机设置中,利用协同过滤改进探索-利用权衡,以提升产品推荐效果。
  • 在模拟真实世界广告反馈的现实、可扩展环境中,评估所提出方法的性能。
  • 展示混合型 UCB-RS 方法相较于标准强化学习基线方法(如 ε-贪婪、UCB1 和 EXP3)在在线广告场景中的优越性。

提出的方法

  • 该方法将上限置信度(UCB)算法与用户-用户协同过滤相结合,以估算产品的期望奖励。
  • 利用历史用户交互的参考集计算用户间的相似度,并据此推断目标用户的潜在奖励。
  • UCB-RS 中的置信度区间计算方式为:估计的平均奖励与基于不确定性的探索项之和,其中平均奖励由协同过滤得出。
  • 通过使用最近交互的滑动窗口动态更新奖励估计,以适应非平稳的用户行为。
  • 该方法在 RecoGym 中实现并进行评估,RecoGym 是一个基于 OpenAI Gym 的在线广告仿真环境,结合了电子商务与基于广告的用户交互。
  • 通过调优 λ(协同过滤的权重)和 top-N(相似用户数量)等超参数,以优化性能。

实验结果

研究问题

  • RQ1将协同过滤整合到 UCB 中,如何提升大规模、非平稳多臂赌博机问题在在线广告中的性能?
  • RQ2相似用户数量(top-N)与加权因子 λ 对 UCB-RS 性能的影响如何?
  • RQ3产品受欢迎程度的方差(σμ)如何影响 UCB-RS 相较于基线算法的性能表现?
  • RQ4UCB-RS 在点击率方面相较于标准强化学习算法(如 ε-贪婪、UCB1 和 EXP3)的优越程度如何?
  • RQ5UCB-RS 在不同动作空间大小(如 50、100、200 个产品)下的鲁棒性如何?

主要发现

  • 在所有测试配置下,UCB-RS III 的点击率相较 UCB1 和 EXP3S 提升了 20–40%。
  • UCB-RS 的性能随产品受欢迎程度方差(σμ)增大而提升,表明当热门商品更突出时,其效果更佳。
  • 点击率的累积分布函数(CDF)显示,超过 50% 的用户在使用 UCB-RS III 时点击率高于 2%,优于所有基线方法。
  • λ 的选择对性能有可测量但较小的影响,最优值通过调优获得。
  • 相似用户数量(top-N)对性能有显著影响,top-N = 15 时仍优于基线方法。
  • 即使在 200 个产品的情况下,UCB-RS III 仍保持最高的点击率,展现出良好的可扩展性与对大规模动作空间的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。