[论文解读] Online Learning of Assignments that Maximize Submodular Functions
本文提出 TGBANDIT,一种用于选择最大化单调子模效用函数(如广告点击收入或排名中的信息多样性)的在线学习算法。该算法实现了无遗憾性能保证,其近似比收敛至最优的 1−1/e,优于先前方法在真实世界广告分配和博客排名任务中的表现。
Which ads should we display in sponsored search in order to maximize our revenue? How should we dynamically rank information sources to maximize value of information? These applications exhibit strong diminishing returns: Selection of redundant ads and information sources decreases their marginal utility. We show that these and other problems can be formalized as repeatedly selecting an assignment of items to positions to maximize a sequence of monotone submodular functions that arrive one by one. We present an efficient algorithm for this general problem and analyze it in the no-regret model. Our algorithm possesses strong theoretical guarantees, such as a performance ratio that converges to the optimal constant of 1-1/e. We empirically evaluate our algorithm on two real-world online optimization problems on the web: ad allocation with submodular utilities, and dynamically ranking blogs to detect information cascades.
研究动机与目标
- 解决效用函数呈现收益递减特性的在线分配问题,例如在赞助搜索和信息排名中的应用。
- 开发一种高效算法,在划分拟阵约束下实现对单调子模函数最大化问题的常数因子近似(1−1/e)。
- 设计一种无遗憾的在线学习算法,适用于效用函数按顺序到达且反馈仅限于老虎机式奖励的动态环境。
- 在真实网络应用中实证验证该方法,包括基于子模点击率模型的广告分配和信息级联的动态博客排名。
提出的方法
- 提出 TGBANDIT,一种在线算法,利用多臂赌博机子程序在顺序分配决策中平衡探索与利用。
- 采用表格贪心启发式算法(TABULARGREEDY)作为子程序,为每轮的效用函数计算近似最优分配。
- 通过仅在有效(可行)分配上评估函数,将连续贪心方法适配到离散可行空间,避免无效集合查询。
- 在在线设置中使用老虎机反馈,仅观察所选分配的奖励,而非完整效用函数。
- 应用理论无遗憾分析,证明 TGBANDIT 的累积遗憾呈次线性增长,性能比收敛至 1−1/e。
- 提出一种新颖的用户行为反馈模型,用于搜索场景,通过建模放弃和点击概率,模拟现实的子模奖励函数。
实验结果
研究问题
- RQ1能否设计一种在线算法,在有限反馈下,针对具有收益递减特性的分配问题中的子模效用函数实现最大化?
- RQ2此类算法在遗憾和近似比方面的理论性能保证是什么?
- RQ3与先前方法相比,该算法在真实世界应用(如广告分配和博客排名)中的表现如何?
- RQ4该算法能否在处理具有不同点击和放弃概率的异构用户行为时,仍保持强性能保证?
- RQ5即使效用函数未知且仅能获得部分反馈,该算法在实践中是否能实现接近最优的性能(1−1/e)?
主要发现
- 在广告分配实验中,TGBANDIT 在 C=4 时约在 10^6 轮后达到与先前最先进算法(等价于 C=1)相当的性能,并在此后持续超越。
- 该算法实现了无遗憾性能保证,渐近近似比为 1−1/e,与子模最大化问题的理论下限一致。
- 实证结果表明,TGBANDIT 在广告分配和动态博客排名任务中显著优于现有在线算法。
- 该算法在老虎机反馈下依然有效,仅观察所选分配的奖励,表现出对部分信息的鲁棒性。
- 离线的 TABULARGREEDY 算法在划分拟阵约束下对子模最大化实现了 (1−1/e) 近似比,与已知理论最优值一致。
- 研究表明,即使考虑具有不同点击和放弃概率的多种用户类型,离线问题仍为 NP-难,凸显了在线学习方法的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。