QUICK REVIEW
[论文解读] No-regret algorithms for online $k$-submodular maximization
Tasuku Soma|arXiv (Cornell University)|Jul 13, 2018
Advanced Bandit Algorithms Research参考文献 21被引用 7
一句话总结
本文利用 Blackwell 的可接近性定理与在线线性优化,提出了在线 $k$-子模最大化问题的多项式时间无遗憾算法。对于非单调 $k$-子模函数,其期望 $1/2$-遗憾为 $O(nkar{T})$;对于单调 $k$-子模函数,其期望 $rac{k}{2k-1}$-遗憾为 $O(nkar{T})$,渐近上匹配了目前已知的最佳离线近似比。
ABSTRACT
We present a polynomial time algorithm for online maximization of $k$-submodular maximization. For online (nonmonotone) $k$-submodular maximization, our algorithm achieves a tight approximate factor in an approximate regret. For online monotone $k$-submodular maximization, our approximate-regret matches to the best-known approximation ratio, which is tight asymptotically as $k$ tends to infinity. Our approach is based on the Blackwell approachability theorem and online linear optimization.
研究动机与目标
- 设计一种在一般约束下在线 $k$-子模最大化问题的无遗憾算法。
- 将现有在线子模最大化结果扩展至 $k$-子模设置,该设置推广了子模性与双子模性。
- 实现与 $k$-子模函数目前已知最佳离线近似比相匹配的紧致近似保证。
- 通过使用 Blackwell 的可接近性定理,克服标准在线学习算法(如乘法权重更新)的局限性。
提出的方法
- 该方法利用 Blackwell 的可接近性定理,设计一种在线算法,以在 $k$-子模选择博弈中维持响应可满足策略。
- 定义了一个修改后的向量奖励函数 $\ell'(\mathbf{p}, \mathbf{y})(i)$,以编码目标近似比 $\alpha$ 的选择问题。
- 该算法使用在线梯度下降作为内部在线线性优化(OLO)算法,构建 $k$-元组上的概率分布序列 $\mathbf{p}_t$。
- 对于非单调情形,通过确保期望遗憾被 $O(nk\sqrt{T})$ 有界,实现 $1/2$-遗憾。
- 对于单调情形,该算法采用 $\frac{k}{2k-1}$-近似比,并通过单调 $k$-子模选择博弈实现相同的 $O(nk\sqrt{T})$ 遗憾界。
- 由于算法的确定性,其对自适应对手具有鲁棒性。
实验结果
研究问题
- RQ1能否设计一种在线 $k$-子模最大化无遗憾算法,使其匹配目前已知的最佳离线近似比?
- RQ2Blackwell 的可接近性定理如何应用于构建 $k$-子模函数的在线算法?
- RQ3能否使遗憾界为次线性且独立于函数的具体结构?
- RQ4是否可能将现有在线学习技术(如乘法权重)扩展至 $k$-子模设置,并获得更紧致的保证?
主要发现
- 本文提出了一种在线非单调 $k$-子模最大化问题的多项式时间算法,其期望 $1/2$-遗憾为 $O(nk\sqrt{T})$。
- 对于单调 $k$-子模最大化,该算法实现了 $O(nk\sqrt{T})$ 期望 $\frac{k}{2k-1}$-遗憾,匹配目前已知最紧的离线近似比。
- 该算法为确定性算法,因此对自适应对手具有鲁棒性,优于以往工作中使用的随机化方法。
- 利用 Blackwell 的可接近性定理,其遗憾保证强于标准在线学习算法(如乘法权重更新)。
- 该方法将先前在线子模最大化结果推广至 $k$-子模设置,包括 Roughgarden 和 Wang(2018)的工作。
- 遗憾界在 $T$、$n$ 和 $k$ 上的依赖关系是紧致的,且与已知离线算法的渐近近似比一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。