[论文解读] A Reduction from Delayed to Immediate Feedback for Online Convex Optimization with Improved Guarantees
本文提出一个连续时间延迟模型和延迟转即时反馈的降低方法,在在线凸优化(带一阶反馈)和带盲波形优化的延迟自适应 regret 上获得改进的界限。它统一分析并给出适应延迟和凸性的先进或改进速率。
We develop a reduction-based framework for online learning with delayed feedback that recovers and improves upon existing results for both first-order and bandit convex optimization. Our approach introduces a continuous-time model under which regret decomposes into a delay-independent learning term and a delay-induced drift term, yielding a delay-adaptive reduction that converts any algorithm for online linear optimization into one that handles round-dependent delays. For bandit convex optimization, we significantly improve existing regret bounds, with delay-dependent terms matching state-of-the-art first-order rates. For first-order feedback, we recover state-of-the-art regret bounds via a simpler, unified analysis. Quantitatively, for bandit convex optimization we obtain $O(\sqrt{d_{ ext{tot}}} + T^{\frac{3}{4}}\sqrt{k})$ regret, improving the delay-dependent term from $O(\min\{\sqrt{T d_{ ext{max}}},(Td_{ ext{tot}})^{\frac{1}{3}}\})$ in previous work to $O(\sqrt{d_{ ext{tot}}})$. Here, $k$, $T$, $d_{ ext{max}}$, and $d_{ ext{tot}}$ denote the dimension, time horizon, maximum delay, and total delay, respectively. Under strong convexity, we achieve $O(\min\{σ_{ ext{max}} \ln T, \sqrt{d_{ ext{tot}}}\} + (T^2\ln T)^{\frac{1}{3}} {k}^{\frac{2}{3}})$, improving the delay-dependent term from $O(d_{ ext{max}} \ln T)$ in previous work to $O(\min\{σ_{ ext{max}} \ln T, \sqrt{d_{ ext{tot}}}\})$, where $σ_{ ext{max}}$ denotes the maximum number of outstanding observations and may be considerably smaller than $d_{ ext{max}}$.
研究动机与目标
- 用一个连续时间框架来动机化并建模带轮次依赖延迟的在线学习。
- 开发一种适用于一阶反馈和带盲反馈的延迟转即时反馈降低方法。
- 提供对延迟自适应的 regret 边界,且不需要提前知道延迟参数。
- 在带盲凸优化中实现改进的 regret 速率,并在一阶 OCO 中回收最先进的界限。
- 通过漂移惩罚的在线线性优化(OLO)归约提供统一分析。
提出的方法
- 引入一个连续时间模型,使预测与观测成为时间线上的事件,天然地将 regret 分解为非延迟 regret 与预测漂移。
- 展示与延迟相关量(延迟、积压及其对偶量)之间的等价性,并证明稳态算法的 regret 分解。
- 通过包装器将带延迟的 OCO/BCO 转换为漂移惩罚的在线线性优化(OLO),将带延迟的反馈翻译为非延迟更新。
- 对近端跟随-正则化领导(P-FTRL)与在线镜像下降(OMD)进行封装,以实现延迟自适应的 regret 边界。
- 在同一归约框架内对带盲反馈应用单点梯度估计。
- 引入自适应跳过机制,在出现较大延迟时进一步降低延迟影响。
实验结果
研究问题
- RQ1如何在不假设已知延迟的情况下对在线凸优化中的延迟反馈进行建模与分析?
- RQ2是否可以将延迟的 OCO 与 BCO 归约为具有漂移惩罚的非延迟问题,从而在一阶与带盲设置下获得自适应的 regret 边界?
- RQ3在凸性与强凸性损失下,所得的 regret 边界是什么,它们如何依赖于延迟量如 d_tot、d_max、sigma_max?
- RQ4所提出的归约是否能回收或改进延迟 OCO 与 BCO 的最先进界限,包括两点带盲反馈?
主要发现
- 对于带延迟的带盲凸优化,归约给出期望 regret 为 O(sqrt(d_tot) + T^{3/4} sqrt(k))。
- 对于强凸的带盲损失,边界提升为 O(min{sigma_max ln T, sqrt(d_tot)} + (T^2 ln T)^{1/3} k^{2/3})。
- 对于带一阶反馈的在线凸优化,在凸情形下的 regret 可回收为 O(sqrt(d_tot) + sqrt(T))。
- 在强凸性下,一阶 OCO 的界成为 O(min{sigma_max ln T, sqrt(d_tot)} + (T^2 ln T)^{1/3} k^{2/3})。
- 该框架提供延迟自适应保证,不要求提前知晓 d_max、d_tot、sigma_max 或 T,并支持跳过以进一步将延迟项降至 O(min_Q {|Q| + (sum_{t not in Q} d_t)^{1/2}})。
- 两点带盲反馈的扩展在凸性下得到 O(sqrt(d_tot) + sqrt(Tk)) 的 regret,以及在强凸性下得到 O(min{sigma_max ln T, sqrt(d_tot)} + k ln T) 的界限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。