Skip to main content
QUICK REVIEW

[论文解读] Impossible Tuning Made Possible: A New Expert Algorithm and Its Applications

Liyu Chen, Haipeng Luo|arXiv (Cornell University)|Feb 1, 2021
Advanced Bandit Algorithms Research参考文献 33被引用 7
一句话总结

该论文通过引入一种基于镜像下降(Mirror Descent)并带有校正项和加权熵正则化的新型专家算法,解决了在线学习中长期存在的“不可能调参”问题,实现了所有专家 i 同时的遗憾界 ˜O(√(ln d) Σₜ(ℓₜ,ᵢ − mₜ,ᵢ)²)。该方法可推广至使用预测向量 mₜ 的自适应遗憾界,恢复或改进了现有结果,并实现了一种主算法,能以极低开销学习最优基算法。

ABSTRACT

We resolve the long-standing "impossible tuning" issue for the classic expert problem and show that, it is in fact possible to achieve regret $O\left(\sqrt{(\ln d)\sum_t \ell_{t,i}^2} ight)$ simultaneously for all expert $i$ in a $T$-round $d$-expert problem where $\ell_{t,i}$ is the loss for expert $i$ in round $t$. Our algorithm is based on the Mirror Descent framework with a correction term and a weighted entropy regularizer. While natural, the algorithm has not been studied before and requires a careful analysis. We also generalize the bound to $O\left(\sqrt{(\ln d)\sum_t (\ell_{t,i}-m_{t,i})^2} ight)$ for any prediction vector $m_t$ that the learner receives, and recover or improve many existing results by choosing different $m_t$. Furthermore, we use the same framework to create a master algorithm that combines a set of base algorithms and learns the best one with little overhead. The new guarantee of our master allows us to derive many new results for both the expert problem and more generally Online Linear Optimization.

研究动机与目标

  • 解决专家问题中的‘不可能调参’问题,即无法同时为所有专家实现自适应遗憾界。
  • 开发一个统一的算法框架,可推广至各种预测向量 mₜ,恢复或改进现有的自适应遗憾界。
  • 设计一种主算法,整合多个基算法,并以极低开销实时学习表现最优的算法,从而在在线学习中实现新结果。

提出的方法

  • 提出一种基于镜像下降的算法,其校正项受 Steinhardt 和 Liang (2014) 启发,并采用专家和轮次特定的学习率的加权负熵正则化项。
  • 引入一种线性搜索过程以计算权重,避免标准乘法权重的成比例更新形式,从而实现对每个专家的非等价调参。
  • 采用细致的遗憾分析,利用界中一个负项,实现对所有 i 的 ˜O(√(ln d) Σₜ(ℓₜ,ᵢ − mₜ,ᵢ)²) 保证。
  • 将该框架推广至在线线性优化(OLO),推导出涉及损失路径长度和方差的遗憾界。
  • 应用加倍技巧(doubling trick)以处理无界损失范围和无约束设置下的无界直径。
  • 设计一种主算法,整合多个基算法,并以极低开销实时学习表现最优的算法。

实验结果

研究问题

  • RQ1能否解决‘不可能调参’问题——即同时为所有专家实现自适应遗憾界?
  • RQ2给定预测向量 mₜ,能否设计一种单一算法,使所有专家 i 的遗憾界达到 ˜O(√(ln d) Σₜ(ℓₜ,ᵢ − mₜ,ᵢ)²)?
  • RQ3该框架能否推广至 OLO,并在路径长度和方差方面获得新遗憾界?
  • RQ4能否设计一种主算法,以极低开销学习最优基算法,并实现新的自适应保证?
  • RQ5该算法能否处理无界损失范围和无约束在线学习中的无界决策集?

主要发现

  • 所提算法同时为所有专家 i 实现了 ˜O(√(ln d) Σₜ(ℓₜ,ᵢ − mₜ,ᵢ)²) 的遗憾界,成功解决了‘不可能调参’问题。
  • 通过选择不同的预测向量 mₜ,该框架可恢复或改进 (A,B)-PROD、ADAPT-ML-PROD 和 OPTIMISTIC-ADAPT-ML-PROD 的结果。
  • 在 OLO 中,该算法实现了 ˜O(√(r Σₜ⟨u, ℓₜ − mₜ⟩²)) 的遗憾界,其中 r 为损失协方差矩阵的秩,并可推广至切换遗憾和未知损失范围的情形。
  • 主算法以仅对 T 对数级的开销学习最优基算法,且在专家和 OLO 设置下均能实现新结果。
  • 对于未知利普希茨常数的无约束学习,该算法使用加倍技巧自适应设定决策集直径,实现 ˜O(√(r Σₜ⟨u, ℓₜ − mₜ⟩²) + √(D_T B) + G_T ||u||³/²) 的遗憾界。
  • 该框架可通过先验 π 推广至 KL 散度竞争者,并可扩展至区间遗憾和 bandit 设置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。