Skip to main content
QUICK REVIEW

[论文解读] Online Optimization with Memory and Competitive Control

Guanya Shi, Yiheng Lin|arXiv (Cornell University)|Feb 13, 2020
Optimization and Search Problems参考文献 39被引用 20
一句话总结

本文提出了乐观正则化在线平衡下降(OOBDO)算法,这是一种用于具有结构化记忆的在线凸优化的新算法,其中成本依赖于前 $ p $ 次决策且并非完全预先可知。该算法实现了恒定的、与维度无关的竞争力比率,这是首个针对超过一步记忆的此类结果,并建立了与在线控制的联系,为一大类控制问题提供了恒定竞争力的策略。

ABSTRACT

This paper presents competitive algorithms for a novel class of online optimization problems with memory. We consider a setting where the learner seeks to minimize the sum of a hitting cost and a switching cost that depends on the previous $p$ decisions. This setting generalizes Smoothed Online Convex Optimization. The proposed approach, Optimistic Regularized Online Balanced Descent, achieves a constant, dimension-free competitive ratio. Further, we show a connection between online optimization with memory and online control with adversarial disturbances. This connection, in turn, leads to a new constant-competitive policy for a rich class of online control problems.

研究动机与目标

  • 解决在超过一步记忆的在线优化中缺乏恒定竞争力算法的空白。
  • 消除成本函数必须在动作选择前已知的限制性假设,推广平滑在线凸优化(SOCO)。
  • 在具有记忆的在线优化与具有对抗性扰动的在线控制之间建立理论联系。
  • 为一大类在线控制问题开发具有恒定竞争力比率的策略,克服先前工作的局限性。

提出的方法

  • 提出一种新的问题设定——具有结构化记忆的在线凸优化,其中损失依赖于前 $ p $ 次动作,且并非精确预先可知。
  • 引入乐观正则化在线平衡下降(OOBDO)算法,通过引入乐观性和正则化来处理延迟和部分信息。
  • 采用竞争力比率分析框架,证明 OOBDO 实现了与维度和问题规模无关的恒定竞争力比率。
  • 将具有线性动态和对抗性扰动的一类广泛在线控制问题,简化为具有结构化记忆的在线凸优化问题。
  • 采用非平凡的约化技术,将优化设定中的竞争力保证传递到控制设定中。
  • 通过显式构造噪声序列分析最坏情况下的成本比率,以界定最优线性控制器与真正离线最优控制器之间的性能差距。

实验结果

研究问题

  • RQ1能否设计出一种针对超过一步记忆的在线优化问题的恒定竞争力算法,而无需预先掌握未来成本?
  • RQ2在在线控制问题中,最优静态线性控制器与真正离线最优控制器之间的理论性能差距是多少?
  • RQ3能否形式化具有记忆的在线优化与在线控制之间的联系,从而为一般控制系统生成恒定竞争力的策略?
  • RQ4所提算法的竞争力比率如何随系统参数(如记忆长度 $ p $ 和系统动态)变化?
  • RQ5在具有对抗性扰动的线性控制系统中,最优线性控制器与真正离线最优控制器之间的最坏情况性能比率是多少?

主要发现

  • 所提出的 OOBDO 算法在具有结构化记忆的在线凸优化中实现了与问题维度和记忆长度 $ p $ 无关的恒定竞争力比率。
  • 竞争力比率被一个通用常数所界定,表明其在各种问题实例中的鲁棒性。
  • 对于恒定扰动,当 $ T \to \infty $ 时,竞争力比率趋近于 $ \frac{q + (a-1)^2}{4} \cdot \frac{q + (a-1)^2}{q} $,显示出对系统参数的依赖性。
  • 对于振荡扰动 $ w_t = (-1)^t w $,竞争力比率被界定为 $ \frac{q + (a-1)^2}{4} \cdot \frac{q + (a+1)^2}{q} $,可能远大于恒定扰动情况。
  • 最优线性控制器与真正离线最优控制器之间的差距可能任意大,揭示了静态遗憾基准的局限性。
  • 从在线控制到具有结构化记忆的在线凸优化的约化,为一大类具有对抗性扰动的线性控制系统提供了恒定竞争力策略,其适用范围超越了先前要求控制矩阵可逆或完全知晓扰动的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。