Skip to main content
QUICK REVIEW

[论文解读] Online non-convex optimization with imperfect feedback

Amélie Héliou, Matthieu Martin|arXiv (Cornell University)|Oct 16, 2020
Advanced Bandit Algorithms Research参考文献 47被引用 5
一句话总结

本文提出了一种基于对偶平均的混合策略学习策略,用于在反馈不完善的情况下进行在线非凸优化,其中学习者仅能观测到损失函数的不精确模型或实际损失。该方法在带 bandit 反馈的情况下,仍能实现紧致的 $Ó(T^{1/2})$ 静态遗憾和 $Ó(T^{2/3}V_T^{1/3})$ 动态遗憾边界,通过核基损失估计实现,解决了关于能否将类似 Hedge 的算法扩展到无显式函数模型的 bandit 设置中的一个开放性问题。

ABSTRACT

We consider the problem of online learning with non-convex losses. In terms of feedback, we assume that the learner observes - or otherwise constructs - an inexact model for the loss function encountered at each stage, and we propose a mixed-strategy learning policy based on dual averaging. In this general context, we derive a series of tight regret minimization guarantees, both for the learner's static (external) regret, as well as the regret incurred against the best dynamic policy in hindsight. Subsequently, we apply this general template to the case where the learner only has access to the actual loss incurred at each stage of the process. This is achieved by means of a kernel-based estimator which generates an inexact model for each round's loss function using only the learner's realized losses as input.

研究动机与目标

  • 为解决在反馈不完善的情况下在线非凸优化中的空白,其中先前方法假设损失模型是精确的。
  • 将类似 Hedge 和 FTPL 的随机化算法推广到仅能观测实际损失而非完整损失函数的设置中。
  • 在损失函数非凸且仅能观测实际损失的情况下,推导出紧致的遗憾边界——包括静态和动态遗憾。
  • 解决一个开放性问题:Hedge 类型的算法是否能在无显式函数模型的 bandit 设置中实现次线性遗憾。

提出的方法

  • 提出一种基于对偶平均与不精确损失模型的通用算法模板,支持在非凸在线学习中实现遗憾最小化。
  • 引入一种基于核的估计器,仅利用每轮学习者观测到的实际损失,构建损失函数的不精确模型。
  • 通过利用历史实际损失构建损失模型,将对偶平均框架应用于 bandit 反馈,避免了对显式函数覆盖的依赖。
  • 通过分析窗口策略、正则化参数与损失模型误差率之间的相互作用,推导出遗憾边界。
  • 采用时间窗口化分析并结合自适应参数,平衡探索与利用,以最小化累积遗憾。
  • 采用混合策略,结合指数加权与对偶平均,实现最优遗憾量级。

实验结果

研究问题

  • RQ1当仅能获得不精确或部分反馈时,随机化在线学习算法是否能在非凸设置中实现次线性遗憾?
  • RQ2是否可能在不依赖损失函数显式模型的前提下,将类似 Hedge 的算法扩展到 bandit 反馈设置?
  • RQ3在损失函数非凸且仅能观测实际损失的情况下,可实现何种遗憾边界?
  • RQ4在非凸在线优化中,核基损失估计的性能与基于网格的有限臂 bandit 方法相比如何?
  • RQ5在反馈不完善的在线非凸优化中,探索、正则化与模型误差之间的最优权衡是什么?

主要发现

  • 所提出的对偶平均框架在不精确损失模型下实现了 $Ó(T^{1/2})$ 静态遗憾,与凸设置下的最优速率一致。
  • 对于动态遗憾,在损失模型误差的一般假设下,该方法实现了 $Ó(T^{2/3}V_T^{1/3})$,其中 $V_T$ 衡量最优策略的变化程度。
  • 当仅能观测实际损失时,基于核的估计器使该方法实现了与精确模型相同的 $Ó(T^{1/2})$ 静态遗憾和 $Ó(T^{2/3}V_T^{1/3})$ 动态遗憾边界。
  • 数值实验表明,基于核的方法收敛至理论预测的 $T^{-1/3}$ 遗憾斜率,而基于网格的方法收敛至有限遗憾,表明其收敛更慢。
  • 与基于网格的 EXP3 方法相比,核方法表现出显著更低的方差和更快的遗憾衰减,验证了其在实际中的高效性。
  • 通过自适应窗口化与参数调优,实现了理论遗憾边界 $\mathbb{E}[\operatorname{DynReg}(T)] = \mathcal{O}(T^{1+n\mu+\beta-\rho} + T^{1-\beta} + T^{1-\mu} + T^{2\rho-n\mu-\beta}V_T)$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。