Skip to main content
QUICK REVIEW

[论文解读] Algorithmic Chaining and the Role of Partial Feedback in Online Nonparametric Learning

Nicolò Cesa‐Bianchi, Pierre Gaillard|arXiv (Cornell University)|Feb 27, 2017
Advanced Bandit Algorithms Research被引用 12
一句话总结

该论文提出了一种在线非参数学习中部分反馈下的算法链框架,通过利用更丰富的反馈结构来收紧遗憾界。通过利用保留价离散化实现方差控制,并结合EWA估计方法,相较于标准Exp3,实现了更优的遗憾标度,且在有界损失假设下具有理论保证。

ABSTRACT

We investigate contextual online learning with nonparametric (Lipschitz) comparison classes under different assumptions on losses and feedback information. For full information feedback and Lipschitz losses, we design the first explicit algorithm achieving the minimax regret rate (up to log factors). In a partial feedback model motivated by second-price auctions, we obtain algorithms for Lipschitz and semi-Lipschitz losses with regret bounds improving on the known bounds for standard bandit feedback. Our analysis combines novel results for contextual second-price auctions with a novel algorithmic approach based on chaining. When the context space is Euclidean, our chaining approach is efficient and delivers an even better regret bound.

研究动机与目标

  • 提出一种在部分反馈下在线非参数学习的遗憾最小化框架。
  • 通过利用更丰富的反馈结构,改进现有的Exp3风格算法。
  • 通过保留价的策略性离散化,控制损失估计的方差。
  • 通过期望分解与集中性论证,推导出更紧的遗憾界。
  • 在有界损失假设下建立理论性能保证。

提出的方法

  • 使用离散化的保留价集合 $ y_k = (k-1)\gamma $ 来组织反馈并控制估计误差。
  • 应用指数加权平均(EWA)算法,结合学习率 $ \eta $ 来组合预测。
  • 通过项 $ \sum_{j=1}^{K} \frac{q_t(j)}{\sum_{i=1}^{j} q_t(i)} $ 实现方差控制,其上界为 $ \frac{1}{1-\gamma} $。
  • 使用塔规则(tower rule)处理条件期望,将期望遗憾分解为可管理的组成部分。
  • 通过结合EWA遗憾分解、损失估计偏差与方差控制,推导出遗憾界。
  • 引入 $ s_t(j) = \sum_{i=1}^{j} q_t(i) $,以实现对 $ j $ 的求和的积分近似。

实验结果

研究问题

  • RQ1如何利用部分反馈来改进在线非参数学习中的遗憾界?
  • RQ2通过保留价对动作空间进行离散化,对估计方差有何影响?
  • RQ3通过控制估计损失的二阶矩,能否实现更紧的遗憾界?
  • RQ4EWA框架如何适应具有有界损失的部分反馈设置?
  • RQ5反馈结构在降低损失估计器的有效方差方面起到什么作用?

主要发现

  • 遗憾界被上界控制为 $ \frac{\eta}{2(1-\gamma)} \sum_{t=1}^{T} \mathbb{E}\left[ \sum_{j=1}^{K} \frac{q_t(j)}{\sum_{i=1}^{j} q_t(i)} \right] + \frac{\ln K}{\eta} $,该界通过反馈丰富性控制了方差。
  • 项 $ \sum_{j=1}^{K} \frac{q_t(j)}{\sum_{i=1}^{j} q_t(i)} $ 被一个依赖于 $ \gamma $ 的常数所界定,从而实现在时间上的统一控制。
  • 使用非负估计损失的EWA允许通过引理 LABEL:lem:boundEWA-appe 实现清晰的遗憾分解。
  • 条件期望 $ \mathbb{E}_{t-1}[\widehat{\ell}_t(j)] = \ell_t(y_j) $ 确保了损失估计的无偏性。
  • 当 $ \eta \propto \sqrt{\frac{\ln K}{T}} $ 时,该界呈现 $ O(\sqrt{T \ln K}) $ 的量级,与部分反馈下已知的最优率一致。
  • 通过战略性离散化利用更丰富的反馈结构,该框架在遗憾控制上优于标准Exp3。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。