Skip to main content
QUICK REVIEW

[论文解读] Online Agnostic Boosting via Regret Minimization

Nataly Brukhim, Xinyi Chen|arXiv (Cornell University)|Mar 2, 2020
Advanced Bandit Algorithms Research参考文献 34被引用 4
一句话总结

本文提出了首个在线无关提升算法,将具有次线性遗憾的弱在线学习器转化为具有趋于零遗憾的强学习器。通过将提升问题转化为在线凸优化(OCO),该方法统一了在线学习与统计学习中的无关与可实现设置,通过遗憾最小化实现近乎最优的相关性边界。

ABSTRACT

Boosting is a widely used machine learning approach based on the idea of aggregating weak learning rules. While in statistical learning numerous boosting methods exist both in the realizable and agnostic settings, in online learning they exist only in the realizable case. In this work we provide the first agnostic online boosting algorithm; that is, given a weak learner with only marginally-better-than-trivial regret guarantees, our algorithm boosts it to a strong learner with sublinear regret. Our algorithm is based on an abstract (and simple) reduction to online convex optimization, which efficiently converts an arbitrary online convex optimizer to an online booster. Moreover, this reduction extends to the statistical as well as the online realizable settings, thus unifying the 4 cases of statistical/online and agnostic/realizable boosting.

研究动机与目标

  • 通过开发首个无关在线提升算法,弥合在线学习中的差距,因为以往方法仅限于可实现(错误有界)设置。
  • 通过单一归约框架,统一四种学习范式——统计/在线与无关/可实现。
  • 通过将已知的可实现情况归约扩展到无关情况,实现从差分隐私学习到在线学习的高效归约。
  • 支持在线控制与时间序列预测等应用,其中对抗性序列常见,强学习器至关重要。

提出的方法

  • 该算法将在线提升归约为在线凸优化(OCO),通过OCO学习的权重对弱学习器的预测进行凸组合。
  • 采用遗憾最小化的OCO算法,根据其历史表现动态调整N个弱学习器的权重。
  • 假设弱学习器具有略好于平凡的遗憾保证,通过对抗序列上的期望相关性增益来定义。
  • 最终预测为弱学习器输出的归一化平均值,并投影到±1以确保有效的二元预测。
  • 通过调整损失函数和标签重标记策略,该方法适用于无关与可实现设置。
  • 该框架具有通用性,可扩展至任意具有次线性遗憾的OCO算法,支持模块化插件不同优化组件。

实验结果

研究问题

  • RQ1能否在无关在线设置下,将具有次线性遗憾的弱在线学习器提升为具有趋于零遗憾的强学习器?
  • RQ2是否可能通过单一提升框架统一在线学习与统计学习在无关与可实现设置下的表现?
  • RQ3能否通过无关在线提升将差分隐私学习到在线学习的归约从可实现情况扩展到无关情况?
  • RQ4在线无关提升中,弱学习器数量与遗憾边界之间的最优权衡是什么?
  • RQ5提升学习器的性能如何随弱学习器的优势参数γ和OCO遗憾变化?

主要发现

  • 所提出的在线无关提升算法以高概率实现至少 $1 - O(1/(γ\sqrt{T}))$ 的相关性,随着T增大趋近于完美相关性。
  • 该算法将问题归约为在线凸优化,从而可使用任意具有次线性遗憾的OCO算法,实现强泛化能力。
  • 该方法在单一抽象归约下统一了所有四种学习设置组合——统计/在线与无关/可实现。
  • 在可实现设置下,该算法实现至少 $1 - \tilde{O}(R_{\mathcal{W}}(T)/(\gamma T) + R_{\mathcal{A}}(N)/N)$ 的相关性,随着T和N增大趋近于1。
  • 该框架实现了从差分隐私学习到在线学习的高效归约,扩展了以往仅限于可实现情况的研究结果。
  • 理论分析表明,即使弱学习器仅相对于随机猜测具有常数优势,强学习器的遗憾仍为T的次线性函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。