Skip to main content
QUICK REVIEW

[論文レビュー] Online Agnostic Boosting via Regret Minimization

Nataly Brukhim, Xinyi Chen|arXiv (Cornell University)|Mar 2, 2020
Advanced Bandit Algorithms Research参考文献 34被引用数 4
ひとこと要約

本稿では、部分線形のリグレットを示す弱いオンライン学習者を、消失するリグレットを持つ強い学習者に変換する最初のオンライン・オルソドックスブースティングアルゴリズムを提示する。ブースティング問題をオンライン凸最適化(OCO)に還元することにより、オンライン学習および統計的学習の両方におけるオルソドックスおよび実現可能な設定を統一し、リグレット最小化によってほぼ最適な相関バウンドを達成する。

ABSTRACT

Boosting is a widely used machine learning approach based on the idea of aggregating weak learning rules. While in statistical learning numerous boosting methods exist both in the realizable and agnostic settings, in online learning they exist only in the realizable case. In this work we provide the first agnostic online boosting algorithm; that is, given a weak learner with only marginally-better-than-trivial regret guarantees, our algorithm boosts it to a strong learner with sublinear regret. Our algorithm is based on an abstract (and simple) reduction to online convex optimization, which efficiently converts an arbitrary online convex optimizer to an online booster. Moreover, this reduction extends to the statistical as well as the online realizable settings, thus unifying the 4 cases of statistical/online and agnostic/realizable boosting.

研究の動機と目的

  • 従来の手法が実現可能(誤り数束縛)な設定に限られていたことから、オンライン学習におけるギャップを埋めるために、最初のオルソドックスオンラインブースティングアルゴリズムを開発すること。
  • 統計的/オンラインおよびオルソドックス/実現可能な4つの学習パラダイムを、単一の還元フレームワークによって統合すること。
  • 微分プライバシー学習からオンライン学習への還元を、既知の実現可能ケース還元をオルソドックスケースに拡張することで、効率的な還元を可能にすること。
  • 敵対的シーケンスが一般的で、強い学習者が不可欠となるオンライン制御や時系列予測の応用を支援すること。

提案手法

  • アルゴリズムは、オンラインブースティングをオンライン凸最適化(OCO)に還元し、弱い学習者の予測の凸結合を、OCOによって学習された重みで重み付けする。
  • 弱い学習者の過去のパフォーマンスに基づき、動的にN個の弱い学習者の重みを調整するために、リグレット最小化を実行するOCOアルゴリズムを採用する。
  • 弱い学習者は、敵対的シーケンス上での期待相関増加によって定義される、わずかに良いより自明なリグレット保証を持つものと仮定する。
  • 最終的な予測は、弱い学習者出力の正規化平均であり、±1への射影により有効な二値予測を保証する。
  • 損失関数とラベル再ラベル戦略の調整により、オルソドックスおよび実現可能な両設定に適用可能である。
  • フレームワークは一般性に富み、部分線形リグレットを有する任意のOCOアルゴリズムに適用可能であり、異なる最適化コンponentのモジュラーな組み込みを可能にする。

実験結果

リサーチクエスチョン

  • RQ1弱いオンライン学習者が部分線形リグレットを示す場合、オルソドックスオンライン設定において、リグレットが消失する強い学習者にブースト可能か?
  • RQ2単一のブースティングフレームワークによって、オルソドックスおよび実現可能な設定におけるオンライン学習と統計的学習を統合可能か?
  • RQ3微分プライバシー学習からオンライン学習への還元を、実現可能ケースに限らず、オルソドックスオンラインブースティングを用いて拡張可能か?
  • RQ4オンライン・オルソドックスブースティングにおける、弱い学習者の数とリグレットバウンドとの最適なトレードオフは何か?
  • RQ5弱い学習者の優位性パラメータγおよびOCOのリグレットに応じて、ブーストされた学習者の性能はどのようにスケーリングするか?

主な発見

  • 提案されたオンライン・オルソドックスブースティングアルゴリズムは、高確率で $1 - O(1/(γ\sqrt{T}))$ 以上の相関を達成し、Tが増加するにつれて完全な相関に近づく。
  • アルゴリズムは問題をオンライン凸最適化に還元し、部分線形リグレットを有する任意のOCOアルゴリズムを用いることで、強力な一般化性能を実現可能にする。
  • この方法は、統計的/オンラインおよびオルソドックス/実現可能なすべての4つの組み合わせの学習設定を、単一の抽象的還元フレームワークで統合する。
  • 実現可能設定では、少なくとも $1 - \tilde{O}(R_{\mathcal{W}}(T)/(\gamma T) + R_{\mathcal{A}}(N)/N)$ の相関を達成し、TおよびNが増加するにつれて1に近づく。
  • フレームワークは、微分プライバシー学習からオンライン学習への効率的還元を可能にし、従来の実現可能ケースに限られた結果を拡張する。
  • 理論的解析により、弱い学習者がランダム推測より定数の優位性しか持たない場合でも、強い学習者のリグレットがTに関して部分線形に保たれることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。