Skip to main content
QUICK REVIEW

[論文レビュー] MetaGrad: Multiple Learning Rates in Online Learning

Tim van Erven, Wouter M. Koolen|arXiv (Cornell University)|Apr 29, 2016
Advanced Bandit Algorithms Research参考文献 39被引用数 20
ひとこと要約

MetaGrad は、経験的性能に基づくマスターアルゴリズムを用いて、複数の学習率を動的に組み合わせる自己適応的オンライン学習アルゴリズムであり、調整なしで、指数的凸性、強い凸性、および曲率のない関数(正則化なしのヒンジ損失など)を含む広範な関数クラスに対して対数的レジストを達成できる。主な貢献は、単調でない、性能に基づく重み付けされた学習率選択戦略により、多様な関数タイプにわたって高速なレートを達成することにある。

ABSTRACT

In online convex optimization it is well known that certain subclasses of objective functions are much easier than arbitrary convex functions. We are interested in designing adaptive methods that can automatically get fast rates in as many such subclasses as possible, without any manual tuning. Previous adaptive methods are able to interpolate between strongly convex and general convex functions. We present a new method, MetaGrad, that adapts to a much broader class of functions, including exp-concave and strongly convex functions, but also various types of stochastic and non-stochastic functions without any curvature. For instance, MetaGrad can achieve logarithmic regret on the unregularized hinge loss, even though it has no curvature, if the data come from a favourable probability distribution. MetaGrad's main feature is that it simultaneously considers multiple learning rates. Unlike previous methods with provable regret guarantees, however, its learning rates are not monotonically decreasing over time and are not tuned based on a theoretically derived bound on the regret. Instead, they are weighted directly proportional to their empirical performance on the data using a tilted exponential weights master algorithm.

研究の動機と目的

  • 手動のチューニングなしで、多様な関数クラスにわたって自動的に高速なレジストレートを達成する自己適応的オンライン学習手法の開発。
  • 従来のアプローチが強い凸性と一般凸性の関数の間を補間するにとどまっていたのを拡張する。
  • 正則化なしのヒンジ損失のような曲率のない関数を、有利なデータ分布のもとで取り扱えるようにする。
  • 理論的レジストバウンドに依存せず、単調に減少しない学習率選択戦略を設計する。
  • 確率的および非確率的設定を同時に適応可能な統一的なフレームワークを提供する。

提案手法

  • MetaGrad は、複数の『スレーブ』を保持するマスターアルゴリズムを用い、各スレーブは異なる学習率 η を使用する。
  • 各スレーブは、自らの学習率 η を用いてオンライン勾配降下法を実行し、勾配とパラメータ更新に基づく補助損失を追跡する。
  • マスターアルゴリズムは、データに対する経験的性能に基づき、より良い結果を出した学習率に高い重みを割り当てる、傾きを加えた指数的重み付けを用いる。
  • 学習率は、広い範囲のレートをカバーできるように、重み付きの重ね合わせを持つ指数的スケールのグリッドから選択される。
  • フルバージョンは d×d の共分散行列を維持するが、計算効率を高めるために、対角バージョンは対角成分のみを追跡する。
  • レジストバウンドは、マスターのレジストとスレーブ固有の補助レジストバウンドを組み合わせることで導出され、データ構造に適応する合成バウンドが得られる。

実験結果

リサーチクエスチョン

  • RQ1正則化なしのヒンジ損失は曲率を持たないが、有利なデータ分布のもとで、オンライン学習アルゴリズムが対数的レジストを達成できるか。
  • RQ2指数的凸性、強い凸性、および曲率のない関数を含む複数の関数クラスに同時に高速なレートを達成できる自己適応的手法を設計できるか。
  • RQ3理論的レジストバウンドに依存せず、単調に減少しない学習率選択戦略を設計できるか。
  • RQ4より広い関数クラスに拡張する際の、適応性と計算コストのトレードオフは何か。
  • RQ5事前に関数クラスを知らなくても、一般凸関数とより簡単な関数タイプの両方に対してレジストバウンドを同時にタイトに保てるか。

主な発見

  • MetaGrad は、任意の u ∈ U に対して、O(√T ln ln T) および O(√(V^u_T d ln T) + d ln T) のレジストバウンドを達成する。ここで V^u_T は、パラメータ距離に重み付けされた勾配の分散を測定する。
  • 有利なデータ分布のもとで、MetaGrad は曲率の欠如にもかかわらず、正則化なしのヒンジ損失に対して対数的レジスト O(ln T) を達成する。
  • MetaGrad の対角バージョンは、O(d ln(D²G²T)) のレジストを達成し、次元依存性について理論的期待と一致する。
  • MetaGrad のフルバージョンは、蓄積された勾配行列のランクに依存するレジストバウンドを達成し、データに低次元構造が存在する場合にはより高速なレートを実現できる。
  • レジストバウンドが任意の u ∈ U に対して成り立つことから、未知のデータ分布に対しても性能が安定しており、データの内蔵的難易度に適応する。
  • 関数クラスの事前知識を必要とせず、強力な理論的保証を維持するため、オンライン学習タスクに広く適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。