Skip to main content
QUICK REVIEW

[論文レビュー] Regret Bounds for Lifelong Learning

Pierre Alquier, Mai, The Tien|arXiv (Cornell University)|Oct 27, 2016
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、逐次処理されるタスク間でデータ表現を指数的重み付き集約を用いて精錬する、長期間学習のためのメタアルゴリズムEWA-LLを提案する。この手法は、タスク内アルゴリズムの性能保証を引き継ぐレグレットバウンドを確立し、一般かつ凸損失関数の下で、有限な予測子集合に対して、従来の$O(1/\sqrt{m})$バウンドよりも鋭い$O(1/m)$レートを達成する。ここで$m$は1タスクあたりのサンプルサイズである。

ABSTRACT

We consider the problem of transfer learning in an online setting. Different tasks are presented sequentially and processed by a within-task algorithm. We propose a lifelong learning strategy which refines the underlying data representation used by the within-task algorithm, thereby transferring information from one task to the next. We show that when the within-task algorithm comes with some regret bound, our strategy inherits this good property. Our bounds are in expectation for a general loss function, and uniform for a convex loss. We discuss applications to dictionary learning and finite set of predictors. In the latter case, we improve previous $O(1/\sqrt{m})$ bounds to $O(1/m)$ where $m$ is the per task sample size.

研究の動機と目的

  • タスク内アルゴリズムに最小限の仮定を置く長期間学習の理論的分析を提供すること。
  • 共有されるデータ表現を精錬することで、タスク間で知識を転送するメタアルゴリズムの開発。
  • タスク内学習者たちの統計的性質を引き継ぐ、メタアルゴリズムのレグレットバウンドの導出。
  • 特に有限な予測子集合に対して、既存の収束レートを改善すること。
  • オンラインからバッチへの変換を用いて、学習する学習(learning-to-learn)設定への分析の拡張。

提案手法

  • 各タスクの後で指数的重み付き集約(EWA)を用いて、表現に関する事前分布を維持・更新するEWA-LLというメタアルゴリズムを提案。
  • オンラインレグレット解析を用いて、メタラーナーの累積損失を理想の予測子に対してバウンド。
  • オンラインからバッチへの変換を適用し、学習する学習設定における一般化リスクバウンドを導出。
  • 集中法を用いて、凸損失関数の下での一様なレグレットバウンドを導出。
  • 学習する学習における一般化を保証するために、表現および予測子の確率的選択戦略を採用。
  • 主な応用例として、辞書学習と有限な予測子集合の2つの分野における性能分析。

実験結果

リサーチクエスチョン

  • RQ1任意のタスク内アルゴリズムのレグレット特性を引き継ぐ長期間学習用のメタアルゴリズムを設計できるか?
  • RQ2一般および凸損失関数の下で、そのようなメタアルゴリズムに対してどの程度のレグレットバウンドを確立できるか?
  • RQ3既存の$O(1/\sqrt{m})$バウンドと比較して、小規模なサンプルサイズの下で収束レートを改善できるか?
  • RQ4オンライン長期間学習フレームワークを、オフラインの学習する学習設定に適応できるか?
  • RQ5EWA-LLメタアルゴリズムに対して、一様かつ高確率のバウンドを導出できるか?

主な発見

  • EWA-LLメタアルゴリズムは、タスク内アルゴリズムのレグレットバウンドを引き継ぎ、個々のタスクで優れた性能を発揮するならば、長期間学習設定でも優れた性能を発揮することが保証される。
  • 有限な予測子集合に対して、従来の$O(1/\sqrt{m})$レグレットバウンドを$O(1/m)$に改善した。ここで$m$は1タスクあたりのサンプルサイズである。
  • 一般レグレットバウンドは$1/\sqrt{T} + 1/\sqrt{m}$のオーダーであり、特定の状況では$1/\sqrt{T} + 1/m$のより良いレートが得られる。
  • 凸損失関数の下で一様なレグレットバウンドが確立され、期待値の分析を超えて高確率保証へと分析を拡張した。
  • オンラインからバッチへの変換により、学習する学習設定におけるリスクバウンドが得られ、この戦略が新しいタスクへもうまく一般化されることを示した。
  • このフレームワークは、辞書学習およびカーネル法に適用可能であり、深層ニューラルネットワークやその他の表現学習モデルへの応用も可能性を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。