Skip to main content
QUICK REVIEW

[論文レビュー] Learning where to learn: Gradient sparsity in meta and continual learning

Johannes von Oswald, Dominic Zhao|Zurich Open Repository and Archive (University of Zurich)|Jan 1, 2021
Domain Adaptation and Few-Shot Learning被引用数 24
ひとこと要約

この論文は、各パラメータの勾配マスキングを通じて更新すべき重みを学習する sparse-MAML を提案し、スパースな勾配降下を生み出すことで一般化を向上させ、少数ショット学習と継続学習における干渉を低減します。

ABSTRACT

Finding neural network weights that generalize well from small datasets is difficult. A promising approach is to learn a weight initialization such that a small number of weight changes results in low generalization error. We show that this form of meta-learning can be improved by letting the learning algorithm decide which weights to change, i.e., by learning where to learn. We find that patterned sparsity emerges from this process, with the pattern of sparsity varying on a problem-by-problem basis. This selective sparsity results in better generalization and less interference in a range of few-shot and continual learning problems. Moreover, we find that sparse learning also emerges in a more expressive model where learning rates are meta-learned. Our results shed light on an ongoing debate on whether meta-learning can discover adaptable features and suggest that learning by sparse gradient descent is a powerful inductive bias for meta-learning systems.

研究の動機と目的

  • 学習すべき場所を学習すること(勾配マスキングを介して)により、標準的な MAML よりも一般化が向上するかを調査する。
  • 層やタスク間で現れる勾配のスパース性パターンを分析する。
  • スパース勾配更新が、少数ショット性能、ドメイン横断適応、継続学習に与える影響を検討する。
  • sparse-MAML およびその派生が、既存の勾配モジュレーション手法と比較してどうであるかを評価する。
  • より深いモデルやオンライン継続学習設定へのスケーラビリティを探る。

提案手法

  • 内側ループの更新を調整する二値勾配マスク m を導入し、phi_{tau,k+1}=phi_{tau,k}-alpha * (1_{m>=0} ∘ ∇_phi L_in_tau(phi_{tau,k})) を適用する。
  • 外部損失の勾配と蓄積された内側ループ勾配を整合させる一階微分勾配で m を更新する。
  • 非微分可能なマスクをバックプロップするためにストレートスルー推定器を使用する。
  • ConvNet および ResNet-12 を用いた 5-way miniImageNet へ sparse-MAML を適用し、1-shot および 5-shot の regime を評価する。
  • MAML、ANIL、BOIL、Meta-SGD、MT-nets、および sparse-ReLU またはバイナリマスクを用いた変種と比較する。
  • La-MAML および sparse-La-MAML(および sparse-ReLU 派生)と組み合わせて、継続学習へ拡張する。

実験結果

リサーチクエスチョン

  • RQ1勾配マスクを介して適応すべき重みを学習することは、標準的な MAML や ANIL よりも少数ショットの一般化を改善するか。
  • RQ2層およびタスク間で現れるスパース性パターンは何で、ネットワークの深さやデータレジームとどう関係するか。
  • RQ3スパース勾配更新は、ドメイン間適応や継続学習における干渉を減らすか。
  • RQ4スパース-MAML の派生(バイナリマスク vs 整数化学習率)は、性能とスパース性の面でどう比較されるか。

主な発見

  • Sparse-MAML は、初期層で勾配のスパース性を高め、深い層へ向かうにつれて低下させる勾配スパース性を誘発し、少数ショットの性能と相関する。
  • 内部ループのステップ数が多く、内部ループ学習率が大きいと、より多くのスパース性と一般化の向上を促進する。
  • バイナリ勾配マスクと整流化学習率の派生はいずれも高い性能を達成でき、Sparse-ReLU-MAML は ResNet-12 のような深いモデルで特に良好な性能を示す。
  • Sparse 学習は、ミニImageNet から TieredImageNet、CUB、Cars へのクロスドメイン適応を、手作業のフリーズベースラインより改善する。
  • 継続学習において、 sparse-La-MAML および sparse-ReLU-C-MAML は保持精度を維持・向上させ、タスク間の干渉を低減し、スパース性パターンは容量とタスク構造に適応する。
  • 全体として、 sparse 勾配降下は、少数ショットおよび継続学習設定において一般化を改善し、 forgetting を低減する堅牢な帰納的バイアスとして機能する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。