Skip to main content
QUICK REVIEW

[論文レビュー] Supermasks in Superposition

Mitchell Wortsman, Vivek Ramanujan|arXiv (Cornell University)|Jun 26, 2020
Domain Adaptation and Few-Shot Learning参考文献 51被引用数 8
ひとこと要約

Supermasks in Superposition (SupSup) は、固定されたランダム初期化されたニューラルネットワークと、タスク固有のサブネットワーク(スーパーマスク)を用いることで、2500タスクにわたる継続的学習においても災難的忘却を回避する。タスク識別は、スーパーマスクの線形重ね合わせの勾配ベース最適化により行い、2500タスクにおいても1ステップの勾配最適化で正確な推論を達成。ゼロショットタスク発見と、ホフリートネットワークリザボアを用いた定数サイズのメモリをサポートする。

ABSTRACT

We present the Supermasks in Superposition (SupSup) model, capable of sequentially learning thousands of tasks without catastrophic forgetting. Our approach uses a randomly initialized, fixed base network and for each task finds a subnetwork (supermask) that achieves good performance. If task identity is given at test time, the correct subnetwork can be retrieved with minimal memory usage. If not provided, SupSup can infer the task using gradient-based optimization to find a linear superposition of learned supermasks which minimizes the output entropy. In practice we find that a single gradient step is often sufficient to identify the correct mask, even among 2500 tasks. We also showcase two promising extensions. First, SupSup models can be trained entirely without task identity information, as they may detect when they are uncertain about new data and allocate an additional supermask for the new training distribution. Finally the entire, growing set of supermasks can be stored in a constant-sized reservoir by implicitly storing them as attractors in a fixed-sized Hopfield network.

研究の動機と目的

  • 未訓練でランダムに重み付けされたサブネットワークを活用することで、継続的学習における災難的忘却を解消すること。
  • テスト時におけるタスクIDの明示的監督なしに、スーパーマスクの組み合わせの勾配ベース最適化により正確なタスク推論を実現すること。
  • 最小限のメモリオーバーヘッドで、数千タスクにスケーリング可能な継続的学習を実現すること。
  • 事前のID監督なしに、新しいタスクのゼロショット発見を可能にすること。
  • 固定サイズのホフリートネットワークリザボアを用いて、増加するスーパーマスクのセットを効率的に格納すること。

提案手法

  • 固定されたランダム初期化されたベースニューラルネットワークを用い、各タスクごとに固有のバイナリスーパーマスクを学習してサブネットワークを形成する。
  • テスト時に、出力エントロピーを最小化するように、学習済みスーパーマスクの凸結合を最適化することでタスク識別を実行する。
  • MNISTの2500通りの順列のうち正しいタスクを特定するために、1ステップの勾配最適化を用いる。
  • 訓練時におけるタスクIDの情報なしに、不確実性を検出し、未学習のタスク分布に対して新しいスーパーマスクを割り当てるメカニズムを導入する。
  • ホフリートネットワークリザボアを用いて、スーパーマスクを定数サイズのメモリに暗黙的に格納し、それらをアトラクタとして扱う。
  • 3文字の分類体系(例:GG, GN, NNs)を用い、タスクIDの可用性に応じた継続的学習シナリオを体系的に評価する。

実験結果

リサーチクエスチョン

  • RQ1固定されたランダム初期化されたネットワークが、災難的忘却を回避しながら数千のタスクを学習できるか?
  • RQ2明示的監督なしに、スーパーマスクの組み合わせの勾配ベース最適化のみでテスト時に正確なタスク識別が可能か?
  • RQ3事前のタスクID情報なしに、未学習のタスク分布を検出し、それに適応できるか?
  • RQ4ホフリートネットワークリザボアを用いて、すべての学習済みスーパーマスクを定数サイズのメモリに格納できるか?
  • RQ5スーパーマスクのスパarsityとネットワークの過剰パラメータ化が、推論精度と耐性に与える影響は?

主な発見

  • GGシナリオにおいて、最近のベースラインと比較して、より低いストレージとトレーニング時間で、SplitImageNetで最先端の性能を達成した。
  • GNシナリオでは、MNISTの2500通りの順列においても、忘却を示さず、タスク推論に1ステップの勾配最適化のみを用いて高い精度を維持した。
  • NNsシナリオにおいて、不確実性を検出し、自律的に新しいスーパーマスクを割り当てることで、新しいタスクの発見に成功した。
  • 余分なニューロンが存在しても正確なタスク推論が達成可能であり、分布シフトに対して耐性が向上した。
  • ホフリートネットワークリザボアにより、すべてのスーパーマスクが固定サイズのメモリに暗黙的に格納され、完全なモデル容量が保持された。
  • 実験的結果から、出力エントロピーの勾配最適化による最小化が、高次元のタスク空間においても正確なスーパーマスクの特定を信頼性高く実現することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。