Skip to main content
QUICK REVIEW

[論文レビュー] Firefly Neural Architecture Descent: a General Approach for Growing Neural Networks

Lemeng Wu, Bo Liu|arXiv (Cornell University)|Feb 17, 2021
Domain Adaptation and Few-Shot Learning被引用数 16
ひとこと要約

Firefly Neural Architecture Descent は、現在のネットワークに $\epsilon$-近似する関数的近傍内での最適なアーキテクチャを繰り返し選択することで、動的かつ段階的にニューラルネットワークを拡大する原理的で勾配降下型のフレームワークである。幅と深さの両方の柔軟で効率的な拡大を可能にし、より小さな、より正確なモデルを用いて災難的忘却を回避する継続的学習において最先端の性能を達成する。

ABSTRACT

We propose firefly neural architecture descent, a general framework for progressively and dynamically growing neural networks to jointly optimize the networks' parameters and architectures. Our method works in a steepest descent fashion, which iteratively finds the best network within a functional neighborhood of the original network that includes a diverse set of candidate network structures. By using Taylor approximation, the optimal network structure in the neighborhood can be found with a greedy selection procedure. We show that firefly descent can flexibly grow networks both wider and deeper, and can be applied to learn accurate but resource-efficient neural architectures that avoid catastrophic forgetting in continual learning. Empirically, firefly descent achieves promising results on both neural architecture search and continual learning. In particular, on a challenging continual image classification task, it learns networks that are smaller in size but have higher average accuracy than those learned by the state-of-the-art methods.

研究の動機と目的

  • 動的で段階的な方法で、ニューラルネットワークのパラメータとアーキテクチャの両方を同時に最適化する課題に対処すること。
  • 性能向上を保証しないヒューリスティック法やランダムなネットワーク拡大手法の限界を克服すること。
  • 幅と深さの両方の拡大をサポートする汎用的で柔軟なフレームワークを開発すること。
  • 原理的でないネットワーク拡大によって、継続的学習における災難的忘却を効果的に防止すること。
  • 2次または組み合わせ的探索に基づくアーキテクチャ探索手法の代替として、スケーラブルで効率的な選択肢を提供すること。

提案手法

  • この手法は、関数的近傍 $\partial(f_t, \epsilon)$ 上での勾配降下最適化としてネットワーク拡大を定式化し、$f_{t+1}$ を複雑さ制約下で損失を最小化する近傍内の最良ネットワークとする。
  • \epsilon が小さい場合、テイラー展開を用いることで組み合わせ最適化問題を貪欲な選択プロセスに簡略化し、計算を効率化する。
  • 関数的摂動の微分可能で統一された探索空間を通じて、幅の拡大(ニューロンの追加)と深さの拡大(層の追加)の両方をサポートする。
  • 継続的学習では、関数的に同等だがより大きなアーキテクチャに拡大することで、過去の知識を保持し、忘却を低減する。
  • ニューロンの分割に限定されない一般化された勾配降下の一般化であり、新たな層やニューロンの追加を含む任意の構造的変更を許容する。
  • 標準的なニューラルネットワークコンポonentやセルベースの NAS(例:DARTS)に適用可能な微分可能で反復的な手順として実装される。

実験結果

リサーチクエスチョン

  • RQ1パラメータとアーキテクチャを同時に最適化する原理的で勾配に類似した降下法を、ニューラルネットワークの拡大に応用できるか?
  • RQ2幅の拡大と深さの拡大を統一的なフレームワークでサポートできるほど、ネットワーク拡大を柔軟にできるか?
  • RQ3このような手法が、災難的忘却を低減することで、ヒューリスティック法やランダム探索戦略を上回る性能を継続的学習で達成できるか?
  • RQ4最先端の手法と比較して、高精度でより小さな、より効率的なモデルを達成できる程度はどの程度か?
  • RQ5テイラー展開の使用が、複雑なアーキテクチャ探索空間における効率的で貪欲な選択を可能にする仕組みは何か?

主な発見

  • 20クラスに分割されたCIFAR-100の挑戦的な継続的画像分類タスクにおいて、Fireflyは、最先端の手法よりもサイズが小さいにもかかわらず、平均精度がより高いモデルを学習した。
  • Firefly は、最終的なネットワークでたった 80 パラメータで CIFAR-100 で 91.03% の精度を達成し、Learn-to-Grow や Compact-Pick-Grow などの手法を上回った。
  • 関数的に同等だがより大きなネットワークを動的に拡大することで、災難的忘却が軽減され、過去の知識が保持された。
  • ニューラルアーキテクチャ探索において、DARTSベースのモデルでセル構造を効果的に最適化し、継続的学習を越えて一般化可能であることを示した。
  • 関数的近傍をテイラー展開で近似することで、高コストな2次計算を回避し、効率的で貪欲なネットワーク拡大を可能にした。
  • 実験的結果から、Firefly は、精度とモデル効率の両面で、ヒューリスティックベースの拡大手法を一貫して上回ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。