Skip to main content
QUICK REVIEW

[論文レビュー] Neural Architecture Search for Class-incremental Learning

Shenyang Huang, Vincent François-Lavet|arXiv (Cornell University)|Sep 14, 2019
Domain Adaptation and Few-Shot Learning参考文献 22被引用数 10
ひとこと要約

本稿では、強化学習メタコントローラーとNet2Net重み転送を用いて、段階的インクリメンタル学習におけるニューラルネットワークアーキテクチャの動的進化を可能にするautoMLフレームワーク、継続的ニューラルアーキテクチャ探索(CNAS)を提案する。CNASは固定アーキテクチャモデルを上回り、かつ従来のNAS手法と比較して少なくとも1桁の効率向上を達成しており、必要に応じてのみ適応的に拡張することで、パラメータ成長を抑えて優れた精度を達成する。

ABSTRACT

In class-incremental learning, a model learns continuously from a sequential data stream in which new classes occur. Existing methods often rely on static architectures that are manually crafted. These methods can be prone to capacity saturation because a neural network's ability to generalize to new concepts is limited by its fixed capacity. To understand how to expand a continual learner, we focus on the neural architecture design problem in the context of class-incremental learning: at each time step, the learner must optimize its performance on all classes observed so far by selecting the most competitive neural architecture. To tackle this problem, we propose Continual Neural Architecture Search (CNAS): an autoML approach that takes advantage of the sequential nature of class-incremental learning to efficiently and adaptively identify strong architectures in a continual learning setting. We employ a task network to perform the classification task and a reinforcement learning agent as the meta-controller for architecture search. In addition, we apply network transformations to transfer weights from previous learning step and to reduce the size of the architecture search space, thus saving a large amount of computational resources. We evaluate CNAS on the CIFAR-100 dataset under varied incremental learning scenarios with limited computational power (1 GPU). Experimental results demonstrate that CNAS outperforms architectures that are optimized for the entire dataset. In addition, CNAS is at least an order of magnitude more efficient than naively using existing autoML methods.

研究の動機と目的

  • 固定アーキテクチャに依存するのではなく、動的にニューラルネットワークアーキテクチャを適応的に変更することにより、継続的学習における容量飽和を解消すること。
  • 各学習ステップで人為的介入なしに最適なアーキテクチャを自動的に選択できるautoMLシステムの開発。
  • Net2Netを活用した重み転送とヒューリスティック駆動の拡張戦略により、アーキテクチャ探索における計算コストを低減すること。
  • 限られたGPUリソースと制限されたデータ環境という現実的条件下で、継続的アーキテクチャ探索の有効性を評価すること。
  • 適応的アーキテクチャ進化が、静的またはグリーディー拡張戦略と比較して、一般化性能とパラメータ効率性に優れていることを示すこと。

提案手法

  • 現在のタスク用ネットワークから、Net2WiderNetおよびNet2DeeperNetの変換を探索する強化学習エージェント(メタコントローラー)を用いる。
  • 過去のアーキテクチャからの訓練済み重みをNet2Net変換により転送することで、トレーニング時間と計算コストを顕著に削減する。
  • 過剰なパラメータ化や不必要な複雑さを防ぐために、ネットワーク拡張のタイミングを決定するヒューリスティック関数を採用する。
  • 各タイムステップで保持済みのバリデーションセット上でアーキテクチャ探索を実施し、これまでに学習済みのすべてのクラスに対して最も高い性能を示すアーキテクチャを選択する。
  • 過去のすべてのデータを蓄積するデータセットを維持し、知識レハーサルを用いて深刻な忘却を緩和する。
  • 各タイムステップで最大30のアーキテクチャをサンプリングし、検索空間のサイズを制御するため、Net2WiderNetおよびNet2DeeperNetの変換をそれぞれ最大5回までに制限する。

実験結果

リサーチクエスチョン

  • RQ1固定アーキテクチャモデルと比較して、動的アーキテクチャ探索は、クラスインクリメンタル学習における性能向上をもたらすか?
  • RQ2強化学習と重み転送の組み合わせが、継続的アーキテクチャ探索における計算コストをどのように低減するか?
  • RQ3ヒューリスティック関数が、継続的学習における過剰パラメータ化の防止と一般化性能の向上に与える影響は何か?
  • RQ4CNASは、NAS や EAS といったナードなautoML手法と比較して、効率性と精度の点でどのように異なるか?
  • RQ5RLメタコントローラーは、ヒューリスティックのみまたはグリーディー手法と比較して、変化するデータ分布への適応性をどのように向上させるか?

主な発見

  • CNASはCIFAR-100データセット全体を最適化したモデルを上回り、継続的アーキテクチャ探索がより優れた一般化性能をもたらすことを示している。
  • CNASは、ナードなNASやEAS手法と比較して、少なくとも1桁の効率向上を達成しており、1つのGPUのみを用い、900のアーキテクチャを学習完了までに93時間で処理している。
  • ヒューリスティック関数により、早期かつ過剰なモデル拡張が防がれ、過学習のリスクが低下し、トレーニングコストも削減される。
  • RLメタコントローラーにより、CNASは時間経過とともに効果的な探索ポリシーを学習でき、36クラス学習後にはメタコントローラーを搭載しないRAS-HFを上回る性能を示した。
  • アブレーションスタディでは、メタコントローラーとヒューリスティック関数の両方を備えたCNASが、最も優れた性能を発揮し、RAS(グリーディーに拡張)と比較してパラメータ成長が著しく低い。RASは計算的に非現実的になる。
  • パラメータ成長曲線と性能比較から、CNASは静的アーキテクチャ(SA)よりも高い精度を達成しながら、顕著に少ないパラメータ数を用いていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。