Skip to main content
QUICK REVIEW

[論文レビュー] Multi-objective Neural Architecture Search via Non-stationary Policy Gradient

Zewei Chen, Fengwei Zhou|arXiv (Cornell University)|Jan 23, 2020
Advanced Multi-Objective Optimization Algorithms参考文献 48被引用数 6
ひとこと要約

本稿では、多目的ニューラルアーキテクチャサーチ(NAS)における完全なパレートフロントを効率的に近似するために、非定常ポリシー勾配を用いた強化学習フレームワーク、NPG-NASを提案する。適応的報酬関数(ADFおよびADC)と、探索用のコサイン温度減衰を導入することで、高速な収束と高い精度を達成し、CIFAR-10、CIFAR-100、ImageNetにおいて、モデルサイズを削減しながらも、優れたパレートカバレッジと最先端の性能を達成した。

ABSTRACT

Multi-objective Neural Architecture Search (NAS) aims to discover novel architectures in the presence of multiple conflicting objectives. Despite recent progress, the problem of approximating the full Pareto front accurately and efficiently remains challenging. In this work, we explore the novel reinforcement learning (RL) based paradigm of non-stationary policy gradient (NPG). NPG utilizes a non-stationary reward function, and encourages a continuous adaptation of the policy to capture the entire Pareto front efficiently. We introduce two novel reward functions with elements from the dominant paradigms of scalarization and evolution. To handle non-stationarity, we propose a new exploration scheme using cosine temperature decay with warm restarts. For fast and accurate architecture evaluation, we introduce a novel pre-trained shared model that we continuously fine-tune throughout training. Our extensive experimental study with various datasets shows that our framework can approximate the full Pareto front well at fast speeds. Moreover, our discovered cells can achieve supreme predictive performance compared to other multi-objective NAS methods, and other single-objective NAS methods at similar network sizes. Our work demonstrates the potential of NPG as a simple, efficient, and effective paradigm for multi-objective NAS.

研究の動機と目的

  • 多目的ニューラルアーキテクチャサーチ(NAS)における完全なパレートフロントを、効率的かつ正確に近似すること。
  • スカラライゼーション法や進化的手法の限界を克服し、複数回の実行を要するか、高いサーチコストとバイアスを伴う問題を解消すること。
  • 一度のトレーニングランで、多様でパレート最適なアーキテクチャを動的に探索できる統合型RLベースのフレームワークを開発すること。
  • 継続的に微調整される事前学習済み共有モデルを活用し、アーキテクチャの評価速度と精度を向上させること。

提案手法

  • ADF(ターゲットベースの望ましさ)とADC(パレート支配に基づく)の2つの新しい非定常報酬関数を導入し、段階的スカラライゼーションとパレートフロントのバンドワイド拡張を実現する。
  • 報酬関数が時間とともに変化する非定常ポリシー勾配フレームワークを採用し、継続的なポリシー適応を誘導する。
  • 非定常トレーニング中の探索と活用のバランスを図るため、ウォームリスタートを伴うコサイン温度減衰を適用する。
  • 各アーキテクチャサンプルに対して継続的に微調整される事前学習済みモデルを用い、高速かつ正確な検証精度推定を実現する。
  • セルベースの探索空間でアーキテクチャを生成するコントローラーポリシーを活用し、パレート支配またはスカラライズド目的に基づく報酬を適用する。
  • ポリシーが段階的に真のパレートフロントを支配するか、それに近づくアーキテクチャを生成するように学習するエンドツーエンドトレーニングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1非定常ポリシー勾配フレームワークは、単一のトレーニングランで多目的NASにおける完全なパレートフロントを効果的に近似できるか?
  • RQ2提案されたADFおよびADC報酬関数は、従来のスカラライゼーション法や進化的手法と比較して、パレートフロントカバレッジと多様性の面でどのように優れているか?
  • RQ3ウォームリスタートを伴うコサイン温度減衰は、NASにおける非定常RLの探索性をどの程度向上させるか?
  • RQ4継続的に微調整される事前学習済み共有モデルを用いたアーキテクチャ評価は、初期から訓練する場合と比較して、どの程度高速かつ正確か?
  • RQ5NPG-NASで発見されたアーキテクチャは、ImageNetの転移学習などの下流タスクにおいても一般化性能を示せるか?

主な発見

  • ADF-LはCIFAR-100で83.99%の精度を達成し、パrameter数が573万で、DenseNet-BCに比べて77.61%も少ないパrameter数で上回った。
  • ADC-L10とADF-L100は、DPP-Net-PNASに比べてより高いトップ1精度を達成したが、パラメータ数はその10分の1にまで削減された。
  • NPG-NASはCIFAR-10およびCIFAR-100から得たセルをImageNetに転送し、789万パラメータで76.67%のトップ1精度を達成し、同サイズ帯の多数のNAS手法を上回った。
  • 本フレームワークは、ランダムサーチ(RS)と比較して、より均一で広範なパレートフロントを達成し、特にADCでは範囲と多様性に優れた結果を示した。
  • 事前学習済み共有モデルにより、わずか50ステップで高速収束が達成され、探索時と独立した訓練時の精度の間に高い相関(高い検証精度に裏付けられる)が示された。
  • 3目的のCIFAR-10において、ADFおよびADCはRSを上回り、M-DFと同等の性能を示したが、ADCはパレートフロントの右側でより広範なカバレッジを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。