Skip to main content
QUICK REVIEW

[論文レビュー] Learning to reinforcement learn for Neural Architecture Search

Jorge Gomez-Robles, Joaquin Vanschoren|arXiv (Cornell University)|Nov 9, 2019
Adversarial Robustness in Machine Learning参考文献 16被引用数 14
ひとこと要約

本稿では、複数の画像分類データセットを横断して転送可能な方策を学習する深層メタ強化学習(メタRL)フレームワークを提案する。初期学習済みの戦略を再訓練するのではなく適応することで、リソース制約下でも優れた性能を発揮し、未学習のデータセットに対しても効果的に一般化する。標準RLを上回るアーキテクチャ品質を達成するとともに、学習中に適応的行動を示す。

ABSTRACT

Reinforcement learning (RL) is a goal-oriented learning solution that has proven to be successful for Neural Architecture Search (NAS) on the CIFAR and ImageNet datasets. However, a limitation of this approach is its high computational cost, making it unfeasible to replay it on other datasets. Through meta-learning, we could bring this cost down by adapting previously learned policies instead of learning them from scratch. In this work, we propose a deep meta-RL algorithm that learns an adaptive policy over a set of environments, making it possible to transfer it to previously unseen tasks. The algorithm was applied to various proof-of-concept environments in the past, but we adapt it to the NAS problem. We empirically investigate the agent's behavior during training when challenged to design chain-structured neural architectures for three datasets with increasing levels of hardness, to later fix the policy and evaluate it on two unseen datasets of different difficulty. Our results show that, under resource constraints, the agent effectively adapts its strategy during training to design better architectures than the ones designed by a standard RL algorithm, and can design good architectures during the evaluation on previously unseen environments. We also provide guidelines on the applicability of our framework in a more complex NAS setting by studying the progress of the agent when challenged to design multi-branch architectures.

研究の動機と目的

  • NASにおける新しいデータセットごとに強化学習(RL)エージェントを再訓練する高コストな課題に対処すること。
  • 多様なデータセットを横断して汎用的な方策を学習するメタRLエージェントを構築することで、NASにおける転移学習を可能にすること。
  • メタRLエージェントが学習中に戦略を適応的に変更でき、追加のトレーニングなしに未学習のデータセットに一般化できるかどうかを評価すること。
  • マルチブランチニューラルネットワークのようなより複雑なアーキテクチャへのフレームワークのスケーラビリティを調査すること。
  • リソース制約下での実世界のNAS設定においてメタRLを適用するための実用的ガイドラインを提供すること。

提案手法

  • 本手法は、難易度の異なる複数の画像分類データセットを表す環境の集合に対して確率的方策を学習する深層メタRLアルゴリズムを採用する。
  • エージェントは、アーキテクチャ探索プロセスにおける時間的依存性をモデル化するため、再帰的ニューラルネットワーク(LSTM)を用いる。これにより、探索ステップ間で文脈を維持できる。
  • 方策は、複数のタスク全体でのパフォーマンス最適化を目的としたメタ学習目的関数を組み合わせた、変更されたアドバンテージアクターキャリブレーション(A2C)アルゴリズムで訓練される。
  • フレームワークは、段階的に難易度が上がる3つのデータセット(CIFAR-10, CIFAR-100, ImageNet-100)を含むメタデータセットを用いて、多様な探索環境をシミュレートする。
  • 評価では、固定された方策を2つの新たな未学習データセットに適用し、ゼロショット一般化能力をテストする。
  • 行動空間は、基本ブロックの事前定義された探索空間に基づいて選択されるチェーン構造のニューラルアーキテクチャに対して定義される。

実験結果

リサーチクエスチョン

  • RQ1メタRLエージェントは、NASにおける複数の画像分類データセットにわたって転送可能な方策を学習できるか?
  • RQ2リソース制約下にあっても、メタRLエージェントはデータセットの難易度に応じて学習中に戦略を適応的に変更するか?
  • RQ3両者とも未学習のデータセットで評価された場合、メタRLエージェントのパフォーマンスは標準RLを上回るか?
  • RQ4メタRLフレームワークは、マルチブランチニューラルネットワークのようなより複雑なアーキテクチャへ拡張可能か?
  • RQ5ハイパーパrameter設定やアーキテクチャの変更により、複雑な探索空間におけるエージェントの探索と適応性がどのように向上するか?

主な発見

  • リソース制約下でも、メタRLエージェントは標準RLを上回る性能を示し、学習中に適応的行動を示すことで、より優れた性能のニューラルアーキテクチャを設計した。
  • メタRLエージェントは、データセットの難易度に応じて戦略を適応的に変更する行動を示し、これがパフォーマンスの向上に寄与した。
  • 2つの未学習のデータセットで評価した結果、固定された方策が人間が設計したベースラインよりも高いかつ一貫性のある正確性を達成した。
  • マルチブランチ設定では、エージェントがブランチ構造を十分に探索できず、結果としてチェーン構造のネットワークに限定されてしまうなど、探索の限界が明らかになった。
  • メタRLエージェントの学習プロセスは遅く、初期の長期間にわたる探索フェーズが見られた。これは、特にj, η, およびαのハイパーパrameterチューニングが訓練効率を向上させる可能性を示唆している。
  • データセットサイズと報酬推定の計算的緩和策が原因で、複数のデータセットでネットワーク性能が低く抑えられた。これは、コスト削減戦略が最終的なモデル品質に影響を及える可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。