Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-objective Neural Architecture Search via Non-stationary Policy Gradient

Zewei Chen, Fengwei Zhou|arXiv (Cornell University)|2020. 01. 23.
Advanced Multi-Objective Optimization Algorithms참고 문헌 48인용 수 6
한 줄 요약

이 논문은 다목적 신경망 아키텍처 탐색(NAS)에서 전체 파레토 최적 해를 효율적으로 근사하기 위해 비정상 정책 기울기(non-stationary policy gradients)를 사용하는 강화학습 프레임워크인 NPG-NAS를 제안한다. 적응형 보상 함수(ADF 및 ADC)와 탐색을 위한余弦 온도 감쇠(cosine temperature decay)를 도입함으로써 빠른 수렴과 높은 정확도를 달성하였으며, CIFAR-10, CIFAR-100, ImageNet에서 기존 방법들을 능가하는 파레토 커버리지와 최신 기술 수준의 성능을 기록했고, 모델 크기는 감소시켰다.

ABSTRACT

Multi-objective Neural Architecture Search (NAS) aims to discover novel architectures in the presence of multiple conflicting objectives. Despite recent progress, the problem of approximating the full Pareto front accurately and efficiently remains challenging. In this work, we explore the novel reinforcement learning (RL) based paradigm of non-stationary policy gradient (NPG). NPG utilizes a non-stationary reward function, and encourages a continuous adaptation of the policy to capture the entire Pareto front efficiently. We introduce two novel reward functions with elements from the dominant paradigms of scalarization and evolution. To handle non-stationarity, we propose a new exploration scheme using cosine temperature decay with warm restarts. For fast and accurate architecture evaluation, we introduce a novel pre-trained shared model that we continuously fine-tune throughout training. Our extensive experimental study with various datasets shows that our framework can approximate the full Pareto front well at fast speeds. Moreover, our discovered cells can achieve supreme predictive performance compared to other multi-objective NAS methods, and other single-objective NAS methods at similar network sizes. Our work demonstrates the potential of NPG as a simple, efficient, and effective paradigm for multi-objective NAS.

연구 동기 및 목표

  • 다목적 신경망 아키텍처 탐색(NAS)에서 전체 파레토 최적 해를 효율적이고 정확하게 근사하는 데 도전한다.
  • 스칼라화 및 진화적 방법의 한계를 극복한다. 이러한 방법들은 다수의 실행이 필요하거나 높은 탐색 비용과 편향 문제를 야기한다.
  • 단일 학습 런에서 동적으로 정책을 적응시켜 다양한 파레토 최적 아키텍처를 탐색할 수 있는 통합된 RL 기반 프레임워크를 개발한다.
  • 지속적으로 정밀 조정되는 사전 훈련된 공유 모델을 사용해 아키텍처 평가 속도와 정확도를 향상시킨다.

제안 방법

  • ADF(대상 기반 선호도)와 ADC(파레토 지배 기반)라는 두 가지 새로운 비정상 보상 함수를 도입한다. ADF는 점진적 스칼라화를 위해 사용되고, ADC는 파레토 최적 해의 밴드별 확장을 위해 사용된다.
  • 보상 함수가 시간이 지남에 따라 변화하는 비정상 정책 기울기 프레임워크를 활용하여 지속적인 정책 적응을 이끌어낸다.
  • 비정상 학습 중 탐색과 이용의 균형을 이루기 위해 온도 감쇠와 함께 온도를 재설정하는 코사인 감쇠를 적용한다.
  • 각 아키텍처 샘플이 들어올 때마다 지속적으로 미세조정되는 사전 훈련된 공유 모델을 사용하여 신속하고 정확한 검증 정확도 추정을 가능하게 한다.
  • 셀 기반 탐색 공간에서 아키텍처를 생성하는 컨트롤러 정책을 활용하며, 보상은 파레토 지배 또는 스칼라화된 목표에 기반한다.
  • 정책이 점차적으로 진정한 파레토 최적 해를 지배하거나 근접하는 아키텍처를 생성하도록 엔드 투 엔드 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1비정상 정책 기울기 프레임워크는 단일 학습 런으로 다목적 NAS에서 전체 파레토 최적 해를 효과적으로 근사할 수 있는가?
  • RQ2제안된 ADF 및 ADC 보상 함수는 전통적 스칼라화 및 진화적 방법에 비해 파레토 최적 해 커버리지와 다양성 측면에서 어떻게 비교되는가?
  • RQ3온도 감쇠와 함께 온도 재설정을 적용한 코사인 감쇠는 비정상 RL을 통한 NAS에서 탐색을 얼마나 향상시키는가?
  • RQ4지속적으로 정밀 조정되는 사전 훈련된 공유 모델을 사용한 아키텍처 평가의 정확도와 속도는 초기부터 훈련하는 것과 비교해 얼마나 뛰어난가?
  • RQ5NPG-NAS를 통해 발견된 아키텍처는 ImageNet 전이 학습과 같은 후행 작업에 잘 일반화되는가?

주요 결과

  • ADF-L은 573만 개의 파라미터로 CIFAR-100에서 83.99%의 정확도를 기록했으며, DenseNet-BC에 비해 77.61% 적은 파라미터를 사용했다.
  • ADC-L10과 ADF-L100은 DPP-Net-PNAS에 비해 더 높은 상위-1 정확도를 기록했고, 파라미터 수는 그의 1/10에 불과했다.
  • NPG-NAS는 CIFAR-10과 CIFAR-100에서 유한한 셀을 ImageNet으로 전이하여 789만 개의 파라미터로 76.67%의 상위-1 정확도를 달성했으며, 유사한 크기의 대부분의 NAS 방법들을 능가했다.
  • 이 프레임워크는 랜덤 탐색(RS)보다 더 균일하고 확장된 파레토 최적 해를 달성했으며, 특히 ADC의 경우 범위와 다양성이 뛰어났다.
  • 사전 훈련된 공유 모델은 단지 50단계 만으로도 빠른 수렴을 이끌었고, 탐색 기간 동안의 정확도와 독립적인 훈련 정확도 사이에 높은 상관관계(강한 검증 정확도로 암시됨)를 보였다.
  • 3목적 CIFAR-10에서 ADF와 ADC는 RS를 능가했고, M-DF와 유사한 성능을 보였으며, ADC는 파레토 최적 해의 오른쪽 측면에서 더 넓은 커버리지를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.