Skip to main content
QUICK REVIEW

[논문 리뷰] Multinomial Distribution Learning for Effective Neural Architecture Search

Xiawu Zheng, Rongrong Ji|arXiv (Cornell University)|2019. 05. 18.
Advanced Neural Network Applications참고 문헌 32인용 수 15
한 줄 요약

이 논문은 MdeNAS를 제안하며, 이는 신경망 아키텍처 탐색을 다항분포 학습 문제로 재구성하는 새로운 신경망 아키텍처 탐색 방법이다. 여기서 노드 간 연산은 높은 기대 성능를 위해 최적화된 학습된 분포에서 샘플링된다. 성능 순위 가설을 활용하여 학습을 조기에 종료할 수 있도록 함으로써, MdeNAS는 단지 4 GPU 시간과 2 GPU 일의 컴퓨팅 시간으로 CIFAR-10(2.55% 테스트 오차)과 ImageNet(75.2% top-1 정확도)에서 최신 기준 성능을 달성하며, 이는 이전 방법들에 비해 계산 비용을 크게 감소시킨다.

ABSTRACT

Architectures obtained by Neural Architecture Search (NAS) have achieved highly competitive performance in various computer vision tasks. However, the prohibitive computation demand of forward-backward propagation in deep neural networks and searching algorithms makes it difficult to apply NAS in practice. In this paper, we propose a Multinomial Distribution Learning for extremely effective NAS,which considers the search space as a joint multinomial distribution, i.e., the operation between two nodes is sampled from this distribution, and the optimal network structure is obtained by the operations with the most likely probability in this distribution. Therefore, NAS can be transformed to a multinomial distribution learning problem, i.e., the distribution is optimized to have a high expectation of the performance. Besides, a hypothesis that the performance ranking is consistent in every training epoch is proposed and demonstrated to further accelerate the learning process. Experiments on CIFAR10 and ImageNet demonstrate the effectiveness of our method. On CIFAR-10, the structure searched by our method achieves 2.55% test error, while being 6.0x (only 4 GPU hours on GTX1080Ti) faster compared with state-of-the-art NAS algorithms. On ImageNet, our model achieves 75.2% top1 accuracy under MobileNet settings (MobileNet V1/V2), while being 1.2x faster with measured GPU latency. Test code with pre-trained models are available at https://github.com/tanglang96/MDENAS

연구 동기 및 목표

  • 기존 신경망 아키텍처 탐색(NAS) 방법이 각 후보 아키텍처에 대해 광범위한 학습과 검증을 요구하는 높은 계산 비용 문제를 해결한다.
  • 기존 NAS의 비효율성을 해결하기 위해, 성능 평가를 위해 전체 수렴을 기다리는 방식을 개선한다.
  • 대규모 데이터셋인 ImageNet과 같은 환경에서 적용 가능한, 최소한의 메모리 및 컴퓨팅 오버헤드를 갖춘 빠르고 정확한 아키텍처 탐색 방법을 개발한다.
  • 아키텍처 간 성능 순위가 학습 에포크 전반에 걸쳐 일관되게 유지된다는 새로운 가설을 검증한다. 이를 통해 조기 평가가 가능하다.
  • 연산에 대한 다항분포를 직접 학습하여 효율적으로 고성능 아키텍처를 탐색할 수 있는 탐색 알고리즘을 설계한다.

제안 방법

  • 노드 간 연산에 대한 공동 다항분포로 NAS 탐색 공간을 정의하며, 각 연산은 이 분포에서 샘플링된다.
  • 조기 학습 에포크에서의 성능 피드백을 사용하여 분포의 파라미터를 최적화하며, 열악한 성능의 연산에서 성능이 우수한 연산으로 확률 질량을 이동시킨다.
  • 성능 순위 가설 도입: 어떤 아키텍처 A가 어떤 학습 에포크에서 아키텍처 B를 능가한다면, 전체 수렴 후에도 그럴 가능성이 높다. 이를 통해 조기 종료가 가능하다.
  • 기울기 기반 업데이트를 사용하여 다항분포 파라미터를 학습하며, 샘플링된 아키텍처의 기대 성능를 최대화한다.
  • 학습된 분포를 사용하여 탐색 중에 전체 학습 없이도 최종 아키텍처를 직접 샘플링한다.
  • CIFAR-10에서 탐색을 수행하고 최적의 셀을 ImageNet으로 이식하며, 공정한 비교를 위해 MobileNet 스타일 제약 조건을 적용한다.

실험 결과

연구 질문

  • RQ1조기 학습 에포크에서 아키텍처 성능 순위를 신뢰성 있게 예측할 수 있는가? 이를 통해 NAS에서 조기 종료가 가능한가?
  • RQ2NAS를 계산 비용을 줄이기 위해 다항분포 학습 문제로 효과적으로 재구성할 수 있는가?
  • RQ3연산에 대한 분포를 학습하는 것이 강화학습 또는 미분가능한 NAS보다 더 나은 아키텍처 탐색을 이끌 수 있는가?
  • RQ4CIFAR-10에서 탐색한 모델이 ImageNet에 성공적으로 이식되어 경쟁력 있는 성능과 낮은 지연 시간을 달성할 수 있는가?
  • RQ5제안된 방법이 이전 방법들에 비해 훨씬 적은 GPU 시간과 메모리 소비로 ImageNet에서 최신 기준 정확도를 달성할 수 있는가?

주요 결과

  • CIFAR-10에서 MdeNAS는 단일 GTX1080Ti에서 4 GPU 시간으로 2.55% 테스트 오차를 달성하며, 최신 기준 NAS 방법 대비 6.0배 빠른 속도 향상을 보였다.
  • MobileNet 설정 하에서 ImageNet에서는 75.2% top-1 정확도를 기록했으며, ProxylessNAS(74.8%)와 ShuffleNetV2(72.6%)를 모두 능가했고, 측정된 GPU 지연 시간에서 1.2배 빠른 성능를 보였다.
  • ImageNet에서의 탐색 시간은 2 GPU 일로 줄었으며, ProxylessNAS의 4 GPU 일 대비 크게 감소했고, 메모리 소비도 현저히 낮았다.
  • 다양한 네트워크와 학습 에포크 전반에 걸쳐 성능 순위 가설이 유지되어, 아키텍처 비교를 위한 조기 평가의 타당성이 입증되었다.
  • 동일한 탐색 공간에서 랜덤 탐색을 수행한 백본의 오차율은 3.49%였으며, 이는 MdeNAS의 뛰어난 성능가 그 효율적인 탐색 메커니즘에서 기인하며, 단지 탐색 공간의 품질 때문이 아니라는 것을 시사한다.
  • 이 방법은 대부분의 이전 NAS 방법들이 계산 비용으로 인해 불가능한 ImageNet에서의 직접 탐색을 가능하게 하여, 확장성과 실용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.