Skip to main content
QUICK REVIEW

[논문 리뷰] Balanced One-shot Neural Architecture Optimization

Renqian Luo, Tao Qin|arXiv (Cornell University)|2019. 09. 24.
Advanced Neural Network Applications참고 문헌 21인용 수 9
한 줄 요약

이 논문은 초기화된 한 번의 신경망 아키텍처 탐색(One-shot Neural Architecture Search, NAO)을 향상시키기 위해 슈퍼넷 학습 중에 아키텍처를 그 모델 크기에 비례하여 샘플링하는 방법인 균형 잡힌 한 번의 신경망 아키텍처 최적화(Balanced NAO)를 제안한다. 이는 크기가 다른 아키텍처 간의 최적화를 균형 있게 만들며, 한 번의 학습과 전체 학습 간의 순위 상관관계를 크게 향상시켜 더 정확하고 안정적인 아키텍처 탐색을 가능하게 한다. 이로 인해 CIFAR-10에서 2.60%의 테스트 오차와 모바일 설정에서 ImageNet에서 74.4%의 Top-1 정확도를 달성한다.

ABSTRACT

The ability to rank candidate architectures is the key to the performance of neural architecture search~(NAS). One-shot NAS is proposed to reduce the expense but shows inferior performance against conventional NAS and is not adequately stable. We investigate into this and find that the ranking correlation between architectures under one-shot training and the ones under stand-alone full training is poor, which misleads the algorithm to discover better architectures. Further, we show that the training of architectures of different sizes under the current one-shot method is imbalanced, which causes the evaluated performances of the architectures to be less predictable of their ground-truth performances and affects the ranking correlation heavily. Consequently, we propose Balanced NAO where we introduce balanced training of the supernet during the search procedure to encourage more updates for large architectures than small architectures by sampling architectures in proportion to their model sizes. Comprehensive experiments verify that our proposed method is effective and robust which leads to a more stable search. The final discovered architecture shows significant improvements against baselines with a test error rate of 2.60\% on CIFAR-10 and top-1 accuracy of 74.4% on ImageNet under the mobile setting. Code and model checkpoints will be publicly available. The code is available at github.com/renqianluo/NAO_pytorch.

연구 동기 및 목표

  • 기존의 한 번의 NAS 방법이 전통적 NAS에 비해 성능이 열 劣하고 불안정한 문제를 해결하기 위해.
  • 왜 한 번의 NAS가 한 번의 학습과 전체 학습 평가 간의 순위 상관관계를 유지하지 못하는지 조사하기 위해.
  • 작은 아키텍처가 큰 아키텍처에 비해 과도하게 최적화되는 불균형한 학습이 순위 정밀도를 떨어뜨린다는 것을 규명하기 위해.
  • 모델 크기에 비례하여 아키텍처를 샘플링함으로써 최적화 불균형을 줄이고 순위 상관관계 및 탐색 안정성을 향상시키는 균형 잡힌 학습 전략을 제안하기 위해.
  • 균형 잡힌 샘플링이 CIFAR-10 및 ImageNet과 같은 벤치마크 데이터셋에서 더 나은 일반화 및 성능을 이끌어내는지 증명하기 위해.

제안 방법

  • 슈퍼넷 학습 중에 아키텍처를 그 모델 크기에 비례하는 확률로 샘플링하는 비례 샘플링을 도입한다.
  • 더 큰 아키텍처가 크기에 비례하여 더 많은 학습 업데이트를 받도록 한 번의 NAS 학습 절차를 수정하여 최적화 불균형을 줄인다.
  • 모든 후보 아키텍처에 걸쳐 가중치 공유를 하는 표준 슈퍼넷 아키텍처를 유지한다.
  • 기본 한 번의 NAS 방법과 동일한 검색 및 평가 프로토콜을 사용하며, 샘플링 전략 이외에는 차이가 없다.
  • 고정된 스텝 수로 슈퍼넷을 학습하고, 한 번의 성능을 사용하여 후보 아키텍처를 순위 매기고 선택한다.
  • 동일한 DARTS 학습 프로토콜을 사용하여 최종으로 발견된 아키텍처를 ImageNet으로 이식하여 공정한 비교를 수행한다.

실험 결과

연구 질문

  • RQ1기존의 한 번의 NAS 방법은 학습 비용을 줄였음에도 불구하고 왜 높은 성능의 아키텍처를 탐색하지 못하는가?
  • RQ2크기가 다른 아키텍처 간의 최적화 불균형이 한 번의 학습과 전체 학습 간의 순위 상관관계를 어느 정도 악화시키는가?
  • RQ3모델 크기에 기반한 비례 샘플링이 한 번의 NAS에서 순위 상관관계와 탐색 안정성을 향상시킬 수 있는가?
  • RQ4균형 잡힌 샘플링을 통해 탐색된 아키텍처의 성능은 CIFAR-10 및 ImageNet에서 기존의 NAS 및 다른 한 번의 NAS 방법과 비교해 어떻게 되는가?
  • RQ5제안된 방법은 ImageNet과 같은 대규모 데이터셋으로 이식되었을 때도 강력한 일반화 성능을 유지하는가?

주요 결과

  • 비례 샘플링 하에서 한 번의 학습과 전체 학습 간의 순위 상관관계가 크게 향상되었으며, 균형 잡힌 샘플링 대비 10점 이상의 이중 정확도 향상을 보였다.
  • 제안된 균형 잡힌 NAO는 CIFAR-10에서 2.60%의 테스트 오차율을 기록하여 기준 한 번의 NAS 방법을 초월했으며, 기존의 전통적 NAS 방법과 동등한 성능을 달성했다.
  • 모바일 설정에서 ImageNet에서는 발견된 아키텍처가 Top-1 정확도 74.4%를 기록하여 인간이 설계한 모델을 뛰어넘었으며, 최신 기술 수준의 NAS 방법과 비슷한 성능을 보였다.
  • 이 방법은 뛰어난 안정성을 보였으며, 다섯 개의 독립적으로 탐색된 아키텍처 평균 테스트 오차율이 2.67%로 낮은 분산과 일관된 성능을 보였다.
  • 성능 향상의 원인은 균형 잡힌 최적화에 기인하며, 비례 샘플링은 작은 아키텍처의 과적합을 줄이고 한 번의 평가의 대표성을 향상시킨다.
  • 기존의 NAS에 비해 훨씬 낮은 검색 비용으로 경쟁적인 성능을 달성했으며, 다른 한 번의 NAS 접근 방식과 비교해도 성능을 matching하거나 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.