Skip to main content
QUICK REVIEW

[논문 리뷰] A Study of the Learning Progress in Neural Architecture Search Techniques

Prabhant Singh, Tobias Jacobs|arXiv (Cornell University)|2019. 06. 18.
Adversarial Robustness in Machine Learning참고 문헌 11인용 수 7
한 줄 요약

이 연구는 효율적인 신경망 아키텍처 탐색(ENAS)에서 제어기의 학습 진전을 분석하기 위해 다양한 학습 에포크에서 생성된 아키텍처의 테스트 정확도를 측정한다. 놀랍게도, 성능 향상이 시간이 지남에 따라 측정되지 않았는데, 초기에 생성된 아키텍처가 수백 개의 에포크 후에 생성된 아키텍처와 동일한 성능을 보였다. 이는 ENAS의 성공이 제어기 학습이 아니라 검색 공간 설계에 기인하며, 일회성 방법이 타당한 대안이 될 수 있음을 시사한다.

ABSTRACT

In neural architecture search, the structure of the neural network to best model a given dataset is determined by an automated search process. Efficient Neural Architecture Search (ENAS), proposed by Pham et al. (2018), has recently received considerable attention due to its ability to find excellent architectures within a comparably short search time. In this work, which is motivated by the quest to further improve the learning speed of architecture search, we evaluate the learning progress of the controller which generates the architectures in ENAS. We measure the progress by comparing the architectures generated by it at different controller training epochs, where architectures are evaluated after having re-trained them from scratch. As a surprising result, we find that the learning curves are completely flat, i.e., there is no observable progress of the controller in terms of the performance of its generated architectures. This observation is consistent across the CIFAR-10 and CIFAR-100 datasets and two different search spaces. We conclude that the high quality of the models generated by ENAS is a result of the search space design rather than the controller training, and our results indicate that one-shot architecture design is an efficient alternative to architecture search by ENAS.

연구 동기 및 목표

  • ENAS의 제어기가 고성능 아키텍처를 생성하는 데 시간이 지남에 따라 향상되는지 조사하기 위해.
  • ENAS의 학습 과정이 생성된 아키텍처의 정확도 향상에 측정 가능한 기여를 하는지 평가하기 위해.
  • ENAS 제어기의 장기적 학습이 최종 모델 성능 향상에 실질적인 이점을 제공하는지 결정하기 위해.
  • 일회성 아키텍처 생성이 정확도를 희생시키지 않고 전체 ENAS 탐색 과정을 대체할 수 있는지 평가하기 위해.

제안 방법

  • 저자는 ENAS 제어기를 여러 에포크 동안 학습시켰고, 학습의 다양한 단계에서 아키텍처를 샘플링하였다.
  • 각 생성된 아키텍처는 전체 훈련 세트를 사용하여 260–310 에포크 동안 다시 훈련시켜 정확한 테스트 정확도를 측정하였다.
  • 첫 번째 에포크에 생성된 아키텍처의 성능을 전체 제어기 학습 후 생성된 아키텍처와 비교하였다.
  • 맥로 및 마이크로 검색 공간을 사용하여 CIFAR-10과 CIFAR-100에서 실험을 수행하였다.
  • 제어기 피드백의 대체 지표로 공유 가중치를 사용한 검증 정확도를 사용했지만, 이와 최종 테스트 정확도 사이의 상관관계를 평가하였다.
  • 공식 ENAS 구현을 사용했으며, CIFAR-100 및 풀링 연산을 지원하기 위해 수정를 가했다.

실험 결과

연구 질문

  • RQ1ENAS 제어기가 제어기 학습 과정 전반에 걸쳐 생성된 아키텍처의 성능이 향상되는가?
  • RQ2공유 가중치를 사용한 검증 정확도와 재훈련된 아키텍처의 최종 테스트 정확도 사이에 측정 가능한 상관관계가 있는가?
  • RQ3전체 ENAS 학습 과정을 완료하지 않고도 고성능 아키텍처를 찾을 수 있는가?
  • RQ4최종 아키텍처의 품질이 검색 공간 설계에 의해 결정되는 정도가 제어기 최적화에 의해 결정되는 정도보다 어느 정도 높은가?

주요 결과

  • ENAS 제어기가 생성한 아키텍처의 테스트 정확도는 시간이 지남에 따라 유의미한 향상이 없었으며, 학습 진전이 관찰되지 않았다.
  • CIFAR-10과 CIFAR-100 양쪽 모두에서 첫 번째 학습 에포크에 생성된 아키텍처가 150–310 에포크의 제어기 학습 후 생성된 아키텍처와 동일한 성능을 보였다.
  • CIFAR-10 매크로 검색 공간의 최종 정확도는 훈련 후 95.38%였고, 초기 상태는 95.81%로 매우 미미한 향상이 있었다.
  • CIFAR-100 매크로 검색 공간의 경우, 초기 정확도는 80.75%였고, 최종 정확도는 80.47%로 일관된 향상이 없었다.
  • 공유 가중치를 사용한 검증 정확도는 재훈련된 모델의 최종 테스트 정확도와 양의 상관관계를 보이지 않았다.
  • 결과적으로, ENAS가 찾은 고성능 모델은 제어기 학습이 아니라 검색 공간 설계 덕분이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.