[논문 리뷰] Neural Architecture Search using Deep Neural Networks and Monte Carlo Tree Search
이 논문은 다단계 메타-DNN을 사용해 네트워크 정확도를 예측하고, 분산된 전이 학습 기반 롤아웃 전략을 통해 평가 비용을 줄이는 몬테 카를로 트리 검색(MCTS)-기반 신경망 아키텍처 탐색 에이전트인 AlphaX를 제안한다. 12개의 GPU 일과 1,000개의 샘플을 사용해 AlphaX는 CIFAR-10에서 97.84%의 top-1 정확도와 ImageNet에서 75.5%의 정확도를 달성했으며, 정확도와 샘플 효율성 측면에서 기존의 최고 성능(NAS) 방법을 모두 능가한다.
Neural Architecture Search (NAS) has shown great success in automating the design of neural networks, but the prohibitive amount of computations behind current NAS methods requires further investigations in improving the sample efficiency and the network evaluation cost to get better results in a shorter time. In this paper, we present a novel scalable Monte Carlo Tree Search (MCTS) based NAS agent, named AlphaX, to tackle these two aspects. AlphaX improves the search efficiency by adaptively balancing the exploration and exploitation at the state level, and by a Meta-Deep Neural Network (DNN) to predict network accuracies for biasing the search toward a promising region. To amortize the network evaluation cost, AlphaX accelerates MCTS rollouts with a distributed design and reduces the number of epochs in evaluating a network by transfer learning, which is guided with the tree structure in MCTS. In 12 GPU days and 1000 samples, AlphaX found an architecture that reaches 97.84\% top-1 accuracy on CIFAR-10, and 75.5\% top-1 accuracy on ImageNet, exceeding SOTA NAS methods in both the accuracy and sampling efficiency. Particularly, we also evaluate AlphaX on NASBench-101, a large scale NAS dataset; AlphaX is 3x and 2.8x more sample efficient than Random Search and Regularized Evolution in finding the global optimum. Finally, we show the searched architecture improves a variety of vision applications from Neural Style Transfer, to Image Captioning and Object Detection.
연구 동기 및 목표
- 기존 신경망 아키텍처 탐색(NAS) 방법의 높은 계산 비용과 낮은 샘플 효율성 문제를 해결한다.
- MCTS를 통한 온라인 성능 모델링을 통합해 적응형 탐색과 이용을 가능하게 하여 탐색 효율성을 향상시킨다.
- MCTS 트리 구조를 기반으로 유도된 전이 학습과 롤아웃 샘플링을 통해 후보 아키텍처 평가 비용을 감소시킨다.
- 실용적인 계산 예산 내에서 CIFAR-10과 ImageNet에서 최고 성능을 달성한다.
- 검색된 아키텍처가 스타일 전이, 객체 검출, 이미지 캡션 생성 등 다양한 시각 작업으로의 일반화 능력을 입증한다.
제안 방법
- 아키텍처 탐색 중 탐색과 이용의 균형을 이루기 위해 상한 신뢰도 적용 트리(UCT)를 사용한 몬테 카를로 트리 검색(MCTS)을 적용한다.
- 기존 아키텍처에서 학습한 정보를 바탕으로 알려진 아키텍처를 일반화해 예측하는 다단계 메타-DNN을 도입한다.
- 부모 네트워크의 가중치를 기반으로 자식 네트워크를 초기화함으로써 학습 에포크 수를 70에서 20으로 줄이며 정확도를 유지한다.
- 다중 GPU를 활용해 롤아웃을 병렬화함으로써 MCTS를 분산 설계하여 탐색 속도를 가속화한다.
- MCTS 트리 구조를 기반으로 전이 학습과 롤아웃 샘플링을 유도하여 유망한 탐색 영역을 우선순위로 지정한다.
- 다양한 정확도 범위에 맞는 전용 MLP와 적절한 예측기를 선택하는 게이팅 네트워크를 포함한 계층적 회귀 접근법을 사용해 메타-DNN을 훈련시킨다.
실험 결과
연구 질문
- RQ1MCTS 기반 NAS는 랜덤 검색과 Q-러닝 또는 정규화된 진화와 같은 탐욕적 방법보다 더 높은 샘플 효율성을 달성할 수 있는가?
- RQ2메타-DNN이 신경망 아키텍처의 정확도 예측을 크게 향상시켜 탐색 효율성을 향상시킬 수 있는가?
- RQ3전이 학습과 분산 계산을 통해 NAS에서 후보 아키텍처 평가의 학습 비용을 얼마나 줄일 수 있는가?
- RQ4검색된 아키텍처는 표준 벤치마크를 넘어서 다양한 시각 응용 분야로 일반화될 수 있는가?
- RQ5적응형 탐색과 예측 모델링을 통합하면 고정확도 아키텍처에 더 빨리 수렴할 수 있는가?
주요 결과
- AlphaX는 12개의 GPU 일과 1,000개의 샘플을 사용해 CIFAR-10에서 97.84%의 top-1 정확도와 ImageNet에서 75.5%의 정확도를 달성했으며, 정확도와 샘플 효율성 측면에서 기존 최고 성능(NAS) 방법을 모두 능가했다.
- NASBench-101에서 AlphaX는 랜덤 검색보다 3배, 정규화된 진화보다 2.8배 더 높은 샘플 효율성을 보였다.
- 다단계 메타-DNN은 훈련 세트에서 상관계수 0.784를 기록했으며, 단일 MLP보다 우수했고, RNN 기반 모델 대비 예측 오류를 크게 감소시켰다.
- 전이 학습 덕분에 자식 네트워크는 20 에포크 만에 초기화 없이 학습한 경우와 동일한 정확도를 달성했으며, 평가 비용을 70% 이상 절감했다.
- 검색된 아키텍처인 AlphaX-1은 후행 작업에서 성능 향상을 이끌어냈다: COCO에서 SSD의 mAP는 20.1%에서 23.7%로 상승했고, 이미지 캡션 생성의 BLEU 점수는 최대 4.4점 상승했다.
- 알고리즘 비교 결과, AlphaX는 Q-러닝과 랜덤 검색보다 2.3배 더 빨리 전역 최적해에 도달했으며, 국소 최적해에 갇히기 쉬운 하이클라이밍보다도 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.