Skip to main content
QUICK REVIEW

[논문 리뷰] DC-NAS: Divide-and-Conquer Neural Architecture Search

Yunhe Wang, Yixing Xu|arXiv (Cornell University)|2020. 05. 29.
Advanced Neural Network Applications참고 문헌 43인용 수 4
한 줄 요약

DC-NAS는 수렴 특성 표현을 기반으로 하위 네트워크를 클러스터링하여 평가 정확도를 향상시키는 분할 정복 방식의 신경망 아키텍처 탐색을 제안한다. 각 클러스터에서 최고의 아키텍처를 선택하고 통합함으로써 성능을 향상시킨다. 이는 동일한 FLOPs 제약 조건 하에서 ImageNet에서 75.1%의 top-1 정확도를 달성하며, 최신 기술을 초월한다.

ABSTRACT

Most applications demand high-performance deep neural architectures costing limited resources. Neural architecture searching is a way of automatically exploring optimal deep neural networks in a given huge search space. However, all sub-networks are usually evaluated using the same criterion; that is, early stopping on a small proportion of the training dataset, which is an inaccurate and highly complex approach. In contrast to conventional methods, here we present a divide-and-conquer (DC) approach to effectively and efficiently search deep neural architectures. Given an arbitrary search space, we first extract feature representations of all sub-networks according to changes in parameters or output features of each layer, and then calculate the similarity between two different sampled networks based on the representations. Then, a k-means clustering is conducted to aggregate similar architectures into the same cluster, separately executing sub-network evaluation in each cluster. The best architecture in each cluster is later merged to obtain the optimal neural architecture. Experimental results conducted on several benchmarks illustrate that DC-NAS can overcome the inaccurate evaluation problem, achieving a $75.1\%$ top-1 accuracy on the ImageNet dataset, which is higher than that of state-of-the-art methods using the same search space.

연구 동기 및 목표

  • 기존 신경망 아키텍처 탐색(NAS)에서 빠르게 수렴하는 아키텍처에 편향을 주는 초기 정지의 불안정성과 정확도 문제를 해결하기 위해.
  • 유사한 아키텍처를 클러스터로 묶어 효율적인 비교를 통해 큰 검색 공간의 평가 복잡도를 줄이기 위해.
  • 각 클러스터에서 최고의 아키텍처를 선택하고 통합하여 더 우수한 최종 모델을 구성함으로써 검색 성능을 향상시키기 위해.
  • 수렴 동역학에 기반한 클러스터링이 모든 아키텍처에 동일한 초기 정지를 적용하는 것보다 더 우수한 일반화와 높은 정확도를 이끌어낼 수 있음을 입증하기 위해.

제안 방법

  • 학습 에포크 동안 레이어 출력 특성의 변화를 추적하여 하위 네트워크의 특성 표현을 추출함으로써 수렴 속도와 행동을 캡처한다.
  • 추출된 특성 표현을 사용해 아키텍처 간 유사도를 계산하고 유사한 아키텍처를 함께 그룹화한다.
  • 수렴 동역학에서의 아키텍처 유사도를 기반으로 검색 공간을 K개의 클러스터로 분할하기 위해 k-means 클러스터링을 적용한다.
  • 검증 정확도를 기반으로 한 성능 지표를 사용해 각 클러스터에서 가장 뛰어난 성능을 보이는 하위 네트워크를 선택한다.
  • 각 클러스터에서 최상의 성능을 보이는 모델들을 통합하여 최종 탐색된 아키텍처를 구성한다.
  • 1,000만 개의 아키텍처를 샘플링하기 위해 학습된 연산 확률을 가진 슈퍼넷을 사용하여 특성 추출 및 클러스터링을 수행한다.

실험 결과

연구 질문

  • RQ1수렴 동역학에 기반한 아키텍처 클러스터링이 균일한 초기 정지보다 NAS 평가의 신뢰성을 향상시키는가?
  • RQ2유사한 아키텍처로 이루어진 클러스터로 검색 공간을 분할하면 더 나은 최종 모델 성능을 얻을 수 있는가?
  • RQ3분할 정복 전략이 초기 정지 편향으로 인한 열악한 아키텍처 선택 위험을 줄일 수 있는가?
  • RQ4정확도, FLOPs, 지연 시간 측면에서 DC-NAS의 성능이 최신 기술 기반 NAS 방법과 비교해 어떻게 되는가?

주요 결과

  • DC-NAS는 ImageNet 검증 세트에서 75.1%의 top-1 정확도를 달성하여 하드웨어 효율적인 NAS 모델 중 최신 기술 기준을 수립한다.
  • 동일한 FLOPs 제약 조건 하에서 기준 방법인 FBNet에 비해 검색 성능을 1.5–2.0% 향상시킨다.
  • 총 검색 비용은 231 GPU 시간으로, 기준 방법인 FBNet 대비 1.07배 뿐이므로 추가 비용이 거의 없다.
  • 최고의 DC-NAS 모델의 지연 시간(ARM 기준 118.12ms)은 FBNet-C(116.55ms)와 유사하여 뛰어난 하드웨어 효율성을 보여준다.
  • 클러스터 수(K)를 5를 초과해 늘여도 성능 향상이 없음을 확인하여, K=5가 효과적인 클러스터링을 위해 충분함을 시사한다.
  • 수렴 행동은 아키텍처 구조 이외의 요소로서도 최종 성능을 강력하게 예측할 수 있음을 입증하여, 초기 정지 편향을 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.