Skip to main content
QUICK REVIEW

[논문 리뷰] Improving One-shot NAS by Suppressing the Posterior Fading

Xiang Li, Lin Chen|arXiv (Cornell University)|2019. 10. 06.
Video Surveillance and Tracking Methods참고 문헌 33인용 수 9
한 줄 요약

이 논문은 Posterior Convergent NAS (PC-NAS)를 제안하며, 가중치 공유 NAS에서 발생하는 사후 확률 흐림 현상을 동적 부분 모델 풀을 통한 점진적 탐색 공간 축소 방식으로 완화하는 one-shot 신경망 아키텍처 탐색 방법이다. 사전 확률을 진짜 파rameter 사후 확률에 가깝게 유도함으로써, PC-NAS는 엄격한 지연 시간 제약 조건을 유지하면서도 상태의 최고 성능을 달성한다. 작은 탐색 공간에서는 ImageNet에서 76.8%의 top-1 정확도를, 큰 탐색 공간에서는 78.1%를 기록했으며, 객체 검출 및 재식별 작업으로의 전이성 또한 뛰어나다.

ABSTRACT

There is a growing interest in automated neural architecture search (NAS). To improve the efficiency of NAS, previous approaches adopt weight sharing method to force all models share the same set of weights. However, it has been observed that a model performing better with shared weights does not necessarily perform better when trained alone. In this paper, we analyse existing weight sharing one-shot NAS approaches from a Bayesian point of view and identify the posterior fading problem, which compromises the effectiveness of shared weights. To alleviate this problem, we present a practical approach to guide the parameter posterior towards its true distribution. Moreover, a hard latency constraint is introduced during the search so that the desired latency can be achieved. The resulted method, namely Posterior Convergent NAS (PC-NAS), achieves state-of-the-art performance under standard GPU latency constraint on ImageNet. In our small search space, our model PC-NAS-S attains 76.8 % top-1 accuracy, 2.1% higher than MobileNetV2 (1.4x) with the same latency. When adopted to the large search space, PC-NAS-L achieves 78.1 % top-1 accuracy within 11ms. The discovered architecture also transfers well to other computer vision applications such as object detection and person re-identification.

연구 동기 및 목표

  • 초기 모델 수가 증가함에 따라 KL 발산이 증가함으로써 공유 가중치가 진짜 모델 성능을 반영하지 못하는 one-shot NAS에서의 사후 확률 흐림 문제를 해결한다.
  • 사전 확률을 진짜 파rameter 사후 확률에 가깝게 유도함으로써 공유 가중치의 예측 정확도를 향상시켜 아키텍처 순위 매기기 성능을 향상시킨다.
  • 높은 성능과 다양한 비전 작업 간 전이성을 유지하면서도 엄격한 지연 시간 제약 조건을 충족하는 효율적인 아키텍처 탐색을 가능하게 한다.
  • 기존 one-shot 및 진화적 탐색 방법보다 뛰어난 성능을 보이며, 표준 GPU 지연 시간 제약 조건 하에서도 실용적이고 확장 가능한 NAS 프레임워크를 개발한다.

제안 방법

  • 일방적인 NAS를 베이지안 모델 선택 문제로 재정의하여, 확률적 관점에서 가중치 공유의 한계를 분석한다.
  • 사후 확률 흐림을 핵심 문제로 규명: 슈퍼그래프 내 모델 수가 증가함에 따라 진짜 사후 확률과 사전 사후 확률 간 KL 발산이 증가한다.
  • 점진적으로 탐색 공간을 축소하는 다단계 학습 프로세스를 도입하며, 높은 잠재력이 있는 부분 모델 풀을 유지하고 업데이트한다.
  • 각 학습 간격마다 풀에서 부분 모델을 샘플링하고, 이를 전체 모델로 확장한 후 재평가하여 새로운 최상위 후보 모델 풀을 구성한다.
  • 최종 아키텍처가 목표 추론 속도를 충족하도록 탐색 중에 하드 지연 시간 제약 조건을 적용한다.
  • 축소된 탐색 공간을 활용해 사후 확률 수렴을 향상시켜, 공유 가중치 성능 추정의 신뢰도를 높인다.

실험 결과

연구 질문

  • RQ1왜 one-shot NAS에서 공유 가중치는 개별 아키텍처의 진짜 성능을 예측하지 못하는가?
  • RQ2슈퍼그래프 내 모델 수가 증가할수록 진짜 파rameter 사후 확률과 사전 사후 확률 간의 발산은 어떻게 영향을 받는가?
  • RQ3동적이고 점진적인 탐색 공간 축소 전략은 사후 확률 수렴과 아키텍처 순위 매기기 정확도를 향상시킬 수 있는가?
  • RQ4엄격한 지연 시간 제약 조건 하에서 제안된 방법은 표준 one-shot 및 진화적 탐색 방법보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ5발견된 아키텍처는 객체 검출 및 인물 재식별과 같은 후행 작업으로 얼마나 잘 전이되는가?

주요 결과

  • PC-NAS-S는 MobileNetV2와 동일한 지연 시간(1.4x)을 유지하면서 ImageNet에서 76.8%의 top-1 정확도를 달성했으며, 이는 2.1% 높은 성능이며 EfficientNet-B0보다 20% 더 빠르다.
  • 더 큰 탐색 공간에서 PC-NAS-L은 11ms 이내의 지연 시간 내에 78.1%의 top-1 정확도를 기록했으며, 동일 조건에서 이전 최고 성능을 초월했다.
  • 공유 가중치 정확도와 독립 정확도 간 피어슨 상관계수는 One-Shot의 0.11에서 PC-NAS의 0.92로 상승하여 예측 능력이 크게 향상됨을 보여준다.
  • 진화적 탐색과 조합했을 때, PC-NAS로 학습된 슈퍼그래프는 75.9%의 top-1 정확도를 기록했으며, 이는 PC-NAS-L보다 2.2% 낮지만 표준 탐색 전략보다 메서드의 우수성을 입증한다.
  • PC-NAS-L의 백본은 COCO 객체 검출에서 38.5 mAP, Market-1501 재식별에서 81.0% mAP를 기록했으며, 파라미터 수가 적고 추론 속도가 더 빠르면서도 MobileNetV2를 능가하고 ResNet101 수준에 가까운 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.