[논문 리뷰] Multi-objective Architecture Search for CNNs.
이 논문은 CNN에서 효율적이고 다목적 신경망 아키텍처 탐색을 위한 NASH와 Pareto-NASH를 제안한다. NASH는 네트워크 변형과 공격적인 학습률 스케줄링을 통해 학습 비용을 줄여, CIFAR10에서 3일 만에 4% 미만의 오차를 달성한다. Pareto-NASH는 정확도와 파라미터 수 사이의 파레토 최적 아키텍처를 단일 런으로 탐색할 수 있게 하여, 56 GPU 일 이내에 3.5% 오차와 400만 파라미터를 가진 모델, 또는 4.6% 오차와 100만 파라미터 이하의 모델을 발견한다.
Architecture search aims at automatically finding neural architectures that are competitive with architectures designed by human experts. While recent approaches have come close to matching the predictive performance of manually designed architectures for image recognition, these approaches are problematic under constrained resources for two reasons: first, the architecture search itself requires vast computational resources for most proposed methods. Secondly, the found neural architectures are solely optimized for high predictive performance without penalizing excessive resource consumption. We address the first shortcoming by proposing NASH, an architecture search which considerable reduces the computational resources required for training novel architectures by applying network morphisms and aggressive learning rate schedules. On CIFAR10, NASH finds architectures with errors below 4% in only 3 days. We address the second shortcoming by proposing Pareto-NASH, a method for multi-objective architecture search that allows approximating the Pareto-front of architectures under multiple objective, such as predictive performance and number of parameters, in a single run of the method. Within 56 GPU days of architecture search, Pareto-NASH finds a model with 4M parameters and test error of 3.5%, as well as a model with less than 1M parameters and test error of 4.6%.
연구 동기 및 목표
- CNN을 위한 신경망 아키텍처 탐색(NAS)의 높은 계산 비용을 줄이기 위해.
- 정확도와 모델 크기를 모두 고려하는 효율성 인식 기반 최적화를 통해 NAS에서의 효율성 부족 문제를 해결하기 위해.
- 예측 성능과 파라미터 수의 균형을 이루는 아키텍처를 동시에 탐색할 수 있도록 하기 위해.
- 자원 제약 조건 하에서 효율적으로 확장 가능한 방법을 개발하기 위해.
제안 방법
- NASH는 부모 네트워크에서 효율적으로 새로운 아키텍처를 생성하고 학습하기 위해 네트워크 변형을 활용한다.
- 아키텍처 탐색 중 수렴 속도를 가속화하기 위해 공격적인 학습률 스케줄링을 사용한다.
- Pareto-NASH는 정확도와 파라미터 수 측면에서 다양한 아키텍처를 유지함으로써 NASH를 다목적 최적화로 확장한다.
- 성능과 모델 크기 간의 트레이드오프를 근사하기 위해 단일 탐색 런을 사용한다.
- 다중 목적 기반 평가 및 업데이트를 통해 기저가 되는 기법을 사용하여 아키텍처를 평가한다.
- 변형 기반 파라미터 공유를 통해 아키텍처 간 특징과 기울기를 재사용함으로써 탐색 효율성을 확보한다.
실험 결과
연구 질문
- RQ1성능을 희생시키지 않고 아키텍처 탐색을 상당히 더 효율적으로 만들 수 있는가?
- RQ2단일 탐색 런이 정확도와 모델 크기 간의 트레이드오프를 반영하는 다양한 아키텍처를 식별할 수 있는가?
- RQ3NAS에서 경쟁적인 정확도를 유지하면서 얼마나 많은 계산 비용을 줄일 수 있는가?
- RQ4공격적인 학습률 스케줄링이 아키텍처 탐색에서 수렴 속도를 향상시킬 수 있는가?
- RQ5다목적 NAS 접근법을 사용할 경우 모델 정확도와 파라미터 수 사이의 달성 가능한 트레이드오프는 무엇인가?
주요 결과
- NASH는 단지 3일의 학습으로 CIFAR10에서 4% 이하의 테스트 오차를 달성하여 탐색 시간을 크게 단축시켰다.
- Pareto-NASH는 56 GPU 일 이내에 400만 파라미터와 3.5% 테스트 오차를 가진 모델을 발견했다.
- Pareto-NASH를 사용해 100만 파라미터 이하와 4.6% 테스트 오차를 가진 더 작은 모델도 발견되었다.
- 이전의 NAS 접근법에 비해 상당히 낮은 계산 비용으로도 경쟁 가능한 성능을 달성했다.
- 파레토 프론트 근사치는 여러 성능이 뛰어나고 효율적인 아키텍처를 포함하여 효과적인 트레이드오프 탐색을 보여주었다.
- 네트워크 변형과 공격적인 학습률 스케줄링의 사용은 탐색 중 더 빠른 수렴과 더 낮은 자원 사용을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.