[논문 리뷰] ASAP: Architecture Search, Anneal and Prune
ASAP는 differentiable, annealable NAS 방법으로, 검색 중 하위 연산을 점진적으로 가지치며 정확도를 유지하면서 검색 시간을 크게 줄인다.
Automatic methods for Neural Architecture Search (NAS) have been shown to produce state-of-the-art network models. Yet, their main drawback is the computational complexity of the search process. As some primal methods optimized over a discrete search space, thousands of days of GPU were required for convergence. A recent approach is based on constructing a differentiable search space that enables gradient-based optimization, which reduces the search time to a few days. While successful, it still includes some noncontinuous steps, e.g., the pruning of many weak connections at once. In this paper, we propose a differentiable search space that allows the annealing of architecture weights, while gradually pruning inferior operations. In this way, the search converges to a single output network in a continuous manner. Experiments on several vision datasets demonstrate the effectiveness of our method with respect to the search cost and accuracy of the achieved model. Specifically, with $0.2$ GPU search days we achieve an error rate of $1.68\%$ on CIFAR-10.
연구 동기 및 목표
- Annealable하고 differentiable한 검색 공간을 도입하여 neural architecture search 시간을 줄인다.
- 검색 단계 동안 약한 연결을 점진적으로 가지치기로 최종 아키텍처의 품질을 향상시킨다.
- 선정된 스케줄에 대한 수렴 보장을 제공하기 위해 어닐링 일정과 가지치기 정책에 이론적 가이드를 제시한다.
- ASAP가 CIFAR-10에서 최첨단 NAS 방법과 경쟁하고 다른 데이터셋으로의 이전 가능성을 보여준다.
제안 방법
- NAS 셀 내 혼합 연산에 대한 differentiable하고 annealable한 검색 공간을 정의한다.
- 각 엣지에서 연산을 선택하기 위해 Gibbs-Boltzmann 유사 분포 Phi_o(alpha; T)를 사용하며, 시간이 지남에 따라 어닐링되는 온도 T를 적용한다.
- 검증 손실에 대한 그래디언트 하강법으로 아키텍처 가중치 alpha를 업데이트하고, 학습 손실에 대해 네트워크 가중치 omega를 업데이트한다.
- Phi_o(alpha; T)를 임계값 theta_t로 임계 처리하여 inferior한 연산을 점진적으로 가지치고, 시간이 지나도 지속적으로 가지치기가 가능하도록 한다.
- 선정된 일정에 대해 (0, δ)-PAC)로 inferior한 연산 가지치기에 대한 이론적 보장(Theorem 2)과 실용적인 지수형 어닐링 일정 제공.
- 학습된 보통 셀과 축소 셀을 쌓아 최종 네트워크를 구성하며, 어닐링과 점진적 가지치기를 활용하는 DARTS 패러다임을 따른다.
실험 결과
연구 질문
- RQ1어닐링 가능한 differentiable 검색 공간이 정확도를 희생하지 않으면서 NAS 효율성을 개선할 수 있는가?
- RQ2검색 중에 연결을 점진적으로 가지치면 종료 시의 하드 가지치기보다 더 빠른 수렴과 더 나은 최종 아키텍처를 얻을 수 있는가?
- RQ3탐색과 수렴의 균형을 맞추기 위해 어닐링 일정과 가지치기 임계값을 어떻게 설계해야 하는가?
- RQ4ASAP가 CIFAR-10에서의 성능과 ImageNet과 같은 더 큰 데이터셋으로의 이전성 측면에서 다른 NAS 방법과 비교해 어떠한가?
주요 결과
- ASAP는 검색 시간을 시간당으로 단축하고 이전의 NAS 방법과 경쟁적이거나 더 나은 CIFAR-10 테스트 오차를 달성할 수 있다(예: ASAP-Large: 1.68% test error).
- ASAP-Small, ASAP-Medium, ASAP-Large는 각각 CIFAR-10에서 1.99%, 1.75%, 1.68%의 테스트 오차를 달성하며 비교적 제한된 검색 비용을 갖는다.
- 이 방법은 검색 중 연속적인 가지치기를 가능하게 하여 에폭 시간 감소와 검색 진행에 따라 희소성을 증가시킨다.
- ASAP는 CIFAR-10에서 다수의 최신 NAS 방법보다 우수한 정확도를 달성하면서 매우 낮은 검색 비용(예: 특정 실행의 경우 GPU 일 0.2)을 유지한다.
- ASAP 아키텍처는 CIFAR-10에서 학습되었고 ImageNet 및 다른 벤치마크로의 이전성이 입증되어 검색된 셀의 이전 가능성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.