[논문 리뷰] MiLeNAS: Efficient Neural Architecture Search via Mixed-Level Reformulation
MiLeNAS는 이중수준 최적화와 단일수준 최적화를 융합하는 혼합수준 재구성 방식을 제안하여, 기존 이중수준 최적화 방법에서 발생하는 이阶 도함수 근사에 기인한 기울기 오차를 줄이면서도 일阶 최적화의 효율성을 유지한다. 이는 단지 5시간 만에 SOTA 성능을 달성하며, CIFAR-10에서 2.51%의 오차율, ImageNet에서 24.7%의 top-1 오차율을 기록하여 DARTS와 GDAS를 능가한다. 또한 모델 크기 기반 검색 및 조기 정지 전략을 통해 더 빠르고 안정적인 검색을 가능하게 한다.
Many recently proposed methods for Neural Architecture Search (NAS) can be formulated as bilevel optimization. For efficient implementation, its solution requires approximations of second-order methods. In this paper, we demonstrate that gradient errors caused by such approximations lead to suboptimality, in the sense that the optimization procedure fails to converge to a (locally) optimal solution. To remedy this, this paper proposes \mldas, a mixed-level reformulation for NAS that can be optimized efficiently and reliably. It is shown that even when using a simple first-order method on the mixed-level formulation, \mldas\ can achieve a lower validation error for NAS problems. Consequently, architectures obtained by our method achieve consistently higher accuracies than those obtained from bilevel optimization. Moreover, \mldas\ proposes a framework beyond DARTS. It is upgraded via model size-based search and early stopping strategies to complete the search process in around 5 hours. Extensive experiments within the convolutional architecture search space validate the effectiveness of our approach.
연구 동기 및 목표
- 기존 방법에서 이중수준 최적화의 이阶 근사에 기인한 기울기 오차 문제를 해결하기 위해.
- 단일수준 최적화에서 흔히 발생하는 과적합을 방지하는 더 안정적이고 효율적인 NAS 프레임워크를 개발하기 위해.
- 복잡한 이阶 근사에 의존하지 않고도 더 빠른 수렴과 높은 정확도를 달성할 수 있는 신경망 아키텍처 탐색 방법을 개발하기 위해.
- 검색 속도를 높이고 설계 통찰을 제공하는 실용적인 검색 전략—모델 크기 기반 검색 및 조기 정지—를 도입하기 위해.
제안 방법
- 아키텍처 가중치 α에 대해 훈련 손실과 검증 손실을 동시에 최소화하고, 네트워크 가중치 w에 대해 훈련 손실을 최소화하는 혼합수준 최적화 문제로 NAS를 재구성한다.
- 단일수준(λ=0)과 이중수준(λ→∞) 최적화 사이를 연결하는 하이퍼파rameter λ를 도입하여 두 패러다임 간의 부드러운 전이를 가능하게 한다.
- 혼합수준 수식에 대해 일阶 최적화를 적용하여, 이중수준 최적화에서 기인하는 기울기 오차를 피한다.
- 셀당 합성곱 연산 수를 추적하여 모델 크기 기반 검색을 구현함으로써 최적의 파라미터 복잡도 트레이드오���을 유도한다.
- 모델 크기 단계에서 성능 수렴을 관찰함에 기반한 조기 정지 전략을 적용하여 검색 시간을 약 5시간으로 단축시킨다.
- 일반적으로 DARTS 프레임워크를 확장하여, 미분 가능 및 샘플링 기반 검색 공간 모두를 지원한다.
실험 결과
연구 질문
- RQ1혼합수준 최적화 수식이 기울기 오차를 줄이면서도 계산 효율성을 유지할 수 있는가?
- RQ2단일수준과 이중수준 목표를 융합함으로써 순수한 이중수준 또는 단일수준 방법보다 더 나은 일반화 능력과 낮은 검증 오차를 달성할 수 있는가?
- RQ3모델 크기 기반 검색 및 조기 정지 전략이 정확도를 희생시키지 않고 NAS를 크게 가속화할 수 있는가?
- RQ4MiLeNAS는 샘플링 기반 및 미분 가능 NAS 모두를 포함한 다양한 검색 공간에서 효과적으로 작동하는가?
주요 결과
- CIFAR-10에서 MiLeNAS는 검증 오차 2.51% ± 0.11%를 기록하여, 최고 기록인 2.34%에 근접하며 DARTS(2.76%)와 GDAS(2.82%)를 0.2% 이상 뛰어넘었다.
- ImageNet에서는 top-1 오차율 24.7%, top-5 오차율 7.6%를 기록하여, 이중수준 방법보다 1~2%포인트 우수한 성능을 보였다.
- MiLeNAS는 검색 과정을 약 5시간 내에 완료하여, 이阶 이중수준 최적화 방법보다 3배 빠르게 수렴하였다.
- 모델 크기 기반 검색는 350만에서 450만 파라미터 사이에 명확한 성능 정점이 존재함을 드러내어, 이 범위를 초과해 파라미터가 증가해도 정확도 향상이 없음을 시사했다.
- 정상 셀에서 6개의 합성곱, 감소 셀에서 0개의 합성곱에 도달했을 때 성능 수렴을 관찰함에 따라 조기 정지 전략이 효과적으로 작동하여 최종 정확도에 손상 없이 검색을 가속화했다.
- MiLeNAS는 다양한 검색 공간—미분 가능(DARTS) 및 샘플링 기반(GDAS)—에서 모두 뛰어난 성능을 기록함으로써 일반화 적용 가능성의 타당성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.