[논문 리뷰] Efficient Neural Architecture Search via Proximal Iterations
NASP는 보조 네트워크와 이차 근사치를 사용하지 않고도 직접 이산 아키텍처를 최적화하기 위해 보조 반복 기법을 사용하는 새로운 미분 가능 신경망 아키텍처 탐색 방법을 제안한다. 이로 인해 10배 이상의 속도 향상과 기존 최고 수준의 방법들인 DARTS보다 뛰어난 성능을 달성할 수 있으며, 이산 정규화를 통한 제약 최적화 프레임워크를 통해 아키텍처의 무결성과 모델 복잡도 제어를 유지한다.
Neural architecture search (NAS) recently attracts much research attention because of its ability to identify better architectures than handcrafted ones. However, many NAS methods, which optimize the search process in a discrete search space, need many GPU days for convergence. Recently, DARTS, which constructs a differentiable search space and then optimizes it by gradient descent, can obtain high-performance architecture and reduces the search time to several days. However, DARTS is still slow as it updates an ensemble of all operations and keeps only one after convergence. Besides, DARTS can converge to inferior architectures due to the strong correlation among operations. In this paper, we propose a new differentiable Neural Architecture Search method based on Proximal gradient descent (denoted as NASP). Different from DARTS, NASP reformulates the search process as an optimization problem with a constraint that only one operation is allowed to be updated during forward and backward propagation. Since the constraint is hard to deal with, we propose a new algorithm inspired by proximal iterations to solve it. Experiments on various tasks demonstrate that NASP can obtain high-performance architectures with 10 times of speedup on the computational time than DARTS.
연구 동기 및 목표
- 기존의 미분 가능 NAS 방법들이 비용이 많이 들고 성능이 저하되는 문제를 해결하기 위해, 특히 고비용의 보조 네트워크 학습과 이차 근사치에 의존하는 방법들에 대비한다.
- 학습 중에 이산 아키텍처 선택을 강제하면서도 미분 가능성을 유지하는 제약 최적화 문제로 신경망 아키텍처 탐색을 재정의한다.
- 각 레이어당 하나의 활성 연산만 유지하는 안정적인 갱신을 가능하게 하는 보조 반복 기반 효율적인 최적화 알고리즘을 개발한다.
- 모델 복잡도 제어와 더 나은 일반화 및 탐색 효율성을 가능하게 하는 정규화를 도입한다.
- 특히 큰 탐색 공간에서 기존 최고 수준의 방법들인 DARTS보다 더 빠른 수렴 속도와 높은 성능을 달성한다.
제안 방법
- NASP는 각 레이어의 연산에 대한 이산 제약 조건과 모델 복잡도에 대한 정규화를 포함한 제약 최적화 문제로 아키텍처 탐색을 설정한다.
- 비볼록이고 비연속적인 최적화 문제를 해결하기 위해 보조 반복 기법을 사용하며, 안정적이고 효율적인 갱신을 가능하게 한다.
- 보조 단계는 이산 아키텍처 선택(각 레이어당 하나의 연산만 활성화)을 강제하는 닫힌 형태의 해를 도출하여, 이차 근사치가 필요 없음을 보장한다.
- 보조 네트워크를 학습하지 않고도 선택된 연산만 갱신함으로써, 전방 및 역전파 비용을 극적으로 감소시킨다.
- 아키텍처 파라미터를 [0,1] 범위에 유지하기 위해 레이지 업데이트 전략을 도입하여, 표준 보조 알고리즘 대비 수렴성과 안정성을 향상시킨다.
- 학습 중 연산 간의 상호작용을 분리함으로써 간섭을 줄이고, 더 큰 탐색 공간에서 효과적인 탐색을 가능하게 한다.
실험 결과
연구 질문
- RQ1보조 네트워크 학습 없이도 성능이 뛰어나면서 계산 비용을 줄일 수 있는 미분 가능 탐색 방법이 가능한가?
- RQ2보조 반복 기법이 이산 아키텍처 선택을 효과적으로 구현하면서도 미분 가능성과 최적화 효율성을 유지할 수 있는가?
- RQ3아키텍처 탐색에서 이차 근사치를 제거하면 수렴 속도가 빨라지고 성능이 향상되는가?
- RQ4모델 복잡도에 대한 정규화가 NAS에서 일반화 및 탐색 안정성 향상에 기여하는가?
- RQ5DARTS 및 GDAS, BayesNAS와 같은 동시대의 방법들과 비교해 NASP는 속도와 정확도 측면에서 어떻게 성능을 내는가?
주요 결과
- CIFAR-10에서 NASP는 DARTS 대비 10배 이상의 속도 향상을 달성했으며, 검증 정확도 70.4%와 테스트 정확도 69.5%를 기록했다.
- ImageNet에서는 뿌리 33M 파라미터로 71.2%의 상위-1 정확도를 달성했으며, DARTS(71.2% 정확도이지만 더 높은 파라미터 수)를 능가했고 수렴 속도도 더 빠르게 나타났다.
- NASP의 아키텍처 파라미터($\bar{\mathbf{A}}$)는 학습 에포크 수에 따라 변화하는 연산 선택의 진동이 적어 DARTS보다 훨씬 더 안정적인 것으로 확인되었다.
- GDAS와 BayesNAS와 같은 동시대의 방법들보다 NASP는 탐색 효율성과 성능 면에서 모두 뛰어나며, PTB에서의 탐색 비용이 0.1 GPU 일로 GDAS의 0.4 GPU 일보다 낮게 나타났다.
- 제거 실험 결과, 직접적인 보조 갱신은 이산 제약 조건으로 인해 실패하며, 레이지 업데이트 전략이 성능 향상에 필수적임을 확인했다. 이는 표준 보조 알고리즘보다 뛰어난 성능을 내는 것으로 나타났다.
- 이산 아키텍처 갱신이 아키텍처 파라미터의 동역학을 안정화시키므로, 이차 근사치가 필요 없게 되었으며, 이러한 근사치는 더 이상 필요하지 않다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.