[논문 리뷰] Hierarchical Neural Architecture Search via Operator Clustering
이 논문은 DARTS를 개선하기 위해 상관관계가 있는 연산자를 군집화하고 프oxy 및 최종 학습 단계 간 최적화 복잡도를 일치시키는 계층적 신경망 아키텍처 탐색 방법인 StacNAS를 제안한다. 연산자 상관관계와 깊이/복잡도 불일치 문제를 해결함으로써 StacNAS는 CIFAR-10(2.33% 오차), CIFAR-100, 그리고 ImageNet(24.17% top-1 오차)에서 최신 기술 수준의 정확도를 달성하며, 다양한 탐색 공간에서 DARTS 유사 방법들을 능가한다.
Recently, the efficiency of automatic neural architecture design has been significantly improved by gradient-based search methods such as DARTS. However, recent literature has brought doubt to the generalization ability of DARTS, arguing that DARTS performs poorly when the search space is changed, i.e, when different set of candidate operators are used. Regularization techniques such as early stopping have been proposed to partially solve this problem. In this paper, we tackle this problem from a different perspective by identifying two contributing factors to the collapse of DARTS when the search space changes: (1) the correlation of similar operators incurs unfavorable competition among them and makes their relative importance score unreliable and (2) the optimization complexity gap between the proxy search stage and the final training. Based on these findings, we propose a new hierarchical search algorithm. With its operator clustering and optimization complexity match, the algorithm can consistently find high-performance architecture across various search spaces. For all the five variants of the popular cell-based search spaces, the proposed algorithm always obtains state-of-the-art architecture with best accuracy on the CIFAR-10, CIFAR-100 and ImageNet over other well-established DARTS-alike algorithms. Code is available at https://github.com/susan0199/StacNAS.
연구 동기 및 목표
- 다양한 탐색 공간에서 DARTS의 일반화 실패 문제를 해결하기 위해, 특히 후보 연산자가 상관관계가 있거나 프oxy 및 최종 학습 단계 간 최적화 복잡도가 다를 경우에 대응한다.
- 3×3 및 5×5 분리형 컨볼루션과 같은 높은 상관관계를 가지는 연산자 간의 불리한 경쟁으로 인한 아키텍처 탐색의 불안정성을 해결한다.
- 프록시 탐색 단계의 최적화 복잡도를 최종 모델 학습 단계와 일치시켜 아키텍처 탐색의 신뢰성을 향상시킨다.
- 먼저 최적의 연산자 그룹을 선택하고, 그룹 내에서 최고의 연산자를 고르는 계층적 탐색 프레임워크를 개발한다. 이는 탐색의 안정성과 성능을 향상시킨다.
제안 방법
- 두 단계로 구성된 계층적 탐색 프레임워크를 제안한다. 첫 번째 단계에서는 특성 맵 상관관계(평탄화된 특성 맵의 피어슨 상관계수를 사용)를 기반으로 유사한 연산자를 군집화하고, 두 번째 단계에서는 각 군집 내에서 최고의 연산자를 선택한다.
- 높은 상관관계를 가지는 연산자 간의 불리한 경쟁을 완화하기 위해 연산자 군집화를 도입함으로써 더 신뢰할 수 있는 아키텍처 파rameter 추정을 보장한다.
- 기울기 혼동(gradient confusion)을 활용해 프록시 탐색 네트워크와 최종 학습 네트워크 간 최적화 복잡도를 측정하고 일치시켜, 다양한 깊이에서 일관된 스키프 커넥션 선택을 보장한다.
- 프록시 탐색 단계에서 최종 학습의 깊이와 일치하는 깊이/너비 설정을 적용하여 스키프 커넥션의 과도하거나 부족한 선택을 방지한다.
- 아키텍처 파rameter를 확률적 경사 하강법으로 최적화하는 미분 가능 탐색 프레임워크를 적용하지만, 연산자 그룹화를 통해 학습 안정성을 향상시킨다.
- CIFAR-10, CIFAR-100, ImageNet에서 다양한 셀 기반 탐색 공간의 변형에 대해 메서드를 검증한다.
실험 결과
연구 질문
- RQ1스уп러넷 내 연산자 상관관계가 미분 가능 NAS에서 아키텍처 파ram터 추정의 신뢰성에 어떤 영향을 미치는가?
- RQ2왜 DARTS는 연산자 유형이 다를 경우 다양한 탐색 공간 구성에서 일반화에 실패하는가?
- RQ3프록시 및 최종 학습 단계 간 최적화 복잡도 격차가 아키텍처 탐색 결과에 얼마나 큰 영향을 미치는가?
- RQ4계층적 연산자 군집화와 복잡도 일치가 다양한 탐색 공간에서 미분 가능 NAS의 안정성과 일반화 능력을 얼마나 향상시킬 수 있는가?
- RQ5학습된 아키텍처 파arameter α와 실제 성능 간 상관관계는 어느 정도이며, 이는 구조적 수정을 통해 향상시킬 수 있는가?
주요 결과
- StacNAS는 CIFAR-10에서 2.33%의 테스트 오차를 기록하여, 모든 DARTS 유사 방법을 능가하며 원래의 셀 기반 탐색 공간에서 새로운 최신 기술 수준을 수립한다.
- ImageNet(mobile 설정)에서 StacNAS는 표준 학습 시 24.17%의 top-1 오차, AutoAugmentation 적용 시 23.12%의 top-1 오차를 기록하며, 모두 최신 기술 수준의 결과이다.
- CIFAR-10의 셀 기반 탐색 공간 5가지 변형에서 StacNAS는 DARTS, CARS, PC-DARTS, DARTS-ES를 모두 일관되게 능가한다.
- 학습된 아키텍처 파arameter(α)와 실제 성능 간 상관계수는 DARTS의 0.2에서 StacNAS의 0.9로 증가하여, 더 신뢰할 수 있고 안정적인 아키텍처 탐색을 의미한다.
- 절단 분석 결과, 연산자 군집화와 복잡도 일치 모두 성능 향상에 기여하며, 기준 DARTS 대비 전체 방법이 오차를 0.5% 이상 감소시킴을 보여준다.
- 첫 번째 단계에서의 연산자 선택에 대해 높은 내성성을 보이며, 군집에서 무작위 샘플링을 해도 강력한 성능(2.53% 오차)을 기록함으로써 초기 군집 대표자의 민감도가 낮음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.