[논문 리뷰] HM-NAS: Efficient Neural Architecture Search via Hierarchical Masking
HM-NAS는 기존의 가중치 공유 NAS의 한계를 극복하기 위해 다중 수준 아키텍처 인코딩과 계층적 마스킹을 사용하여 수동으로 설계된 히우리스틱 없이 최적의 네트워크 구조를 자동으로 학습하는 효율적인 신경망 아키텍처 탐색 방법을 제안한다. 이는 기존 방법보다 1.8배 적은 파라미터와 2.7배 빠른 훈련 속도로 CIFAR-10과 ImageNet에서 최신 기술 수준의 정확도를 달성한다.
The use of automatic methods, often referred to as Neural Architecture Search (NAS), in designing neural network architectures has recently drawn considerable attention. In this work, we present an efficient NAS approach, named HM- NAS, that generalizes existing weight sharing based NAS approaches. Existing weight sharing based NAS approaches still adopt hand-designed heuristics to generate architecture candidates. As a consequence, the space of architecture candidates is constrained in a subset of all possible architectures, making the architecture search results sub-optimal. HM-NAS addresses this limitation via two innovations. First, HM-NAS incorporates a multi-level architecture encoding scheme to enable searching for more flexible network architectures. Second, it discards the hand-designed heuristics and incorporates a hierarchical masking scheme that automatically learns and determines the optimal architecture. Compared to state-of-the-art weight sharing based approaches, HM-NAS is able to achieve better architecture search performance and competitive model evaluation accuracy. Without the constraint imposed by the hand-designed heuristics, our searched networks contain more flexible and meaningful architectures that existing weight sharing based NAS approaches are not able to discover.
연구 동기 및 목표
- 기존의 가중치 공유 NAS 방법이 아키텍처 후보 생성 시 수동으로 설계된 히우리스틱에 의해 제약을 받는 부분 최적성 문제를 해결하기 위해.
- 노드당 고정된 에지와 연산 수에 대한 제약을 완화하여 더 넓은 신경망 아키텍처 공간에서 탐색할 수 있도록 하기 위해.
- 계층적 마스크를 사용하여 아키텍처 탐색을 미분 가능한 모델 프루닝 문제로 공식화함으로써 탐색 효율성과 모델 정확도를 향상시키기 위해.
- 스업넷 훈련 중 이중 최적화에 의해 발생하는 아키텍처 탐색 편향을 보정하기 위해 학습된 마스킹 메커니즘을 도입하기 위해.
- 고정된 셀과 고정된 연산을 사용하는 기존 NAS 접근 방식보다 더 유연하고 의미 있는 아키텍처를 발견하기 위해.
제안 방법
- 노드당 고정된 수의 에지와 연산이 아닌 가변적인 수를 허용하는 다중 수준 아키텍처 인코딩 체계를 도입하여 각 에지와 연산에 대해 학습 가능한 중요도 가중치를 제공한다.
- 스업넷 훈련 중 중요하지 않은 가중치와 연결을 프루닝함으로써 최적의 아키텍처를 자동으로 학습하는 계층적 마스킹 메커니즘을 적용한다.
- 아키텍처 탐색을 미분 가능한 모델 프루닝 문제로 간주하여 마스크를 종합적으로 훈련시켜 스업넷에서 최적의 아키텍처를 선택한다.
- 학습된 마스크를 사용하여 스업넷 훈련 중 이중 최적화에 기인한 편향을 보정함으로써 수렴성과 일반화 성능을 향상시킨다.
- 모든 가능한 아키텍처를 포함하는 하나의 과다 파rameter화된 스업넷을 구성하여 모든 후보 아키텍처를 효율적으로 공동 훈련할 수 있도록 한다.
- 계층적 마스킹 체계를 적용하여 노드당 입력 에지의 수와 에지당 연산의 수를 동적으로 결정함으로써 고정 셀 설계를 초월한다.
실험 결과
연구 질문
- RQ1기존의 가중치 공유 NAS 방법의 고정된 아키텍처 제약을 완화하면 더 뛰어난 성능과 더 유연한 신경망 아키텍처를 얻을 수 있는가?
- RQ2계층적 마스킹 메커니즘이 수동으로 설계된 히우리스틱 없이 최적의 아키텍처 구성 요소를 자동으로 학습할 수 있는가?
- RQ3제안된 방법이 스업넷 훈련 중 이중 최적화에 기인한 탐색 편향을 줄일 수 있는가?
- RQ4기존 최신 기술 수준의 NAS 접근 방식과 비교해도 유의미하게 감소된 파라미터 수와 훈련 시간으로 경쟁 가능한 정확도를 달성할 수 있는가?
- RQ5발견된 아키텍처가 기존의 고정 셀, 고정 연산 NAS 접근 방식으로는 도달할 수 없었던 더 유연하고 의미 있는 아키텍처인가?
주요 결과
- HM-NAS는 최신 기술 수준의 가중치 공유 NAS 방법보다 1.8배 적은 파라미터와 2.7배 빠른 훈련 속도로 CIFAR-10에서 2.41±0.05의 top-1 정확도를 달성한다.
- ImageNet에서는 더 뛰어난 효율성과 함께 경쟁 가능한 정확도를 확보하여 CIFAR-10을 초월한 일반화 능력을 입증한다.
- HM-NAS에서 학습된 에지 중요도는 무작위 가중치 초기화에 대해 강건하며, 후속 중간 노드에서 일관되게 높은 중요도를 보인다.
- HM-NAS가 발견한 최고 성능 아키텍처는 DARTS가 정확히 두 개의 에지와 각 에지당 하나의 연산을 강제하는 것과는 달리, 입력 에지 수가 변동 가능하고(≥2) 각 에지당 다수의 연산을 포함한다.
- 계층적 마스킹 체계는 기존 NAS 접근 방식이 아키텍처 제약으로 인해 탐색할 수 없는 더 유연하고 의미 있는 아키텍처를 발견하는 데 기여한다.
- 절단 실험 결과, 다중 수준 인코딩과 계층적 마스킹이 무작위 아키텍처 및 단일 수준 인코딩 또는 수동으로 설계된 히우리스틱을 사용하는 방법보다 우수한 성능을 낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.