Skip to main content
QUICK REVIEW

[논문 리뷰] NASI: Label- and Data-agnostic Neural Architecture Search at Initialization

Yao Shu, Shaofeng Cai|arXiv (Cornell University)|2021. 09. 02.
Advanced Neural Network Applications참고 문헌 49인용 수 7
한 줄 요약

NASI는 모델 훈련을 완전히 생략하는 라벨 및 데이터에 관계없는 신경망 아키텍처 탐색(NAS) 방법을 제안한다. 이는 초기화 시점에서 신경장핵 커널(NTK)의 트레이스 노름 근사치를 활용하여 아키텍처 성능을 추정함으로써 달성된다. CIFAR-10/100 및 ImageNet에서 최고 수준의 탐색 효율성과 경쟁 가능한 일반화 성능을 기록하며, 랜덤 라벨이나 데이터가 존재하는 경우에도 이식 가능성을 입증한다.

ABSTRACT

Recent years have witnessed a surging interest in Neural Architecture Search (NAS). Various algorithms have been proposed to improve the search efficiency and effectiveness of NAS, i.e., to reduce the search cost and improve the generalization performance of the selected architectures, respectively. However, the search efficiency of these algorithms is severely limited by the need for model training during the search process. To overcome this limitation, we propose a novel NAS algorithm called NAS at Initialization (NASI) that exploits the capability of a Neural Tangent Kernel in being able to characterize the converged performance of candidate architectures at initialization, hence allowing model training to be completely avoided to boost the search efficiency. Besides the improved search efficiency, NASI also achieves competitive search effectiveness on various datasets like CIFAR-10/100 and ImageNet. Further, NASI is shown to be label- and data-agnostic under mild conditions, which guarantees the transferability of architectures selected by our NASI over different datasets.

연구 동기 및 목표

  • 신경망 아키텍처 탐색 중 모델 훈련을 제거하여 탐색 효율을 극도로 향상시키기.
  • 신경장핵 커널(NTK)을 활용해 초기화 시점에서 신경망 아키텍처 성능을 추정하는 방법을 개발하기.
  • 다양한 데이터셋, 라벨, 데이터 분포에서 일반화 성능이 우수한 아키텍처를 확보하기.
  • 어떤 조건에서도 라벨 및 데이터에 관계없는 NAS를 실현하여 이식 가능한 아키텍처 탐색을 달성하기.
  • 비용이 많이 들지 않는 훈련을 피하면서도 경쟁 가능한 성능을 유지할 수 있는 효율적이고, 미분 가능하며 확장 가능한 NAS 프레임워크 제공하기.

제안 방법

  • 무한히 넓은 DNN의 초기화 시점에서 성능를 특성화하기 위해 신경장핵 커널(NTK)을 활용하여 훈련 없이 성능를 추정할 수 있도록 한다.
  • 기울기 흐름 기반의 수식을 활용해 NTK의 트레이스 노름을 근사하며, 특히 샘플 기울기 노름의 합과 미니배치 기울기 노름의 합을 사용한다.
  • Gumbel-Softmax 변환을 통해 이산적인 아키텍처 선택을 연속적이고 미분 가능한 최적화 문제로 재구성함으로써 NAS를 연속적이고 미분 가능한 최적화 문제로 재정의한다.
  • 모델 훈련 없이도 고성능 아키텍처를 찾기 위해 기울기 기반 최적화 알고리즘을 적용한다.
  • 아키텍처 복잡성과 최적화 성능를 균형 잡기 위해 제약 조건 ν와 페널티 계수 μ에 대한 고정된 결정 방법을 도입한다.
  • 다양한 탐색 공간에서 정확한 NTK 값과의 피어슨 상관계수 분석을 통해 NTK 트레이스 노름 근사치의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1초기화 시점에서 모델 훈련 없이도 신경망 아키텍처 탐색을 수행할 수 있는가?
  • RQ2신경장핵 커널(NTK)의 트레이스 노름을 사용해 초기화 시점에서 아키텍처 성능를 정확하게 예측할 수 있는가?
  • RQ3NASI는 라벨 및 데이터에 관계없는 탐색을 실현하여 다양한 데이터셋과 데이터 분포 간 이식 가능성을 확보하는가?
  • RQ4NTK 트레이스 노름의 근사치가 탐색 효율성과 효과성에 어떤 영향을 미치는가?
  • RQ5하이퍼파rameter ν와 μ는 최종 탐색된 아키텍처의 일반화 성능에 어떤 영향을 미치는가?

주요 결과

  • NASI는 CIFAR-10/100 및 ImageNet에서 비교된 모든 NAS 알고리즘 중 가장 낮은 탐색 비용을 기록하면서도 경쟁 가능한 성능을 유지한다.
  • NAS-Bench-1Shot1의 세 가지 탐색 공간 전반에서 제안된 NTK 트레이스 노름 근사치와 정확한 NTK 트레이스 노름 간 피어슨 상관계수는 모두 0.85 초과이다.
  • 샘플 기울기 노름의 합이 가장 우수한 근사치를 제공하며, S1에서는 0.88, S2에서는 0.92, S3에서는 0.87의 상관계수를 기록한다.
  • 배치 크기(b=8에서 b=128)가 변화하더라도 탐색 결과가 안정적이며, 모든 설정에서 테스트 오차가 ±0.3 이내로 유지되어 근사치의 강건성을 확인한다.
  • 최적의 제약 조건 ν=100이 가장 낮은 테스트 오차를 기록하며, 다른 ν 값보다 우수한 성능를 보이며, μ는 최종 성능에 ν만큼 뚜렷한 영향을 미치지 않는다.
  • NASI는 CIFAR-10에서 랜덤으로 생성된 라벨이나 데이터 조건에서도 잘 성능을 내는 아키텍처를 선택함으로써, 그 라벨 및 데이터에 관계없는 성격과 강력한 이식 가능성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.