Skip to main content
QUICK REVIEW

[논문 리뷰] Generalizing Few-Shot NAS with Gradient Matching

Shoukang Hu, Ruochen Wang|arXiv (Cornell University)|2022. 03. 29.
Advanced Neural Network Applications인용 수 10
한 줄 요약

이 논문은 기존의 과도한 가중치 공유로 인한 성능 저하 문제를 해결하기 위해, 일반화된 소수의 신경망 아키텍처 탐색(NAS) 방법인 GM-NAS를 제안한다. GM-NAS는 기울기 일치 점수(GM)를 활용해 슈퍼넷을 하위 슈퍼넷으로 지능적으로 분할함으로써 유해한 가중치 공유를 줄인다. 예산 제약 하에 유사한 기울기 기반 엣지 클러스터링을 통해 더 높은 엣지 분할을 가능하게 하여, DARTS 스페이스에서 2.34%의 테스트 오차와 ImageNet에서 19.7%의 Top-1 오차를 기록하며 최신 기술 수준을 달성한다. 또한 상위 아키텍처 간 순위 상관관계를 크게 향상시킨다.

ABSTRACT

Efficient performance estimation of architectures drawn from large search spaces is essential to Neural Architecture Search. One-Shot methods tackle this challenge by training one supernet to approximate the performance of every architecture in the search space via weight-sharing, thereby drastically reducing the search cost. However, due to coupled optimization between child architectures caused by weight-sharing, One-Shot supernet's performance estimation could be inaccurate, leading to degraded search outcomes. To address this issue, Few-Shot NAS reduces the level of weight-sharing by splitting the One-Shot supernet into multiple separated sub-supernets via edge-wise (layer-wise) exhaustive partitioning. Since each partition of the supernet is not equally important, it necessitates the design of a more effective splitting criterion. In this work, we propose a gradient matching score (GM) that leverages gradient information at the shared weight for making informed splitting decisions. Intuitively, gradients from different child models can be used to identify whether they agree on how to update the shared modules, and subsequently to decide if they should share the same weight. Compared with exhaustive partitioning, the proposed criterion significantly reduces the branching factor per edge. This allows us to split more edges (layers) for a given budget, resulting in substantially improved performance as NAS search spaces usually include dozens of edges (layers). Extensive empirical evaluations of the proposed method on a wide range of search spaces (NASBench-201, DARTS, MobileNet Space), datasets (cifar10, cifar100, ImageNet) and search algorithms (DARTS, SNAS, RSPS, ProxylessNAS, OFA) demonstrate that it significantly outperforms its Few-Shot counterparts while surpassing previous comparable methods in terms of the accuracy of derived architectures.

연구 동기 및 목표

  • 자식 아키텍처 간 과도한 가중치 공유로 인한 쌍방향 최적화에 의한 성능 저하 문제를 해결하기 위해.
  • 소수의 NAS를 향상시키기 위해 기존의 전수적이고 연산 기반의 분할 기준을, 유사한 연산을 그룹화하는 더 지능적인 분할 기준으로 대체하기 위해.
  • 자식 모델 간 기울기 유사성을 활용하여, 탐색 효율성과 정확도를 극대화하는 슈퍼넷 분할 전략을 개발하기 위해.
  • 기울기 기반 클러스터링을 통해 각 엣지당 분기 요소를 줄여 고정된 예산 하에 더 높은 엣지 분할을 가능하게 하기 위해.
  • 다양한 탐색 공간, 데이터셋, NAS 알고리즘에서 일관된 성능 향상을 입증하기 위해.

제안 방법

  • 다른 자식 모델의 공유 가중치 기울기 간 코사인 유사도를 계산하여, 가중치 공유의 적합성을 평가하는 기울기 일치 점수(GM)를 제안한다.
  • GM 점수를 그래프 클러스터링 설정의 가중치 엣지로 사용하여 슈퍼넷을 하위 슈퍼넷으로 분할함으로써, 해로운 가중치 공유를 최소화한다.
  • 최적의 엣지 분할을 식별하기 위해 그래프 최소 컷 기반 엣지 선택 전략을 도입하여 분산을 줄이고 성능을 향상시킨다.
  • 슈퍼넷 웜업과 분할 후 하위 슈퍼넷 가중치 재시작을 적용하여 학습 안정성을 확보하고 잔여 가중치 공유 영향을 제거한다.
  • 각 분할 엣지당 다수의 하위 슈퍼넷을 허용함으로써 임의의 분기 요소를 지원하며, 동일한 예산 하에 더 많은 엣지를 분할할 수 있도록 한다.
  • NASBench-201, DARTS, MobileNet 등의 다양한 벤치마크와 DARTS, SNAS, RSPS, ProxylessNAS, OFA 등의 알고리즘에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1자식 모델 간 기울기 유사성이 슈퍼넷 내에서 가중치 공유를 위한 적합성 평가 기준으로 효과적으로 기능할 수 있는가?
  • RQ2기울기 일치를 통해 슈퍼넷 분할을 유도할 경우, 전수적 분할 대비 더 나은 성능 추정과 탐색 결과를 얻을 수 있는가?
  • RQ3기울기 기반 클러스터링을 통해 분기 요소를 감소시킴으로써, 고정된 예산 하에 기존 소수의 NAS보다 더 높은 엣지 분할을 달성할 수 있는가?
  • RQ4기존 방법 대비 GM-NAS는 상위 아키텍처 간 순위 상관관계를 얼마나 향상시키는가?
  • RQ5슈퍼넷 웜업 에포크 수 및 재시작 전략과 같은 하이퍼파라미터 설정에 대해 GM-NAS는 얼마나 강건한가?

주요 결과

  • DARTS 탐색 공간에서 GM-NAS는 2.34%의 테스트 오차를 기록하여 최신 기술 수준의 메서드 중 상위에 위치한다.
  • MobileNet 탐색 공간을 사용한 ImageNet에서 GM-NAS는 19.7%의 Top-1 테스트 오차를 기록하며 이전의 유사한 메서드를 초월한다.
  • 분기 요소가 2일 경우, GM-NAS는 네 개의 엣지를 분할한다(소수의 NAS는 두 개). 동일한 예산 하에 세 배로 더 많은 엣지 분할이 가능하다.
  • NASBench-201에서 상위 1% 아키텍처 간 스피어만 상관계수는 0.532를 기록하며, 소수의 NAS의 0.117보다 유의미하게 높다.
  • 슈퍼넷 웜업과 하위 슈퍼넷 재시작은 필수적이다. 이를 제거하면 CIFAR-10에서 평균 정확도가 93.95%에서 91.04%로 떨어진다.
  • 최소 컷 기반 엣지 선택 전략은 성능 분산을 줄이며(0.08 vs. 0.39), 평균 정확도를 향상시킨다(93.95% vs. 93.58%) NASBench-201에서 검증됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.