Skip to main content
QUICK REVIEW

[논문 리뷰] iDARTS: Differentiable Architecture Search with Stochastic Implicit Gradients

Miao Zhang, Steven W. Su|arXiv (Cornell University)|2021. 06. 21.
Advanced Neural Network Applications인용 수 16
한 줄 요약

iDARTS는 은닉 함수 정리(implicit function theorem)를 활용하여 더 정확하고 효율적으로 초기차수(hypergradients)를 계산함으로써, 전개된 최적화 경로에 의존하지 않는 다른iable 아키텍처 탐색 방법을 제안한다. 확률적 Neumann-시리즈 근사법을 사용함으로써 정적점에 더 빠르게 수렴하고, NAS-Bench-1Shot1, NAS-Bench-201, 및 표준 DARTS 검색 공간에서 기준 방법들을 능가하는 성능을 달성한다.

ABSTRACT

extit{Differentiable ARchiTecture Search} (DARTS) has recently become the mainstream of neural architecture search (NAS) due to its efficiency and simplicity. With a gradient-based bi-level optimization, DARTS alternately optimizes the inner model weights and the outer architecture parameter in a weight-sharing supernet. A key challenge to the scalability and quality of the learned architectures is the need for differentiating through the inner-loop optimisation. While much has been discussed about several potentially fatal factors in DARTS, the architecture gradient, a.k.a. hypergradient, has received less attention. In this paper, we tackle the hypergradient computation in DARTS based on the implicit function theorem, making it only depends on the obtained solution to the inner-loop optimization and agnostic to the optimization path. To further reduce the computational requirements, we formulate a stochastic hypergradient approximation for differentiable NAS, and theoretically show that the architecture optimization with the proposed method, named iDARTS, is expected to converge to a stationary point. Comprehensive experiments on two NAS benchmark search spaces and the common NAS search space verify the effectiveness of our proposed method. It leads to architectures outperforming, with large margins, those learned by the baseline methods.

연구 동기 및 목표

  • 다른iable 아키텍처 탐색에서 초기차수 계산을 개선하여 DARTS의 불안정성과 낮은 일반화 성능 문제를 해결하는 것.
  • 내부 루프 최적화 경로에 종속되지 않는 메모리 효율적인 아키텍처 기울기 계산 방법을 개발하는 것.
  • 초기차수 추정에서 헤시안 역행렬의 확률적 Neumann-시리즈 근사를 통해 계산 비용을 감소시키는 것.
  • 손실 함수에 대한 온건한 가정 하에 정적점 수렴을 이론적으로 정당화하는 것.
  • 표준 NAS 벤치마크에서의 경험적 검증을 통해 기존 DARTS 변종 대비 뛰어난 성능을 입증하는 것.

제안 방법

  • 아키텍처 파라미터가 초기차수를 계산하기 위해 은닉 함수 정리를 활용하는 이중 최적화 문제로 DARTS를 재구성하는 것.
  • 은닉 함수 정리를 사용하여 최종 내부 루프 가중치의 함수로 초기차수를 표현함으로써 최적화 경로에 대한 의존성을 제거하는 것.
  • 초기차수 계산에서 헤시안 역행렬의 역행렬을 구하기 위해 네이만 시리즈(Neumann series)를 적용함으로써 명시적 행렬 역행렬 계산을 피하는 것.
  • 정확도를 유지하면서 계산 비용을 줄이기 위해 네이만 시리즈 기반 초기차수의 확률적 근사를 도입하는 것.
  • 근사 품질과 효율성의 균형을 위해 네이만 시리즈의 합을 K항까지 잘라내는 것.
  • 이론적 분석을 통해 표준 손실 함수 및 학습률 가정 하에 정적점 수렴이 보장됨을 밝혀내는 것.

실험 결과

연구 질문

  • RQ1전개된 최적화 경로 대신 은닉 함수 정리를 활용함으로써 다른iable NAS에서의 초기차수 계산을 향상시킬 수 있는가?
  • RQ2헤시안 역행렬의 네이만 시리즈 기반 근사는 더 안정적이고 효율적인 아키텍처 탐색을 이끌 수 있는가?
  • RQ3암시적 초기차수의 확률적 변종은 계산 비용을 줄이면서도 성능을 유지할 수 있는가?
  • RQ4제안된 방법은 손실 함수에 대한 온건한 가정 하에 정적점으로 수렴하는가?
  • RQ5iDARTS는 다양한 NAS 벤치마크에서 기존 DARTS 변종 대비 정확도와 일반화 성능 측면에서 어떻게 비교되는가?

주요 결과

  • iDARTS는 NAS-Bench-1Shot1에서 최신 기준 성능을 달성하여 기준 방법들에 비해 큰 격차를 보였다.
  • NAS-Bench-201에서 iDARTS는 DARTS 및 그 변종을 뛰어넘는 성능을 보였으며, 특히 CIFAR-10과 CIFAR-100에서 두드러진 성과를 보였다.
  • 이 방법은 강력한 이식성(transferability)을 보였으며, CIFAR-10에서 발견한 아키텍처를 ImageNet으로 이식했을 때 높은 정확도를 달성했다.
  • 확률적 네이만 근사는 메모리 및 계산 비용을 줄이며 효율적인 학습을 가능하게 하였고, 높은 품질의 아키텍처 탐색을 유지했다.
  • 이론적 분석을 통해 iDARTS가 표준 가정 하에 정적점으로 수렴할 것으로 기대됨을 확인하여 견고한 이론적 기반을 확보했다.
  • 경험적 결과는 iDARTS가 DARTS에서 관찰된 불안정성 문제, 즉 날카로운 손실 곡면과 이산화 후 열악한 일반화 성능을 완화함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.