Skip to main content
QUICK REVIEW

[논문 리뷰] Shapley-NAS: Discovering Operation Contribution for Neural Architecture Search

Xiao Han, Ziwei Wang|arXiv (Cornell University)|2022. 06. 20.
Machine Learning in Materials Science인용 수 7
한 줄 요약

Shapley-NAS는 DARTS에서 기울기 기반 아키텍처 파라미터 크기의 한계를 극복하기 위해 모델 성능에 대한 연산의 진정한 기여도를 평가하기 위해 셰플리 값(Shapley values)을 사용하는 새로운 미분 가능한 신경망 아키텍처 탐색 방법을 제안한다. 몬테카를로 샘플링을 통한 조기 절단과 모멘텀 기반 최적화를 통해 셰플리 값의 근사치를 계산함으로써, CIFAR-10(2.43% 오차), ImageNet(23.9% top-1 정확도), NAS-Bench-201 벤치마크에서 낮은 탐색 비용으로 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

In this paper, we propose a Shapley value based method to evaluate operation contribution (Shapley-NAS) for neural architecture search. Differentiable architecture search (DARTS) acquires the optimal architectures by optimizing the architecture parameters with gradient descent, which significantly reduces the search cost. However, the magnitude of architecture parameters updated by gradient descent fails to reveal the actual operation importance to the task performance and therefore harms the effectiveness of obtained architectures. By contrast, we propose to evaluate the direct influence of operations on validation accuracy. To deal with the complex relationships between supernet components, we leverage Shapley value to quantify their marginal contributions by considering all possible combinations. Specifically, we iteratively optimize the supernet weights and update the architecture parameters by evaluating operation contributions via Shapley value, so that the optimal architectures are derived by selecting the operations that contribute significantly to the tasks. Since the exact computation of Shapley value is NP-hard, the Monte-Carlo sampling based algorithm with early truncation is employed for efficient approximation, and the momentum update mechanism is adopted to alleviate fluctuation of the sampling process. Extensive experiments on various datasets and various search spaces show that our Shapley-NAS outperforms the state-of-the-art methods by a considerable margin with light search cost. The code is available at https://github.com/Euphoria16/Shapley-NAS.git

연구 동기 및 목표

  • DARTS에서 아키텍처 파라미터 크기가 모델 성능에 대한 실제 연산 중요도를 신뢰성 있게 반영하지 못하는 한계를 해결하기 위해.
  • 모든 연산 간의 복잡한 상호작용을 고려하여 각 연산의 마진널 기여도를 직접 측정하는 방법을 개발하기 위해.
  • 조기 절단을 적용한 몬테카를로 샘플링을 통해 셰플리 값의 근사치를 계산하여 효율적이고 안정적인 아키텍처 탐색을 가능하게 하기 위해.
  • 연산 강도와 최종 모델 성능 간의 상관관계를 향상시켜 더 나은 아키텍처 발견을 이끌기 위해.
  • CIFAR-10, CIFAR-100, ImageNet, NAS-Bench-201에서 최소한의 탐색 비용으로 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 모든 가능한 연산 조합에 대해 검증 정확도에 대한 각 연산의 마진널 기여도를 정량화하기 위해 협력 게임 이론의 셰플리 값(Shapley value)을 사용한다.
  • NP-난해한 정확한 셰플리 값 계산을 효율적으로 근사하기 위해 조기 절단을 적용한 몬테카를로 샘플링을 활용한다.
  • 학습 중 스토케스틱 샘플링으로 인한 추정치의 변동성을 줄이기 위해 모멘텀 업데이트 메커니즘을 통합한다.
  • 추정된 셰플리 값 기반으로 슈퍼넷 가중치와 아키텍처 파라미터를 반복적으로 최적화하여 아키텍처 선택의 근거로 삼는다.
  • 슈퍼넷 내 각 연산을 협력 게임의 플레이어로 간주하며, 부분 집합의 연산으로 구성된 서브넷의 검증 정확도가 가치 함수가 되도록 한다.
  • 최고의 셰플리 값 기여도를 보이는 연산을 선택하여 최종 아키텍처를 도출함으로써 높은 성능 상관관계를 확보한다.

실험 결과

연구 질문

  • RQ1셰플리 값은 기울기 기반 아키텍처 파라미터 크기보다 미분 가능한 아키텍처 탐색에서 연산 중요도를 더 신뢰할 만하게 측정할 수 있는가?
  • RQ2조기 절단을 적용한 몬테카를로 샘플링은 신경망 아키텍처 탐색에서 연산 기여도에 대한 정확한 셰플리 값을 얼마나 효과적으로 근사하는가?
  • RQ3셰플리 값 기반의 연산 선택 방식은 DARTS 및 기타 최신 기술 대비 더 나은 최종 모델 성능을 달성하는가?
  • RQ4다양한 탐색 공간에서 셰플리 값 기반의 연산 강도와 실제 테스트 정확도 사이의 상관관계는 어떠한가?
  • RQ5제안된 방법은 CIFAR-10, ImageNet, NAS-Bench-201과 같은 표준 벤치마크에서 낮은 탐색 비용으로 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • Shapley-NAS는 DARTS 탐색 공간을 사용하여 CIFAR-10에서 테스트 오차율 2.43%를 달성하며 기존 방법들을 능가한다.
  • 모바일 설정에서 ImageNet에서는 Shapley-NAS가 top-1 정확도 23.9%를 기록하여 대규모 데이터셋에서 뛰어난 성능을 보였다.
  • NAS-Bench-201에서 Shapley-NAS는 CIFAR-10과 CIFAR-100에서 최적 아키텍처를 발견했고, ImageNet-16-120에서는 거의 최적의 해를 도출했다.
  • CIFAR-10에서는 셰플리 값과 테스트 정확도 사이의 켄달 타우 상관계수는 0.526, CIFAR-100은 0.474, ImageNet-16-120는 0.357로, DARTS보다 유의미하게 높았다.
  • Shapley-NAS를 통해 유도된 아키텍처 파라미터는 실제 성능 기여도를 반영하도록 진화하며, sep_conv_5x5와 sep_conv_3x3와 같은 연산은 정확도 기여도가 가장 클 때에만 우세해졌다.
  • 모멘텀 업데이트 메커니즘이 스토케스틱 샘플링 과정의 분산을 효과적으로 줄여 더 안정적이고 신뢰할 수 있는 아키텍처 탐색을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.