Skip to main content
QUICK REVIEW

[논문 리뷰] NAS-Bench-360: Benchmarking Neural Architecture Search on Diverse Tasks

Renbo Tu, Nicholas J. Roberts|arXiv (Cornell University)|2021. 10. 12.
Advanced Neural Network Applications인용 수 11
한 줄 요약

NAS-Bench-360는 컴퓨터 비전, 음성, 유전체학, 과학 계산을 아우르는 10개의 기계학습 작업을 포함하는 다양한 벤치마크 세트를 소개하여 기존의 전통적인 컴퓨터 비전 벤치마크를 넘어서 신경망 아키텍처 탐색(NAS) 방법을 평가한다. 이 연구는 최첨단 NAS 방법이 다양한 작업에서 일관되지 않은 성능을 보이며, 자원이 제한된 환경에서는 고정된 CNN 모델이 종종 NAS를 능가하고, 제로비용 프록시는 신뢰할 수 없는 성능을 보임을 밝혀냈다.

ABSTRACT

Most existing neural architecture search (NAS) benchmarks and algorithms prioritize well-studied tasks, e.g. image classification on CIFAR or ImageNet. This makes the performance of NAS approaches in more diverse areas poorly understood. In this paper, we present NAS-Bench-360, a benchmark suite to evaluate methods on domains beyond those traditionally studied in architecture search, and use it to address the following question: do state-of-the-art NAS methods perform well on diverse tasks? To construct the benchmark, we curate ten tasks spanning a diverse array of application domains, dataset sizes, problem dimensionalities, and learning objectives. Each task is carefully chosen to interoperate with modern CNN-based search methods while possibly being far-afield from its original development domain. To speed up and reduce the cost of NAS research, for two of the tasks we release the precomputed performance of 15,625 architectures comprising a standard CNN search space. Experimentally, we show the need for more robust NAS evaluation of the kind NAS-Bench-360 enables by showing that several modern NAS procedures perform inconsistently across the ten tasks, with many catastrophically poor results. We also demonstrate how NAS-Bench-360 and its associated precomputed results will enable future scientific discoveries by testing whether several recent hypotheses promoted in the NAS literature hold on diverse tasks. NAS-Bench-360 is hosted at https://nb360.ml.cmu.edu.

연구 동기 및 목표

  • CIFAR-10과 ImageNet과 같은 잘 연구된 컴퓨터 비전 작업 외의 강력한 평가가 부족한 문제를 해결하기 위해.
  • 컴퓨터 비전 작업에서 뛰어난 성능을 보이는 NAS 방법이 유전체학, 음성, 과학 시뮬레이션과 같은 다양한 원거리 응용 분야로 일반화되는지 조사하기 위해.
  • 통합된 벤치마크 프레임워크를 사용해 이질적인 도메인 간에 NAS 알고리즘과 검색 공간의 재현 가능하고 체계적인 평가를 가능하게 하기 위해.
  • 15,625개 아키텍처에 대한 사전 계산된 성능 결과를 두 작업에 대해 공개하여 NAS 연구를 가속화하고 학습 비용을 절감하기 위해.
  • 기존의 NAS 가설(예: 제로비용 프록시의 효용성)이 비컴퓨터 비전 작업에서 유효한지 테스트하기 위해.

제안 방법

  • 이미지 분류, 음성 인식, 단백질 구조 예측, 유전체학, 유체역학, 의료 신호 처리를 포함하는 10개의 다양한 기계학습 작업을 선별하였다.
  • 표준 합성곱 신경망(CNN) 검색 공간과 호환되도록 하되, NAS 방법의 원래 개발 배경과는 거리가 먼 도메인을 대표하도록 작업을 선별하였다.
  • NAS-Bench-201 검색 공간의 15,625개 아키텍처에 대해 두 작업(CIFAR-100 및 Spherical)에 대한 사전 계산된 정확도와 FLOPS를 공개하여 빠른 평가를 가능하게 하였다.
  • 모든 작업에서 표준 NAS 알고리즘(DARTS, DenseNAS, Auto-DL, AMBER)과 베이스라인(Wide ResNet, 전문가가 설계한 모델)을 사용하였다.
  • 에러 프로파일을 통해 작업 간 성능을 평가하였으며, 특정 메트릭 τ 이내에서 최고 성능을 낸 메서드의 에러를 기준으로, 메서드가 얼마나 많은 작업에서 우수한 성능를 내는지 측정하였다.
  • NAS 가설의 일반화 가능성(예: 제로비용 프록시 성능, 검색 공간 효율성 등)을 테스트하기 위해 분석 연구를 수행하였다.

실험 결과

연구 질문

  • RQ1최첨단 NAS 방법은 다양한 비컴퓨터 비전 기계학습 작업에서 일관되게 성능을 내는가?
  • RQ2이미지 분류를 위해 설계된 NAS 방법은 유전체학, 음성, 과학 시뮬레이션 분야의 작업으로 일반화되어 효과적으로 작동하는가?
  • RQ3제로비용 프록시는 다양한 작업에서 어떻게 작동하는가? 그리고 컴퓨터 비전 외부에서 아키텍처 성능을 신뢰할 수 있게 예측할 수 있는가?
  • RQ4자원이 제한된 환경에서 다양한 도메인 전반에 걸쳐 고정 아키텍처를 사용하는 것보다 NAS를 사용할 경우 성능상의 이점이 있는가?
  • RQ5다양한 작업 범위에서 평가했을 때, 특정 검색 알고리즘이 뛰어나다는 기존의 NAS 발견들이 얼마나 유효한가?

주요 결과

  • 자원이 제한된 연구자들은 종종 NAS를 적용하기보다는 고정된 Wide ResNet을 사용하는 것이 더 낫다. NAS 방법은 다양한 작업에서 성능이 떨어지는 경향이 있기 때문이다.
  • NAS-Bench-201 기반의 분석과 컴퓨터 비전 작업에서의 발견은 다른 도메인으로 일반화되지 않으며, 이는 NAS 방법이 작업에 따라 특수화된 행동을 보임을 시사한다.
  • 제로비용 프록시는 NAS-Bench-360 작업 전반에서 일관되지 않은 성능을 보이며, 이는 이전 연구 결과를 뒷받침하고 있으며, 다양한 환경에서의 신뢰성 부족을 강조한다.
  • NAS 방법의 성능는 작업 간에 크게 달라지며, 일부 메서드는 Cosmic 및 DeepSEA와 같은 특정 도메인에서 열악한 성능를 보이며, 이는 작업 특성에 매우 민감함을 시사한다.
  • 두 작업(CIFAR-100 및 Spherical)에 대한 사전 계산된 모델은 빠른 평가와 재현 가능성을 가능하게 하며, 여러 검색 공간을 통해 15,625개 아키텍처의 FLOPS 및 파라미터 수를 보고하였다.
  • 전문가가 설계한 모델은 특히 ECG 및 DeepSEA와 같이 맞춤형 모듈이 핵심적인 도메인에서 파라미터 효율성과 FLOPS 측면에서 NAS로 학습된 모델을 능가하는 경향이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.