[논문 리뷰] NAS-Bench-Suite: NAS Evaluation is (Now) Surprisingly Easy
이 논문은 25개의 다양한 NAS 검색 공간과 데이터셋을 하나의 인터페이스로 통합한 통합적이고 확장 가능한 벤치마크 세트인 NAS-Bench-Suite를 소개한다. 이는 신속하고 재현 가능하며 일반화 가능한 신경망 아키텍처 탐색 연구를 가능하게 한다. 주요 기여는 NAS 알고리즘과 하이퍼파ram터가 벤치마크 간에 일반화되지 않음을 입증한 것으로, 이는 한정된 데이터셋에서 유도된 오해의 결론을 피하기 위해 더 넓은 평가가 필요하다는 점을 시사한다.
The release of tabular benchmarks, such as NAS-Bench-101 and NAS-Bench-201, has significantly lowered the computational overhead for conducting scientific research in neural architecture search (NAS). Although they have been widely adopted and used to tune real-world NAS algorithms, these benchmarks are limited to small search spaces and focus solely on image classification. Recently, several new NAS benchmarks have been introduced that cover significantly larger search spaces over a wide range of tasks, including object detection, speech recognition, and natural language processing. However, substantial differences among these NAS benchmarks have so far prevented their widespread adoption, limiting researchers to using just a few benchmarks. In this work, we present an in-depth analysis of popular NAS algorithms and performance prediction methods across 25 different combinations of search spaces and datasets, finding that many conclusions drawn from a few NAS benchmarks do not generalize to other benchmarks. To help remedy this problem, we introduce NAS-Bench-Suite, a comprehensive and extensible collection of NAS benchmarks, accessible through a unified interface, created with the aim to facilitate reproducible, generalizable, and rapid NAS research. Our code is available at https://github.com/automl/naslib.
연구 동기 및 목표
- 기존 NAS 벤치마크 간의 일관성과 상호운용성 부족 문제를 해결하여 일반화 가능한 연구를 방해하지 않도록 하기 위해.
- 일부 벤치마크에서 학습된 NAS 알고리즘과 하이퍼파ram터가 다른 검색 공간과 작업으로 일반화되는지 조사하기 위해.
- 다양한 데이터셋과 아키텍처를 통해 NAS 방법의 빠르고 재현 가능한 평가를 가능하게 하는 통합적이고 확장 가능한 인터페이스를 제공하기 위해.
- NAS 커뮤니티 내에서 알고리즘의 강건성과 하이퍼파ram터 이행 가능성에 대한 일반적인 오해를 식별하고 수정하기 위해.
- 다양한 문제 유형과 검색 공간 특성에 걸쳐 포괄적인 평가를 가능하게 하여 실험적 엄밀함을 촉진하기 위해.
제안 방법
- 저자들은 거의 모든 공개된 쿼리 가능한 NAS 벤치마크를 하나의 통합 API로 통합하여, 표 형태, 서rogate, 실제 NAS 벤치마크를 모두 지원한다.
- 그래프 표현을 위해 NetworkX를 사용하고, 사전에 계산된 벤치마크 데이터에 액세스하기 위한 get_dataset_api 함수를 구현하여 표준화된 인터페이스를 구현한다.
- 이븐 알고리즘과 성능 예측기의 성능은 이미지 분류, NLP, 음성, 객체 검출을 포함한 25개의 서로 다른 검색 공간과 데이터셋 조합에서 평가된다.
- 각 벤치마크 별로 하이퍼파ram터 최적화(HPO)를 수행하고, 최적의 하이퍼파ram터가 다른 벤치마크 간에 이행 가능한지 체계적으로 테스트한다.
- 통계 분석으로서 검색 공간 특성(크기, 이웃 수), 알고리즘 성능 순위 간의 켄달 타우 상관계수를 분석한다.
- 실제 및 서rogate 벤치마크 모두를 지원하여 최대 10^18개의 아키텍처를 포함한 검색 공간에서도 평가가 가능하다.
실험 결과
연구 질문
- RQ1NAS-Bench-101과 NAS-Bench-201에서 잘 성능을 내는 NAS 알고리즘이 다른 검색 공간과 데이터셋으로 일반화되는가?
- RQ2NAS 방법의 최적 하이퍼파ram터는 다른 검색 공간 간에 이행 가능한가, 아니면 특정 벤치마크에 매우 의존적인가?
- RQ3검색 공간 크기나 이웃 수와 같은 특성이 다양한 NAS 알고리즘과 성능 예측기의 성능와 어떻게 상관관계가 있는가?
- RQ4알고리즘 강건성과 같은 NAS 연구의 암묵적 가정이 다양한 벤치마크에서 평가될 경우 얼마나 깨지게 되는가?
- RQ5통합된 벤치마크 세트가 NAS 연구의 재현 가능성과 일반화 가능성에 상당한 기여를 할 수 있는가?
주요 결과
- NAS-Bench-101과 NAS-Bench-201에서 잘 성능을 내는 많은 NAS 알고리즘들이 다른 벤치마크로 일반화되지 않음을 확인하여, 소수의 벤치마크에서 유도된 결론이 항상 일반화되지 않음을 시사한다.
- NAS 방법의 최적 하이퍼파라미터는 특정 검색 공간에 매우 의존적이며, 벤치마크 간에 튜닝된 하이퍼파라미터를 이행하는 것은 종종 성능 저하를 초래한다.
- XGBoost와 RF와 같은 성능 예측기들은 검색 공간 크기와 이웃 수와 강한 상관관계를 보이며, 하이퍼파라미터를 튜닝했을 때 XGBoost는 검색 공간 크기와 -0.51의 켄달 타우 상관계수를 기록한다.
- BOHAMIANN은 튜닝되지 않은 상태에서는 큰 이웃 수에서 비교적 더 나은 성능을 보이며(상관계수 0.35), 튜닝된 상태에서는 작은 이웃 수에서 더 나은 성능을 보이며(상관계수 0.37) 하이퍼파라미터 의존성이 복잡함을 시사한다.
- 국소 탐색과 정규화된 진화 알고리즘은 작은 검색 공간과 작은 이웃 수를 가진 공간에서 뚜렷이 더 우수한 성능를 보이며, 정규화된 진화 알고리즘의 경우 이웃 수와 성능 순위 간에 -0.51의 상관관계를 보인다.
- 검색 공간 내 연산 수와 정확도의 사분위율 범위 사이에 엄격한 음의 상관관계가 존재하여, 더 큰 검색 공간일수록 성능 분포가 더 일관됨을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.