[논문 리뷰] Accuracy Prediction with Non-neural Model for Neural Architecture Search
이 논문은 신경망 아키텍처 탐색(NAS)에서 비신경망 정확도 예측기로 기울기 부스팅 결정 트리(GBDT)를 사용하는 것을 제안하며, GBDT가 신경망 기반 예측기보다 유사하거나 더 높은 예측 정확도를 달성할 수 있음을 입증한다. GBDT의 특성 중요도 및 SHAP 값 분석을 활용해 탐색 공간을 정제함으로써 샘플 효율성을 향상시키며, ImageNet에서 23.4%의 top-1 오차율과 NASBench-101에서 랜덤 탐색 대비 22배 높은 샘플 효율성을 달성한다.
Neural architecture search (NAS) with an accuracy predictor that predicts the accuracy of candidate architectures has drawn increasing attention due to its simplicity and effectiveness. Previous works usually employ neural network-based predictors which require more delicate design and are easy to overfit. Considering that most architectures are represented as sequences of discrete symbols which are more like tabular data and preferred by non-neural predictors, in this paper, we study an alternative approach which uses non-neural model for accuracy prediction. Specifically, as decision tree based models can better handle tabular data, we leverage gradient boosting decision tree (GBDT) as the predictor for NAS. We demonstrate that the GBDT predictor can achieve comparable (if not better) prediction accuracy than neural network based predictors. Moreover, considering that a compact search space can ease the search process, we propose to prune the search space gradually according to important features derived from GBDT. In this way, NAS can be performed by first pruning the search space and then searching a neural architecture, which is more efficient and effective. Experiments on NASBench-101 and ImageNet demonstrate the effectiveness of using GBDT as predictor for NAS: (1) On NASBench-101, it is 22x, 8x, and 6x more sample efficient than random search, regularized evolution, and Monte Carlo Tree Search (MCTS) in finding the global optimum; (2) It achieves 24.2% top-1 error rate on ImageNet, and further achieves 23.4% top-1 error rate on ImageNet when enhanced with search space pruning. Code is provided at https://github.com/renqianluo/GBDT-NAS.
연구 동기 및 목표
- 신경망 예측기의 과적합 및 설계 복잡성 문제를 해결하기 위해, 특히 GBDT와 같은 비신경망 모델을 NAS에서 정확도 예측기로 탐색한다.
- GBDT가 탐색 공간에서 열악한 성능을 보이는 연산을 식별하고 제거할 수 있음을 활용해 NAS의 샘플 효율성을 향상시킨다.
- 두 단계로 구성된 NAS 프레임워크를 개발한다. 첫 번째 단계는 GBDT를 사용해 탐색 공간을 정제하는 것이며, 두 번째 단계는 동일한 GBDT 예측기를 사용해 정제된 공간 내에서 최고 성능을 보이는 아키텍처를 탐색하는 것이다.
- NASBench-101 및 ImageNet과 같은 벤치마크 데이터셋에서 GBDT 기반 예측 및 정제의 효과성을 검증한다.
제안 방법
- GBDT 기반 학습에 적합하도록 신경망 아키텍처를 원핫 인코딩된 표형 특성으로 재구성한다.
- 소규모 아키텍처-정확도 쌍 세트를 기반으로 GBDT 모델을 훈련시어 미리 보지 못한 아키텍처의 정확도를 예측한다.
- SHAP 값 분석을 통해 특성 중요도를 해석하고, 해로운 연산(예: 레이어 1에서의 'MB3 7x7')을 식별해 정제한다.
- 음수인 SHAP 값과 기여도가 낮은 특성을 점진적으로 제거함으로써 탐색 복잡도를 감소시킨다.
- 동일한 GBDT 예측기를 사용해 정제된 탐색 공간에서 NAS를 수행하여 최고 성능을 보이는 아키텍처를 선별한다.
- ImageNet에서의 검증 및 NASBench-101에서의 기준 NAS 방법과의 비교를 통해 성능을 평가한다.
실험 결과
연구 질문
- RQ1GBDT와 같은 비신경망 모델이 NAS의 정확도 예측에서 신경망 기반 예측기보다 우월한 성능을 낼 수 있는가?
- RQ2GBDT를 사용해 탐색 공간 정제를 이끌면 NAS의 샘플 효율성이 향상되는가?
- RQ3SHAP 기반 특성 해석은 탐색 공간에서 열악한 성능을 보이는 연산을 식별하고 제거하는 데 얼마나 효과적인가?
- RQ4GBDT-NAS-S3는 표준 NAS 기준 대비 ImageNet에서 더 높은 정확도를 달성할 수 있는가?
주요 결과
- GBDT-NAS는 NASBench-101에서 랜덤 탐색, 정규화된 진화, 몬테카를로 트리 탐색 대비 각각 22배, 8배, 6배 높은 샘플 효율성을 기록했다.
- GBDT-NAS는 ImageNet에서 24.2%의 top-1 오차율을 기록하여 비신경망 예측기임에도 강력한 성능을 입증했다.
- SHAP 값 기반 탐색 공간 정제를 통합한 GBDT-NAS-S3는 ImageNet에서 23.4%의 top-1 오차율을 달성했으며, 정제되지 않은 변형보다 뛰어난 성능을 보였다.
- SHAP 기반 정제가 특성 중요도 기반 정제보다 우월했으며, 반복 횟수가 증가함에 따라 정확도 격차가 점점 커져, 하위 공간의 품질 향상이 확인되었다.
- GBDT-NAS-S3가 발견한 아키텍처는 SHAP 분석을 통해 레이어 1에서 해로운 것으로 밝혀진 'MB3 7x7' 연산을 피했으며, 이는 더 나은 일반화 성능으로 이어졌다.
- GBDT로 정제된 탐색 공간에서 샘플링된 아키텍처의 평균 검증 정확도는 기준보다 높았으며, 반복 횟수가 증가함에 따라 격차가 점점 커졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.