[논문 리뷰] Model-based Asynchronous Hyperparameter and Neural Architecture Search
이 논문은 가우시안 프로세스 기반 베이지안 최적화와 이질적 복잡도를 가진 비동기 스케줄링을 조합한 모델 기반의 비동기 하이퍼파rameter 및 신경망 아키텍처 탐색 방법인 A-BOHB를 제안한다. 하이퍼파ram터와 자원 수준을 함께 모델링하고 보류 중인 평가를 가짜로 시뮬레이션함으로써 A-BOHB는 동기 및 무작위 비동기 기준 대비 더 빠른 수렴 속도와 뛰어난 위험 성능을 달성한다. 특히 고비용 딥러닝 벤치마크에서 두드러진다.
We introduce a model-based asynchronous multi-fidelity method for hyperparameter and neural architecture search that combines the strengths of asynchronous Hyperband and Gaussian process-based Bayesian optimization. At the heart of our method is a probabilistic model that can simultaneously reason across hyperparameters and resource levels, and supports decision-making in the presence of pending evaluations. We demonstrate the effectiveness of our method on a wide range of challenging benchmarks, for tabular data, image classification and language modelling, and report substantial speed-ups over current state-of-the-art methods. Our new methods, along with asynchronous baselines, are implemented in a distributed framework which will be open sourced along with this publication.
연구 동기 및 목표
- 분산 환경에서의 동기화 병목 현상으로 인한 동기 하이퍼파ram터 및 신경망 아키텍처 탐색(HNAS)의 비효율성을 해결한다.
- 일반적으로 최고 성능에 도달하지 못하는 비동기 Hyperband 변종에서의 무작위 샘플링의 한계를 극복한다.
- 다양한 자원 수준과 보류 중인 평가를 고려한 비동기 의사결정을 지원하는 체계적인 모델 기반 접근법을 개발한다.
- 하이퍼파ram터와 자원 수준 간의 공동 확률 모델링을 활용해 샘플 효율성과 벽시계 시간 성능을 향상시켜 HNAS의 샘플 효율성과 벽시계 시간 성능을 향상시킨다.
- 베이지안 최적화나 분산 시스템에 대한 전문 지식이 제한된 실무자들이 실용적이고 확장 가능하며 효율적인 자동 머신러닝을 활용할 수 있도록 한다.
제안 방법
- 하이퍼파ram터와 자원 수준(예: 훈련 에포크 수)에서의 검증 손실을 함께 모델링하는 공동 가우시안 프로세스(GP) 대체 모델을 도입한다.
- 완료된 평가와 보류 중인 평가를 모두 고려하여, 높은 자원 수준에서의 성능을 확률적 추론을 통해 예측한다.
- 보류 중인 설정의 결과를 시뮬레이션하기 위해 '가짜(fantasy)' 샘플링을 적용하여, 모든 워커가 완료되기를 기다리지 않고도 비동기 의사결정을 가능하게 한다.
- 이 모델을 비동기 Hyperband(HB) 스케줄링 프레임워크에 통합하여, 무작위 설정 샘플링 대신 모델 기반의 획득 함수를 사용한다.
- 다음으로 평가할 설정을 선택하기 위해 기대 개선도(Expected Improvement, EI) 또는 개선 가능성 확률(Probability of Improvement, PI) 기반의 획득 함수를 사용한다.
- 초기 저신뢰도 평가를 기반으로 유망한 설정을 더 높은 자원 수준으로 승격시킴으로써 다중 신뢰도 최적화를 지원한다.
실험 결과
연구 질문
- RQ1무작위 또는 동기 기준 대비 모델 기반 접근법이 비동기 하이퍼파ram터 및 신경망 아키텍처 탐색의 샘플 효율성과 벽시계 시간 성능을 향상시키는가?
- RQ2보류 중인 평가가 존재하는 비동기 환경에서 하이퍼파ram터와 자원 수준을 함께 모델링하는 것이 의사결정에 어떤 영향을 미치는가?
- RQ3가짜 기반 추론을 사용하는 가우시안 프로세스 대체 모델이 비동기 HB 변종에서 무작위 설정 샘플링보다 우월한가?
- RQ4고비용 딥러닝 벤치마크에서 A-BOHB는 동기 BOHB 및 ASHA와 비교해 위험도를 얼마나 줄이는가?
- RQ5특히 제한된 컴퓨팅 예산 하에서 병렬 워커 수가 다양할 경우 A-BOHB의 성능는 어떻게 스케일링되는가?
주요 결과
- A-BOHB는 CIFAR-10에서 ResNet에 대해 약 두 배의 워커를 사용하는 A-HB와 동일한 벽시계 시간 내에 검증 오차 위험도 $10^{-2}$ (정확도 차이 1%)를 달성한다.
- LSTM 언어 모델링(WikiText-2)에서 A-BOHB는 동기 BOHB 및 ASHA를 능가하며, 더 적은 계산 부하로 경쟁 가능한 성능을 더 빨리 달성한다.
- A-BOHB는 동일한 결과를 얻기 위해 무작위 샘플링 기반의 비동기 HB 변종(예: ASHA)에 비해 자원을 절반으로 사용하면서도 성능을 동일하거나 초월한다.
- 이 방법은 동기화 오버헤드를 크게 줄여, 동일한 벽시계 시간 내에 더 많은 설정을 높은 자원 수준으로 승격시킬 수 있도록 한다.
- 표현형 및 이미지 분류 벤치마크에서 A-BOHB는 최신 동기 및 비동기 HNAS 방법보다 일관된 속도 향상과 낮은 위험도를 보여준다.
- 공동 GP 모델은 자원 수준 간 효과적인 내삽을 가능하게 하며, 보류 중인 평가에서 불완전한 데이터가 존재하더라도 견고한 의사결정을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.