[논문 리뷰] Transferable Neural Processes for Hyperparameter Optimization
이 논문은 관련 데이터셋에서의 이력 HPO 실험에서 지식을 전이함으로써 베이지안 최적화의 속도를 높이는 엔드 투 엔드 하이퍼파ram터 최적화(HPO) 방법인 전이 가능한 신경 프로세스(TNP)를 제안한다. TNP는 데이터셋 인식 주의 메커니즘을 사용해 유사한 데이터셋을 동적으로 가중치를 부여하고, 전이 가능한 모델 파라미터와 초기 하이퍼파ram터 설정을 학습하며, 기존 방법 대비 최대 한 단계 어휘 수준의 더 적은 시행 수로 최신 기술 성능을 달성한다.
Automated machine learning aims to automate the whole process of machine learning, including model configuration. In this paper, we focus on automated hyperparameter optimization (HPO) based on sequential model-based optimization (SMBO). Though conventional SMBO algorithms work well when abundant HPO trials are available, they are far from satisfactory in practical applications where a trial on a huge dataset may be so costly that an optimal hyperparameter configuration is expected to return in as few trials as possible. Observing that human experts draw on their expertise in a machine learning model by trying configurations that once performed well on other datasets, we are inspired to speed up HPO by transferring knowledge from historical HPO trials on other datasets. We propose an end-to-end and efficient HPO algorithm named as Transfer Neural Processes (TNP), which achieves transfer learning by incorporating trials on other datasets, initializing the model with well-generalized parameters, and learning an initial set of hyperparameters to evaluate. Experiments on extensive OpenML datasets and three computer vision datasets show that the proposed model can achieve state-of-the-art performance in at least one order of magnitude less trials.
연구 동기 및 목표
- 매우 제한된 시행 수로도 하이퍼파ram터 최적화(HPO)를 수행하는 데 어려움을 겪는 문제를 해결하기 위해, 특히 비용이 많이 들고 대규모인 데이터셋에 대해.
- 수렴하기 위해 많은 시행 수가 필요한 전통적인 SMBO 방법의 비효율성을 해결하기 위해.
- 수동적인 메타기능을 사용하지 않고도 이력 HPO 실험에서 유사한 데이터셋의 정보를 활용해 효과적인 전이 학습을 가능하게 하기 위해.
- 전이 가능한 모델 초기화, 적응형 유사도 모델링, 최적화된 초기 설정을 결합한 확장 가능한 엔드 투 엔드 HPO 프레임워크를 개발하기 위해.
- 수작업된 메타기능이 아닌 학습된 표현을 통해 동적으로 데이터셋 유사도를 평가함으로써 부정적 전이를 줄이기 위해.
제안 방법
- TNP는 신경 프로세스(NPs)를 서로서 모델로 사용하여 함수에 대한 분포를 정의하며, 신경망의 표현력과 가우시안 프로세스의 불확실성 측정 기능을 결합한다.
- 모델은 각 하이퍼파ram터-정확도 관측값을 잠재 표현으로 인코딩하기 위해 인코더를 사용한다.
- 데이터셋 인식 크로스 주의 메커니즘은 집계된 관측값 표현을 사용해 대상 데이터셋과 이력 데이터셋 간의 유사도를 계산한다.
- 주의 메커니즘으로부터 유도된 잠재 분포가 디코더의 입력으로 사용되며, 이는 새로운 하이퍼파라미터 설정에 대한 성능와 불확실성을 예측한다.
- 모델은 메타학습 전략(MAML 유사)을 사용해 엔드 투 엔드로 훈련되며, 서로서 모델 파라미터에 대한 전이 가능한 초기화를 학습한다.
- TNP는 학습된 전이 가능한 사전 분포에서 유도된 잘 일반화된 하이퍼파라미터 설정 세트로 SMBO를 초기화함으로써 수렴 속도를 가속화한다.
실험 결과
연구 질문
- RQ1유사한 데이터셋에서의 이력 HPO 실험에서의 전이 학습이 최적의 하이퍼파라미터를 찾기 위해 필요한 시행 수를 크게 줄일 수 있는가?
- RQ2수작업된 메타기능에 의존하지 않고 데이터셋 유사도를 효과적으로 모델링할 수 있는가?
- RQ3암묵적 커널 학습을 갖춘 신경 프로세스 서로서 모델이 다양한 데이터셋을 통해 일반화되고 효율적으로 확장 가능한가?
- RQ4관측치, 모델 파라미터, 초기 설정의 전이를 통합하면 단일 소스 전이보다 뛰어난 HPO 성능을 달성할 수 있는가?
- RQ5유사하지 않은 데이터셋에서 전이할 경우 모델은 어떻게 부정적 전이를 완화하는가?
주요 결과
- TNP는 OpenML 데이터셋과 컴퓨터 비전 벤치마크인 CIFAR-10, SVHN, MNIST에서 최신 기술 성능을 달성하며, 기존 방법 대비 최대 한 단계 어휘 수준의 더 적은 시행 수가 필요하다.
- CIFAR-10 데이터셋에서 TNP는 단 10회의 시행 내로 높은 분류 정확도를 달성했으며, GP 기반 방법과 무작위 탐색보다도 뛰어난 성능을 보였다.
- 절단 실험 결과, 데이터셋 인식 주의, 전이 가능한 초기화, 일반화된 초기 설정 세 가지 구성 요소가 모두 HPO 성능 향상에 기여하는 것으로 확인되었다.
- 모델은 데이터셋 간의 유사도 벡터를 학습함으로써 부정적 전이를 효과적으로 방지했으며, 관련 데이터셋(breast-w)과의 유사도 점수는 0.5439, 비유사 데이터셋(mfeat-zernike)과의 점수는 0.1174였다.
- 기본 방법에 의해 생성된 이력 관측값의 품질에 관계없이 TNP는 강건한 성능 유지를 보였으며, 노이즈가 있거나 최적화되지 않은 사전 데이터에 대해서도 잘 작동했다.
- 이력 데이터셋 수가 50개를 초과하면 성능에 약간의 저하가 발생했으며, 이는 지식의 다양성과 노이즈 누적 사이의 상충 관계를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.