Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Tune XGBoost with XGBoost

Johanna Sommer, Dimitrios Sarigiannis|arXiv (Cornell University)|2019. 09. 16.
Machine Learning and Data Classification참고 문헌 14인용 수 8
한 줄 요약

이 논문은 메타학습을 통합한 성능 향상된 순차적 반감법(Successive Halving)의 변종인 MeSH를 제안한다. MeSH는 초기 단계 평가 결과로부터 최종 모델 성능을 예측하는 메타-재귀모형을 사용한다. 95개 데이터셋에서 학습한 MeSH는 XGBoost 메타-재귀모형을 사용하여 5개 테스트 데이터셋 중 3개에서 랜덤 서치와 표준 순차적 반감법을 능가하며, 동일한 총 예산 내에서 더 낮은 검증 손실을 기록한다.

ABSTRACT

In this short paper we investigate whether meta-learning techniques can be used to more effectively tune the hyperparameters of machine learning models using successive halving (SH). We propose a novel variant of the SH algorithm (MeSH), that uses meta-regressors to determine which candidate configurations should be eliminated at each round. We apply MeSH to the problem of tuning the hyperparameters of a gradient-boosted decision tree model. By training and tuning our meta-regressors using existing tuning jobs from 95 datasets, we demonstrate that MeSH can often find a superior solution to both SH and random search.

연구 동기 및 목표

  • 이전 튜닝 경험을 활용하여 XGBoost의 하이퍼파라미터 튜닝 효율성을 향상시키기 위해.
  • 순차적 반감법(SH)의 한계를 해결하기 위해, 즉 초기 성능 순위가 최종 성능을 예측하지 못하는 문제를 해결하기 위해.
  • SH 동안 추가 비용 없이 이용 가능한 랜드마킹 메타특성(landmarking meta-features)을 사용하여 메타-재귀모형을 학습시켜 더 나은 구성 선택을 할 수 있는지 탐색하기 위해.
  • 메타학습을 통해 초기 단계 결과와 메타특성을 사용해 최종 검증 손실을 예측함으로써 SH를 향상시킬 수 있는지 평가하기 위해.
  • 동일한 예산 내에서 MeSH가 랜덤 서치와 표준 SH보다 더 나은 하이퍼파라미터 구성에 도달할 수 있음을 입증하기 위해.

제안 방법

  • MeSH는 각 라운드에서 구성 제거를 결정하기 위해 검증 손실 대신 메타-재귀모형의 예측값을 사용하도록 순차적 반감법을 수정한다.
  • 각 라운드에서 메타-재귀모형은 데이터셋 메타특성, 하이퍼파라미터 설정, 그리고 더 작은 자원에서의 이전 검증 손실을 기반으로 구성의 최종 검증 손실을 예측한다.
  • 메타-재귀모형은 95개의 OpenML 데이터셋에서 유래한 30만 개의 예제로 구성된 메타-데이터셋을 오프라인으로 학습한다. KNN, MLP, XGBoost를 후보 모델로 사용한다.
  • 메타-데이터셋에는 자원 증가에 따라 증가하는 자원 범위(16에서 1024개의 부스팅 라운드)에서 구성의 초기 평가로부터 추출한 랜드마킹 메타특성이 포함되어 있다.
  • 온라인 단계에서는 SH와 동일한 예산을 사용한다: 64개의 구성, 자원 범위 16–1024, η=2, 총 7라운드.
  • 각 테스트 데이터셋에 대해, 학습에서 5개의 데이터셋을 제외하고, 메타-재귀모형의 하이퍼파라미터를 튜닝하기 위해 3중 교차검증을 사용한다.

실험 결과

연구 질문

  • RQ1초기 단계 평가에서 유도된 메타학습 예측이 순차적 반감법 내 구성 선택을 향상시킬 수 있는가?
  • RQ2이전 튜닝 작업에서 학습된 메타-재귀모형을 사용하면 표준 순차적 반감법보다 더 나은 최종 하이퍼파라미터 구성에 도달할 수 있는가?
  • RQ3다양한 데이터셋에서 MeSH가 랜덤 서치와 표준 순차적 반감법에 비해 최종 검증 손실 측면에서 어떻게 비교되는가?
  • RQ4MeSH 프레임워크 내에서 KNN, MLP, XGBoost 중 어떤 메타-재귀모형 아키텍처가 가장 잘 성능을 내는가?
  • RQ5XGBoost 하이퍼파라미터 튜닝에서 초기 성능 추세가 최종 성능과 얼마나 관련이 있는가?

주요 결과

  • XGBoost를 메타-재귀모형으로 사용한 MeSH는 5개 테스트 데이터셋 중 3개에서 가장 낮은 평균 검증 손실을 기록하여, 랜덤 서치와 순차적 반감법을 모두 능가했다.
  • Dataset 904에서 MeSH는 XGBoost를 사용해 검증 손실을 0.2986으로 낮췄고, 표준 순차적 반감법의 0.3024 및 랜덤 서치의 0.3139보다 우수했다.
  • 오프라인 단계에서는 랜드마킹 메타특성(초기 평가)이 점점 더 많이 확보될수록 메타-재귀모형의 예측 정확도가 향상됨을 확인했다.
  • XGBoost 메타-재귀모형을 사용한 MeSH는 Dataset 930에서 평균 검증 손실 0.4881을 기록했으며, 순차적 반감법(0.4907)과 랜덤 서치(0.4903)보다 略적으로 우수했다.
  • 모든 5개의 테스트 데이터셋에서 MeSH는 XGBoost를 사용할 경우 순차적 반감법보다 항상 열등하지 않았고, 3개의 경우에서 유의미하게 더 나은 성능을 보였다.
  • 모든 테스트 데이터셋에서 XGBoost 메타-재귀모형은 KNN 및 MLP를 항상 능가했으며, 이는 XGBoost가 이 메타학습 과제에 적합하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.