Skip to main content
QUICK REVIEW

[논문 리뷰] How to out-perform default random forest regression: choosing hyperparameters for applications in large-sample hydrology

Divya K. Bilolikar, Aishwarya More|arXiv (Cornell University)|2023. 05. 11.
Hydrological Forecasting Using AI인용 수 4
한 줄 요약

이 연구는 대규모 수문학에서 랜덤 포레스트 및 XGBoost 회귀 모델의 최적화된 초파rameter를 규명하여 기본 설정보다 크게 뛰어난 성능을 내는 데 성공했다. 151개의 글로벌 유역 데이터셋과 메타학습을 활용하여 예측 정확도를 향상시키는 데이터 기반의 기본 설정을 제공함으로써, 전문가가 아닌 수문학자들도 고급 머신러닝을 쉽게 활용할 수 있도록 했다. 특히 KGE 및 NSE 지표에서 뛰어난 성능을 보였다.

ABSTRACT

Predictions are a central part of water resources research. Historically, physically-based models have been preferred; however, they have largely failed at modeling hydrological processes at a catchment scale and there are some important prediction problems that cannot be modeled physically. As such, machine learning (ML) models have been seen as a valid alternative in recent years. In spite of their availability, well-optimized state-of-the-art ML strategies are not being widely used in water resources research. This is because using state-of-the-art ML models and optimizing hyperparameters requires expert mathematical and statistical knowledge. Further, some analyses require many model trainings, so sometimes even expert statisticians cannot properly optimize hyperparameters. To leverage data and use it effectively to drive scientific advances in the field, it is essential to make ML models accessible to subject matter experts by improving automated machine learning resources. ML models such as XGBoost have been recently shown to outperform random forest (RF) models which are traditionally used in water resources research. In this study, based on over 150 water-related datasets, we extensively compare XGBoost and RF. This study provides water scientists with access to quick user-friendly RF and XGBoost model optimization.

연구 동기 및 목표

  • 수문학적 회귀에서 성능이 열악한 기본 초파arameter 설정에도 불구하고 널리 사용되고 있는 랜덤 포레스트 및 XGBoost 모델의 문제를 해결하기 위해.
  • 수문학 분야에서 최신 머신러닝을 도입하는 데 걸림돌이 되는 초파arameter 최적화(HPO)에 대한 전문 지식 부족 문제를 해결하기 위해.
  • 메타특성 기반으로 새로운 데이터셋에 대한 최적 초파arameter를 예측할 수 있도록 151개의 대규모 수문학 데이터셋을 기반으로 메타모델을 개발하기 위해.
  • KGE 및 NSE 평가 지표와 초파arameter 최적화 전략에 따라 XGBoost 및 랜덤 포레스트의 성능을 체계적으로 비교하기 위해.
  • 실제 수문학 응용 분야에서 표준 설정보다 뛰어난 성능을 보이는 실용적이고 사용자 友好的이며 데이터 기반의 초파arameter 기본 설정을 제공하기 위해.

제안 방법

  • CAMELS 및 관련 벤치마크 데이터셋에서 유래한 151개의 대규모 수문학 데이터셋을 수집하고 처리하여 다양한 기후 및 수문학적 조건을 반영하였다.
  • 랜덤 서치를 활용하여 XGBoost 및 랜덤 포레스트 모델의 정의된 초파라미터 공간 내에서 체계적인 초파라미터 최적화를 수행하였다.
  • KGE 및 NSE를 주요 평가 지표로 사용하여 모든 데이터셋 및 초파라미터 설정에서 모델 성능을 평가하였다.
  • 각 데이터셋에서 메타특성(예: 예측자 수, 데이터 범위, 왜도 등)을 추출하여 새로운 데이터셋에 대한 최적 초파라미터를 예측할 수 있는 메타러닝 모델을 훈련시켰다.
  • 데이터셋의 메타특성과 최적 초파라미터 설정 간의 관계를 기반으로 한 메타모델을 훈련시켜 새로운 강우유역으로의 일반화 능력을 확보하였다.
  • 모든 데이터셋에서 교차검증을 통해 신규 초파라미터 기본 설정이 기본 설정 및 이전 최적 설정 대비 성능을 검증하였다.

실험 결과

연구 질문

  • RQ1초파라미터 최적화가 대규모 수문학에서 랜덤 포레스트 및 XGBoost 모델의 예측 성능을 크게 향상시킬 수 있는가?
  • RQ2KGE와 NSE 지표를 사용할 때 XGBoost 및 랜덤 포레스트의 최적 초파라미터 설정이 어떻게 다를 수 있는가?
  • RQ3메타특성 기반으로 훈련된 메타러닝 모델이 새로운, 미사용된 수문학적 강우유역에 대해 최적 초파라미터를 신뢰성 있게 예측할 수 있는가?
  • RQ4이 연구에서 규명된 최적 초파라미터 설정이 다양한 수문학적 조건과 데이터 특성에서 일관되게 기본 설정보다 뛰어나게 성능을 발휘하는가?
  • RQ5수문학적 회귀에서 모델 성능 향상에 가장 영향을 미치는 초파라미터는 무엇이며, 평가 지표에 따라 그 특성이 어떻게 달라지는가?

주요 결과

  • KGE를 평가 지표로 사용할 경우 랜덤 포레스트의 새로운 최적 기본 초파라미터는 mtry=0.885, numtrees=780, replace=True, min_node_size=0.14, sample_fraction=0.900이며, 이는 기본 설정보다 뚜렷이 뛰어난 성능을 보였다.
  • NSE를 평가 지표로 사용할 경우 랜덤 포레스트의 최적 기본 초파라미터는 mtry=0.650, numtrees=49, replace=False, min_nodesize=0.37, sample_fraction=0.854로, 평가 지표에 따라 최적 설정이 크게 달라지는 경향을 보였다.
  • KGE가 평가 지표일 경우 XGBoost가 랜덤 포레스트를 능가하며, KGE에 최적화된 초파라미터는 numrounds=2945, eta=0.018, subsample=0.483로 구성되어 있었다.
  • NSE 평가 시 XGBoost의 최적 설정은 numrounds=4942, eta=0.029, subsample=0.765, max_depth=6, lambda=1019.458로, 기본 설정보다 더 높은 정규화와 더 깊은 트리 구조를 보였다.
  • 이 연구에서 제안한 최적 기본 설정은 Probst 등(2019)이 제안한 원래의 기본 설정보다 일관되게 뛰어나며, 특히 mtry, 트리 수, 샘플 비율 등에서 이전 권고 사항보다 더 높게 설정되어 있었다.
  • XGBoost는 랜덤 포레스트보다 항상 빠르지만 ranger 구현보다는 느리며, 새로운 초파라미터 설정이 다양한 강우유역 유형에서 예측 정확도를 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.