Skip to main content
QUICK REVIEW

[論文レビュー] How to out-perform default random forest regression: choosing hyperparameters for applications in large-sample hydrology

Divya K. Bilolikar, Aishwarya More|arXiv (Cornell University)|May 11, 2023
Hydrological Forecasting Using AI被引用数 4
ひとこと要約

本研究では、大規模な水文データセットにおけるランダムフォレストおよびXGBoost回帰モデルの最適化されたハイパーパrameterを特定し、デフォルト設定を著しく上回る性能を達成した。151のグローバルな流域データセットとメタラーニングを用いて、予測精度を向上させるデータ駆動型のデフォルトを提供した。特にKGEおよびNSE指標において顕著な改善が見られ、専門的なチューニング知識がなくても水文学者が最先端の機械学習を活用できるようにした。

ABSTRACT

Predictions are a central part of water resources research. Historically, physically-based models have been preferred; however, they have largely failed at modeling hydrological processes at a catchment scale and there are some important prediction problems that cannot be modeled physically. As such, machine learning (ML) models have been seen as a valid alternative in recent years. In spite of their availability, well-optimized state-of-the-art ML strategies are not being widely used in water resources research. This is because using state-of-the-art ML models and optimizing hyperparameters requires expert mathematical and statistical knowledge. Further, some analyses require many model trainings, so sometimes even expert statisticians cannot properly optimize hyperparameters. To leverage data and use it effectively to drive scientific advances in the field, it is essential to make ML models accessible to subject matter experts by improving automated machine learning resources. ML models such as XGBoost have been recently shown to outperform random forest (RF) models which are traditionally used in water resources research. In this study, based on over 150 water-related datasets, we extensively compare XGBoost and RF. This study provides water scientists with access to quick user-friendly RF and XGBoost model optimization.

研究の動機と目的

  • 水文的回帰において、性能が最適でないにもかかわらず広く使われているランダムフォレストおよびXGBoostモデルのデフォルトハイパーパrameterの使用を是正すること。
  • 水文学における最新の機械学習の導入を妨げるハイパーパramータ最適化(HPO)の専門的知識の欠如という障壁を克服すること。
  • 151の大型水文データセットを用いて訓練されたメタモデルを構築し、メタ特徴量に基づいて新しいデータセットの最適ハイパーパラメータを予測すること。
  • KGEおよびNSE指標を用いた評価とHPO戦略の違いを考慮した、XGBoostおよびランダムフォレストの性能を体系的に比較すること。
  • 実世界の水文的応用において、標準設定を上回る実用的で使いやすく、データ駆動型のハイパーパラメータデフォルトを提供すること。

提案手法

  • CAMELSおよび関連ベンチマークデータセットから、多様な気候的・水文的条件をカバーする151の大型水文データセットを収集・処理した。
  • ランダムサーチを用いて、XGBoostおよびランダムフォレストモデルの両方のハイパーパラメータ空間に対して体系的なハイパーパラメータ最適化を実施した。
  • すべてのデータセットおよびハイパーパラメータ設定におけるモデル性能を評価する主な指標として、KGEおよびNSEを用いた。
  • 各データセットから、予測子の数、データ範囲、歪度などのメタ特徴量を抽出し、新しいデータセットの最適ハイパーパラメータを予測するメタラーナーを訓練した。
  • データセットのメタ特徴量と最適ハイパーパラメータ設定の関係を用いて、未観測の流域に一般化可能なメタモデルを訓練した。
  • 全データセットにわたる交差検証を用いて、新しいハイパーパラメータデフォルトがデフォルト設定および先行の最適デフォルトを上回る性能を示すかを検証した。

実験結果

リサーチクエスチョン

  • RQ1ハイパーパラメータ最適化は、大型水文データセットにおけるランダムフォレストおよびXGBoostモデルの予測性能を著しく向上させることができるか?
  • RQ2KGEとNSE指標を用いた評価において、XGBoostおよびランダムフォレストの最適ハイパーパラメータはどのように異なるか?
  • RQ3データセットのメタ特徴量に基づいて訓練されたメタラーナーは、未観測の水文的流域に対して最適ハイパーパラメータを信頼性高く予測できるか?
  • RQ4本研究で特定された最適ハイパーパラメータは、多様な水文的条件およびデータ特性において、一貫してデフォルト設定を上回る性能を示すか?
  • RQ5モデル性能を向上させるために最も影響力のあるハイパーパラメータは何か?また、評価指標に応じてその影響はどのように変化するか?

主な発見

  • KGEを評価指標として用いた場合のランダムフォレストの新しい最適デフォルトハイパーパラメータは、mtry=0.885、numtrees=780、replace=True、min_node_size=0.14、sample_fraction=0.900であり、デフォルト設定を著しく上回る性能を示した。
  • NSEを評価指標とした場合の最適ランダムフォレストデフォルトは、mtry=0.650、numtrees=49、replace=False、min_nodesize=0.37、sample_fraction=0.854であり、評価指標に応じた顕著な最適設定のシフトが確認された。
  • KGEを評価指標とした場合、XGBoostはランダムフォレストを上回る性能を示し、最適ハイパーパラメータはnumrounds=2945、eta=0.018、subsample=0.483であった。
  • NSEを評価指標とした場合、XGBoostの最適設定はnumrounds=4942、eta=0.029、subsample=0.765、max_depth=6、lambda=1019.458であり、デフォルトよりも高い正則化と深い木構造であることが示された。
  • 本研究で提示された両モデルの新しい最適デフォルトは、Probstら(2019)が提示したオリジナルのデフォルトを一貫して上回った。特にmtry、木の数、サンプルフラクションについては、前回の推奨値よりも高い値が設定されており、顕著な改善が見られた。
  • XGBoostは一貫してランダムフォレストよりも高速であったが、ranger実装よりは遅く、新しいハイパーパラメータ設定により、多様な流域タイプにおいて予測精度が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。