[論文レビュー] A Learning Framework for An Accurate Prediction of Rainfall Rates
本研究では、勾配ブースティングを用いた特徴選択と複数の重回帰モデル、特にランダムフォレストを用いてインダス渇水域の月間降雨量を気象変数を用いて予測する機械学習フレームワークを提案する。ランダムフォレストモデルが最高のピアソン相関係数と最小の平均絶対誤差を達成し、相対湿度(300 mb、150 mb)、u風成分(700 mb)、および気温(150 mb、10 mb)が予測に最も寄与する特徴として特定された。
The present work is aimed to examine the potential of advanced machine learning strategies to predict the monthly rainfall (precipitation) for the Indus Basin, using climatological variables such as air temperature, geo-potential height, relative humidity and elevation. In this work, the focus is on thirteen geographical locations, called index points, within the basin. Arguably, not all of the hydrological components are relevant to the precipitation rate, and therefore, need to be filtered out, leading to a lower-dimensional feature space. Towards this goal, we adopted the gradient boosting method to extract the most contributive features for precipitation rate prediction. Five state-of-the-art machine learning methods have then been trained where pearson correlation coefficient and mean absolute error have been reported as the prediction performance criteria. The Random Forest regression model outperformed the other regression models achieving the maximum pearson correlation coefficient and minimum mean absolute error for most of the index points. Our results suggest the relative humidity (for pressure levels of 300 mb and 150 mb, respectively), the u-direction wind (for pressure level of 700 mb), air temperature (for pressure levels of 150 mb and 10 mb, respectively) as the top five influencing features for accurate forecasting the precipitation rate.
研究の動機と目的
- インダス渇水域における月間降雨量を高精度に予測するデータ駆動型の機械学習フレームワークの構築を目的とする。
- 気温、湿度、風、ジオポテンシャル高度などの気象変数の中から、最も影響力のある水文的予測因子を同定することを目的とする。
- ピアソン相関係数と平均絶対誤差を評価指標として用い、5つの最先端の機械学習モデルの性能を比較することを目的とする。
- 勾配ブースティングを用いた特徴選択により、関係のない水文的要因を除外することで特徴次元を低減することを目的とする。
- 物理ベースの水文的モデルに対する計算効率の良い代替手段を提供することを目的とする。
提案手法
- 気象予測子として、0.05°解像度のCHIRPS v2降水量データと、1981–2017年の2.5°解像度のNCEP-NCAR再解析データを用いた。
- 異なる気圧レベルにおける各水文変数(例:相対湿度、風成分)を個々の予測因子として扱い、合計85個の特徴を抽出した。
- 勾配ブースティングを用いて、インダス渇水域の13のインデックス点において、降雨予測に最も寄与する特徴を順位付け・抽出した。
- 学習データの90%を用いて5つの機械学習モデル(ランダムフォレスト、XGBoost、LightGBM、SVM、ANN)を訓練し、残りの10%をテストに割り当てた。
- 交差検証を用いてハイパーパramータを最適化し、ピアソン相関係数と平均絶対誤差(MAE)を用いてモデルの性能を評価した。
- 特徴重要度分析を実施し、インデックス点全体で頻繁に選択された特徴に基づいて、最も重要な予測因子を同定した。
実験結果
リサーチクエスチョン
- RQ1気象変数を用いた場合、インダス渇水域の月間降雨量を予測する際に、どの機械学習モデルが最も優れた性能を示すか?
- RQ2気温、湿度、風、ジオポテンシャル高度のうち、どの水文的特徴が異なる大気圧レベルで降水量の予測に最も寄与するか?
- RQ3勾長ブースティングは、降雨量予測のための特徴空間の低減と精度向上にどの程度効果的か?
- RQ4特定の大気変数(例:300 mbにおける相対湿度、700 mbにおけるu風成分)の相対的寄与度は、正確な降雨予測にどの程度影響を与えるか?
- RQ5データ駆動型モデルは、地域的降雨予測において、精度と計算効率の面で従来の物理ベースのモデルを上回ることができるか?
主な発見
- ランダムフォレスト回帰モデルが他のすべてのモデルを上回り、13のインデックス点の多くで最高のピアソン相関係数と最小の平均絶対誤差を達成した。
- 300 mbおよび150 mbにおける相対湿度が、それぞれ11回および8回のモデルで最も頻繁に上位予測因子として選択された。
- 700 mbにおけるu方向風が8つのインデックス点で上位特徴として選択され、強い予測的関連性を示した。
- 150 mbおよび10 mbにおける気温が上位5つの最も影響力のある特徴に含まれ、それぞれ7回および6回のモデルで選択された。
- 特徴選択の頻度分析によると、rh^l1(1000 mbにおける相対湿度)が最も支配的な予測因子であり、11のインデックス点で登場した。
- 複数の気圧レベルにおける相対湿度、u風成分、および気温の組み合わせが、正確な降雨予測に最も情報量が多い特徴セットとして一貫して顕在した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。