[論文レビュー] Improving Subseasonal Forecasting in the Western U.S. with Machine Learning
本論文は、米国西部における週単位の気温および降水量予測のための機械学習アンサンブルシステムを提案する。多タスク特徴選択とk近傍法を組み合わせることで、予測精度を向上させる。この手法は、運用中のCFSv2モデルおよびトップRodeo競合モデルを著しく上回り、2011–2018年の期間において気温予測で40–50%、降水量予測で129–169%の高いスキルを達成した。
Water managers in the western United States (U.S.) rely on longterm forecasts of temperature and precipitation to prepare for droughts and other wet weather extremes. To improve the accuracy of these longterm forecasts, the U.S. Bureau of Reclamation and the National Oceanic and Atmospheric Administration (NOAA) launched the Subseasonal Climate Forecast Rodeo, a year-long real-time forecasting challenge in which participants aimed to skillfully predict temperature and precipitation in the western U.S. two to four weeks and four to six weeks in advance. Here we present and evaluate our machine learning approach to the Rodeo and release our SubseasonalRodeo dataset, collected to train and evaluate our forecasting system. Our system is an ensemble of two regression models. The first integrates the diverse collection of meteorological measurements and dynamic model forecasts in the SubseasonalRodeo dataset and prunes irrelevant predictors using a customized multitask model selection procedure. The second uses only historical measurements of the target variable (temperature or precipitation) and introduces multitask nearest neighbor features into a weighted local linear regression. Each model alone is significantly more accurate than the debiased operational U.S. Climate Forecasting System (CFSv2), and our ensemble skill exceeds that of the top Rodeo competitor for each target variable and forecast horizon. Moreover, over 2011-2018, an ensemble of our regression models and debiased CFSv2 improves debiased CFSv2 skill by 40-50% for temperature and 129-169% for precipitation. We hope that both our dataset and our methods will help to advance the state of the art in subseasonal forecasting.
研究の動機と目的
- 水資源管理および火災管理を支援するため、米国西部における正確な週単位の天候予測の必要性に対応すること。
- 気温および降水量について、2週間から6週間先の予測において、運用中の米国気象予報システム(CFSv2)を上回る予測スキルを向上させること。
- 高次元の気象データとスキル指向の目的関数を考慮した、週単位予測の独自の課題に特化した機械学習フレームワークの開発。
- 今後の週単位予測研究を支援するため、新しいベンチマークデータセット(SubseasonalRodeo)を公開すること。
- CFSv2と複数の機械学習モデルをアンサンブル化することで、複数の予測期間および変数において予測スキルが顕著に向上することを示すこと。
提案手法
- 本システムは、2つの非線形回帰モデル(MultiLLRとAutoKNN)のアンサンブルを用いる。
- MultiLLRは、多様な気象およびモデル予測データソースから関連する予測変数を特定するため、多タスクバックワードステップワイズ特徴選択を実行する。
- AutoKNNは、歴史的な目的変数測定値(気温または降水量)のみを用い、スキルに特化したk近傍特徴を重み付き局所線形回帰に組み込む。
- 平均の予測スキルが正である場合に、平均のスキルを確実に向上させる、新しいアンサンブル手順を導入する。
- 標準的な回帰損失ではなく、予測スキルを最適化するためのカスタム多タスク目的関数を活用する。
- NMMEおよびCFSv2を含む複数のソースから収集されたSubseasonalRodeoデータセットを、モデルの学習および評価に使用する。
実験結果
リサーチクエスチョン
- RQ1機械学習モデルは、運用中のCFSv2システムを上回る、米国西部における週単位の気温および降水量予測を改善できるか?
- RQ2高次元の気象データから関連する予測変数を特定するにあたり、多タスク特徴選択アプローチはどの程度効果的か?
- RQ3外部の予測変数を一切使用しないモデルが、最近傍法を用いることで高い予測スキルを達成できるか?
- RQ4CFSv2と複数の機械学習モデルをアンサンブル化することで、異なる予測期間において統計的に有意に予測スキルが向上するか?
- RQ5AutoKNNが学習した最近傍の特徴は、歴史的気象データにおける季節的および時間的パターンをどの程度反映しているか?
主な発見
- MultiLLRモデル単体でも、気温および降水量予測の週3–4および週5–6において、補正済みCFSv2モデルを上回る性能を示した。
- 目的変数の履歴のみを用いるAutoKNNモデルも、両変数および予測期間において補正済みCFSv2モデルを上回った。
- MultiLLRとAutoKNNのアンサンブルは、4つの予測タスクすべてにおいて、トップRodeo競合モデルを上回った。
- 2011–2018年の期間にわたり、提案モデルと補正済みCFSv2のアンサンブルは、気温予測で40–50%、降水量予測で129–169%の高いスキルを達成した。
- 降水量予測では、選択されたモデルがより簡潔で、中央値の特徴数が4–5であったのに対し、気温予測では7であった。
- AutoKNNモデルの降水量に対する最近傍は強く季節的であり、上位の近傍は通常、同じ月のデータから選ばれていたが、気温の場合は年間を通じて広く分布していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。