Skip to main content
QUICK REVIEW

[論文レビュー] ClimateSet: A Large-Scale Climate Model Dataset for Machine Learning

Julia Kaltenborn, Charlotte Emilie Elektra Lange|arXiv (Cornell University)|Nov 7, 2023
Scientific Computing and Data Management被引用数 5
ひとこと要約

ClimateSet は、36 個の CMIP6 および Input4MIPs 気象モデルからの入力と出力を含む大規模で一貫性があり、機械学習に適したデータセットであり、気候エミュレーションのためのマルチモデル機械学習を可能にする。このデータセットは、モデルを横断して一般化することができる「スーパー エミュレータ」の訓練を支援し、実験の結果、U-Net や ConvLSTM が優れた性能を示し、特に ClimaX Frozen のようなモデルでは、転移学習が一般化を向上させることを示している。

ABSTRACT

Climate models have been key for assessing the impact of climate change and simulating future climate scenarios. The machine learning (ML) community has taken an increased interest in supporting climate scientists' efforts on various tasks such as climate model emulation, downscaling, and prediction tasks. Many of those tasks have been addressed on datasets created with single climate models. However, both the climate science and ML communities have suggested that to address those tasks at scale, we need large, consistent, and ML-ready climate model datasets. Here, we introduce ClimateSet, a dataset containing the inputs and outputs of 36 climate models from the Input4MIPs and CMIP6 archives. In addition, we provide a modular dataset pipeline for retrieving and preprocessing additional climate models and scenarios. We showcase the potential of our dataset by using it as a benchmark for ML-based climate model emulation. We gain new insights about the performance and generalization capabilities of the different ML models by analyzing their performance across different climate models. Furthermore, the dataset can be used to train an ML emulator on several climate models instead of just one. Such a "super emulator" can quickly project new climate change scenarios, complementing existing scenarios already provided to policymakers. We believe ClimateSet will create the basis needed for the ML community to tackle climate-related tasks at scale.

研究の動機と目的

  • マルチモデル学習のための、大規模で一貫性があり、機械学習に適した気象モデルデータセットが不足しているという問題に対処すること。
  • 単一モデルのデータに依存するのではなく、多様な気象モデルを横断して一般化できる機械学習モデルを可能にすること。
  • エミュレーション、ダウンスケーリング、シナリオ予測などのスケーラブルな気候モデリングタスクを支援すること。
  • 追加の気象モデルやシナリオの取得および前処理のためのモジュラーなパイプラインを提供すること。
  • 多様な機械学習アーキテクチャを用いた気候エミュレーションのベンチマークを通じて、マルチモデル学習の価値を示すこと。

提案手法

  • データセットは、大気、海洋、陸面変数を含む、CMIP6 および Input4MIPs からの 36 個の気象モデルを集約している。
  • 一貫性のある空間的・時間的解像度を確保するため、モジュラーなパイプラインを用いてデータを前処理している。
  • 複数の気象モデルを同時に学習および評価できるように設計されており、これにより「スーパー エミュレータ」の訓練が可能になっている。
  • 実験では、表面気温(TAS)および降水量(PR)の気候エミュレーションに、U-Net や ConvLSTM、ClimaX といった標準的な機械学習モデルを用いている。
  • 転移学習は、あるモデルで事前学習を行い、別のモデルでファインチューニングすることで、一般化能力を評価している。
  • 性能評価は、複数のモデルおよびシナリオにおけるテストセットの RMSE を用いている。

実験結果

リサーチクエスチョン

  • RQ1大規模で一貫性のあるマルチモデルデータセット上で学習された単一の機械学習モデルは、多様な気象モデルを横断して効果的に一般化できるか?
  • RQ2予測精度および耐性の観点から、マルチモデル学習(スーパー エミュレーション)は単一モデルエミュレーションと比べてどのように異なるか?
  • RQ3転移学習の設定において、どの機械学習アーキテクチャが異なる気象モデルに最もよく一般化するか?
  • RQ4ある気象モデルで事前学習することで、別のモデルでの性能がどの程度向上するか?
  • RQ5複数のモデルで学習された「スーパー エミュレータ」は、政策立案者による気候シナリオ予測を加速させることができるか?

主な発見

  • 複数の気象モデルで学習されたスーパー エミュレータは、競争力のある性能を示しており、特に ConvLSTM がすべての選択されたデータセットで最高の性能を発揮した。
  • ファインチューニング実験において、U-Net は他のモデルを上回り、気象モデルを横断して一般化する能力が優れていることが示された。
  • ClimaX Frozen はファインチューニングによって最大の性能向上を示し、多様なモデルで事前学習することで大幅な改善が可能な余地があることが示された。
  • BCC-CSM2-MR や EC-Earth3 で事前学習することで、NorESM2-LM での性能が向上し、学習されたパターンの転送可能性が確認された。
  • 表 8 の正の RMSE 差は、ファインチューニングが一貫して性能を向上させることを示しており、気象モデル間に転送可能なパターンが存在することが裏付けられた。
  • モジュラーなパイプラインにより、追加の気象モデルのスケーラブルな取得および前処理が可能となり、今後のデータセットの拡張を支援している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。