[论文解读] ClimART: A Benchmark Dataset for Emulating Atmospheric Radiative Transfer in Weather and Climate Models
ClimART 引入了一个大规模、公开可用的基准数据集,包含超过一千万个当前、前工业时代和未来气候条件下的大气辐射传输样本,以加速机器学习(ML)对气候模型物理过程的模拟。该数据集使 ML 模型的严谨评估成为可能,揭示出图网络(GraphNets)和卷积神经网络(CNNs)等结构化架构在分布外泛化方面显著优于标准多层感知机(MLPs),尤其是在极端气候条件下,未来气候的均方根误差(RMSE)从超过 100 降至约 30。
Numerical simulations of Earth's weather and climate require substantial amounts of computation. This has led to a growing interest in replacing subroutines that explicitly compute physical processes with approximate machine learning (ML) methods that are fast at inference time. Within weather and climate models, atmospheric radiative transfer (RT) calculations are especially expensive. This has made them a popular target for neural network-based emulators. However, prior work is hard to compare due to the lack of a comprehensive dataset and standardized best practices for ML benchmarking. To fill this gap, we build a large dataset, ClimART, with more than \\emph{10 million samples from present, pre-industrial, and future climate conditions}, based on the Canadian Earth System Model. ClimART poses several methodological challenges for the ML community, such as multiple out-of-distribution test sets, underlying domain physics, and a trade-off between accuracy and inference speed. We also present several novel baselines that indicate shortcomings of datasets and network architectures used in prior work. Download instructions, baselines, and code are available at: https://github.com/RolnickLab/climart
研究动机与目标
- 为天气和气候建模中的机器学习模拟器基准测试解决缺乏标准化、综合性数据集的问题。
- 实现不同气候条件下(包括前工业时代和未来气候等分布外,OOD)ML 模型的公平比较。
- 通过提供可扩展、文档齐全的数据集、代码和基线模型,降低机器学习研究人员参与气候科学的门槛。
- 识别先前 ML 模型和数据集的局限性,特别是在极端大气条件下的一致性与泛化能力。
- 通过强调气候相关任务中的准确率-速度权衡和物理信息设计,推动机器学习方法论的创新。
提出的方法
- 该数据集 ClimART 源自加拿大地球系统模型(CanESM),模拟了当前、前工业时代和未来气候条件下的大气辐射传输。
- 包含超过一千万个样本,涵盖详细的气象剖面数据,包括气体浓度、温度、气压和地表反照率,以表征多样的辐射通量条件。
- 数据集被划分为分布内和分布外测试集,包括历史时期(1850–1852)和未来时期(2097–2099)的气候状态,用于分布外泛化能力的评估。
- 训练并评估了多种 ML 基线模型,包括 MLPs、CNNs、GCNs 和 GraphNets,使用标准化指标(如 RMSE 和 MBE)评估向上和向下辐射通量。
- 在 CPU 和 GPU 配置下对推理速度进行了基准测试,批量大小为 8192,以评估实际部署潜力。
- 通过损失函数和尊重底层辐射传输方程的模型架构,探索了物理信息设计。
实验结果
研究问题
- RQ1不同神经网络架构(如 MLP、CNN、GraphNet)在前工业时代和未来气候等分布外气候状态下的泛化能力如何?
- RQ2在 GPU 加速下,大气辐射传输 ML 模拟器的推理速度与准确率之间存在何种权衡?
- RQ3结构化模型(如 CNNs、GraphNets)在捕捉大气数据中的空间和物理依赖关系方面,相较于全连接 MLPs 的优势有多大?
- RQ4物理信息神经网络组件在辐射传输模拟中能否提升泛化能力和物理合理性?
- RQ5模型性能和鲁棒性在不同气候环境(包括晴空和极端气体浓度条件)下如何变化?
主要发现
- MLP 模型在未来的分布外数据上性能严重下降,RMSE 超过 100 W/m²,而 GraphNet 和 CNN 模型的 RMSE 分别保持在约 30 和 18 W/m² 左右。
- 在 GPU 上,GraphNet 模型的推理时间在非 MLP 模型中最快(每帧 0.1659 秒),甚至优于基于物理的 RT 模型在 CPU 上的表现。
- 在 GPU 上,MLP 模型的推理时间仅为每帧 0.0016 秒(批量大小 8192),相比基于物理的 RT 模型在 4 个 CPU 上的 3.3666 秒,实现了 2000 倍的加速。
- CNN 和 GraphNet 模型在分布外泛化方面显著优于 MLPs,表明架构归纳偏差对稳健气候建模至关重要。
- 基于物理的 RT 模型在 CPU 数量从 16 增加到 64 时收益递减,表明其在串行执行中存在硬件瓶颈,而 ML 模型则能通过批量处理高效扩展。
- 该数据集表明,仅在有限或简化数据(如水行星条件)上训练的模型无法泛化到真实大气变异性,凸显了全面、物理真实的基准的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。