Skip to main content
QUICK REVIEW

[论文解读] ChaosBench: A Multi-Channel, Physics-Based Benchmark for Subseasonal-to-Seasonal Climate Prediction

Juan Nathaniel, Yongquan Qu|arXiv (Cornell University)|Feb 1, 2024
Meteorological Phenomena and SimulationsEarth and Planetary Sciences被引用 3
一句话总结

ChaosBench 引入了一个大规模、多通道、基于物理的次季节到季节(S2S)气候预测基准,包含45年60个变量通道的观测数据以及来自四个国家气象局的44天物理驱动预报。该基准采用基于视觉和新型物理指标评估数据驱动模型(如 PanguWeather 和 GraphCast),揭示了专为短期天气预报优化的模型在S2S任务上表现不佳,甚至低于气候学基线。

ABSTRACT

Accurate prediction of climate in the subseasonal-to-seasonal scale is crucial for disaster preparedness and robust decision making amidst climate change. Yet, forecasting beyond the weather timescale is challenging because it deals with problems other than initial condition, including boundary interaction, butterfly effect, and our inherent lack of physical understanding. At present, existing benchmarks tend to have shorter forecasting range of up-to 15 days, do not include a wide range of operational baselines, and lack physics-based constraints for explainability. Thus, we propose ChaosBench, a challenging benchmark to extend the predictability range of data-driven weather emulators to S2S timescale. First, ChaosBench is comprised of variables beyond the typical surface-atmospheric ERA5 to also include ocean, ice, and land reanalysis products that span over 45 years to allow for full Earth system emulation that respects boundary conditions. We also propose physics-based, in addition to deterministic and probabilistic metrics, to ensure a physically-consistent ensemble that accounts for butterfly effect. Furthermore, we evaluate on a diverse set of physics-based forecasts from four national weather agencies as baselines to our data-driven counterpart such as ViT/ClimaX, PanguWeather, GraphCast, and FourCastNetV2. Overall, we find methods originally developed for weather-scale applications fail on S2S task: their performance simply collapse to an unskilled climatology. Nonetheless, we outline and demonstrate several strategies that can extend the predictability range of existing weather emulators, including the use of ensembles, robust control of error propagation, and the use of physics-informed models. Our benchmark, datasets, and instructions are available at https://leap-stc.github.io/ChaosBench.

研究动机与目标

  • 为次季节到季节(S2S)气候预测缺乏全面、长期、物理约束的基准问题提供解决方案。
  • 提供一个大规模、多通道的数据集,涵盖45年时间跨度,包含60个变量通道,以及来自四个国家气象局的44天预报。
  • 建立两个独立的S2S预测任务——全动力学预测与稀疏动力学预测——以满足多样化研究需求。
  • 将基于物理的评估指标与基于视觉的指标相结合,确保模型输出具有物理一致性且可解释。
  • 对最先进数据驱动模型(如 PanguWeather、FourCastNetV2、GraphCast、ClimaX)在S2S预测中的表现进行评估,揭示关键性能差距。

提出的方法

  • 该基准通过46万帧真实观测与模拟数据构建高维视频回归任务,覆盖60个变量通道(如温度、位势高度、湿度),空间分辨率为121×240。
  • 整合来自四个国家气象局(美国、欧洲、英国、亚洲)的44天预报作为数据驱动模型的业务基线。
  • 框架引入基于物理的评估指标,包括谱功率分布和滞后自编码器(Lagged AE)分析,用于评估模型在时间维度上的物理一致性和信号保持能力。
  • 定义了两个独立任务:(1) 全动力学预测,即预测全部48个目标变量;(2) 稀疏动力学预测,聚焦于关键变量子集。
  • 该基准支持自回归与直接推理两种方法,可评估模型的泛化能力与长时序稳定性。
  • 支持使用标准视觉指标(如RMSE)与新型物理感知指标对大规模数据驱动模型进行评估,以检测长期预报中不合理的物理行为。

实验结果

研究问题

  • RQ1与气候学基线相比,最先进数据驱动模型在长期次季节到季节(S2S)气候预测中的表现如何?
  • RQ2现有数据驱动模型在44天预报时长内对高频大气信号的保持程度如何?与物理驱动预报相比表现如何?
  • RQ3基于物理的指标是否能够检测到标准视觉指标可能忽略的模型输出中不合理的物理退化?
  • RQ4为何专为短期天气预报训练的模型在S2S任务中失败?其架构或训练过程中缺失了哪些物理原理?
  • RQ5在训练中引入时间信息与物理约束,如何影响长期预报精度与谱一致性?

主要发现

  • 数据驱动模型如 PanguWeather、FourCastNetV2、GraphCast 和 ClimaX 在S2S预测中的表现显著劣于长期气候学平均值,表明其在短期动力学之外的泛化能力存在根本性缺陷。
  • 高频谱信号在长期预报中迅速衰减,模型在 t=44 时已失去结构化的功率谱,尤其在自回归推理下更为明显,即使使用了时间建模也难以避免。
  • 基于物理的指标(如谱功率分布和滞后自编码器分析)揭示,数据驱动模型对高频大气变异性保持能力差,而低频信号则相对稳定。
  • FNO 模型在长时间滚动预测中表现出相对稳定的谱特性,表明某些网络架构在保持物理信号结构方面优于其他模型。
  • 专为短期天气预报训练的模型无法捕捉S2S系统对初始条件与边界条件的双重敏感性,凸显S2S建模中物理信息设计的必要性。
  • 引入基于物理的评估指标可暴露传统RMSE或像素级指标无法检测的不物理行为,如虚假信号放大或谱泄漏。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。