[论文解读] Deep Learning Based Cloud Cover Parameterization for ICON
本研究利用风暴分辨率模拟数据,开发并评估了基于深度学习的ICON气候模型云覆盖率参数化方法。在全局和区域粗粒度大气数据上进行训练的三种具有不同垂直局部性假设的神经网络架构,能够准确预测亚网格云覆盖率,其中全局训练的模型可成功泛化至区域数据;SHAP可解释性分析揭示了模型对特定湿度和云冰的过度依赖,凸显了局部学习模式及模型误差来源。
A promising approach to improve cloud parameterizations within climate models and thus climate projections is to use deep learning in combination with training data from storm-resolving model (SRM) simulations. The ICOsahedral Non-hydrostatic (ICON) modeling framework permits simulations ranging from numerical weather prediction to climate projections, making it an ideal target to develop neural network (NN) based parameterizations for sub-grid scale processes. Within the ICON framework, we train NN based cloud cover parameterizations with coarse-grained data based on realistic regional and global ICON SRM simulations. We set up three different types of NNs that differ in the degree of vertical locality they assume for diagnosing cloud cover from coarse-grained atmospheric state variables. The NNs accurately estimate sub-grid scale cloud cover from coarse-grained data that has similar geographical characteristics as their training data. Additionally, globally trained NNs can reproduce sub-grid scale cloud cover of the regional SRM simulation. Using the game-theory based interpretability library SHapley Additive exPlanations, we identify an overemphasis on specific humidity and cloud ice as the reason why our column-based NN cannot perfectly generalize from the global to the regional coarse-grained SRM data. The interpretability tool also helps visualize similarities and differences in feature importance between regionally and globally trained column-based NNs, and reveals a local relationship between their cloud cover predictions and the thermodynamic environment. Our results show the potential of deep learning to derive accurate yet interpretable cloud cover parameterizations from global SRMs, and suggest that neighborhood-based models may be a good compromise between accuracy and generalizability.
研究动机与目标
- 开发适用于ICON气候模型中亚网格尺度云覆盖率的准确且可解释的深度学习参数化方法。
- 评估在全球数据上训练的神经网络在区域风暴分辨率模拟数据上的泛化性能。
- 研究神经网络设计中垂直局部性在云覆盖率预测中的作用。
- 利用SHAP可解释性诊断神经网络中特征重要性及模型误差来源。
- 评估基于邻域的模型相较于基于列的模型在准确率与泛化能力之间是否具有更优的平衡。
提出的方法
- 训练了三种不同的神经网络架构:一种假设完全垂直局部性(基于列的模型),一种假设有限垂直上下文(基于邻域的模型),一种假设无垂直局部性(全局模型)。
- 训练数据源自高分辨率ICON风暴分辨率模拟(全球QUBICC和区域NARVAL)的粗粒度输出。
- 模型从温度、气压、比湿和云冰等粗粒度大气状态变量中预测云体积分数和云面积分数。
- 使用SHapley Additive ExPlanations(SHAP)将模型预测归因于输入特征,从而实现误差分解,并在不同模型间进行比较。
- 通过将模型预测的云覆盖率与原始风暴分辨率模拟的真实值进行比较,评估模型性能。
- 构建背景数据集,以确保SHAP分析中具有可比的基准值,从而实现跨模型的特征重要性稳健比较。
实验结果
研究问题
- RQ1在粗粒度风暴分辨率模拟数据上训练的深度神经网络,能否准确再现ICON模型中的亚网格尺度云覆盖率?
- RQ2神经网络架构中垂直局部性的程度如何影响其在不同空间域中的预测准确率与泛化能力?
- RQ3在全球数据上训练的神经网络在具有不同模型设置的区域模拟中,其泛化能力有多强?
- RQ4神经网络最依赖哪些大气变量,这与模型误差有何关联?
- RQ5基于SHAP的可解释性能否揭示区域与全局训练模型之间在特征重要性上的系统性差异?
主要发现
- 三种神经网络架构均能基于粗粒度数据准确估计亚网格尺度云覆盖率,其地理特征与训练数据一致。
- 在全球数据上训练的神经网络成功泛化至区域风暴分辨率模拟中的云覆盖率预测,表现出强大的可迁移性。
- SHAP分析显示,基于列的神经网络过度强调比湿和云冰,这限制了其从全球数据向区域数据的泛化能力。
- 可解释性工具表明,区域和全球训练的基于列的模型表现出相似的特征重要性模式,云覆盖率预测与局部热力学环境密切相关。
- 本研究结果表明,基于邻域的模型可能在准确率与泛化能力之间提供比纯基于列的模型更优的平衡。
- 结果表明,深度学习可生成准确、可解释且可迁移的云覆盖率参数化方法,适用于集成至气候模型中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。