Skip to main content
QUICK REVIEW

[论文解读] Combining data assimilation and machine learning to infer unresolved scale parametrisation

Julien Brajard, Alberto Carrassi|arXiv (Cornell University)|Sep 9, 2020
Meteorological Phenomena and Simulations参考文献 42被引用 10
一句话总结

本文提出一种混合建模框架,结合数据同化(DA)与机器学习(ML),从噪声大且稀疏的观测中推断未解析尺度的参数化方法。通过使用集合卡尔曼滤波(EnKF)从不完整数据中估计模型误差,并训练神经网络以模拟该误差,该方法相较于仅使用截断物理模型的预测模型具有更高的准确性,在洛伦兹双尺度模型与MAOOAM模型中均显著提升了吸引子表征能力与预测技能。

ABSTRACT

In recent years, machine learning (ML) has been proposed to devise data-driven parametrisations of unresolved processes in dynamical numerical models. In most cases, the ML training leverages high-resolution simulations to provide a dense, noiseless target state. Our goal is to go beyond the use of high-resolution simulations and train ML-based parametrisation using direct data, in the realistic scenario of noisy and sparse observations. The algorithm proposed in this work is a two-step process. First, data assimilation (DA) techniques are applied to estimate the full state of the system from a truncated model. The unresolved part of the truncated model is viewed as a model error in the DA system. In a second step, ML is used to emulate the unresolved part, a predictor of model error given the state of the system. Finally, the ML-based parametrisation model is added to the physical core truncated model to produce a hybrid model. The DA component of the proposed method relies on an ensemble Kalman filter while the ML parametrisation is represented by a neural network. The approach is applied to the two-scale Lorenz model and to MAOOAM, a reduced-order coupled ocean-atmosphere model. We show that in both cases the hybrid model yields forecasts with better skill than the truncated model. Moreover, the attractor of the system is significantly better represented by the hybrid model than by the truncated model.

研究动机与目标

  • 开发一种数据驱动的方法,用于在仅有噪声大且稀疏观测的情况下,对动力模型中的未解析尺度进行参数化。
  • 克服现有基于机器学习的参数化方法依赖高分辨率模拟或无噪声数据的局限性。
  • 将数据同化与机器学习相结合,从不完整观测中估计模型误差,并训练神经网络以预测该误差。
  • 构建一种混合模型,将基于物理的截断模型与学习到的参数化方法相结合,以提升预测准确性与动力一致性。
  • 在低阶混沌模型(洛伦兹双尺度模型与MAOOAM)上验证该方法,在真实观测条件下评估其性能。

提出的方法

  • 使用集合卡尔曼滤波(EnKF)从噪声大、稀疏的观测中估计系统的完整状态,将未解析尺度视为模型误差。
  • 将模型误差定义为真实系统演化与截断模型在低维状态空间中预测结果之间的差异。
  • 训练前馈神经网络,学习从解析状态到估计模型误差的映射关系,使用数据同化估计的状态作为训练数据。
  • 通过将训练好的神经网络参数化方法添加到截断模型的物理核心中,构建混合模型。
  • 将该方法应用于两个测试系统:双尺度洛伦兹模型与MAOOAM大气-海洋模型,通过对比理想观测与噪声观测评估性能。
  • 在两个模型中采用相同的训练与评估协议,以评估方法对观测噪声与空间稀疏性的鲁棒性。

实验结果

研究问题

  • RQ1当仅使用噪声大且稀疏的观测进行训练时,机器学习模型能否有效学习未解析尺度的参数化方法,而无需依赖高分辨率模拟?
  • RQ2在真实观测条件下,该混合模型相较于截断模型在预测技能与吸引子表征方面表现如何?
  • RQ3利用数据同化来估计模型误差在多大程度上改善了神经网络参数化的训练效果?
  • RQ4该混合模型在混沌、多尺度系统中对观测噪声与空间采样稀疏性的鲁棒性如何?
  • RQ5该方法能否推广至更复杂、高维的模型,如实际气候与天气预报中使用的模型?

主要发现

  • 即使在仅使用噪声大且稀疏观测进行训练的情况下,该混合模型在双尺度洛伦兹系统与MAOOAM模型中均显著提升了预测技能,优于截断模型。
  • 与截断模型相比,混合模型对系统吸引子的表征更优,基于数据同化的混合模型展现出更优的动力一致性。
  • 对于MAOOAM模型,基于噪声观测训练的混合模型在海洋变量上的预测技能与基于理想观测训练的混合模型相当。
  • 该方法对高噪声观测与稀疏空间分布具有鲁棒性,尽管观测频率降低时预测技能有所下降。
  • 在数据同化估计状态上训练的神经网络成功模拟了未解析尺度的影响,减少了模型误差并改善了长期动力行为。
  • 该方法在高维系统中具有良好可扩展性,且无需物理模型的伴随模型,从而简化了实现与维护工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。