Skip to main content
QUICK REVIEW

[论文解读] Explainable Offline-Online Training of Neural Networks for Parameterizations: A 1D Gravity Wave-QBO Testbed in the Small-data Regime

Hamid A. Pahlavan, Pedram Hassanzadeh|arXiv (Cornell University)|Sep 16, 2023
Meteorological Phenomena and Simulations参考文献 44被引用 6
一句话总结

本研究提出了一种气候模型中基于神经网络的参数化方法的离线-在线训练策略,其中在小样本数据(18个月)上离线训练的12层卷积神经网络(CNN)无法产生真实的准两年振荡(QBO)动力学,但通过使用时间平均的QBO统计量进行集合卡尔曼反演(EKI)对仅两个层进行在线再训练,成功恢复了准确性。傅里叶分析显示,该网络学习到了与重力波动力学一致的低通、高通和带通滤波器。

ABSTRACT

There are different strategies for training neural networks (NNs) as subgrid-scale parameterizations. Here, we use a 1D model of the quasi-biennial oscillation (QBO) and gravity wave (GW) parameterizations as testbeds. A 12-layer convolutional NN that predicts GW forcings for given wind profiles, when trained offline in a big-data regime (100-years), produces realistic QBOs once coupled to the 1D model. In contrast, offline training of this NN in a small-data regime (18-months) yields unrealistic QBOs. However, online re-training of just two layers of this NN using ensemble Kalman inversion and only time-averaged QBO statistics leads to parameterizations that yield realistic QBOs. Fourier analysis of these three NNs' kernels suggests why/how re-training works and reveals that these NNs primarily learn low-pass, high-pass, and a combination of band-pass filters, consistent with the importance of both local and non-local dynamics in GW propagation/dissipation. These findings/strategies apply to data-driven parameterizations of other climate processes generally.

研究动机与目标

  • 解决在气候模型中对子网格尺度过程进行数据稀缺、物理信息约束的神经网络参数化训练的挑战。
  • 探究在线再训练是否能够纠正基于小样本数据离线训练的神经网络重力波参数化中出现的性能退化问题。
  • 探索是否可以使用时间平均的大尺度统计量而非完整高分辨率数据,用于在线训练。
  • 通过傅里叶分析理解神经网络中学习到的滤波器的功能角色,以建立网络行为与物理波动力学之间的联系。
  • 证明物理信息初始化和高效的集合规模可改善使用EKI进行在线学习时的收敛性。

提出的方法

  • 在100年的高保真重力波强迫数据上离线训练一个12层卷积神经网络(CNN),以在1D模型中产生真实的QBO。
  • 在仅18个月的数据上(小样本情形)重新训练相同的CNN,导致产生非物理的QBO,随后使用集合卡尔曼反演(EKI)进行在线再训练。
  • 在在线EKI训练期间,仅使用时间平均的QBO统计量(如纬向风廓线)作为观测约束,避免使用完整的时间序列数据。
  • 对训练后CNN的卷积核进行傅里叶分析,识别主要的频率滤波器(低通、高通、带通),并解释其物理相关性。
  • 使用固定200个成员的集合规模进行EKI,仅优化CNN的两个层,利用物理信息先验以改善收敛性。
  • 使用开源的EnsembleKalmanProcesses.jl和qbo1d代码库分别进行EKI和1D-QBO模拟,确保可复现性。

实验结果

研究问题

  • RQ1是否可以通过使用时间平均统计量的在线再训练,纠正基于小样本数据训练的神经网络参数化在1D QBO模型中的失败?
  • RQ2训练后的神经网络学习到了哪些类型的频率滤波器?这些滤波器与重力波传播和耗散的物理过程有何关联?
  • RQ3EKI训练中所需的集合成员数量是否随深层神经网络的参数数量而增加,还是受网络有效维度的限制?
  • RQ4基于物理信息的神经网络权重初始化是否能改善使用EKI进行在线学习的收敛性和成功率?
  • RQ5该离线-在线训练策略在多大程度上可推广至气候建模中其他子网格尺度参数化问题?

主要发现

  • 在18个月数据(小样本情形)上进行离线训练导致产生非物理的QBO,而使用100年数据进行离线训练则能产生真实的QBO动力学。
  • 通过EKI和时间平均QBO统计量对仅两个层进行在线再训练,成功恢复了真实的QBO行为,证明了离线-在线策略的有效性。
  • 对CNN卷积核进行傅里叶分析显示,网络学习到了低通、高通和带通滤波器,与重力波传播中局部与非局部波动力学的重要性一致。
  • 尽管网络规模不同(1000、5000、10000个参数),仅需200个集合成员即可实现EKI收敛,表明过参数化会降低有效参数空间的维度。
  • 在在线训练中使用随机初始化的网络权重导致超过95%的集合成员失败,但当使用基于SpArK框架滤波器分析的先验信息时,成功实现了收敛。
  • 基于学习到的滤波器类型(如低通、高通)进行物理信息初始化,是改善气候模型中深层神经网络在线训练时EKI收敛性并降低计算成本的有前景策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。