[论文解读] Data-Efficient Operator Learning via Unsupervised Pretraining and In-Context Learning
本文提出了一种数据高效的神经算子学习框架,用于科学机器学习中的偏微分方程(PDE)问题,通过结合无监督预训练(在未标注PDE数据上)和推理时上下文学习实现。该方法减少了训练过程中对昂贵PDE模拟的依赖,并在推理时实现灵活、零成本的 few-shot 泛化,即使在数据有限的情况下,其性能也优于随机初始化和视觉预训练模型。
Recent years have witnessed the promise of coupling machine learning methods and physical domain-specific insights for solving scientific problems based on partial differential equations (PDEs). However, being data-intensive, these methods still require a large amount of PDE data. This reintroduces the need for expensive numerical PDE solutions, partially undermining the original goal of avoiding these expensive simulations. In this work, seeking data efficiency, we design unsupervised pretraining for PDE operator learning. To reduce the need for training data with heavy simulation costs, we mine unlabeled PDE data without simulated solutions, and we pretrain neural operators with physics-inspired reconstruction-based proxy tasks. To improve out-of-distribution performance, we further assist neural operators in flexibly leveraging a similarity-based method that learns in-context examples, without incurring extra training costs or designs. Extensive empirical evaluations on a diverse set of PDEs demonstrate that our method is highly data-efficient, more generalizable, and even outperforms conventional vision-pretrained models. We provide our code at https://github.com/delta-lab-ai/data_efficient_nopt.
研究动机与目标
- 解决神经算子学习在PDE问题中对大量数据的依赖,而这些数据通常依赖于昂贵的数值模拟。
- 通过在无标签PDE数据上进行无监督预训练,利用未标注数据降低训练过程中的模拟成本。
- 通过推理时的上下文学习,实现在无需额外训练或微调的情况下提升分布外泛化能力。
- 证明在未标注PDE数据上进行预训练所获得的归纳偏置优于现成的视觉预训练模型。
提出的方法
- 设计两个基于重构的代理任务,用于在未标注PDE数据上进行无监督预训练,以学习有意义的函数空间表征。
- 使用这些代理任务对神经算子进行预训练,以在下游微调阶段提升数据效率和泛化能力。
- 提出一种灵活、零开销的上下文学习策略,使模型能够在推理时使用任意数量的示范样本,自适应地适应未见过的物理参数。
- 保持标准训练流程不变,实现推理时无缝集成上下文学习。
- 在微调过程中使用标准神经算子架构(如FNO)并固定编码器层,以评估表征质量。
- 在多种PDE上评估性能,包括Helmholtz方程、对流-扩散方程和波动方程,在低数据量和分布外设置下进行测试。
实验结果
研究问题
- RQ1如何通过在未标注PDE数据上进行无监督预训练,减少神经算子训练中对模拟解数据的依赖?
- RQ2在未标注PDE数据上进行预训练是否能带来优于使用现成视觉预训练模型的泛化性能?
- RQ3如何设计上下文学习机制,以在不增加额外训练成本的情况下提升神经算子的分布外泛化能力?
- RQ4无监督预训练与上下文学习的结合是否能在多种PDE族中实现更优的数据效率和鲁棒性?
主要发现
- 在未标注PDE数据上进行无监督预训练显著减少了微调阶段所需的模拟PDE解的数量,实现了与使用更大数据量训练的模型相当的性能。
- 所提出的无监督预训练方法优于视觉预训练模型(如Video-MAE),尤其在低数据设置下表现更优,并在长序列滚动预测中保持更稳定的性能。
- 在未标注PDE数据上进行预训练可减少过拟合和泛化差距,且无需早停策略,表明其具有强大的正则化效果。
- 即使在微调时使用预训练阶段固定的编码器特征,模型性能仍优于从零开始训练的基线模型,证明了所学表征的质量。
- 上下文学习在所有测试的PDE中均提升了分布外泛化能力,且随着示范样本数量的增加,性能持续提升。
- 上下文学习机制在解决方案精度上优于标准微调模型,可视化结果表明预测解在颜色条范围上更接近真实值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。