[论文解读] Equivariant Learning of Stochastic Fields: Gaussian Processes and Steerable Conditional Neural Processes
本文提出了一种新型的协变模型——可旋转条件神经过程(Steerable Conditional Neural Processes, SteerCNPs),用于学习物理与工程中的随机场,如矢量场。通过利用群论和可旋转核函数强制实现旋转与反射下的协变性,SteerCNPs 在合成数据与真实世界数据上均展现出更优的泛化能力与鲁棒性,在似然估计与迁移学习任务中均优于基线模型,尤其在数据增强与分布偏移设置下表现更佳。
Motivated by objects such as electric fields or fluid streams, we study the problem of learning stochastic fields, i.e. stochastic processes whose samples are fields like those occurring in physics and engineering. Considering general transformations such as rotations and reflections, we show that spatial invariance of stochastic fields requires an inference model to be equivariant. Leveraging recent advances from the equivariance literature, we study equivariance in two classes of models. Firstly, we fully characterise equivariant Gaussian processes. Secondly, we introduce Steerable Conditional Neural Processes (SteerCNPs), a new, fully equivariant member of the Neural Process family. In experiments with Gaussian process vector fields, images, and real-world weather data, we observe that SteerCNPs significantly improve the performance of previous models and equivariance leads to improvements in transfer learning tasks.
研究动机与目标
- 开发一种尊重物理对称性(如旋转与反射)的机器学习模型,用于随机场建模。
- 形式化描述高斯过程在空间变换下保持协变性的条件。
- 设计一种新型神经过程变体——SteerCNPs,通过可旋转核函数与群表示强制实现协变性。
- 在少样本与分布外设置下,展示改进的性能与泛化能力。
- 弥合协变深度学习与概率建模之间的鸿沟,服务于科学机器学习。
提出的方法
- 论文基于群表示理论,推导出向量值高斯过程在正交变换下保持协变性的充要条件。
- 提出 SteerCNPs,一种条件神经过程,采用具有纤维表示的可旋转卷积层,确保在 O(n) 的有限子群(如 C₄、C₈、D₄、D₈)下的协变性。
- 模型采用群协变的消息传递机制,使上下文点在群作用下与预测场一致变换。
- 通过使用群 H 的不可约表示,确保模型输出在群运算下与输入以相同方式变换,从而保持协变性。
- 采用端到端训练,通过最大化似然函数优化,使用 softplus 激活函数处理协方差,sigmoid 激活函数处理均值,以维持不变性与有界输出。
- 通过使用空白图像与旋转数字的数据增强策略,提升对分布偏移与上下文外泛化任务的鲁棒性。
实验结果
研究问题
- RQ1在何种条件下,随机过程模型在旋转与反射等空间变换下保持协变性?
- RQ2如何构建在 Rⁿ 中一般正交变换下协变的高斯过程?
- RQ3我们能否设计一种在非平移对称性(如旋转与反射)下完全协变的神经过程模型?
- RQ4强制协变性是否能提升少样本与分布外设置下的泛化能力与鲁棒性?
- RQ5协变性在真实世界科学数据(如气象场与矢量场)上的性能表现如何?
主要发现
- SteerCNPs 在旋转 MNIST 上的平均测试对数似然得分显著高于基线模型,达到 1.18 ± 0.02,而 ConvCNP 为 1.06 ± 0.04。
- 采用 D₈ 对称性的模型表现最佳,表明更丰富的对称群可提升泛化能力。
- 定性结果表明,SteerCNPs 在旋转下保持一致的预测结果,而非协变模型(如 ConvCNP)在上下文集旋转时产生不稳定的输出。
- 在外推任务中,SteerCNPs 对未见区域与更大画布的泛化能力更强,且在远离上下文点的位置噪声预测更少。
- 训练过程中引入空白图像可提升对测试集中大范围空白区域的泛化能力,减轻分布偏移问题。
- 协变性显著提升迁移学习性能,尤其在旋转与分布偏移设置下,验证了物理归纳偏置的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。