[论文解读] Learning Invariances using the Marginal Likelihood
该论文提出一种方法,通过将输入不变性直接嵌入核结构并利用边缘似然进行优化,实现高斯过程模型中输入不变性的学习。利用可微采样过程获得的无偏核估计进行变分推断,该方法实现了端到端训练,以发现最优不变性(如仿射变换和局部形变),从而在MNIST变体上实现更好的泛化性能,且边缘似然能正确识别出更优模型,无需验证数据。
Generalising well in supervised learning tasks relies on correctly extrapolating the training data to a large region of the input space. One way to achieve this is to constrain the predictions to be invariant to transformations on the input that are known to be irrelevant (e.g. translation). Commonly, this is done through data augmentation, where the training set is enlarged by applying hand-crafted transformations to the inputs. We argue that invariances should instead be incorporated in the model structure, and learned using the marginal likelihood, which correctly rewards the reduced complexity of invariant models. We demonstrate this for Gaussian process models, due to the ease with which their marginal likelihood can be estimated. Our main contribution is a variational inference scheme for Gaussian processes containing invariances described by a sampling procedure. We learn the sampling procedure by back-propagating through it to maximise the marginal likelihood.
研究动机与目标
- 通过在模型先验中用不变性建模替代数据增强,解决监督学习中数据增强的局限性。
- 实现通过边缘似然在高斯过程模型中直接学习不变性(如旋转、剪切和形变)。
- 通过可微采样获得无偏核估计,克服非闭式不变核的工程挑战。
- 证明边缘似然可作为端到端优化不变性参数的有效、可微目标函数。
- 表明该方法在MNIST变体上泛化性能良好,优于标准RBF核,且无需验证集即可实现模型选择。
提出的方法
- 该方法使用双重求和核,通过对给定不变性分布下变换后的输入平均基础核(如RBF)来实现。
- 提出边缘似然的变分下界,仅依赖于核的无偏估计,从而在积分或求和不可计算时仍可实现优化。
- 通过可微采样过程(如仿射变换、形变)对不变性进行建模,可反向传播以优化不变性参数。
- 通过参数化不变性变换的分布进行采样,构建核估计,从而实现对不变性结构的基于梯度的优化。
- 完整训练目标为边缘似然的变分下界,使用重参数化梯度的随机梯度下降进行最大化。
- 该方法支持端到端训练,其中高斯过程超参数与不变性参数通过反向传播联合优化。
实验结果
研究问题
- RQ1能否利用边缘似然作为目标函数,在高斯过程模型中有效学习仿射变换和局部形变等不变性?
- RQ2当作为模型选择标准使用时,边缘似然是否能正确识别出最佳不变性结构,而无需依赖验证集?
- RQ3对不变性的可微采样过程是否能实现高斯过程与不变性参数的端到端联合优化?
- RQ4在MNIST等基准数据集上,所学习不变性的性能与手工设计的数据增强或固定不变性假设相比如何?
- RQ5在联合学习不变性参数、高斯过程超参数和变分后验时,优化动力学如何?
主要发现
- 具有学习到的仿射变换的高斯过程模型在MNIST上的测试误差为1.35%,显著优于RBF基线的2.15%。
- 具有学习到的局部形变的模型在MNIST上的测试误差为1.47%,同样优于RBF基线,表明非刚性形变比刚性旋转对MNIST更有效。
- 边缘似然界在所有实验中均正确识别出表现最佳的模型,即使联合优化未达到使用真实不变性初始化的模型性能。
- 仅对旋转不变的模型相比RBF基线仅略有提升,表明仅旋转不变性不足以实现MNIST的泛化。
- 该方法成功在无需验证集的情况下学习到不变性,因为边缘似然作为模型选择的可靠且可微的目标函数。
- 在旋转MNIST实验中,具有固定不变性边界(如±45°或±179°)的模型优于具有学习参数的模型,表明联合训练存在优化挑战,但边缘似然仍能正确对最佳模型进行排序。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。