Skip to main content
QUICK REVIEW

[论文解读] Meta Dropout: Learning to Perturb Features for Generalization

Haebeom Lee, Taewook Nam|arXiv (Cornell University)|May 30, 2019
Domain Adaptation and Few-Shot Learning参考文献 48被引用 4
一句话总结

本文提出 Meta-Dropout,一种基于元学习的正则化方法,通过训练一个输入相关的噪声生成器,在训练过程中扰动潜在特征,从而提升少样本学习中的泛化能力。通过学习根据输入上下文自适应地扰动特征,Meta-Dropout 在 Omniglot 和 miniImageNet 基准上显著优于现有的方法,如流形混合(manifold mixup)和信息丢弃(information dropout)。

ABSTRACT

A machine learning model that generalizes well should obtain low errors on unseen test examples. Thus, if we know how to optimally perturb training examples to account for test examples, we may achieve better generalization performance. However, obtaining such perturbation is not possible in standard machine learning frameworks as the distribution of the test data is unknown. To tackle this challenge, we propose a novel regularization method, meta-dropout, which learns to perturb the latent features of training examples for generalization in a meta-learning framework. Specifically, we meta-learn a noise generator which outputs a multiplicative noise distribution for latent features, to obtain low errors on the test instances in an input-dependent manner. Then, the learned noise generator can perturb the training examples of unseen tasks at the meta-test time for improved generalization. We validate our method on few-shot classification datasets, whose results show that it significantly improves the generalization performance of the base model, and largely outperforms existing regularization methods such as information bottleneck, manifold mixup, and information dropout.

研究动机与目标

  • 为了解决在训练期间测试数据分布未知时提升模型泛化能力的挑战。
  • 开发一种正则化方法,通过在元训练过程中学习潜在特征的最优扰动,显式最小化测试损失。
  • 实现可迁移的、输入特定的噪声生成,使其能够适应少样本学习中的未见任务。
  • 超越现有的正则化技术,如信息瓶颈、流形混合和信息丢弃。
  • 为该方法提供一个概率解释,即在变分推断框架下的元学习。

提出的方法

  • 该方法使用元学习训练一个噪声生成器,基于低层网络的输入相关特征,生成对潜在特征的乘法噪声分布。
  • 噪声生成器通过元学习目标端到端训练,以最小化在多个任务上、随机划分训练/测试集的期望测试损失。
  • 在训练过程中,噪声以随机乘法扰动的形式应用于潜在特征,噪声分布为输入特定且自适应。
  • 该框架被解释为对图模型的变分推断过程进行元学习,其中噪声生成器充当后验近似。
  • 该方法被应用于基于 MAML 的少样本学习框架中,噪声生成器通过内循环和外循环优化联合训练。
  • 噪声生成器使用固定方差(例如单位矩阵),但其输出条件依赖于输入特征,从而实现自适应且可迁移的扰动。

实验结果

研究问题

  • RQ1基于元学习的、输入相关的噪声生成器是否能在少样本学习中实现超越标准正则化的泛化性能?
  • RQ2与固定或输入无关的噪声相比,输入相关的噪声在泛化性能上表现如何?
  • RQ3基于元学习的扰动能否被解释为图模型中的一种变分推断形式?
  • RQ4与基线模型相比,Meta-Dropout 是否在对抗攻击下表现出更强的鲁棒性?
  • RQ5Meta-Dropout 的性能与当前最先进的正则化器(如流形混合和信息丢弃)相比如何?

主要发现

  • 在 Omniglot 1-shot(ℓ₁)上,Meta-Dropout 达到 96.63% 的准确率,在 ℓ₂ 上达到 98.73%,显著优于 MAML 和其他基线方法。
  • 在 Omniglot 5-shot(ℓ∞)上,Meta-Dropout 达到 67.42% 的准确率,比表现最好的基线方法高出超过 4 个百分点。
  • 采用输入相关噪声的方法始终优于固定高斯、独立高斯和权重学习高斯等基线,证明了输入特定扰动的重要性。
  • 使用固定方差的 Meta-Dropout 优于学习自适应方差的变体,表明固定噪声尺度在泛化方面更有效。
  • 消融研究证实,确定性组件(学习到的缩放)和随机组件(噪声注入)均不可或缺,二者结合可获得最佳性能。
  • Meta-Dropout 展现出更强的对抗鲁棒性,在 PGD 攻击下保持更高的干净准确率,优于标准 MAML 和其他基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。