Skip to main content
QUICK REVIEW

[论文解读] Information Theoretic Meta Learning with Gaussian Processes

Michalis K. Titsias, Ruiz, Francisco J. R.|arXiv (Cornell University)|Sep 7, 2020
Domain Adaptation and Few-Shot Learning参考文献 40被引用 5
一句话总结

该论文提出了一种基于变分推断近似信息瓶颈原理中互信息的新型信息论元学习框架。它提出了一种基于记忆的高斯过程方法,用于非参数化任务编码,在少样本回归任务上实现了最先进性能,并在四个少样本分类基准上取得了具有竞争力的结果,优于MAML在回归任务中的表现。

ABSTRACT

We formulate meta learning using information theoretic concepts; namely, mutual information and the information bottleneck. The idea is to learn a stochastic representation or encoding of the task description, given by a training set, that is highly informative about predicting the validation set. By making use of variational approximations to the mutual information, we derive a general and tractable framework for meta learning. This framework unifies existing gradient-based algorithms and also allows us to derive new algorithms. In particular, we develop a memory-based algorithm that uses Gaussian processes to obtain non-parametric encoding representations. We demonstrate our method on a few-shot regression problem and on four few-shot classification problems, obtaining competitive accuracy when compared to existing baselines.

研究动机与目标

  • 将现有元学习算法统一到基于信息瓶颈的信息论原理框架下。
  • 解决元学习中缺乏一种通用且可计算的学习原则的问题,以统一和扩展现有方法。
  • 开发一种基于高斯过程的新型基于记忆的元学习算法,用于非参数化任务编码。
  • 在少样本回归和分类任务上验证所提框架的有效性。

提出的方法

  • 将元学习建模为一个优化问题,通过任务表示与支持集/验证集之间的互信息来定义。
  • 应用变分推断来近似信息瓶颈中难以计算的互信息,从而得到一个可计算的目标,称为变分信息瓶颈(VIB)。
  • 通过使用高斯过程对任务支持集的随机编码进行建模,推导出一种基于记忆的算法,实现非参数化表征学习。
  • 采用深度神经核函数提取特征表征,其中核函数基于线性或余弦相似度以支持GP推断。
  • 通过共享编码器网络实现近端推断,以高效计算任务上的GP后验分布。
  • 在所有数据集上仅使用一个正则化系数 β = 0.001 来展示鲁棒性,超参数通过标准优化进行调优。

实验结果

研究问题

  • RQ1信息论原则(如信息瓶颈)能否为元学习提供一个统一的框架?
  • RQ2如何利用互信息的变分近似来推导出基于梯度和基于记忆的元学习算法?
  • RQ3基于非参数化GP的编码是否能在少样本回归任务中优于参数化模型(如MAML)?
  • RQ4所提框架能否在少样本分类任务上实现具有竞争力的性能?
  • RQ5该方法是否能在多样化的少样本基准上实现最先进性能,而无需大量超参数调优?

主要发现

  • 在少样本正弦回归任务中,GP-VIB方法的误差低于MAML,表明其在回归设置中具有更优的泛化能力。
  • 在mini-ImageNet和CUB少样本分类基准上,GP-VIB在某些设置下实现了最先进准确率,尤其在使用余弦相似度核时表现更优。
  • 使用CosSim核的GP-VIB模型在5-shot CUB上达到了78.35%的准确率(±0.23),优于所有基线方法,包括MAML和基于DKT的方法。
  • 在跨域少样本分类任务(Omniglot → EMNIST)中,使用CosSim的GP-VIB达到了40.70%的准确率(±0.48),是该划分上所有方法中的最高值。
  • 该方法在所有基准上均表现出具有竞争力的性能,即使仅使用单一固定β超参数,结果也接近最佳基线。
  • 该框架成功恢复了MAML和概率性MAML等基于梯度的方法,验证了其通用性和理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。