Skip to main content
QUICK REVIEW

[论文解读] Uncertainty in Multitask Transfer Learning

Alexandre Lacoste, Boris N. Oreshkin|arXiv (Cornell University)|Jun 20, 2018
Domain Adaptation and Few-Shot Learning参考文献 30被引用 12
一句话总结

该论文提出 Deep Prior,一种变分贝叶斯方法,通过分层贝叶斯神经网络从多个多样化任务中学习丰富且与任务无关的先验。通过分离任务特定参数与共享参数,并使用原型网络进行任务条件化,该方法在 5-shot Mini-Imagenet 上实现了 74.5% 的最先进准确率,优于 MAML 和其他基线方法,尤其在异质任务设置下表现更优。

ABSTRACT

Using variational Bayes neural networks, we develop an algorithm capable of accumulating knowledge into a prior from multiple different tasks. The result is a rich and meaningful prior capable of few-shot learning on new tasks. The posterior can go beyond the mean field approximation and yields good uncertainty on the performed experiments. Analysis on toy tasks shows that it can learn from significantly different tasks while finding similarities among them. Experiments of Mini-Imagenet yields the new state of the art with 74.5% accuracy on 5 shot learning. Finally, we provide experiments showing that other existing methods can fail to perform well in different benchmarks.

研究动机与目标

  • 开发一种可扩展的方法,从多个多样化任务中学习有意义且灵活的先验,以提升少样本泛化能力。
  • 解决现有迁移学习方法在任务异质或不相似时失效的局限性。
  • 通过贝叶斯神经网络实现在低数据场景下的有效不确定性估计与后验近似。
  • 通过结合分层贝叶斯建模与任务特定适应机制,提升少样本学习性能。
  • 证明单表征模型在异质基准上会失效,需依赖任务条件化先验以实现鲁棒迁移。

提出的方法

  • 采用分层贝叶斯框架,其中任务特定权重 $w_j$ 从共享先验 $p(w_j | \alpha)$ 中抽取,$\alpha$ 通过多个任务的最大后验估计(MAP)学习得到。
  • 应用变分贝叶斯方法近似后验 $p(w_j | \alpha, S_j)$,实现不确定性估计与正则化。
  • 通过 FILM 层或任务嵌入实现任务条件化,使网络能够利用共享表征适应新任务。
  • 将深度先验与原型网络结合,避免最终层生成的噪声,提升训练稳定性和性能。
  • 在后验上施加 KL 正则化以防止在小样本数据集上过拟合,最优权重通过超参数调优确定。
  • 训练期间采用留一法程序,确保任务嵌入不受测试数据影响,避免数据泄露。

实验结果

研究问题

  • RQ1能否从多样化任务中学习到一个单一共享先验,以改善迁移学习中的少样本泛化?
  • RQ2当任务显著不同时,标准少样本学习方法(如 MAML)的性能会如何退化?
  • RQ3在任务异质而非同质的情况下,任务条件化在多大程度上能提升泛化能力?
  • RQ4在低数据场景下,具有丰富结构化先验的贝叶斯神经网络能否优于均场近似?
  • RQ5单一共享表征是否足以应对所有任务,还是在异质基准上必须依赖任务特定适应?

主要发现

  • 所提出的 Deep Prior 方法在 5-shot Mini-Imagenet 基准上实现了 74.5% 的新最先进准确率,超越了包括 MAML 和 Discriminative k-shot 在内的先前方法。
  • 在异质的 Synbols 基准上,标准原型网络在结合字体与符号任务时准确率下降至 76.8%,而使用条件化的 Deep Prior 恢复至 83.5%。
  • 消融研究证实,残差网络、任务条件化、留一法训练和 KL 正则化对最优性能均至关重要。
  • 该方法表明,当任务差异过大时,MAML 表现会显著下降,凸显更丰富先验的必要性。
  • 实验表明,依赖单一共享表征的模型在异质任务上会失效,而任务条件化先验对实现鲁棒迁移至关重要。
  • 在 Harmonics 数据集上学习到的先验展现出有意义的结构,证实该方法捕捉到了任务间的共享归纳偏置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。