Skip to main content
QUICK REVIEW

[论文解读] Sharp-MAML: Sharpness-Aware Model-Agnostic Meta Learning

Momin Abbas, Quan Xiao|arXiv (Cornell University)|Jun 8, 2022
Topic Modeling被引用 10
一句话总结

本文提出 Sharp-MAML,一种基于锐度感知的元学习框架,通过在双层优化景观中引入锐度感知最小化(SAM)以避免尖锐极小值,从而提升模型无关元学习(MAML)的泛化能力。在 Mini-Imagenet 上,其性能相比原始 MAML 最高提升 3% 的准确率,并提供了理论上的收敛与泛化边界,是首个在双层优化中研究 SAM 的工作。

ABSTRACT

Model-agnostic meta learning (MAML) is currently one of the dominating approaches for few-shot meta-learning. Albeit its effectiveness, the optimization of MAML can be challenging due to the innate bilevel problem structure. Specifically, the loss landscape of MAML is much more complex with possibly more saddle points and local minimizers than its empirical risk minimization counterpart. To address this challenge, we leverage the recently invented sharpness-aware minimization and develop a sharpness-aware MAML approach that we term Sharp-MAML. We empirically demonstrate that Sharp-MAML and its computation-efficient variant can outperform the plain-vanilla MAML baseline (e.g., $+3\%$ accuracy on Mini-Imagenet). We complement the empirical study with the convergence rate analysis and the generalization bound of Sharp-MAML. To the best of our knowledge, this is the first empirical and theoretical study on sharpness-aware minimization in the context of bilevel learning. The code is available at https://github.com/mominabbass/Sharp-MAML.

研究动机与目标

  • 为解决由于复杂非凸损失景观中存在大量鞍点和尖锐局部极小值,导致 MAML 泛化性能较差的问题。
  • 通过整合锐度感知最小化(SAM),惩罚损失景观中的尖锐极小值,从而提升双层元学习中的泛化性能。
  • 为所提出的 Sharp-MAML 框架在双层优化背景下的收敛性与泛化性提供理论保证。
  • 通过实证验证,Sharp-MAML 在如 Mini-Imagenet 和 Omniglot 等少样本学习基准上优于原始 MAML。

提出的方法

  • Sharp-MAML 通过在 MAML 目标中增加一个锐度惩罚项,鼓励元损失景观中出现平坦极小值,该惩罚项基于模型权重邻域内的最大损失。
  • 该方法采用两步优化流程:首先,计算内层任务特定的适应;其次,使用考虑当前权重半径内最坏情况损失的锐度感知准则,更新元初始化。
  • 通过使用单个随机扰动近似锐度项,提出一种计算高效的 Sharp-MAML 变体,降低计算成本,同时保持性能。
  • 理论分析表明,收敛速率为 ${\cal O}(1/\sqrt{T})$,样本复杂度为 ${\cal O}(\epsilon^{-2})$,优于标准 MAML 的已知 ${\cal O}(\epsilon^{-3})$ 边界。
  • 通过分析扰动下的总体损失,推导出泛化边界,表明满足锐度感知条件的模型具有更好的泛化能力。

实验结果

研究问题

  • RQ1锐度感知最小化能否改善如 MAML 这类双层元学习框架中的泛化性能?
  • RQ2在 MAML 中引入锐度感知是否能带来相比标准 MAML 更优的收敛性与泛化性能?
  • RQ3所提出的 Sharp-MAML 方法的理论收敛速率与泛化边界是什么?
  • RQ4Sharp-MAML 的计算效率与原始 MAML 相比如何?是否可在不损失性能的前提下进一步优化?

主要发现

  • 在少样本学习设置下的 Mini-Imagenet 基准上,Sharp-MAML 相比原始 MAML 最高实现 +3% 的准确率提升。
  • 在 Omniglot(20 类 1 样本)上,Sharp-MAML 达到 93.47% 的准确率,优于复现的原始 MAML 基线(91.77%)。
  • Sharp-MAML 的收敛速率为 ${\cal O}(1/\sqrt{T})$,对应样本复杂度为 ${\cal O}(\epsilon^{-2})$,优于标准 MAML 已知的 ${\cal O}(\epsilon^{-3})$ 复杂度。
  • 理论分析表明,由于显式控制损失景观的锐度,使用 Sharp-MAML 训练的模型具有更优的泛化边界。
  • Sharp-MAML 的计算高效变体在降低双层优化中二阶导数计算负担的同时,仍保持强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。