Skip to main content
QUICK REVIEW

[论文解读] Memory-Based Optimization Methods for Model-Agnostic Meta-Learning and Personalized Federated Learning

Bokun Wang, Zhuoning Yuan|arXiv (Cornell University)|Jun 9, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用 8
一句话总结

本文提出了基于记忆的优化方法(MOML 和 LocalMOML),用于模型无关元学习(MAML)和个性化联邦学习,可在任务和数据点的 mini-batch 大小恒定的情况下实现收敛。这些方法在持续学习和跨设备/跨孤岛联邦学习设置中均能实现误差趋近于零,相较于以往的随机 MAML 方法,提供了更优的理论收敛保证和通信效率。

ABSTRACT

In recent years, model-agnostic meta-learning (MAML) has become a popular research area. However, the stochastic optimization of MAML is still underdeveloped. Existing MAML algorithms rely on the ``episode'' idea by sampling a few tasks and data points to update the meta-model at each iteration. Nonetheless, these algorithms either fail to guarantee convergence with a constant mini-batch size or require processing a large number of tasks at every iteration, which is unsuitable for continual learning or cross-device federated learning where only a small number of tasks are available per iteration or per round. To address these issues, this paper proposes memory-based stochastic algorithms for MAML that converge with vanishing error. The proposed algorithms require sampling a constant number of tasks and data samples per iteration, making them suitable for the continual learning scenario. Moreover, we introduce a communication-efficient memory-based MAML algorithm for personalized federated learning in cross-device (with client sampling) and cross-silo (without client sampling) settings. Our theoretical analysis improves the optimization theory for MAML, and our empirical results corroborate our theoretical findings. Interested readers can access our code at \url{https://github.com/bokun-wang/moml}.

研究动机与目标

  • 解决依赖于任务和数据点大批量或不断增长的随机 MAML 算法缺乏收敛保证的问题。
  • 开发适用于持续学习和跨设备联邦学习的优化方法,其中每次迭代仅能访问少量任务。
  • 通过在实际小批量大小约束下建立收敛误差趋近于零,深化对 MAML 优化的理论理解。
  • 设计通信高效的个性化联邦学习算法,适用于跨设备(客户端采样)和跨孤岛(无客户端采样)两种设置。
  • 提供理论分析,改进现有 MAML 收敛界,尤其针对有限任务和非独立同分布(non-i.i.d.)设置。

提出的方法

  • 提出 MOML,一种基于记忆的随机 MAML 算法,通过维护历史梯度的记忆来稳定优化过程,实现在恒定小批量大小下的收敛。
  • 引入 LocalMOML,一种专为联邦学习设计的变体,利用客户端本地记忆以减少通信并提升收敛性能。
  • 使用记忆缓冲区存储并重用先前任务的梯度信息,降低方差,即使在小而固定的 $ K $ 和 $ B $ 下也能实现收敛。
  • 将优化问题建模为两层复合结构,并应用带记忆的随机逼近方案,以降低偏差并提升收敛速度。
  • 通过压缩和选择性传输记忆更新,设计通信高效的变体,尤其适用于存在客户端采样的跨设备联邦学习。
  • 通过分析梯度的期望范数,并在光滑性、梯度有界性和方差等假设下对误差项进行有界处理,建立理论收敛界。

实验结果

研究问题

  • RQ1能否在每次迭代中仅采样恒定数量的任务和数据点,而非要求批量大小不断增长,使随机 MAML 算法实现收敛?
  • RQ2如何将基于记忆的优化方法适配至持续学习和个性化联邦学习设置,以在客户端参与有限的情况下确保收敛?
  • RQ3在实际小批量大小约束和有限任务设置下,基于记忆的 MAML 算法的理论收敛速率如何?
  • RQ4与现有 MAML 变体(如 BSGD 和 BSpiderBoost)相比,所提方法在收敛性和实用性方面表现如何?
  • RQ5在保持收敛性和低误差的前提下,能否在个性化联邦学习中维持通信效率?

主要发现

  • 所提出的 MOML 算法在 $\mathcal{O}(1/\epsilon^2)$ 次迭代内收敛至 $\epsilon$-平稳点,且 $K$ 和 $B$ 恒定,显著优于以往方法(后者要求 $K=\mathcal{O}(1/\epsilon^2)$)。
  • 理论分析表明,MOML 在 $\eta \leq \min\left\{\frac{C_4}{H}, \frac{C_5\beta}{\mathbb{I}[\beta \in (0,1)]}\right\}$ 条件下收敛,确保在标准光滑性和有界性假设下误差趋近于零。
  • LocalMOML 在跨设备和跨孤岛联邦学习设置中均实现收敛,通过选择性记忆更新和压缩技术保持通信效率。
  • 在正弦波回归和少样本学习基准上的实证结果表明,即使每个任务仅有 $K=1$ 或 $K=3$ 个数据点,MOML 仍能实现良好泛化。
  • 在收敛速度和最终测试准确率方面,该方法优于基线 MAML 以及 BSGD/BSpiderBoost,在低数据和非独立同分布设置下表现尤为突出。
  • 本文纠正了 Per-FedAvg(Fallah et al., 2020b)证明中的关键缺陷,表明其等式假设仅在所有客户端均参与时才成立,并提供了修正后的分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。