Skip to main content
QUICK REVIEW

[论文解读] Edge Bias in Federated Learning and its Solution by Buffered Knowledge Distillation

Sangho Lee, KiYoon Yoo|arXiv (Cornell University)|Oct 20, 2020
Privacy-Preserving Technologies in Data参考文献 29被引用 5
一句话总结

本文识别出一种在基于知识蒸馏的联邦学习中出现的‘边缘偏差’问题,即来自各个边缘设备的教师模型因在独特、可能规模较小或分布不均的数据集上训练,会引入不兼容或过拟合的知识,导致中心模型遗忘先前知识。作者提出‘缓冲知识蒸馏’(BKD),通过维护教师预测的缓冲区,选择性地蒸馏无偏知识,显著提升了对延迟节点的鲁棒性,并减少了异步联邦学习设置下的遗忘现象。

ABSTRACT

Federated learning (FL), which utilizes communication between the server (core) and local devices (edges) to indirectly learn from more data, is an emerging field in deep learning research. Recently, Knowledge Distillation-based FL methods with notable performance and high applicability have been suggested. In this paper, we choose knowledge distillation-based FL method as our baseline and tackle a challenging problem that ensues from using these methods. Especially, we focus on the problem incurred in the server model that tries to mimic different datasets, each of which is unique to an individual edge device. We dub the problem 'edge bias', which occurs when multiple teacher models trained on different datasets are used individually to distill knowledge. We introduce this nuisance that occurs in certain scenarios of FL, and to alleviate it, we propose a simple yet effective distillation scheme named 'buffered distillation'. In addition, we also experimentally show that this scheme is effective in mitigating the straggler problem caused by delayed edges.

研究动机与目标

  • 识别并形式化‘边缘偏差’——一种在基于知识蒸馏的联邦学习中出现的问题,即在独特、可能规模较小或分布不均的数据集上训练的边缘模型,会向中心模型引入不兼容的知识。
  • 解决在异步联邦学习中,由于从偏差或不同步的边缘模型蒸馏知识而导致的模型遗忘问题。
  • 提出一种轻量级、高效的解决方案——缓冲知识蒸馏(BKD),在无需完整模型聚合或同步的情况下,增强模型的稳定性和性能。
  • 证明边缘偏差是联邦学习中延迟节点问题的根本原因,且BKD通过选择性蒸馏高质量、一致的知识,有效缓解其影响。

提出的方法

  • 提出‘缓冲知识蒸馏’(BKD),一种蒸馏方案,通过在多个边缘设备上维护教师模型预测的缓冲区,实现对一致、无偏知识的选择性蒸馏。
  • 使用来自多个边缘模型的预测移动平均值或缓冲区,形成稳定的教师信号,降低单个偏差或过时边缘模型的影响。
  • 在学生模型与缓冲教师预测之间应用知识蒸馏损失,确保学生从更具代表性且稳定的知识源学习。
  • 引入一种动态蒸馏过程,其中缓冲区被迭代更新,使系统能够适应新边缘数据,同时最小化延迟节点或过拟合模型的干扰。
  • 在学生输出与缓冲教师输出之间采用温度缩放的交叉熵损失,促进软标签蒸馏,保留模型的泛化能力。
  • 设计实验,在同步与异步边缘更新场景下,对比BKD与原始知识蒸馏方法,验证其对延迟节点的鲁棒性。

实验结果

研究问题

  • RQ1当教师模型在独特、可能规模较小或分布不均的边缘数据集上训练时,联邦学习中的知识蒸馏性能会如何退化?
  • RQ2在异步联邦学习设置中,为何从新引入的、有偏差的边缘模型蒸馏知识会导致中心模型遗忘先前学习的知识?
  • RQ3是否可以通过缓冲蒸馏机制缓解边缘偏差的负面影响,并在无需完整模型聚合的情况下提升模型稳定性?
  • RQ4缓冲知识蒸馏在多大程度上能减少由具有过时或不一致模型权重的延迟边缘引起的性能波动?

主要发现

  • 边缘偏差显著降低了标准知识蒸馏在联邦学习中的性能,尤其是在从不同步或过拟合的边缘模型蒸馏时。
  • 当使用具有过时权重的延迟边缘作为教师时,原始知识蒸馏表现出极高的性能波动,导致先前学习知识的严重遗忘。
  • 缓冲知识蒸馏(BKD)显著降低了性能方差,并在交替使用同步与延迟边缘作为教师时,仍能保持一致的准确率。
  • BKD在无需频繁同步或完整模型聚合的情况下,实现了与完全同步训练相当的准确率,使其在大规模联邦学习系统中更具实用性。
  • 该方法通过选择性地从稳定、缓冲的教师信号中蒸馏知识,有效缓解了延迟节点问题,减少了信息不对称或过时边缘模型的影响。
  • 在CIFAR-100上使用2–3个边缘设备的实验表明,BKD使学生模型的权重分布更接近原始核心模型(例如,与原始权重的相对距离为0.38 vs. 0.44),表明遗忘现象显著减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。