Skip to main content
QUICK REVIEW

[论文解读] Federated Learning under Distributed Concept Drift

Ellango Jothimurugesan, Kevin Hsieh|arXiv (Cornell University)|Jun 1, 2022
Data Stream Mining Techniques被引用 14
一句话总结

本文提出了 FedDrift 和 FedDrift-Eager 两种新型联邦学习框架,通过本地漂移检测与分层聚类,动态创建多个客户端特定模型,以应对分布式概念漂移。该方法在 SINE-2 数据集上实现了接近理想化基准的准确率(99.56%),通过适应客户端间分阶段、多概念漂移,在真实世界与合成漂移场景下显著优于单模型基线,在准确率与稳定性方面表现更优。

ABSTRACT

Federated Learning (FL) under distributed concept drift is a largely unexplored area. Although concept drift is itself a well-studied phenomenon, it poses particular challenges for FL, because drifts arise staggered in time and space (across clients). To the best of our knowledge, this work is the first to explicitly study data heterogeneity in both dimensions. We first demonstrate that prior solutions to drift adaptation that use a single global model are ill-suited to staggered drifts, necessitating multiple-model solutions. We identify the problem of drift adaptation as a time-varying clustering problem, and we propose two new clustering algorithms for reacting to drifts based on local drift detection and hierarchical clustering. Empirical evaluation shows that our solutions achieve significantly higher accuracy than existing baselines, and are comparable to an idealized algorithm with oracle knowledge of the ground-truth clustering of clients to concepts at each time step.

研究动机与目标

  • 解决联邦学习中数据分布随时间非平稳变化且在不同客户端间差异显著的概念漂移挑战。
  • 识别单全局模型方法在处理异构客户端间分阶段、多概念漂移时的根本局限性。
  • 设计一种时变聚类框架,按每个时间步的活跃概念对客户端进行分组,以实现概念感知的模型训练。
  • 提出两种可扩展、自适应的算法——FedDrift-Eager 与 FedDrift——基于漂移检测与分层聚类,动态创建并合并模型。
  • 在保持实际部署可行性的同时,实现接近理想化基准算法(已知客户端-概念分配)的性能。

提出的方法

  • 将概念漂移建模为一种时变客户端聚类问题,其中每个聚类对应一个独立的数据概念。
  • 实现 FedDrift-Eager 作为一种贪婪的、由漂移触发的模型创建机制,在检测到客户端概念漂移时生成新模型。
  • 设计 FedDrift,利用分层聚类将经历相同概念的客户端分组,实现模型的保守合并,降低误报率。
  • 使用本地漂移检测(如统计检验或误差率监控)触发模型创建,确保对客户端特定概念变化的响应能力。
  • 采用基于阈值的合并策略进行分层聚类,以保持模型保真度,避免对短暂漂移的过拟合。
  • 按聚类协作训练模型,使处于同一概念下的客户端可联合优化共享模型,提升泛化能力与稳定性。

实验结果

研究问题

  • RQ1当漂移在不同时间与不同客户端间发生时,单模型联邦学习框架能否有效应对概念漂移?
  • RQ2在去中心化、非独立同分布环境下,如何动态调整客户端聚类以适应时变的多概念漂移?
  • RQ3误报漂移检测对模型性能有何影响?分层聚类在缓解此问题方面的作用如何?
  • RQ4去中心化、多模型联邦学习系统在多大程度上可实现与已知客户端-概念分配的基准算法相当的性能?
  • RQ5当多个新概念同时出现时,所提算法的可扩展性如何?与集中式漂移适应方法相比表现如何?

主要发现

  • FedDrift 在 SINE-2 数据集上达到 99.56% 的准确率,显著优于最佳基线(Adaptive-FedAvg 为 96.74%),并接近基准性能(99.65%)。
  • 在受疫情诱导概念漂移的真实世界 FMoW 数据集上,FedDrift 达到 64% 的准确率,显著优于次佳基线的 58%。
  • FedDrift-Eager 在 SINE-2 上达到 99.17% 的准确率,而 FedDrift 达到 99.56%,表明在多个概念同时出现时具有更优的鲁棒性。
  • FedDrift 通过分层聚类有效降低误报影响,可在两个时间步内合并冗余模型,而 FedDrift-Eager 会保留并污染模型。
  • 在多概念漂移场景(如 SEA-4 和 MNIST-4)中,FedDrift 维持了高准确率与稳定性,而集中式与聚类联邦基线无法恢复性能。
  • FedDrift 中的分层聚类机制有效实现了对瞬时漂移的恢复,并在阈值选择存在不确定性时提升了鲁棒性,尤其在低检测阈值下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。