Skip to main content
QUICK REVIEW

[论文解读] An Empirical Study of Federated Learning on IoT-Edge Devices: Resource Allocation and Heterogeneity

Kok‐Seng Wong, Manh Nguyen-Duc|arXiv (Cornell University)|May 31, 2023
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本实证研究在真实世界物联网边缘设备上评估联邦学习(FL),揭示基于仿真的FL评估显著低估了实际成本和性能问题。作者表明,计算异构性和数据非独立同分布(non-IID)分布是影响FL收敛性和效率的主要因素,设备端训练在不同设备间引入了显著的训练时间和资源消耗差异。

ABSTRACT

Nowadays, billions of phones, IoT and edge devices around the world generate data continuously, enabling many Machine Learning (ML)-based products and applications. However, due to increasing privacy concerns and regulations, these data tend to reside on devices (clients) instead of being centralized for performing traditional ML model training. Federated Learning (FL) is a distributed approach in which a single server and multiple clients collaboratively build an ML model without moving data away from clients. Whereas existing studies on FL have their own experimental evaluations, most experiments were conducted using a simulation setting or a small-scale testbed. This might limit the understanding of FL implementation in realistic environments. In this empirical study, we systematically conduct extensive experiments on a large network of IoT and edge devices (called IoT-Edge devices) to present FL real-world characteristics, including learning performance and operation (computation and communication) costs. Moreover, we mainly concentrate on heterogeneous scenarios, which is the most challenging issue of FL. By investigating the feasibility of on-device implementation, our study provides valuable insights for researchers and practitioners, promoting the practicality of FL and assisting in improving the current design of real FL systems.

研究动机与目标

  • 调查基于仿真的FL评估与物联网边缘设备实际部署之间的差距。
  • 分析计算异构性、网络波动性以及数据非独立同分布分布对FL性能和资源成本的影响。
  • 提供关于设备端FL可行性的实证洞察,重点关注实际资源消耗和系统稳定性。
  • 评估现有基于仿真的FL研究在捕捉真实运行约束方面的局限性。

提出的方法

  • 在包含树莓派和NVIDIA Jetson平台的异构物联网边缘设备网络中,开展了大规模真实世界FL实验。
  • 测量每次FL轮次中的实际训练时间、内存使用量、CPU/GPU负载以及网络带宽消耗。
  • 使用FedAvg算法并控制数据分区,以在客户端之间模拟非独立同分布的数据分布。
  • 收集并分析系统级指标(电池耗电量、内存卡性能、服务器负载),以评估真实世界的运行成本。
  • 将真实设备结果与基于仿真的FL性能进行对比,识别收敛速度和资源使用方面的差异。
  • 评估电源质量与内存卡可靠性对模型训练稳定性与准确率的影响。
Figure 1: The standard FL framework.
Figure 1: The standard FL framework.

实验结果

研究问题

  • RQ1RQ1:在物联网边缘设备上的真实FL部署与基于仿真的评估在性能和资源消耗方面有何差异?
  • RQ2RQ2:物联网设备间的计算异构性如何影响FL收敛时间与模型准确率?
  • RQ3RQ3:数据异构性、网络波动性与设备资源约束的综合影响如何作用于FL系统的效率?
  • RQ4RQ4:电源稳定性与内存卡性能等因素如何影响设备端FL训练的可靠性与持久性?

主要发现

  • 基于仿真的FL评估显著低估了真实世界中的训练时间与资源消耗,尤其在低端设备上更为明显。
  • 计算异构性导致更新交换时间存在显著差异,较慢的设备在FL过程中成为瓶颈。
  • 数据非独立同分布分布是影响模型收敛的最主要因素,尤其当与计算和网络异构性结合时更为显著。
  • 电池寿命退化与全局模型准确率下降直接相关,表明电源约束会影响学习质量。
  • 内存卡速度与可靠性影响数据I/O性能,较慢或故障的内存卡会增加训练延迟并可能导致数据丢失。
  • 聚合服务器性能至关重要;服务器过载可能延迟模型更新并破坏FL训练周期,尤其在客户端负载较高时。
Figure 2: Our Methodology.
Figure 2: Our Methodology.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。