[论文解读] Bitwidth Heterogeneous Federated Learning with Progressive Weight Dequantization
该论文提出 ProWD,一种用于比特位宽异构联邦学习(BHFL)的框架,其中客户端在计算和存储中使用不同的比特位宽。ProWD 在服务器端使用可训练的渐进式去量化器,将低比特位宽的客户端权重重建为更高精度的表示形式,结合选择性聚合以提升兼容性,在 CIFAR-10 和 MNIST 上的实验表明,其性能显著优于基线方法。
In practical federated learning scenarios, the participating devices may have different bitwidths for computation and memory storage by design. However, despite the progress made in device-heterogeneous federated learning scenarios, the heterogeneity in the bitwidth specifications in the hardware has been mostly overlooked. We introduce a pragmatic FL scenario with bitwidth heterogeneity across the participating devices, dubbed as Bitwidth Heterogeneous Federated Learning (BHFL). BHFL brings in a new challenge, that the aggregation of model parameters with different bitwidths could result in severe performance degeneration, especially for high-bitwidth models. To tackle this problem, we propose ProWD framework, which has a trainable weight dequantizer at the central server that progressively reconstructs the low-bitwidth weights into higher bitwidth weights, and finally into full-precision weights. ProWD further selectively aggregates the model parameters to maximize the compatibility across bit-heterogeneous weights. We validate ProWD against relevant FL baselines on the benchmark datasets, using clients with varying bitwidths. Our ProWD largely outperforms the baseline FL algorithms as well as naive approaches (e.g. grouped averaging) under the proposed BHFL scenario.
研究动机与目标
- 解决客户端在计算和内存中使用不同比特位宽时导致的模型性能下降问题。
- 识别性能退化两大关键原因:聚合异构比特位宽权重引发的分布偏移,以及低比特位宽模型表达能力有限。
- 开发一种实用的联邦学习框架,支持多样化的硬件比特位宽,而无需统一客户端规格。
- 通过服务器端可训练的渐进式去量化机制,从低比特位宽客户端更新中恢复高精度模型。
- 通过选择性聚合仅兼容的权重分量,提升兼容性与收敛性。
提出的方法
- 提出比特位宽异构联邦学习(BHFL),一种新型联邦学习设置,客户端可使用不同比特位宽,如 8 位、4 位或三值。
- 在中心服务器引入渐进式去量化器,通过一系列去量化模块将低比特位宽权重逐步重建为更高精度表示。
- 实施选择性权重聚合策略,识别并排除聚合前不兼容的低比特位宽权重分量。
- 端到端训练去量化器,使用重建损失最小化重建权重与全精度权重之间的差异。
- 在上行链路和下行链路中均使用客户端特定的比特位宽,允许异构硬件参与而无需标准化。
- 将该框架应用于标准联邦学习基准(CIFAR-10、MNIST),客户端使用 8 位、4 位和三值权重,以评估性能。
实验结果
研究问题
- RQ1联邦学习系统能否在不强制统一硬件规格的前提下,有效处理使用不同比特位宽的客户端?
- RQ2比特位宽异构性如何影响联邦学习中的模型收敛与性能?
- RQ3服务器端的渐进式去量化机制能否从低比特位宽客户端更新中恢复高精度权重?
- RQ4对权重分量的选择性聚合是否能提升比特位宽异构联邦学习中的兼容性与性能?
- RQ5在比特位宽异构条件下,ProWD 与现有量化感知及基线联邦学习方法相比表现如何?
主要发现
- 在比特位宽异构条件下,ProWD 在 CIFAR-10 和 MNIST 上的准确率显著优于 FedAvg、FedProx、FedPAQ 和 FedCOMGATE,尤其在高比特位宽客户端参与时表现更优。
- 渐进式去量化器成功地将三值和低比特位宽权重逐步重建为全精度表示,如图 6 所示的分步权重分布可视化所示。
- 图 7 中的余弦距离分析表明,ProWD 有效维持了不同比特位宽间的权重多样性,防止了分布偏移至低比特位宽分布。
- ProWD 中的选择性聚合提升了兼容性,降低了因不兼容权重分量导致的性能下降风险。
- 如表 5 和图 4 所示,与基于 QPC 的方法相比,ProWD 实现了更好的知识迁移与本地适应能力。
- 实验结果表明,即使客户端使用 8 位、4 位或三值权重,ProWD 仍能保持高性能,验证了其对比特位宽异构性的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。