Skip to main content
QUICK REVIEW

[论文解读] HAFLO: GPU-Based Acceleration for Federated Logistic Regression

Xiaodian Cheng, Wanhang Lu|arXiv (Cornell University)|Jul 29, 2021
Privacy-Preserving Technologies in Data参考文献 17被引用 10
一句话总结

HAFLO 是一种用于联邦逻辑回归(FLR)的 GPU 加速框架,通过联合优化存储、I/O 和计算,对同态操作进行加速。通过在 NVIDIA V100 GPU 上加速性能关键的同态操作,HAFLO 在同态 FLR 上相比基于 CPU 的 FATE 实现了高达 88.4× 的加速,显著降低了隐私保护机器学习中的训练延迟。

ABSTRACT

In recent years, federated learning (FL) has been widely applied for supporting decentralized collaborative learning scenarios. Among existing FL models, federated logistic regression (FLR) is a widely used statistic model and has been used in various industries. To ensure data security and user privacy, FLR leverages homomorphic encryption (HE) to protect the exchanged data among different collaborative parties. However, HE introduces significant computational overhead (i.e., the cost of data encryption/decryption and calculation over encrypted data), which eventually becomes the performance bottleneck of the whole system. In this paper, we propose HAFLO, a GPU-based solution to improve the performance of FLR. The core idea of HAFLO is to summarize a set of performance-critical homomorphic operators (HO) used by FLR and accelerate the execution of these operators through a joint optimization of storage, IO, and computation. The preliminary results show that our acceleration on FATE, a popular FL framework, achieves a 49.9$ imes$ speedup for heterogeneous LR and 88.4$ imes$ for homogeneous LR.

研究动机与目标

  • 解决由同态加密(HE)开销引起的联邦逻辑回归(FLR)性能瓶颈。
  • 通过利用 GPU 加速,降低 FLR 中 HE 操作的计算延迟。
  • 设计一种 GPU-CPU 异构系统,以最小化数据传输并最大化 FLR 训练中的并行性。
  • 在保持与现有 FL 框架(如 FATE)兼容的同时,实现高吞吐量执行。
  • 针对 GPU 加速的同态操作,优化存储布局、I/O 模式和内核执行。

提出的方法

  • 总结 FLR 中性能关键的同态操作(HOs),以实现针对性的 GPU 加速。
  • 使用 CUDA Toolkit 实现 GPU 优化内核,用于基本 HE 操作,如同态乘法和加法。
  • 设计聚合数据存储系统,以改善内存访问模式并减少 CPU-GPU 数据传输。
  • 引入 I/O 优化工作流,将中间结果缓存在 GPU 内存中,以最小化跨设备数据移动。
  • 将 GPU 加速层集成到开源 FATE 框架中,以保持与现有 FL 流水线的兼容性。
  • 使用 gmpy2 进行 CPU 基线比较,并在真实世界数据集上基准测试吞吐量和训练轮次性能。

实验结果

研究问题

  • RQ1GPU 加速能否显著降低联邦逻辑回归中同态加密的计算开销?
  • RQ2如何优化存储布局和 I/O 管理,以最小化 GPU 加速 FLR 中的延迟?
  • RQ3在异构 FL 系统中,将同态操作从 CPU 卸载到 GPU 能够实现多大的性能提升?
  • RQ4所提出的解决方案在不同 FLR 变体(如同质和异质学习)中的可扩展性如何?
  • RQ5GPU 加速框架在多大程度上能保持与现有 FL 框架(如 FATE)的兼容性?

主要发现

  • 对于异质联邦逻辑回归训练,HAFLO 相比原生 FATE 实现了 49.9× 的加速。
  • 对于计算更密集的同质 FLR,HAFLO 在训练轮次完成时间上实现了 88.4× 的加速。
  • 基于 GPU 的同态乘法操作在吞吐量上超过 CPU 对应实现 100× 以上,尤其得益于对高效模指数运算的处理。
  • 聚合数据存储和 GPU 内中间结果缓存显著降低了 I/O 开销,并提高了内存带宽利用率。
  • 该系统保持了与 FATE 框架的完全兼容性,可在无需架构更改的情况下实现即插即用的加速。
  • 通过联合优化存储、I/O 和计算,有效利用了 GPU 资源,适用于隐私保护机器学习工作负载。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。