[论文解读] Impala: Low-Latency, Communication-Efficient Private Deep Learning Inference
Impala 通过引入代理服务器并结合密钥切换机制,提出了一种低延迟、通信高效的私有深度学习推理协议,显著降低了客户端带宽需求,实现了多个数量级的减少;通过稀疏卷积优化同态加密,并利用截断秘密共享压缩混淆电路。与现有最先进方法相比,该协议实现了超过3倍的带宽节省和4倍的性能加速。
This paper proposes Impala, a new cryptographic protocol for private inference in the client-cloud setting. Impala builds upon recent solutions that combine the complementary strengths of homomorphic encryption (HE) and secure multi-party computation (MPC). A series of protocol optimizations are developed to reduce both communication and performance bottlenecks. First, we remove MPC's overwhelmingly high communication cost from the client by introducing a proxy server and developing a low-overhead key switching technique. Key switching reduces the clients bandwidth by multiple orders of magnitude, however the communication between the proxy and cloud is still excessive. Second, to we develop an optimized garbled circuit that leverages truncated secret shares for faster evaluation and less proxy-cloud communication. Finally, we propose sparse HE convolution to reduce the computational bottleneck of using HE. Compared to the state-of-the-art, these optimizations provide a bandwidth savings of over 3X and speedup of 4X for private deep learning inference.
研究动机与目标
- 解决基于同态加密(HE)和安全多方计算(MPC)的现有私有推理协议中客户端通信与计算开销过高的问题。
- 降低基于同态加密的私有推理中客户端的通信负担,此类负担在CIFAR-10等模型中可能超过每轮推理1 GB。
- 最小化云端在处理线性(HE)和非线性(GC)操作时的计算与通信成本。
- 在保持模型准确率的前提下,通过协同设计的密码学优化显著提升性能。
提出的方法
- 引入代理服务器,通过密钥切换机制实现重加密,使客户端在每个线性层后无需再与云服务器交互,从而减少通信开销。
- 实现稀疏同态卷积,通过利用卷积神经网络中的权重重构稀疏性,降低同态加密的计算开销。
- 通过截断秘密分享的最低有效位,优化混淆电路,降低通信与计算成本,同时不损害安全性。
- 利用 Cheetah HE 内核实现,并与基于代理的架构集成,以最小化客户端负载。
- 在实现中使用 SEAL 库进行 BFV 同态加密,使用 Multi-Protocol SPDZ 进行混淆电路评估。
- 在同态加密、MPC 和通信层之间协同设计优化,实现私有推理端到端的性能提升。
实验结果
研究问题
- RQ1是否能在不损害安全性或准确率的前提下,将基于同态加密的私有推理中客户端的通信开销降低多个数量级?
- RQ2如何利用模型稀疏性缓解卷积层中同态加密的计算瓶颈?
- RQ3在保证正确性与隐私的前提下,通过秘密分享截断能将混淆电路评估优化到何种程度?
- RQ4基于代理的架构能否有效将通信与计算从客户端卸载至云和代理,从而实现可扩展的私有推理?
- RQ5密钥切换、稀疏HE与截断GC的联合优化对端到端推理延迟与带宽的综合性能影响如何?
主要发现
- 与 Gazelle 相比,Impala 将客户端通信带宽减少了超过4个数量级,客户端开销仅依赖于输入大小,与模型架构无关。
- 与当前最先进方法相比,该协议在整体推理延迟上实现了4倍的加速,主要得益于优化后的HE与GC组件。
- 带宽节省超过3倍,离线与在线通信量分别减少至 Gazelle 的GC大小的约1/4和1/2。
- 使用稀疏同态卷积可利用卷积神经网络中的权重重构稀疏性,在不降低模型准确率的前提下显著降低线性层的计算开销。
- 在混淆电路中截断秘密分享的最低9位,可减少GC大小与通信成本,同时保持安全性和正确性。
- 基于代理的重加密与密钥切换机制在云端引入的延迟不足5 ms,实际应用中可忽略不计,支持可扩展部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。