Skip to main content
QUICK REVIEW

[论文解读] RRNet: Towards ReLU-Reduced Neural Network for Two-party Computation Based Private Inference

Hongwu Peng, Shanglin Zhou|arXiv (Cornell University)|Feb 5, 2023
Cryptography and Data Security被引用 5
一句话总结

RRNet 提出了一种可微分神经架构搜索框架,联合优化深度神经网络(DNN)架构与基于FPGA的密码学硬件调度,以最小化两方计算(2PC)基础的私有推理中的ReLU操作。通过将硬件延迟整合到DNN损失函数中,并采用可训练的直通多项式激活初始化方法,RRNet在ResNet-18上实现了最高26倍的加速,在ResNet-50上实现了25倍加速,且精度损失极小,在CIFAR-10上的ReLU减少方面优于SOTA方法。

ABSTRACT

The proliferation of deep learning (DL) has led to the emergence of privacy and security concerns. To address these issues, secure Two-party computation (2PC) has been proposed as a means of enabling privacy-preserving DL computation. However, in practice, 2PC methods often incur high computation and communication overhead, which can impede their use in large-scale systems. To address this challenge, we introduce RRNet, a systematic framework that aims to jointly reduce the overhead of MPC comparison protocols and accelerate computation through hardware acceleration. Our approach integrates the hardware latency of cryptographic building blocks into the DNN loss function, resulting in improved energy efficiency, accuracy, and security guarantees. Furthermore, we propose a cryptographic hardware scheduler and corresponding performance model for Field Programmable Gate Arrays (FPGAs) to further enhance the efficiency of our framework. Experiments show RRNet achieved a much higher ReLU reduction performance than all SOTA works on CIFAR-10 dataset.

研究动机与目标

  • 为解决2PC基础私有推理中比较协议带来的高计算与通信开销,特别是ReLU操作带来的开销。
  • 在不牺牲模型精度的前提下减少DNN中的ReLU数量,尤其是在安全两方计算环境中。
  • 联合优化DNN架构与基于FPGA的密码学硬件调度,以提升能效与性能。
  • 通过将密码学延迟整合到神经架构搜索中,实现2PC基础私有推理的设计空间探索自动化。
  • 通过硬件感知的可微分NAS,实现资源受限平台上的安全DNN推理的实用化部署。

提出的方法

  • 提出一种可训练的直通多项式激活初始化(STPAI),以多项式近似替代计算成本较高的ReLU操作。
  • 开发一种可微分NAS框架,通过将FPGA密码学操作延迟整合到损失函数中,联合优化DNN架构与硬件调度。
  • 为FPGA构建延迟查表与密码学硬件调度器,以优化秘密共享操作的调度并减少端到端延迟。
  • 采用多目标损失函数,并通过超参数λ平衡训练过程中的精度与硬件延迟。
  • 采用两阶段优化流程:内层循环更新网络权重ω,外层循环通过每轮α更新执行4次前向与5次反向传播来更新架构参数α。
  • 通过在每层选择激活值最高的操作(即argmax(α_l,k))来确定最终架构,生成确定性且优化的模型。

实验结果

研究问题

  • RQ1可微分NAS框架能否有效联合优化DNN架构与基于FPGA的密码学硬件调度,以支持2PC基础的私有推理?
  • RQ2在2PC环境中,DNN中的ReLU操作在不造成显著精度损失的情况下可被减少到何种程度?
  • RQ3将硬件延迟整合到NAS损失函数中,如何提升能效与推理速度?
  • RQ4在真实FPGA平台上,2PC基础私有推理中ReLU减少、模型精度与推理延迟之间的权衡关系如何?
  • RQ5所提出的STPAI方法与现有ReLU减少技术相比,在精度与性能方面表现如何?

主要发现

  • 在2PC环境下,RRNet在ResNet-18上实现了最高26倍加速(从324 ms降至12 ms),在ResNet-50上实现了25倍加速(从922 ms降至37 ms),且精度损失极小。
  • 在VGG-16上,完全使用多项式替代使延迟降低20倍(从382 ms降至19 ms),但精度从基线的93.5%下降了3.2%。
  • ResNet-18、-34与-50对完全多项式替代表现出强鲁棒性,尽管加速比达15–26倍,精度仅下降0.26%至0.34%。
  • MobileNetV2在完全多项式替代下实现了15倍加速(从1543 ms降至103 ms),精度下降1.27%。
  • RRNet在CIFAR-10上实现了精度与ReLU数量权衡的更优Pareto前沿,优于SOTA方法如DeepReDuce、DELPHI、CryptoNAS与SNI,尤其在低ReLU数量时表现更优。
  • 所提出的硬件感知NAS结合延迟感知损失函数,成功识别出优化的DNN与硬件配置,在保持高精度的同时显著降低了端到端延迟。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。