[논문 리뷰] RRNet: Towards ReLU-Reduced Neural Network for Two-party Computation Based Private Inference
RRNet는 두 명의 참가자 간 계산 기반(2PC) 개인 추론에서 ReLU 연산을 최소화하기 위해 딥 뉴럴 네트워크(DNN) 아키텍처와 FPGA 기반 암호화 하드웨어 스케줄링을 동시에 최적화하는 미분 가능한 신경망 아키텍처 탐색 프레임워크를 제안한다. 하드웨어 지연 시간을 DNN 손실 함수에 통합하고, 학습 가능한 직렬 통과 다항 활성화 초기화를 사용함으로써, ResNet-18에서 최대 26배, ResNet-50에서 25배의 속도 향상을 달성하였으며, 정확도 저하가 최소화되었고, CIFAR-10에서 SOTA 기법들보다 ReLU 수를 더 효과적으로 줄였다.
The proliferation of deep learning (DL) has led to the emergence of privacy and security concerns. To address these issues, secure Two-party computation (2PC) has been proposed as a means of enabling privacy-preserving DL computation. However, in practice, 2PC methods often incur high computation and communication overhead, which can impede their use in large-scale systems. To address this challenge, we introduce RRNet, a systematic framework that aims to jointly reduce the overhead of MPC comparison protocols and accelerate computation through hardware acceleration. Our approach integrates the hardware latency of cryptographic building blocks into the DNN loss function, resulting in improved energy efficiency, accuracy, and security guarantees. Furthermore, we propose a cryptographic hardware scheduler and corresponding performance model for Field Programmable Gate Arrays (FPGAs) to further enhance the efficiency of our framework. Experiments show RRNet achieved a much higher ReLU reduction performance than all SOTA works on CIFAR-10 dataset.
연구 동기 및 목표
- 2PC 기반 개인 추론에서 비교 프로토콜으로 인한 높은 계산 및 통신 오버헤드, 특히 ReLU 연산으로 인한 문제를 해결하기 위해.
- 모델 정확도를 훼손하지 않으면서 DNN 내의 ReLU 수를 줄이기 위해, 특히 보안적 두 명의 참가자 간 계산 환경에서.
- 에너지 효율성과 성능 향상을 위해 DNN 아키텍처와 FPGA 기반 암호화 하드웨어 스케줄링을 공동 최적화하기 위해.
- 암호화 지연 시간을 신경망 아키텍처 탐색에 통합하여 2PC 기반 개인 추론의 설계 공간 탐색을 자동화하기 위해.
- 하드웨어 인식 미분 가능한 NAS를 통해 자원 제약이 있는 플랫폼에서 보안 DNN 추론의 실용적 구현을 가능하게 하기 위해.
제안 방법
- 계산 비용이 높은 ReLU 연산을 다항식 근사로 대체하기 위해 학습 가능한 직렬 통과 다항 활성화 초기화(STPAI)를 도입한다.
- FPGA 기반 암호화 연산 지연 시간을 손실 함수에 통합하여 DNN 아키텍처와 하드웨어 스케줄링을 동시에 최적화하는 미분 가능한 NAS 프레임워크를 개발한다.
- FPGA용 지연 시간 룩업 테이블과 암호화 하드웨어 스케줄러를 구축하여 비밀 공유 연산의 스케줄링을 최적화하고 종단 간 지연 시간을 줄인다.
- NAS 학습 중 정확도와 하드웨어 지연 시간을 균형 잡기 위해 초수치 파라미터 λ를 사용하는 다목적 손실 함수를 사용한다.
- 이중 최적화 프로세스를 적용한다: 내부 루프는 네트워크 가중치 ω를 갱신하고, 외부 루프는 α에 대한 4회 전방 및 5회 역방향 전파를 통해 아키텍처 파라미터 α를 갱신한다.
- 최종 아키텍처는 각 레이어당 가장 활성화된 연산을 argmax(α_l,k)를 통해 선택하여 결정적이고 최적화된 모델을 생성한다.
실험 결과
연구 질문
- RQ1미분 가능한 NAS 프레임워크가 2PC 기반 개인 추론에서 DNN 아키텍처와 FPGA 기반 암호화 하드웨어 스케줄링을 효과적으로 공동 최적화할 수 있는가?
- RQ22PC 환경에서 정확도 저하 없이 DNN 내의 ReLU 연산을 얼마나 줄일 수 있는가?
- RQ3NAS 손실 함수에 하드웨어 지연 시간을 통합하면 에너지 효율성과 추론 속도 향상에 어떻게 기여하는가?
- RQ4실제 FPGA 플랫폼에서 2PC 기반 개인 추론에서 ReLU 감소, 모델 정확도, 추론 지연 시간 간의 상호 상충 관계는 어떠한가?
- RQ5제안된 STPAI 방법은 기존의 ReLU 감소 기법들과 비교해 정확도와 성능 측면에서 어떻게 우월한가?
주요 결과
- RRNet는 2PC 환경에서 ResNet-18에서 최대 26배의 속도 향상을 기록하였으며, 이는 324ms에서 12ms로 감소하였다. ResNet-50는 922ms에서 37ms로 25배의 속도 향상을 기록하였고, 정확도 저하가 최소였다.
- VGG-16에서는 다항식 전체 교체로 지연 시간이 20배 감소(382ms에서 19ms)하였지만, 기준 정확도 93.5%에서 3.2% 감소하였다.
- ResNet-18, -34, -50는 다항식 전체 교체에도 불구하고 강건성을 유지하여, 15–26배의 속도 향상에도 불구하고 정확도 저하가 0.26%에서 0.34%에 불과하였다.
- MobileNetV2는 다항식 전체 교체로 15배의 속도 향상(1543ms에서 103ms)을 기록하였고, 정확도는 1.27% 감소하였다.
- CIFAR-10에서 RRNet는 정확도 대 ReLU 수의 트레이드오프에서 SOTA 기법들인 DeepReDuce, DELPHI, CryptoNAS, SNI를 능가하는 우수한 파레토 경계를 확보하였다. 특히 낮은 ReLU 수에서 두각을 나타냈다.
- 제안된 하드웨어 인식 NAS와 지연 시간 인식 손실 함수는 최적화된 DNN 및 하드웨어 구성 조합을 성공적으로 식별하였으며, 종단 간 지연 시간을 감소시키면서도 높은 정확도를 유지하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.