Skip to main content
QUICK REVIEW

[논문 리뷰] FPGA-Based Hardware Accelerator of Homomorphic Encryption for Efficient Federated Learning

Zhaoxiong Yang, Shuihai Hu|arXiv (Cornell University)|2020. 07. 21.
Cryptography and Data Security참고 문헌 12인용 수 17
한 줄 요약

이 논문은 데이터센터 배포를 위해 고도로 효율적이고 자원을 적게 사용하는 FPGA 기반 하드웨어 가속기를 제안한다. 이는 연합 학습에서 학습 효율성을 향상시키기 위한 Paillier 동형 암호화를 위한 것이다. 고수준 합성(HLS)을 활용하고 몽고메리 알고리즘을 사용해 모듈로 곱셈을 최적화함으로써, 암호화 시간을 최대 71% 감소시키고 소프트웨어 대비 10.6배 빠른 성능을 달성하였다. 이는 데이터센터 내 배포에 적합한 뛰어난 DSP 효율성과 소형 자원 사용을 동시에 확보하였다.

ABSTRACT

With the increasing awareness of privacy protection and data fragmentation problem, federated learning has been emerging as a new paradigm of machine learning. Federated learning tends to utilize various privacy preserving mechanisms to protect the transferred intermediate data, among which homomorphic encryption strikes a balance between security and ease of utilization. However, the complicated operations and large operands impose significant overhead on federated learning. Maintaining accuracy and security more efficiently has been a key problem of federated learning. In this work, we investigate a hardware solution, and design an FPGA-based homomorphic encryption framework, aiming to accelerate the training phase in federated learning. The root complexity lies in searching for a compact architecture for the core operation of homomorphic encryption, to suit the requirement of federated learning about high encryption throughput and flexibility of configuration. Our framework implements the representative Paillier homomorphic cryptosystem with high level synthesis for flexibility and portability, with careful optimization on the modular multiplication operation in terms of processing clock cycle, resource usage and clock frequency. Our accelerator achieves a near-optimal execution clock cycle, with a better DSP-efficiency than existing designs, and reduces the encryption time by up to 71% during training process of various federated learning models.

연구 동기 및 목표

  • 높은 계산 오버헤드로 인해 동형 암호화가 연합 학습에서 성능 저하를 겪는 문제를 해결하기 위해.
  • 안전하고 프라이버시를 보장하는 연합 학습을 지원하는, 컴act하고 고처리량인 FPGA 기반 가속기 설계를 위해.
  • Paillier 암호화의 핵심 연산인 모듈로 곱셈을 저지연, 고클럭 주파수, 효율적인 DSP 사용을 위해 최적화하기 위해.
  • 성능을 희생시키지 않고도 고수준 합성(HLS)을 통해 유연하고 이식 가능하며 재구성 가능한 배포를 가능하게 하기 위해.
  • 기존 모델에 최소한의 변경으로 FATE 연합 학습 프레임워크에 가속기를 통합하기 위해.

제안 방법

  • 이식 가능성과 파rametric 설정을 고려해 고수준 합성(HLS)을 사용한 Paillier 동형 암호화 가속기 설계.
  • 나눗셈을 제거하고 FPGA 호환성을 향상시키기 위해 몽고메리 알고리즘을 활용한 모듈로 곱셈 구현.
  • 파ipelining과 자원 기반 스케줄링을 통해 최소한의 클럭 사이클, 낮은 자원 사용량, 고클럭 주파수를 달성하기 위해 모듈로 곱셈 유닛 최적화.
  • 하나의 커널당 다수의 데이터 항목을 배치하고 OpenCL 명령 큐를 통해 계산과 데이터 전송을 겹침으로써 암호화 지연 감소.
  • FATE 프레임워크에 소프트웨어 기반 Paillier 암호화를 대체하기 위해 OpenCL 커널 라이브러리 형태로 가속기 통합.
  • 클럭 사이클, DSP 사용량, 메모리 대역폭, 면적 효율성 등 최적화를 이끄는 데 분석 모델링 활용.

실험 결과

연구 질문

  • RQ1FPGA 기반 가속은 연합 학습에서 동형 암호화의 처리량과 효율성을 어떻게 향상시킬 수 있는가?
  • RQ2FPGA에서 Paillier 모듈로 곱셈의 지연과 자원 사용량을 최소화하기 위해 가장 효과적인 아키텍처 최적화는 무엇인가?
  • RQ3제안된 하드웨어 가속기는 소프트웨어 기반 Paillier 구현 대비 암호화 및 복호화 성능에서 어떻게 비교되는가?
  • RQ4선형 모델을 사용한 연합 학습에서 하드웨어 가속기는 학습 반복 시간을 얼마나 줄이는가?
  • RQ5데이터센터 환경에서 확장 가능하고 안전한 모델 학습을 가능하게 하면서도, 높은 보안성과 정확성을 유지할 수 있는가?

주요 결과

  • FPGA 기반 Paillier 가속기는 PHE 라이브러리를 사용한 소프트웨어 대비 암호화 성능에서 10.6배 빠르고, 복호화 성능에서 2.76배 빠르다.
  • 모듈로 곱셈 유닛은 선형 모델에서 학습 반복마다 암호화 시간을 최대 71.2% 감소시켜 전체 학습 반복 시간을 26% 감소시켰다.
  • 디자인은 12,626 연산/초/DSB의 DSP 효율성을 확보하여, 이전의 FPGA 솔루션(San and At, 2014)의 8,903 op/s/DSB를 뛰어넘었다.
  • 효율적인 파이ipelining과 지연 숨기기 덕분에 다양한 피연산자 크기에서 이론적 최소값에 비해 실행 사이클이 10% 이내로 근접한 이상적인 성능 유지를 유지하였다.
  • 고수준 합성의 사용은 기존 RTL 기반 접근 방식이 갖지 못하는 구성 가능성을 고려해도, 재사용 가능하고 이식 가능한 하드웨어 설계를 가능하게 하였다.
  • 가속기는 단지 9개의 DSP 블록과 483개의 슬라이스만 사용하여 높은 컴팩트성과 효율성을 확보하였으며, LUT나 블록 램에만 의존하는 설계보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.