Skip to main content
QUICK REVIEW

[논문 리뷰] FAB: An FPGA-based Accelerator for Bootstrappable Fully Homomorphic Encryption

Rashmi Agrawal, Leo de Castro|arXiv (Cornell University)|2022. 07. 25.
Cryptography and Data Security인용 수 8
한 줄 요약

FAB는 알고리즘-아키텍처 공동 설계를 통해 메모리 대역폭 병목 현상을 해결하고 실용적인 파arameter 세트를 위한 효율적이고 부트스트랩 가능한 완전 동형 암호화(FHE)를 위한 FPGA 기반 가속기이다. 로지스틱 회귀 학습에서 CPU 대비 456배, GPU 대비 6.5배 빠른 성능을 기록하며, 이전의 FPGA 및 GPU 가속기보다 뛰어나고, 비용의 일부분에 불과한 비용으로 ASIC 성능을 재현한다.

ABSTRACT

FHE offers protection to private data on third-party cloud servers by allowing computations on the data in encrypted form. However, to support general-purpose encrypted computations, all existing FHE schemes require an expensive operation known as bootstrapping. Unfortunately, the computation cost and the memory bandwidth required for bootstrapping add significant overhead to FHE-based computations, limiting the practical use of FHE. In this work, we propose FAB, an FPGA-based accelerator for bootstrappable FHE. Prior FPGA-based FHE accelerators have proposed hardware acceleration of basic FHE primitives for impractical parameter sets without support for bootstrapping. FAB, for the first time ever, accelerates bootstrapping (along with basic FHE primitives) on an FPGA for a secure and practical parameter set. The key contribution of our work is to architect a balanced FAB design, which is not memory bound. To this end, we leverage recent algorithms for bootstrapping while being cognizant of the compute and memory constraints of our FPGA. We use a minimal number of functional units for computing, operate at a low frequency, leverage high data rates to and from main memory, utilize the limited on-chip memory effectively, and perform operation scheduling carefully. For bootstrapping a fully-packed ciphertext, while operating at 300 MHz, FAB outperforms existing state-of-the-art CPU and GPU implementations by 213x and 1.5x respectively. Our target FHE application is training a logistic regression model over encrypted data. For logistic regression model training scaled to 8 FPGAs on the cloud, FAB outperforms a CPU and GPU by 456x and 6.5x and provides competitive performance when compared to the state-of-the-art ASIC design at a fraction of the cost.

연구 동기 및 목표

  • 이전 하드웨어 가속기에서 메모리 대역폭에 의해 심각하게 제한되는 FHE 부트스트랩의 성능 병목 문제를 해결하기 위해.
  • 이전의 FPGA 가속기가 작은 파arameter 세트만 지원하는 데 반해, CKKS FHE에 대한 실용적이고 안전한 파arameter 세트를 지원하며, 완전한 부트스트랩을 포함하는 FPGA 기반 가속기를 설계하기 위해.
  • FHE 알고리즘과 FPGA 하드웨어 제약 조건을 공동 설계하여 고성능과 자원 효율성을 달성하고, 메모리 병목으로 인한 계산 대기 시간을 방지하기 위해.
  • ASIC과 경쟁 가능한 성능을 보이며, FPGAs에서 종단 간 보안 머신러닝 워크로드—특히 로지스틱 회귀 학습—을 구현하기 위해.
  • 균형 잡힌 메모리 효율성 설계가 일반 프로세서와 GPU를 뛰어나고, 전용 ASIC과 견줄 수 있는 성능을 내는가를 입증하기 위해.

제안 방법

  • 최신 부트스트랩 기법을 사용하여 FHE 부트스트랩 알고리즘과 FPGA 제약 조건을 공동 설계하여 메모리 접근을 최소화하고 계산 활용도를 극대화하기 위해.
  • 모듈로 산술 연산을 위한 최소한의 256개의 기능 유닛을 구현하고, FHE 원시 연산의 파이프라인 및 병렬 실행을 지원하도록 정교하게 스케줄링하기 위해.
  • Xilinx Alveo U280 FPGA의 고대역폭 메모리(HBM2)를 활용하고, 효율적인 버퍼링과 데이터 재사용을 통해 片상 메모리 사용량을 최소화하여 데이터 이동을 최적화하기 위해.
  • 저전력 및 저면적을 위해 낮은 클럭 주파수(300 MHz)를 사용하고, 병렬 처리와 효율적인 작업 스케줄링을 통해 처리량을 유지하기 위해.
  • 계산과 메모리가 밀도 있게 동기화된 균형 잡힌 아키텍처를 설계하여, F1 및 BTS와 같은 이전 ASIC 가속기에서 발생하는 메모리 대역폭 병목을 피하기 위해.
  • 클라우드 환경에서 여덟 대의 FPGA를 스케일링하여 대규모 FHE 워크로드를 위한 다중 장치 성능을 평가하기 위해.

실험 결과

연구 질문

  • RQ1FPGA 기반 가속기가 이전 ASIC에서 관찰된 메모리 대역폭 병목 현상을 해결하고, 안전한 파arameter 세트를 갖춘 CKKS FHE에 대해 실용적인 부트스트랩 성능을 달성할 수 있는가?
  • RQ2알고리즘 최적화와 아키텍처 공동 설계를 어떻게 활용하여 FHE 워크로드에 대해 FPGA에서 계산과 메모리 사용을 균형 있게 조절할 수 있는가?
  • RQ3FPGA 가속기가 전용 ASIC에 비해 성능을 뛰어나거나 동등하게 유지하면서도 비용 효율적이며 공용 클라우드 환경에서 구현 가능한가?
  • RQ4종단 간 FHE 기반 로지스틱 회귀 학습에서 부트스트랩을 완전히 지원할 경우, FPGA 가속기가 CPU 및 GPU 대비 어떤 성능 향상을 보일 수 있는가?
  • RQ5FPGA에서의 작업 스케줄링 및 메모리 관리 기법이 메모리 기반 ASIC 가속기에서 발생하는 계산 대기 문제를 제거할 수 있는가?

주요 결과

  • 단일 Xilinx Alveo U280 FPGA에서 300 MHz에서 전체 암호문을 부트스트랩할 경우, FAB는 최신 CPU 대비 213배 빠르고 GPU 대비 1.5배 빠르다.
  • 여덟 대의 FPGA에 걸쳐 확장된 로지스틱 회귀 학습에서 FAB는 CPU 대비 456배, GPU 대비 6.5배 빠른 성능을 기록하며 일반 하드웨어를 크게 뛰어넘는다.
  • FAB는 오프더쇼프 FPGA 하드웨어를 사용하고도 최신 ASIC 설계 수준의 성능을 경쟁적으로 보이며, ASIC 비용의 일부분에 불과한 비용으로도 이를 달성한다.
  • 스마트한 작업 스케줄링과 片상 메모리 및 HBM2 대역폭의 효율적 사용을 통해 메모리 대역폭과 계산 자원을 균형 있게 조절함으로써 계산 대기 시간을 피한다.
  • FAB는 완전한 부트스트랩을 지원하는 안전하고 실용적인 파arameter 세트를 위한 CKKS FHE를 지원하며, 이는 이전의 FPGA 가속기가 작은 파arameter 세트만 지원했던 것과 대조된다.
  • 모든 필수 하드웨어 및 소프트웨어 구성 요소가 상용 클라우드 FPGA 플랫폼에서 이용 가능하므로, FAB는 공용 클라우드 환경에서 구현 가능한 것으로 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.