[논문 리뷰] Medha: Microcoded Hardware Accelerator for computing on Encrypted Data
Medha는 프로그래머블이고 마이크로코딩된 FPGA 기반 하드웨어 가속기로, 영리하고 확장 가능한 아키텍처를 통해 암호화된 데이터에서 효율적인 동형 평가를 가능하게 한다. 병렬 RNS 다항식 산술, 片내 메모리, 그리고 하나의 하드웨어 설계로 다수의 다항식 차수를 지원하기 위한 새로운 분할 정복 기법을 활용하여, 최적화된 소프트웨어(Microsoft SEAL) 대비 큰 RNS-HEAAN 매개변수 세트에서 최대 78×의 성능 향상을 달성한다.
Homomorphic encryption (HE) enables computation on encrypted data, and hence it has a great potential in privacy-preserving outsourcing of computations to the cloud. Hardware acceleration of HE is crucial as software implementations are very slow. In this paper, we present design methodologies for building a programmable hardware accelerator for speeding up the cloud-side homomorphic evaluations on encrypted data. First, we propose a divide-and-conquer technique that enables homomorphic evaluations in a large polynomial ring $R_{Q,2N}$ to use a hardware accelerator that has been built for the smaller ring $R_{Q,N}$. The technique makes it possible to use a single hardware accelerator flexibly for supporting several HE parameter sets. Next, we present several architectural design methods that we use to realize the flexible and instruction-set accelerator architecture, which we call `Medha'. At every level of the implementation hierarchy, we explore possibilities for parallel processing. Starting from hardware-friendly parallel algorithms for the basic building blocks, we gradually build heavily parallel RNS polynomial arithmetic units. Next, many of these parallel units are interconnected elegantly so that their interconnections require the minimum number of nets, therefore making the overall architecture placement-friendly on the platform. For Medha, we take a memory-conservative design approach and get rid of any off-chip memory access during homomorphic evaluations. Finally, we implement Medha in a Xilinx Alveo U250 FPGA and measure timing performances of the microcoded homomorphic addition, multiplication, key-switching, and rescaling for the leveled HE scheme RNS-HEAAN at 200 MHz clock frequency. For two large parameter sets, Medha achieves accelerations by up to 68x and 78x times respectively compared to a highly optimized software implementation Microsoft SEAL running at 2.3 GHz.
연구 동기 및 목표
- 클라우드 컴퓨팅에서 동형 암호화(HE)의 성능 저하 문제를 해결하기 위해 고속이며 유연한 하드웨어 가속기를 설계하는 것.
- 단일 재구성 가능한 하드웨어 아키텍처를 사용하여 다양한 HE 매개변수 세트—특히 큰 다항식 차수—를 지원하는 것.
- 키 스위칭 및 기타 연산 동안 외부 메모리 액세스를 제거하여 지연 시간과 에너지 효율성을 향상시키는 것.
- 다항식 산술에서의 깊은 병렬성과 처리 단위 간 효율적인 상호연결을 통해 높은 성능을 달성하는 것.
- 실제 성능 지표에서 기존의 소프트웨어 및 하드웨어 솔루션을 뛰어넘는 실용적이고 프로토타입 검증이 완료된 가속기를 제공하는 것.
제안 방법
- 더 큰 링 $ R_{Q,2N} $ 내의 연산을 더 작은 링 $ R_{Q,N} $ 전용으로 설계된 하드웨어 가속기로 매핑하기 위한 분할 정복 기법을 제안하여, 다양한 다항식 차수에 대한 민첩한 지원을 가능하게 한다.
- 모듈러 산술과 수론적 변환(NTT)을 위한 하드웨어 우수 알고리즘을 갖춘 고도로 병렬화된 RNS 다항식 산술 유닛(RPAU)을 설계한다.
- FPGA 상에서 네트워크 수를 최소화하고 배치 효율성을 향상시키기 위해 린 기반 토폴로지로 다수의 RPAU를 상호연결한다.
- 핵심 스위칭 및 기타 연산 중 외부 메모리 전송을 제거하기 위해 片내 메모리를 활용한 메모리 절약형 아키텍처를 구현한다.
- 다양한 동형 연산—덧셈, 곱셈, 재스케일링, 키 스위칭 등—을 지원하기 위해 프로그래머블성을 확보하기 위해 마이크로코딩된 명령어 세트를 구현한다.
- 200 MHz에서 Xilinx Alveo U250 FPGA에 물리적 구현을 통해 설계를 검증하고, 큰 매개변수 세트에 대한 성능을 측정한다.
실험 결과
연구 질문
- RQ1하나의 하드웨어 가속기가 재설계 없이도 다수의 다항식 차수를 효율적으로 지원할 수 있는 방법은 무엇인가?
- RQ2RNS 기반 다항식 산술 유닛에서 고도의 병렬성과 낮은 상호연결 오버헤드를 달성하기 위한 아키텍처 기법은 무엇인가?
- RQ3큰 매개변수 HE 체계에서 키 스위칭 동안 외부 메모리 액세스를 片내 메모리 최적화를 통해 완전히 제거할 수 있는가?
- RQ4마이크로코딩된 프로그래머블 가속기가 실제 HE 워크로드에서 매우 최적화된 소프트웨어 구현보다 얼마나 뛰어난 성능을 낼 수 있는가?
- RQ5프로토타입 FPGA 가속기의 성능은 지연 시간과 처리량 측면에서 이전의 ASIC 및 FPGA 기반 HE 가속기와 비교해 어떻게 되는가?
주요 결과
- Medha는 RNS-HEAAN 매개변수 세트 $ ( ext{log } Q, N) = (438, 2^{14}) $ 와 $ (546, 2^{15}) $ 에 대해 각각 최대 68× 및 78×의 성능 향상을 달성하며, Microsoft SEAL(2.3 GHz에서 실행) 대비 빠른 성능을 보인다.
- 새로운 분할 정복 기법을 통해 린 매핑을 구현함으로써, 단일 하드웨어 설계로 다항식 차수 $ 2^{14} $ 와 $ 2^{15} $ 를 모두 지원한다.
- 메모리 절약형 설계 덕분에, 큰 매개변수 조건에서도 키 스위칭 연산이 완전히 片내에서 수행되며 외부 메모리 액세스가 전혀 발생하지 않는다.
- 매개변수 세트 $ (438, 2^{14}) $ 에서 Medha는 블록 파이프라인 하드웨어 가속기 HEAX 대비 거의 2.37× 낮은 지연 시간을 기록한다.
- FPGA 프로토타입은 하드웨어 가속이 프로그래머블성과 유연성을 희생하지 않고도 높은 성능을 제공할 수 있음을 입증한다.
- 저자들은 Medha의 ASIC 최적화된 버전에서 추가로 5–10×의 성능 향상이 가능할 것으로 예측한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.