[논문 리뷰] MATCHA: A Fast and Energy-Efficient Accelerator for Fully Homomorphic Encryption over the Torus
MATCHA는 근사 곱셈이 없는 정수 FFT/이상적 FFT를 사용하고, 공격적인 부스팅 키 편집을 통한 파ip라인 데이터 경로를 통해 토러스 위의 완전한 암호화(TFHE)를 가속화하는 하드웨어 가속기이다. 이는 이전의 CPU, GPU, FPGA, ASIC 솔루션보다 2.3배 높은 처리량과 6.3배 높은 처리량/와트를 달성하여 TFHE 게이트 처리의 성능과 에너지 효율성을 크게 향상시킨다.
Fully Homomorphic Encryption over the Torus (TFHE) allows arbitrary computations to happen directly on ciphertexts using homomorphic logic gates. However, each TFHE gate on state-of-the-art hardware platforms such as GPUs and FPGAs is extremely slow ($>0.2ms$). Moreover, even the latest FPGA-based TFHE accelerator cannot achieve high energy efficiency, since it frequently invokes expensive double-precision floating point FFT and IFFT kernels. In this paper, we propose a fast and energy-efficient accelerator, MATCHA, to process TFHE gates. MATCHA supports aggressive bootstrapping key unrolling to accelerate TFHE gates without decryption errors by approximate multiplication-less integer FFTs and IFFTs, and a pipelined datapath. Compared to prior accelerators, MATCHA improves the TFHE gate processing throughput by $2.3 imes$, and the throughput per Watt by $6.3 imes$.
연구 동기 및 목표
- 기존의 CPU, GPU, FPGA 등의 하드웨어 플랫폼에서 TFHE 게이트 처리의 높은 지연 시간과 열악한 에너지 효율성을 해결하기 위해.
- TFHE 부스팅에서 실행 시간을 지배하는 FFT/IFFT 커널의 병목 현상을 줄이기 위해.
- TFHE에서 오차 내성 덕분에 정확성을 유지하면서도 처리량을 향상시키기 위해 공격적인 부스팅 키 편집(BKU)을 가능하게 하기 위해.
- 부동소수점 연산 없이 근사 정수 FFT/이상적 FFT를 지원하는 파이프라인화되고 에너지 효율적인 가속기 아키텍처를 설계하기 위해.
- 최신 CPU, GPU, FPGA, ASIC 기반의 TFHE 가속기 대비 뛰어난 성능과 에너지 효율성을 달성하기 위해.
제안 방법
- MATCHA는 곱셈이 없는 근사 정수 FFT/IFFT를 사용하며, 이는 덧셈과 비트 시프트만을 기반으로 하여 면적과 전력 소모를 감소시키면서도 작은 오차를 내재적으로 수용하여 복호화 과정에서 영향을 주지 않는다.
- 공격적인 부스팅 키 편집(BKU)을 지원하기 위해 전용 TGSW 클러스터와 외부 곱셈 코어를 갖춘 파이프라인화된 데이터 경로를 구현하여 FFT/IFFT 호출 횟수를 줄였다.
- 순차적 TGSW 메모리 접근과 비순차적 FFT/IFFT 접근을 위한 별도의 레지스터 범용을 사용하여 데이터 경합을 최소화하고 처리량을 향상시켰다.
- TFHE 연산을 아키텍처에 스케줄링하고 매핑하기 위해 CGRA 기반의 모델링 프레임워크(OpenCGRA)를 활용하여 정확한 지연 시간과 에너지 소비 예측을 가능하게 하였다.
- 16nm 공정을 사용하여 설계를 합성하고, 표준 TFHE 파rameter(N=1024, k=1, Bg=1024, l=3) 하에서 CPU, GPU, FPGA, ASIC 기반 베이스라인과 평가하였다.
- MATCHA는 m=3를 지원하여 GPU(m=4)보다 높은 처리량을 달성하면서도 더 낮은 전력 소비를 구현하였다.
실험 결과
연구 질문
- RQ1TFHE 부스팅에서 오차 내성을 갖춘 근사 곱셈이 없는 정수 FFT/IFFT를 사용할 경우 복호화 오류가 발생하지 않도록 효과적으로 활용될 수 있는가?
- RQ2TFHE를 위한 하드웨어 가속기에서 공격적인 부스팅 키 편집(BKU)은 처리량과 자원 활용도에 어떤 영향을 미치는가?
- RQ3최적화된 메모리 접근 패턴을 갖춘 파이프라인화된 데이터 경로는 TFHE 게이트 처리에서 지연 시간을 크게 줄이고 에너지 효율을 향상시킬 수 있는가?
- RQ4맞춤형 ASIC 가속기(MATCHA)는 CPU, GPU, FPGA 기반의 TFHE 구현 대비 성능과 에너지 효율성에서 어떤 성과를 내는가?
- RQ5TFHE에서 FFT/IFFT 커널에 근사 산술을 얼마나 활용할 수 있는가? 이는 보안성이나 정확성에 영향을 주지 않는 범위에서 가능한가?
주요 결과
- m=3일 때 MATCHA는 TFHE NAND 게이트의 지연 시간을 0.37ms로 줄여 GPU(m=4일 때 0.18ms)를 초월하고 CPU(m=2일 때 6.67ms)보다도 현저히 낮춘다.
- m=3일 때 MATCHA는 효과적인 파이프라인화와 BKU 지원 덕분에 GPU 기반 베이스라인 대비 2.3배 높은 처리량을 달성한다.
- ASIC 기반 베이스라인 대비 MATCHA의 처리량/와트는 6.3배 높아져 39.98W의 낮은 전력 소비에도 불구하고 6.3배 높은 에너지 효율성을 확보하였다.
- m=1인 FPGA와 ASIC 기반 베이스라인은 각각 CPU 대비 2.4배와 8.3배 높은 처리량/와트를 기록하였으며, 이는 비파이프라인 설계의 비효율성을 드러낸다.
- 근사 정수 FFT/IFFT의 사용은 덧셈과 비트 시프트만으로도 고성능을 달성할 수 있게 하여 고비용의 双정밀도 부동소수점 연산을 제거하고 전력 소비를 감소시켰다.
- TGSW와 FFT/IFFT 작업을 위한 별도의 레지스터 범용을 갖춘 파이프라인화된 데이터 경로는 비순차적 및 순차적 메모리 접근 패턴을 효율적으로 처리하여 처리량을 향상시키고 스탠드 시간을 줄였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.