[논문 리뷰] BASALISC: Programmable Hardware Accelerator for BGV Fully Homomorphic Encryption
BASALISC는 BGV 완전 동형 암호화 스킴을 위한 프로그래머블 암호화 ASIC 하드웨어 가속기로, 고유한 RISC 유사 ISA, 갈림길 없는 32 Tb/s 라디안-256 NTT 아키텍처, 그리고 효율적인 부스터링과 자동형사 변환을 가능하게 하는 일반화된 순열 유닛을 특징으로 한다. 다항식의 NTT 우호적 소수를 최적화한 다중기와 키 스위칭을 위한 전용 MAC 유닛을 통합함으로써 HElib 대비 5,000배 이상의 성능 향상을 달성하여 완전히 팩킹된 부스터링을 지원하는 실용적이고 고처리량의 FHE 계산을 가능하게 한다.
Fully Homomorphic Encryption (FHE) allows for secure computation on encrypted data. Unfortunately, huge memory size, computational cost and bandwidth requirements limit its practicality. We present BASALISC, an architecture family of hardware accelerators that aims to substantially accelerate FHE computations in the cloud. BASALISC is the first to implement the BGV scheme with fully-packed bootstrapping -- the noise removal capability necessary for arbitrary-depth computation. It supports a customized version of bootstrapping that can be instantiated with hardware multipliers optimized for area and power. BASALISC is a three-abstraction-layer RISC architecture, designed for a 1 GHz ASIC implementation and underway toward 150mm2 die tape-out in a 12nm GF process. BASALISC's four-layer memory hierarchy includes a two-dimensional conflict-free inner memory layer that enables 32 Tb/s radix-256 NTT computations without pipeline stalls. Its conflict-resolution permutation hardware is generalized and re-used to compute BGV automorphisms without throughput penalty. BASALISC also has a custom multiply-accumulate unit to accelerate BGV key switching. The BASALISC toolchain comprises a custom compiler and a joint performance and correctness simulator. To evaluate BASALISC, we study its physical realizability, emulate and formally verify its core functional units, and we study its performance on a set of benchmarks. Simulation results show a speedup of more than 5,000 times over HElib -- a popular software FHE library.
연구 동기 및 목표
- 클라우드 환경에서의 실용적 구현을 제한하는 완전 동형 암호화(FHE)의 높은 계산 및 메모리 오버헤드 문제를 해결하기 위해.
- 모든 BGV FHE 연산, 특히 임의의 깊이의 계산에 필수적인 완전히 팩킹된 부스터링을 지원하는 도메인 특화 하드웨어 가속기를 설계하기 위해.
- 기능을 손상시키지 않은 채 FHE 가속기의 면적과 전력 소비를 줄이기 위해 다중기의 범위를 NTT 우호적 소수로 제한하기 위해.
- 갈림길 없는 메모리 계층과 일반화된 순열 논리로 고처리량, 저지연의 NTT 및 자동형사 계산을 실현하기 위해.
- 고유한 컴파일러와 성능 시뮬레이터를 포함한 완전한, 형식적으로 검증되고 물리적으로 실현 가능한 가속기 스택을 제공하기 위해.
제안 방법
- BASALISC는 다양한 수준의 하드웨어-소프트웨어 공동 설계 및 시스템 수준 최적화를 지원하기 위해 세 단계의 추상화 레이어를 가진 RISC 유사 ISA를 채택한다.
- 64 MB의 차량 내 암호문 버퍼(CTB)를 갖춘 사다리꼴 메모리 계층 4단계를 구현하며, 갈림길 없는 2차원 메모리 레이아웃을 통해 파ipa라인 스톨 없이 32 Tb/s의 라디안-256 NTT 처리량을 달성한다.
- NTT 전치와 BGV 자동형사 변환을 모두 계산할 수 있도록 일반화된 XOR 기반 순열을 사용하는 고유한 순열 하드웨어 유닛을 사용하여 추가 메모리나 논리 회로가 필요 없도록 한다.
- 통합된 16개 엔트리 레지스터 파일을 갖춘 고유한 곱셈-합산(MAC) 유닛은 특히 하이브리드 키 스위칭을 가속화하여 CTB에서 비동기적이고 독립적으로 실행할 수 있도록 한다.
- 다중기의 사용을 NTT 우호적 소수로 제한함으로써 논리 면적을 46% 감소시키고 전력 소비를 40% 절감하면서도 BGV 부스터링과의 호환성을 유지한다.
- 12nm 저전력 Global Foundries 공정을 사용해 150mm²의 칩 크기와 1 GHz 클럭 주파수로 설계되었으며, 형식적 검증과 핵심 기능 유닛의 에뮬레이션을 거쳐 물리적 테이프아웃이 완료되었다.
실험 결과
연구 질문
- RQ1하나의 ASIC 가속기가 고처리량과 저지연을 유지하면서도 완전히 팩킹된 부스터링을 포함한 모든 BGV FHE 연산을 효율적으로 지원할 수 있는가?
- RQ2추가 실리콘 면적 없이 갈림길 없는 메모리 레이아웃과 일반화된 순열 논리로 NTT 및 자동형사 계산을 어떻게 가속화할 수 있는가?
- RQ3다중기를 NTT 우호적 소수로 제한함으로써 면적과 전력 소비를 얼마나 줄일 수 있으며, 기능적 완전성은 유지할 수 있는가?
- RQ4목적에 맞는 고도로 병렬화된 하드웨어 가속기를 통해 HElib와 같은 소프트웨어 FHE 라이브러리 대비 어떤 성능 향상을 달성할 수 있는가?
- RQ5컴파일러와 시뮬레이터를 포함한 완전한 스택 툴체인을 갖춘 완전히 형식적으로 검증되고 물리적으로 실현 가능한 FHE 가속기를 설계할 수 있는가?
주요 결과
- BASALISC는 FHE 마크로 벤치마크 세트에서 HElib 대비 5,000배 이상의 성능 향상을 달성하여 실용적 FHE 성능의 급격한 향상을 입증한다.
- 갈림길 없는 메모리 레이아웃과 일반화된 순열 유닛 덕분에 파이pline 스톨 없이 32 Tb/s의 라디안-256 NTT 처리량을 달성하여 산술 처리량을 크게 향상시킨다.
- 순열 하드웨어를 NTT 전치와 BGV 자동형사 변환 모두에 재사용함으로써 추가 면적 비용 없이도 다양한 연산에서 높은 효율성을 유지한다.
- 다중기를 NTT 우호적 소수로 제한함으로써 논리 면적을 46% 감소시키고 전력 소비를 40% 절감하면서도 BGV 부스터링 지원을 손상시키지 않는다.
- 통합된 16개 엔트리 레지스터 파일을 갖춘 고유한 MAC 유닛은 고깊이 FHE 계산에 필수적인 하이브리드 키 스위칭 루프를 효율적으로 실행할 수 있도록 한다.
- 설계는 형식적으로 검증되었고 기능적 에뮬레이션을 거쳐 12nm 공정에서 150mm²의 칩 크기와 1 GHz 주파수로 구현되었으며, 물리적 테이프아웃 및 실세계 적용을 위한 준비가 되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.