Skip to main content
QUICK REVIEW

[논문 리뷰] ARK: Fully Homomorphic Encryption Accelerator with Runtime Data Generation and Inter-Operation Key Reuse

Jongmin Kim, Gwangho Lee|arXiv (Cornell University)|2022. 05. 02.
Cryptography and Data Security인용 수 7
한 줄 요약

ARK는 완전호환암호화(FHE)를 위한 도메인 특화 가속기로, 알고리즘-아키텍처 공동 설계를 통해 외부 메모리 대역폭 병목을 해결한다. 최소 키스위칭과 런타임 림 확장 기법을 도입함으로써 외부 메모리 접근을 88% 감소시켜 온칩 워킹 세트 활용을 완전히 가능하게 하고, 기존 연구 대비 승법 처리량은 2,353배 향상되며, 로지스틱 회귀 학습은 18배 빠르게 하며, 실시간으로 ResNet-20 추론을 0.125초 내에 수행한다.

ABSTRACT

Homomorphic Encryption (HE) is one of the most promising post-quantum cryptographic schemes that enable privacy-preserving computation on servers. However, noise accumulates as we perform operations on HE-encrypted data, restricting the number of possible operations. Fully HE (FHE) removes this restriction by introducing the bootstrapping operation, which refreshes the data; however, FHE schemes are highly memory-bound. Bootstrapping, in particular, requires loading GBs of evaluation keys and plaintexts from off-chip memory, which makes FHE acceleration fundamentally bottlenecked by the off-chip memory bandwidth. In this paper, we propose ARK, an Accelerator for FHE with Runtime data generation and inter-operation Key reuse. ARK enables practical FHE workloads with a novel algorithm-architecture co-design to accelerate bootstrapping. We first eliminate the off-chip memory bandwidth bottleneck through runtime data generation and inter-operation key reuse. This approach enables ARK to fully exploit on-chip memory by substantially reducing the size of the working set. On top of such algorithmic enhancements, we build ARK microarchitecture that minimizes on-chip data movement through an efficient, alternating data distribution policy based on the data access patterns and a streamlined dataflow organization of the tailored functional units -- including base conversion, number-theoretic transform, and automorphism units. Overall, our co-design effectively handles the heavy computation and data movement overheads of FHE, drastically reducing the cost of HE operations, including bootstrapping.

연구 동기 및 목표

  • FHE 하드웨어 가속에서 특히 부스터래핑 연산에 기인한 심각한 외부 메모리 대역폭 병목 문제를 해결한다.
  • 크고 일회성인 평문 및 평가 키로 인해 높은 외부 메모리 접근이 발생하는 기존 가속기의 한계를 극복한다.
  • 알고리즘 최적화를 통해 워킹 세트 크기를 극적으로 줄임으로써 FHE 워크로드의 실용적 구현을 가능하게 한다.
  • 온칩 데이터 이동을 최소화하고 알고리즘 향상으로 인한 증가된 계산 집약도를 활용하는 전용 마이크로아키텍처를 설계한다.
  • 암호화된 데이터 상에서 개인정보 보호 기반 머신러닝 워크로드, 예를 들어 CNN 추론 및 로지스틱 회귀 학습에 대해 실시간 성능을 달성한다.

제안 방법

  • 최소 키스위칭을 도입하여, 부스터래핑 중 중복되는 키스위칭 연산을 줄이고, 운영 간 키 재사용을 통해 효율성을 높인다.
  • 런타임 림 확장을 제안하여, 사전 로딩 대신 런타임에 데이터 요소를 생성함으로써 외부 메모리 접근을 최소화한다.
  • FHE 연산에서 발생하는 두 가지 다른 데이터 접근 패턴을 고려한 데이터 배분 정책과 함께 ARK 마이크로아키텍처를 공동 설계하여 데이터 플로우 효율성을 향상시킨다.
  • 기본 변환(BConv), 수론적 변환(NTT), 자동형사 연산을 위한 전용 기능 단위(FU)를 구현하여, 낮은 데이터 이동량을 확보한다.
  • 데이터 플로우를 간소화하고 온칩 데이터 이동을 줄이기 위해 칩을 두 개의 논리적 영역으로 구성한다.
  • CKKS 부스터래핑의 접근 패턴에 맞는 정책을 적용한 간소화된 데이터 플로우 아키텍처를 통합하여 FUs의 동작을 동기화한다.

실험 결과

연구 질문

  • RQ1어떻게 알고리즘 혁신을 통해 FHE 부스터래핑에서 발생하는 외부 메모리 대역폭 병목을 완화할 수 있는가?
  • RQ2런타임 데이터 생성과 운영 간 키 재사용은 FHE 가속기에서 워킹 세트 크기를 얼마나 줄일 수 있는가?
  • RQ3공동 설계된 가속기 아키텍처는 감소된 워킹 세트를 완전히 활용하여 고처리량과 저지연을 달성할 수 있는가?
  • RQ4제안된 최적화 기법을 통해 로지스틱 회귀 및 CNN 추론과 같은 실제 FHE 워크로드에서 어떤 성능 향상을 기대할 수 있는가?
  • RQ5최신 FHE 가속기인 F1과 BTS와 비교해 ARK는 성능 및 효율성 면에서 어떻게 뛰어나게 되는가?

주요 결과

  • 최소 키스위칭과 런타임 림 확장을 통해 ARK는 부스터래핑 중 외부 메모리 접근을 88% 감소시켰다.
  • 공동 설계된 ARK 마이크로아키텍처는 최신 FHE 가속기 F1 [87] 대비 2,353배 높은 승법 처리량을 달성했다.
  • ARK는 ResNet-20 모델에 대해 0.125초 내로 실시간 암호화된 추론을 수행했으며, 기준 CPU 구현 대비 18,214배의 성능 향상을 이뤘다.
  • ARK는 이전 최신 기술 대비 로지스틱 회귀 학습 성능을 18배 향상시켰다.
  • ARK 가속기는 418.3 mm² 크기이며 최대 281.3W의 전력을 소비하여 실용적 구현에 적합한 고면적 및 고전력 효율성을 입증했다.
  • 제안된 알고리즘 최적화로 전체 감소된 워킹 세트를 온칩에 저장할 수 있었고, 외부 메모리 접근 빈도를 줄여 온칩 메모리 및 논리 회로의 완전한 활용이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.