Skip to main content
QUICK REVIEW

[论文解读] BASALISC: Programmable Hardware Accelerator for BGV Fully Homomorphic Encryption

Robin Geelen, Michiel Van Beirendonck|arXiv (Cornell University)|May 27, 2022
Cryptography and Data Security被引用 5
一句话总结

BASALISC 是一种用于 BGV 全同态加密方案的可编程 ASIC 硬件加速器,具备定制的 RISC 类指令集架构(ISA)、无冲突的 32 Tb/s 基于 256 的 NTT 架构,以及一种通用置换单元,可实现高效的自举(bootstrapping)与自同态(automorphisms)。通过为 NTT 友好的素数优化乘法器并集成专用的 MAC 单元用于密钥切换,其在 HElib 上实现了超过 5,000 倍的性能提升,使具备完全打包自举功能的实用、高吞吐量全同态加密(FHE)计算成为可能。

ABSTRACT

Fully Homomorphic Encryption (FHE) allows for secure computation on encrypted data. Unfortunately, huge memory size, computational cost and bandwidth requirements limit its practicality. We present BASALISC, an architecture family of hardware accelerators that aims to substantially accelerate FHE computations in the cloud. BASALISC is the first to implement the BGV scheme with fully-packed bootstrapping -- the noise removal capability necessary for arbitrary-depth computation. It supports a customized version of bootstrapping that can be instantiated with hardware multipliers optimized for area and power. BASALISC is a three-abstraction-layer RISC architecture, designed for a 1 GHz ASIC implementation and underway toward 150mm2 die tape-out in a 12nm GF process. BASALISC's four-layer memory hierarchy includes a two-dimensional conflict-free inner memory layer that enables 32 Tb/s radix-256 NTT computations without pipeline stalls. Its conflict-resolution permutation hardware is generalized and re-used to compute BGV automorphisms without throughput penalty. BASALISC also has a custom multiply-accumulate unit to accelerate BGV key switching. The BASALISC toolchain comprises a custom compiler and a joint performance and correctness simulator. To evaluate BASALISC, we study its physical realizability, emulate and formally verify its core functional units, and we study its performance on a set of benchmarks. Simulation results show a speedup of more than 5,000 times over HElib -- a popular software FHE library.

研究动机与目标

  • 解决全同态加密(FHE)在云环境中因计算与内存开销过高而限制其实际部署的问题。
  • 设计一种专用硬件加速器,支持 BGV FHE 的所有操作,包括完全打包的自举,这对于任意深度计算至关重要。
  • 通过仅使用 NTT 友好的素数限制乘法器,减少面积与功耗,同时不牺牲功能。
  • 利用无冲突的内存层次结构与通用置换逻辑,实现高吞吐量、低延迟的 NTT 与自同态计算。
  • 提供一个完整、形式化验证且可物理实现的加速器栈,包含定制编译器与性能仿真器。

提出的方法

  • BASALISC 采用三层抽象的 RISC 类指令集架构(ISA),以支持不同层次的软硬件协同设计与系统级优化。
  • 其内存层次结构包含四级,配备 64 MB 片上密文缓冲区(CTB),并采用无冲突的二维内存布局,实现无流水线停顿的 32 Tb/s 基于 256 的 NTT 吞吐量。
  • 该架构使用专用的置换硬件单元,通过异或(XOR)基置换,通用化地计算 NTT 转置与 BGV 自同态,无需额外内存或逻辑。
  • 一个集成 16 个条目寄存器文件的定制乘加(MAC)单元,通过与 CTB 异步独立执行,显著加速 BGV 密钥切换,尤其是混合密钥切换。
  • 加速器仅使用 NTT 友好的素数进行乘法器设计,使逻辑面积减少 46%,功耗降低 40%,同时保持与 BGV 自举的兼容性。
  • 该设计采用 12nm 低功耗 Global Foundries 工艺实现,芯片面积为 150mm²,时钟频率为 1 GHz,已完成物理后端设计,所有核心功能单元均通过形式化验证与仿真。

实验结果

研究问题

  • RQ1单个 ASIC 加速器能否以高吞吐量与低延迟高效支持所有 BGV FHE 操作,包括完全打包的自举?
  • RQ2如何通过无冲突内存布局与通用置换逻辑加速 NTT 与自同态计算,而无需额外硅面积?
  • RQ3在不牺牲完整 FHE 功能的前提下,乘法器在多大程度上可被限制为仅使用 NTT 友好的素数以减少面积与功耗?
  • RQ4通过专用的、高度并行化的硬件加速器,相较于 HElib 等软件 FHE 库,可实现多大的性能提升?
  • RQ5能否设计出一个完整、形式化验证且可物理实现的 FHE 加速器,配备完整的工具链(包括编译器与仿真器)?

主要发现

  • BASALISC 在一组 FHE 宏基准测试中,相较于 HElib 实现了超过 5,000 倍的性能提升,显著推动了实用 FHE 的发展。
  • 无冲突内存布局与通用置换单元使 32 Tb/s 基于 256 的 NTT 吞吐量得以实现,且无流水线停顿,显著提升了算术运算吞吐量。
  • 通过复用置换硬件同时支持 NTT 转置与 BGV 自同态,避免了额外的面积开销,确保了在多种操作间保持高效率。
  • 将乘法器限制为仅使用 NTT 友好的素数,使逻辑面积减少 46%,功耗降低 40%,同时未影响对 BGV 自举的支持。
  • 集成 16 个条目寄存器文件的定制 MAC 单元,可高效执行混合密钥切换循环,这对高深度 FHE 计算至关重要。
  • 该设计已完成形式化验证与功能仿真,芯片面积为 150mm²,工作频率为 1 GHz,采用 12nm 工艺,已具备物理后端实现与实际部署条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。