[论文解读] MATCHA: A Fast and Energy-Efficient Accelerator for Fully Homomorphic Encryption over the Torus
MATCHA 是一种硬件加速器,通过使用近似无乘法的整数FFT/理想FFT以及具有激进引导密钥展开(BKU)的流水线数据通路,加速了基于环面的全同态加密(TFHE)。与以往的CPU、GPU、FPGA和ASIC解决方案相比,它实现了2.3倍更高的吞吐量和6.3倍更好的每瓦吞吐量,显著提升了TFHE门处理的性能和能效。
Fully Homomorphic Encryption over the Torus (TFHE) allows arbitrary computations to happen directly on ciphertexts using homomorphic logic gates. However, each TFHE gate on state-of-the-art hardware platforms such as GPUs and FPGAs is extremely slow ($>0.2ms$). Moreover, even the latest FPGA-based TFHE accelerator cannot achieve high energy efficiency, since it frequently invokes expensive double-precision floating point FFT and IFFT kernels. In this paper, we propose a fast and energy-efficient accelerator, MATCHA, to process TFHE gates. MATCHA supports aggressive bootstrapping key unrolling to accelerate TFHE gates without decryption errors by approximate multiplication-less integer FFTs and IFFTs, and a pipelined datapath. Compared to prior accelerators, MATCHA improves the TFHE gate processing throughput by $2.3 imes$, and the throughput per Watt by $6.3 imes$.
研究动机与目标
- 解决现有硬件平台(如CPU、GPU和FPGA)在TFHE门处理中高延迟和能效差的问题。
- 缓解TFHE引导过程中FFT/IFFT内核的瓶颈,该内核占用了大部分执行时间。
- 通过TFHE中的误差容忍机制,实现激进的引导密钥展开(BKU),在保持正确性的同时提升吞吐量。
- 设计一种流水线化、高能效的加速器架构,支持无浮点运算的近似整数FFT/理想FFT。
- 与最先进的基于CPU、GPU、FPGA和ASIC的TFHE加速器相比,实现更优的性能和能效。
提出的方法
- MATCHA 使用近似无乘法的整数FFT和IFFT,仅依赖加法和位移操作,降低面积和功耗,同时容忍微小误差,这些误差在解密过程中可被吸收。
- 通过专用TGSW集群和外部乘法核心实现流水线数据通路,支持激进的引导密钥展开(BKU),减少FFT/IFFT调用次数。
- 架构中为顺序TGSW内存访问和不规则FFT/IFFT访问分别设置独立的寄存器堆,最大限度减少数据冒险,提升吞吐量。
- 利用基于CGRA的建模框架(OpenCGRA)将TFHE操作调度并映射到架构上,实现对延迟和功耗的精确估算。
- 采用16nm工艺进行综合,并在标准TFHE参数(N=1024, k=1, Bg=1024, l=3)下与CPU、GPU、FPGA和ASIC基线进行对比评估。
- MATCHA 支持m=3的BKU,实现比GPU(m=4)更高的吞吐量,同时功耗更低。
实验结果
研究问题
- RQ1在TFHE引导中,能否有效使用近似无乘法的整数FFT和IFFT,而不会引入解密错误?
- RQ2在TFHE硬件加速器中,激进的引导密钥展开(BKU)对吞吐量和资源利用率有何影响?
- RQ3具有优化内存访问模式的流水线数据通路是否能显著降低延迟并提升TFHE门处理的能效?
- RQ4与CPU、GPU和FPGA实现的TFHE相比,定制ASIC加速器(MATCHA)在性能和能效方面有何提升?
- RQ5在不损害安全性或正确性的前提下,能在多大程度上在FFT/IFFT内核中利用近似算术?
主要发现
- 当m=3时,MATCHA将TFHE NAND门的延迟降低至0.37ms,优于GPU(m=4时为0.18ms),且显著低于CPU(m=2时为6.67ms)。
- 当GPU和MATCHA均使用m=3时,MATCHA的吞吐量比GPU基线高出2.3倍,得益于高效的流水线和BKU支持。
- MATCHA相比ASIC基线,每瓦吞吐量提升6.3倍,尽管功耗更低(39.98W),仍实现了6.3倍更好的能效。
- FPGA和ASIC基线在m=1时,相比CPU的吞吐量每瓦提升分别为2.4倍和8.3倍,凸显了非流水化设计的低效性。
- 通过使用近似整数FFT和IFFT,仅依赖加法和位移操作,即可实现高性能,避免了昂贵的双精度浮点运算,显著降低功耗。
- 具有为TGSW和FFT/IFFT操作分别设置的独立寄存器堆的流水线数据通路,能够高效处理不规则和顺序的内存访问模式,提升吞吐量并减少停顿。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。