Skip to main content
QUICK REVIEW

[论文解读] Strix: An End-to-End Streaming Architecture with Two-Level Ciphertext Batching for Fully Homomorphic Encryption with Programmable Bootstrapping

Adiwena Putra, Prasetiyo|arXiv (Cornell University)|May 19, 2023
Cryptography and Data Security被引用 4
一句话总结

Strix 提出了一种针对环面上全同态加密(TFHE)的领域专用硬件加速器,通过一种新颖的两级密文批处理方案——设备级批处理与核心级批处理——结合全流水线流式架构,实现了高吞吐量的可编程刷新(PBS)。该设计通过消除盲旋转碎片化问题,并优化内存与计算资源利用率,采用专用功能单元和折叠式FFT微架构,使吞吐量分别达到CPU和GPU实现的1,067倍和37倍,相较现有最先进的TFHE加速器提升7.4倍。

ABSTRACT

Homomorphic encryption (HE) enables computations on encrypted data by concealing information under noise for security. However, the process of bootstrapping, which resets the noise level in the ciphertext, is computationally expensive and requires a large bootstrapping key. The TFHE scheme offers a faster and programmable bootstrapping algorithm called PBS, crucial for security-focused applications like machine learning. Nevertheless, the current TFHE scheme lacks support for ciphertext packing, resulting in low throughput. This work thoroughly analyzes TFHE bootstrapping, identifies the bottleneck in GPUs caused by the blind rotation fragmentation problem, and proposes a hardware TFHE accelerator called Strix. Strix introduces a two-level batching approach to enhance the batch size in PBS, utilizes a specialized microarchitecture for efficient streaming data processing, and incorporates a fully-pipelined FFT microarchitecture to improve performance. It achieves significantly higher throughput than state-of-the-art implementations on both CPUs and GPUs, outperforming existing TFHE accelerators by a factor of 7.4.

研究动机与目标

  • 为解决TFHE刷新过程中存在的性能瓶颈,特别是GPU上因盲旋转碎片化问题导致批处理受限、吞吐量下降的问题。
  • 设计一种针对TFHE独特计算与数据访问模式的硬件加速器,尤其针对其顺序密文处理与可编程刷新(PBS)工作负载。
  • 克服现有FHE加速器的局限性,这些加速器针对CKKS优化,因数据结构与计算需求差异,无法直接应用于TFHE。
  • 通过设备级与核心级批处理显著提升批处理规模,从而增强空间与时间并行性,实现高吞吐量PBS。
  • 通过专用全流水线功能单元优化加速器微架构,减少内存瓶颈,提升面积效率。

提出的方法

  • 提出两级密文批处理机制:设备级批处理允许多个密文并行处理,共享刷新密钥,提升空间重用;核心级批处理使每个处理核心可顺序处理多个密文,增强时间重用。
  • 设计流式、全流水线架构,实现密文的连续处理,最大限度减少空闲时间,提升顺序PBS操作的吞吐量。
  • 提出一种新颖的TFHE分解微架构,支持高吞吐量流式数据处理,对高效PBS执行至关重要。
  • 采用折叠式FFT微架构,结合折叠方案,降低内存访问开销,相比传统设计实现2倍吞吐量提升与1.7倍面积缩减。
  • 通过分析时间并行性(TvLP)与计算并行性(CLP)之间的权衡,优化加速器配置,在固定外部内存带宽(300 GB/s)下找到最优平衡点。
  • 使用参数集IV,评估多种配置以确定最佳性能点,最终确定TvLP=8与CLP=4为最优配置。

实验结果

研究问题

  • RQ1GPU上TFHE刷新性能下降的根本原因是什么?盲旋转碎片化如何限制批处理规模并降低吞吐量?
  • RQ2如何有效利用两级批处理(设备级与核心级)提升TFHE可编程刷新中的批处理规模?
  • RQ3为支持TFHE中高吞吐量、流式PBS,特别是分解与FFT操作,需要哪些微架构优化?
  • RQ4在TFHE硬件加速器中,时间并行性(TvLP)与计算并行性(CLP)之间的权衡如何影响吞吐量、延迟与内存带宽需求?
  • RQ5与CPU、GPU及现有TFHE加速器相比,定制硬件加速器(如Strix)可实现多大的性能提升?

主要发现

  • Strix在运行TFHE PBS时,吞吐量达到CPU的1,067倍、GPU的37倍,显著提升了同态计算的性能。
  • 最优配置TvLP=8与CLP=4在仅257 GB/s外部内存带宽下实现2,368 PBS/s的吞吐量,有效平衡了计算与内存利用率。
  • 折叠式FFT微架构相比非折叠设计,实现1.7倍面积缩减与2倍吞吐量提升,显著提高效率。
  • 高CLP配置(如CLP=32)需超过1 TB/s内存带宽,导致内存受限,吞吐量仅降至620 PBS/s,凸显设计平衡的重要性。
  • Strix在吞吐量上比最先进的TFHE加速器Matcha提升7.4倍,确立了TFHE加速的新性能基准。
  • 在评估深度神经网络时,Strix的延迟分别比CPU和GPU降低38倍与17倍,证明其在真实工作负载中的实际优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。