Skip to main content
QUICK REVIEW

[論文レビュー] FAB: An FPGA-based Accelerator for Bootstrappable Fully Homomorphic Encryption

Rashmi Agrawal, Leo de Castro|arXiv (Cornell University)|Jul 25, 2022
Cryptography and Data Security被引用数 8
ひとこと要約

FABは、FPGAベースのアクセラレータであり、実用的なパrameterセットにおける効率的で再起動可能な完全同型暗号(FHE)を実現し、アルゴリズム・アーキテクチャ共同設計によりメモリ帯域幅のボトルネックを克服する。CPUに対して456倍の高速化、GPUに対して6.5倍の高速化を達成し、ロジスティック回帰学習において、先行するFPGAおよびGPUアクセラレータを上回り、ASIC性能に匹敵するがコストはごくわずかである。

ABSTRACT

FHE offers protection to private data on third-party cloud servers by allowing computations on the data in encrypted form. However, to support general-purpose encrypted computations, all existing FHE schemes require an expensive operation known as bootstrapping. Unfortunately, the computation cost and the memory bandwidth required for bootstrapping add significant overhead to FHE-based computations, limiting the practical use of FHE. In this work, we propose FAB, an FPGA-based accelerator for bootstrappable FHE. Prior FPGA-based FHE accelerators have proposed hardware acceleration of basic FHE primitives for impractical parameter sets without support for bootstrapping. FAB, for the first time ever, accelerates bootstrapping (along with basic FHE primitives) on an FPGA for a secure and practical parameter set. The key contribution of our work is to architect a balanced FAB design, which is not memory bound. To this end, we leverage recent algorithms for bootstrapping while being cognizant of the compute and memory constraints of our FPGA. We use a minimal number of functional units for computing, operate at a low frequency, leverage high data rates to and from main memory, utilize the limited on-chip memory effectively, and perform operation scheduling carefully. For bootstrapping a fully-packed ciphertext, while operating at 300 MHz, FAB outperforms existing state-of-the-art CPU and GPU implementations by 213x and 1.5x respectively. Our target FHE application is training a logistic regression model over encrypted data. For logistic regression model training scaled to 8 FPGAs on the cloud, FAB outperforms a CPU and GPU by 456x and 6.5x and provides competitive performance when compared to the state-of-the-art ASIC design at a fraction of the cost.

研究の動機と目的

  • FHEの再起動処理における性能ボトルネックを解消すること。これは、従来のハードウェアアクセラレータにおいて、メモリ帯域幅が深刻に制限している。
  • CKKS FHEの実用的で安全なパrameterセット(完全な再起動を含む)をサポートするFPGAベースのアクセラレータを設計すること。これは、従来のFPGAアクセラレータが小さなパrameterセットのみをサポートしていたのとは対照的である。
  • FHEアルゴリズムとFPGAのハードウェア制約を共同で最適化することで、計算のアイドル時間を回避し、高いパフォーマンスとリソース効率を達成すること。
  • ASICと同等のパフォーマンスを達成するが、コストははるかに低いFPGA上で、エンドツーエンドのセキュアな機械学習ワークロード(具体的にはロジスティック回帰学習)を実現すること。
  • バランスの取れた、メモリ効率の良いFPGA設計が、一般向けCPUやGPUを上回り、専用ASICに匹敵する性能を発揮できることを示すこと。

提案手法

  • 最新の再起動技術を用いて、FPGAの制約に合わせたFHE再起動アルゴリズムの共同設計により、メモリアクセスを最小限に抑え、計算リソースの利用を最大化する。
  • モジュラ演算のための最小限の256個の機能ユニットを実装し、FHEプリミティブのパイプライン処理と並列実行を可能にするよう、丁寧にスケジューリングする。
  • Xilinx Alveo U280 FPGAに搭載された高帯域幅メモリ(HBM2)を活用し、効率的なバッファリングとデータ再利用により、オンチップメモリ使用量を最小限に抑えることで、データ移動を最適化する。
  • 低クロック周波数(300 MHz)を採用して消費電力と面積を低減し、代わりに高い並列処理と効率的な演算スケジューリングによりスループットを維持する。
  • 計算とメモリを密接に同期させたバランスの取れたシステムアーキテクチャを設計し、F1 や BTS といった従来のASICアクセラレータが直面するメモリ帯域幅のボトルネックを回避する。
  • クラウド環境における8つのFPGAに設計をスケーリングし、大規模なFHEワークロードにおけるマルチデバイス性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1FPGAベースのアクセラレータは、実用的で安全なパrameterセットを備えたCKKS FHEの再起動処理を、従来のASICで見られたメモリ帯域幅のボトルネックを克服して実現できるか?
  • RQ2アルゴリズム最適化とアーキテクチャ共同設計を活用することで、FHEワークロードにおけるFPGA上の計算とメモリ使用をどのようにバランスさせられるか?
  • RQ3FPGAアクセラレータは、専用ASICに匹敵するか、それ以上のパフォーマンスを発揮しながら、コスト効率が良く、パブリッククラウド環境に展開可能か?
  • RQ4エンドツーエンドのFHEベースのロジスティック回帰学習(完全な再起動を含む)において、FPGAアクセラレータはCPUやGPUに比べてどの程度のパフォーマンス向上を達成できるか?
  • RQ5FPGA上での演算スケジューリングとメモリ管理技術により、メモリ制限による計算アイドル問題を回避できるか?

主な発見

  • 1つのXilinx Alveo U280 FPGAで300 MHzで動作する場合、FABは、最新のCPU実装に対して213倍の高速化、GPUに対して1.5倍の高速化を達成した。これは、完全に埋められた暗号文の再起動処理を対象としている。
  • 8つのFPGAにスケーリングしたロジスティック回帰学習のワークロードでは、FABはCPUに対して456倍、GPUに対して6.5倍の高速化を達成し、一般向けハードウェアを著しく上回った。
  • FABのパフォーマンスは、最新の専用ASIC設計と同等であり、市販のFPGAハードウェアを用いながら、ASICのコストのほんの一部で実現した。
  • スマートな演算スケジューリングとオンチップメモリおよびHBM2帯域幅の効率的使用により、メモリ帯域幅と計算リソースのバランスを取ることで、計算のアイドル時間を回避した。
  • FABは、セキュアで実用的なパrameterセットを備えたCKKS FHEをサポートしており、完全な再起動を含むエンドツーエンドの応用(例:ロジスティック回帰学習)を可能にした。これは、従来のFPGAアクセラレータが小さなパrameterセットのみをサポートしていたのとは対照的である。
  • すべての必要なハードウェアおよびソフトウェアコンponentsが商用クラウドFPGAプラットフォームに用意されているため、FABはパブリッククラウド環境に展開可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。