[論文レビュー] BASALISC: Programmable Hardware Accelerator for BGV Fully Homomorphic Encryption
BASALISC は、B循環完全同型暗号化方式(BGV)のためのプログラマブルな ASIC ハードウェアアクセラレータであり、カスタム RISC に類似した ISA、競合のない 32 Tb/s ラジックス 256 NTT アーキテクチャ、および効率的なブートストラップとオートモルフィズムを可能にする一般化されたパーミュテーションユニットを備えている。マルチプライヤーの NTT 友好的な素数への最適化と、キースイッチングに特化した MAC ユニットの統合により、完全にパックされたブートストラップを含む実用的で高スルーレートの FHE 計算を実現し、HElib よりも 5,000 倍以上の高速化を達成した。
Fully Homomorphic Encryption (FHE) allows for secure computation on encrypted data. Unfortunately, huge memory size, computational cost and bandwidth requirements limit its practicality. We present BASALISC, an architecture family of hardware accelerators that aims to substantially accelerate FHE computations in the cloud. BASALISC is the first to implement the BGV scheme with fully-packed bootstrapping -- the noise removal capability necessary for arbitrary-depth computation. It supports a customized version of bootstrapping that can be instantiated with hardware multipliers optimized for area and power. BASALISC is a three-abstraction-layer RISC architecture, designed for a 1 GHz ASIC implementation and underway toward 150mm2 die tape-out in a 12nm GF process. BASALISC's four-layer memory hierarchy includes a two-dimensional conflict-free inner memory layer that enables 32 Tb/s radix-256 NTT computations without pipeline stalls. Its conflict-resolution permutation hardware is generalized and re-used to compute BGV automorphisms without throughput penalty. BASALISC also has a custom multiply-accumulate unit to accelerate BGV key switching. The BASALISC toolchain comprises a custom compiler and a joint performance and correctness simulator. To evaluate BASALISC, we study its physical realizability, emulate and formally verify its core functional units, and we study its performance on a set of benchmarks. Simulation results show a speedup of more than 5,000 times over HElib -- a popular software FHE library.
研究の動機と目的
- クラウド環境における実用的導入を制限する完全同型暗号化(FHE)の高い計算およびメモリオーバーヘッドを解消すること。
- 任意の深さの計算に不可欠な完全にパックされたブートストラップを含む、すべての BGV FHE 操作をサポートするドメイン特化ハードウェアアクセラレータを設計すること。
- 関数性を損なわずに、マルチプライヤーを NTT 友好的な素数に制限することで、FHE アクセラレータの面積および消費電力を低減すること。
- 競合のないメモリ階層と一般化されたパーミュテーション論理を用いて、高スルーレートかつ低遅延の NTT およびオートモルフィズム計算を実現すること。
- カスタムコンパイラおよびパフォーマンスシミュレータを含む、完全で形式的に検証され、物理的に実現可能なアクセラレータスタックを提供すること。
提案手法
- BASALISC は、多様なレベルのハードウェア・ソフトウェア共同最適化およびシステムレベル最適化を可能にする、3段階の抽象化レイヤーを持つ RISC に類似した ISA を採用している。
- 64 MB のオンチップ暗号文バッファ(CTB)を備えた4段階のメモリ階層を実装し、競合のない2次元メモリレイアウトにより、パイプラインスタガレーションなしで 32 Tb/s のラジックス 256 NTT スループットを実現している。
- NTT の転置と BGV オートモルフィズムの両方を XOR ベースのパーミュテーションで計算できる専用のパーミュテーションハードウェアユニットを採用し、追加のメモリや論理回路を必要としない。
- 統合された 16 エントリのレジスタファイルを備えたカスタム乗算-積算(MAC)ユニットにより、特にハイブリッドキースイッチングにおいて、CTB からの非同期かつ独立した実行が可能になり、BGV キースイッチングが高速化される。
- マルチプライヤーに NTT 友好的な素数のみを用いることで、論理面積を 46% 削減し、消費電力を 40% 減少させつつ、BGV ブートストラップのサポートを維持している。
- 12nm 低消費電力 Global Foundries プロセスを用いて実装され、150mm² のダイサイズと 1 GHz のクロック周波数を達成しており、形式的検証とコア機能ユニットのエミュレーションを経て、物理的テープアウトが完了している。
実験結果
リサーチクエスチョン
- RQ11 つの ASIC アクセラレータが、完全にパックされたブートストラップを含む、すべての BGV FHE 操作を、高スルーレートかつ低遅延で効率的にサポートできるか。
- RQ2追加のシリコン面積を要せず、競合のないメモリレイアウトと一般化されたパーミュテーション論理を用いて、NTT およびオートモルフィズム計算をどのように高速化できるか。
- RQ3マルチプライヤーを NTT 友好的な素数に制限することで、面積と消費電力をどれほど削減できるか、同時に完全な FHE 機能性を損なわないか。
- RQ4目的に特化した、高並列性を持つハードウェアアクセラレータによって、HElib などのソフトウェア FHE ライブラリと比較して、どの程度のパフォーマンス向上が達成できるか。
- RQ5コンパイラおよびシミュレータを含むフルスタックツールチェーンを備えた、完全で形式的に検証され、物理的に実現可能な FHE アクセラレータを設計できるか。
主な発見
- BASALISC は、FHE マクロベンチマークのセットにおいて HElib よりも 5,000 倍以上の高速化を達成し、実用的 FHE パフォーマンスにおける飛躍的な進歩を示した。
- 競合のないメモリレイアウトと一般化されたパーミュテーションユニットにより、パイプラインスタガレーションなしで 32 Tb/s のラジックス 256 NTT スループットが実現され、演算スルーレートが顕著に向上した。
- パーミュテーションハードウェアを NTT の転置と BGV オートモルフィズムの両方の計算に再利用することで、追加の面積コストを回避し、多様な操作において高い効率性を維持した。
- マルチプライヤーを NTT 友好的な素数に制限することで、論理面積を 46% 削減し、消費電力を 40% 減少させたが、BGV ブートストラップのサポートに影響を与えることなく、完全に維持された。
- 統合された 16 エントリのレジスタファイルを備えたカスタム MAC ユニットにより、高深度 FHE 計算に不可欠なハイブリッドキースイッチングループの効率的実行が可能になった。
- 設計は形式的検証と機能エミュレーションが完了しており、12nm プロセス、150mm² のダイサイズ、1 GHz の周波数を達成しており、物理的テープアウトおよび実世界への展開に向けた準備が整っている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。