Skip to main content
QUICK REVIEW

[論文レビュー] ARK: Fully Homomorphic Encryption Accelerator with Runtime Data Generation and Inter-Operation Key Reuse

Jongmin Kim, Gwangho Lee|arXiv (Cornell University)|May 2, 2022
Cryptography and Data Security被引用数 7
ひとこと要約

ARKは、アルゴリズムとアーキテクチャの共同設計により、オフチップメモリ帯域幅のボトルneckを克服する、完全同一暗号化(FHE)向けのドメイン特化アクセラレータである。最小限のキースイッチングとランタイムでのリム拡張を導入することで、オフチップメモリアクセスを88%削減し、オンチップワーキングセットの完全利用を実現。これにより、先行研究と比較して乗算スループットが2,353倍向上し、ロジスティック回帰学習が18倍高速化された。また、リアルタイムでのResNet-20推論が0.125秒で実現された。

ABSTRACT

Homomorphic Encryption (HE) is one of the most promising post-quantum cryptographic schemes that enable privacy-preserving computation on servers. However, noise accumulates as we perform operations on HE-encrypted data, restricting the number of possible operations. Fully HE (FHE) removes this restriction by introducing the bootstrapping operation, which refreshes the data; however, FHE schemes are highly memory-bound. Bootstrapping, in particular, requires loading GBs of evaluation keys and plaintexts from off-chip memory, which makes FHE acceleration fundamentally bottlenecked by the off-chip memory bandwidth. In this paper, we propose ARK, an Accelerator for FHE with Runtime data generation and inter-operation Key reuse. ARK enables practical FHE workloads with a novel algorithm-architecture co-design to accelerate bootstrapping. We first eliminate the off-chip memory bandwidth bottleneck through runtime data generation and inter-operation key reuse. This approach enables ARK to fully exploit on-chip memory by substantially reducing the size of the working set. On top of such algorithmic enhancements, we build ARK microarchitecture that minimizes on-chip data movement through an efficient, alternating data distribution policy based on the data access patterns and a streamlined dataflow organization of the tailored functional units -- including base conversion, number-theoretic transform, and automorphism units. Overall, our co-design effectively handles the heavy computation and data movement overheads of FHE, drastically reducing the cost of HE operations, including bootstrapping.

研究の動機と目的

  • FHEハードウェアアクセラレーションにおける深刻なオフチップメモリ帯域幅ボトルneck、特にブートストラップ処理における課題を解決すること。
  • 大規模で一回限りの使用の評価鍵および平文に起因する高いオフチップメモリアクセスによって制限される既存アクセラレータの限界を克服すること。
  • アルゴリズム的最適化によりワーキングセットサイズを大幅に削減することで、FHEワークロードの実用的導入を可能にすること。
  • オンチップデータ移動を最小限に抑える専用マイクロアーキテクチャを設計し、アルゴリズム的強化に起因する計算強度の向上を活用すること。
  • 暗号化データ上のプライバシー保護型機械学習ワークロード、例えばCNN推論およびロジスティック回帰学習のリアルタイム性能を達成すること。

提案手法

  • ブートストラップ中の重複するキースイッチング操作を削減するアルゴリズム的最適化として、最小限のキースイッチングを導入。この手法により、複数の操作にわたり鍵を再利用する。
  • 事前にロードするのではなく、実行時にデータ要素を生成するランタイムリム拡張を提案。これにより、オフチップメモリアクセスを最小限に抑える。
  • FHE演算における2種類の異なるデータアクセスパターンに適応するデータ配分ポリシーを採用し、ARKマイクロアーキテクチャと共同設計することで、データフロー効率を向上。
  • 基本変換(BConv)、数論的変換(NTT)、自己同型写像の3つの主要FHE演算を最適化した、専用の機能ユニット(FUs)を実装。データ移動を低減することを目的として設計。
  • データフローをスムーズ化し、オンチップデータ移動を削減するため、チップを2つの論理的領域に分割。これにより、メモリ帯域幅の利用効率が向上。
  • CKKSブートストラップのアクセスパターンに特化したポリシーに従い、FUsの動作を同期する洗練されたデータフローアーキテクチャを統合。

実験結果

リサーチクエスチョン

  • RQ1アルゴリズム的イノベーションにより、FHEブートストラップにおけるオフチップメモリ帯域幅ボトルneckをどのように緩和できるか?
  • RQ2実行時データ生成とオペレーション間でのキーリユースは、FHEアクセラレータにおけるワーキングセットサイズをどの程度削減できるか?
  • RQ3共同設計されたアクセラレータアーキテクチャは、縮小されたワーキングセットを完全に活用し、高いスループットと低遅延を達成できるか?
  • RQ4提案された最適化を用いることで、ロジスティック回帰やCNN推論といった実世界のFHEワークロードでどの程度の性能向上が達成できるか?
  • RQ5F1やBTSといった最先端のFHEアクセラレータと比較して、ARKの性能と効率はどの程度か?

主な発見

  • 最小限のキースイッチングとランタイムリム拡張により、ブートストラップ中におけるオフチップメモリアクセスを88%削減。
  • 共同設計されたARKマイクロアーキテクチャは、最先端のHEアクセラレータF1 [87]と比較して、乗算スループットが2,353倍向上した。
  • ARKは、ResNet-20モデルにおけるリアルタイム暗号化推論を0.125秒で実現。ベースラインCPU実装と比較して18,214倍の高速化を達成した。
  • ロジスティック回帰学習性能は、先行する最先端アクセラレータと比較して18倍向上した。
  • ARKアクセラレータのサイズは418.3 mm²、最大消費電力は281.3Wであり、実用的導入に適した高い面積効率および電力効率を示した。
  • 提案されたアルゴリズム的最適化により、縮小されたワーキングセット全体がオンチップに格納可能となり、頻繁なオフチップメモリアクセスの必要がなくなり、オンチップメモリおよび論理回路の完全利用が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。