Skip to main content
QUICK REVIEW

[論文レビュー] LLMs Can Understand Encrypted Prompt: Towards Privacy-Computing Friendly Transformers

X. Liu, Zhuotao Liu|arXiv (Cornell University)|May 28, 2023
Privacy-Preserving Technologies in Data被引用数 7
ひとこと要約

本稿では、GELU やソフトマックス、レイヤー正規化といったプライバシーに不向きな非線形演算を、効率的で同型暗号(HE)および安全なマルチパーティ計算(MPC)と互換性のある代替手法に置き換えるプライバシー計算に配慮したトランスフォーマー・アーキテクチャを提案する。これらの計算コストの高いコンponentsを置き換えることで、最新の Iron や他の最先端手法と比較して、推論時間に5倍の高速化と通信オーバーヘッドに80%の削減を達成し、大規模言語モデル(LLM)の推論においてほぼ同一のモデル精度を維持する。

ABSTRACT

The community explored to build private inference frameworks for transformer-based large language models (LLMs) in a server-client setting, where the server holds the model parameters and the client inputs its private data (or prompt) for inference. However, these frameworks impose significant overhead when the private inputs are forward propagated through the original LLMs. In this paper, we show that substituting the computation- and communication-heavy operators in the transformer architecture with privacy-computing friendly approximations can greatly reduce the private inference costs while incurring very minor impact on model performance. Compared to state-of-the-art Iron (NeurIPS 2022), our privacy-computing friendly model inference pipeline achieves a $5 imes$ acceleration in computation and an 80% reduction in communication overhead, while retaining nearly identical accuracy.

研究の動機と目的

  • 同型暗号(HE)および安全なマルチパーティ計算(MPC)を用いたトランスフォーマー基盤の LLM のプライベート推論における高い計算コストおよび通信コストを解消すること。
  • GELU やソフトマックス、レイヤー正規化といったプライバシー計算に不向きな演算子が、プライベート LLM 推論における主な性能ボトルネックであることを同定すること。
  • これらの非線形演算子のプライバシー計算に配慮した近似手法を設計し、モデル精度を維持しながら暗号化コストを大幅に削減すること。
  • プライベート計算下での推論時間、通信コスト、精度の観点から、変更されたモデルのエンドツーエンド性能を評価すること。

提案手法

  • 著者らは、トランスフォーマー基盤の LLM に対して完全に HE および MPC をサポートするプライベート推論システムを実装し、暗号化された入力に対して安全に計算を実行可能にする。
  • GELU、ソフトマックス、レイヤー正規化がプライベート推論における主なコスト要因であり、合計コストの70%以上を占めることを同定した。
  • これらの演算子を、GELU に対して ReLU、ソフトマックスに対して多項式近似、正規化層に対して簡素化された正規化層に置き換えた。
  • 変更されたモデルは、性能を維持するよう微調整され、プライベート推論下でも元のモデルとほぼ同一の精度を達成した。
  • システムは線形演算に HE を、非線形演算に MPC を使用し、最適化されたデータ符号化およびバッチ処理戦略を採用した。
  • 複数の LLM(BERT-Tiny、BERT-Medium、RoBERTa-Base)を対象に、元のモデルと変更済みモデルの間で通信コストおよび計算コストをエンドツーエンドで測定した。
Figure 1: Ratio of various operators’ cost
Figure 1: Ratio of various operators’ cost

実験結果

リサーチクエスチョン

  • RQ1HE および MPC を用いたトランスフォーマー基盤 LLM のプライベート推論において、主な計算コストおよび通信コストのボトルネックは何か?
  • RQ2GELU やソフトマックス、レイヤー正規化などの非線形演算子に対して、プライバシー計算に配慮した近似手法を適用することで、精度を損なわず推論コストを顕著に削減できるか?
  • RQ3Iron や他の最先端のプライベート推論システムと比較して、提案フレームワークの速度および通信効率はどの程度優れているか?
  • RQ4非線形演算子を HE/MPC 友好的な代替手法に置き換えることで、プライベート LLM 推論のエンドツーエンド精度にどの程度の影響が生じるか?
  • RQ5提案手法は、BERT-Tiny や RoBERTa-Base などの異なる LLM アーキテクチャにスケーリング可能であり、高い効率性とプライバシー保証を維持できるか?

主な発見

  • 提案されたプライバシー計算に配慮したモデルは、RoBERTa-Base において Iron よりも最大 5.7 倍の高速化を達成し、元のモデルの 168.43 秒を 84.50 秒に短縮した。
  • 通信コストは最大 5.6 倍削減され、元のモデルの 6.38GB から最適化済みバージョンの 1.14GB にまで低下した。
  • 全体のプライベート推論コストは 80%削減され、特に GELU、ソフトマックス、正規化層の置き換えによって最も顕著なコスト削減が達成された。
  • 変更済み BERT-Tiny モデルにおけるエンドツーエンドのプライベート推論では、元のモデルのプレインテキスト推論よりもわずかに高い精度を達成しており、性能の安定性または向上を示している。
  • 最適化済みモデルの通信コストは、元のモデルのコストの 13%にまで低下しており、データ送信の面で顕著な効率性向上が確認された。
  • 全評価データセットにおいて、変更されたモデルは元のモデルとほぼ同一の精度を維持しており、アーキテクチャの変更にもかかわらず性能劣化が最小限に抑えられていることが確認された。
Figure 2: Accuracies of the model before and after each substitution. We use $-$ mark to denote which operators have been replaced. The changes are done incrementally. For example, “ $-$ Softmax” means both GELU and Softmax are replaced with privacy-computing friendly alternatives.
Figure 2: Accuracies of the model before and after each substitution. We use $-$ mark to denote which operators have been replaced. The changes are done incrementally. For example, “ $-$ Softmax” means both GELU and Softmax are replaced with privacy-computing friendly alternatives.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。