Skip to main content
QUICK REVIEW

[論文レビュー] East: Efficient and Accurate Secure Transformer Framework for Inference

Yuanchao Ding, Hua Guo|arXiv (Cornell University)|Aug 19, 2023
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

Eastは、非線形関数(GELU や tanh など)の高速化を実現する新しい無関心的区分多項式評価(OPPE)アルゴリズムを用いて、プライバシー保護型Transformer推論のための安全で効率的かつ正確なフレームワークを提案する。従来の手法と比較して、実行時間は1.5倍低減され、通信量は2.6倍低減され、モデルの再トレーニングを必要とせず、プレーンテキスト水準の精度を維持する。

ABSTRACT

Transformer has been successfully used in practical applications, such as ChatGPT, due to its powerful advantages. However, users' input is leaked to the model provider during the service. With people's attention to privacy, privacy-preserving Transformer inference is on the demand of such services. Secure protocols for non-linear functions are crucial in privacy-preserving Transformer inference, which are not well studied. Thus, designing practical secure protocols for non-linear functions is hard but significant to model performance. In this work, we propose a framework \emph{East} to enable efficient and accurate secure Transformer inference. Firstly, we propose a new oblivious piecewise polynomial evaluation algorithm and apply it to the activation functions, which reduces the runtime and communication of GELU by over 1.5$ imes$ and 2.5$ imes$, compared to prior arts. Secondly, the secure protocols for softmax and layer normalization are carefully designed to faithfully maintain the desired functionality. Thirdly, several optimizations are conducted in detail to enhance the overall efficiency. We applied \emph{East} to BERT and the results show that the inference accuracy remains consistent with the plaintext inference without fine-tuning. Compared to Iron, we achieve about 1.8$ imes$ lower communication within 1.2$ imes$ lower runtime.

研究の動機と目的

  • プライバシー保護型Transformer推論における非線形関数のための効率的かつ正確なセキュアプロトコルの不足に対処すること。
  • クライアントの入力プライバシーとサーバーのモデルパラメータプライバシーの両方を保護するセキュアな推論を実現すること。
  • 再トレーニングやアーキテクチャの変更を必要とせず、元のモデルアーキテクチャを維持すること。
  • 従来、通信コストの最大87%を占めていたセキュアな非線形関数のパフォーマンスオーバーヘッドを低減すること。
  • 誤差漏れを最小限に抑えたMPCフレンドリーなプロトコルを設計し、GELU、tanh、softmax、レイヤーノーマライゼーションに対して最適化すること。

提案手法

  • GELU や tanh などの非線形関数を安全に評価するための新しい無関心的区分多項式評価(OPPE)アルゴリズムを提案し、区分多項式近似を用いる。
  • 誤差制限付き変換手法と秘密分散を用いて、正しさとプライバシーを保証するsoftmaxおよびレイヤーノーマライゼーションのセキュアプロトコルを設計する。
  • ベイバー・トリプルの使用を削減し、効率的な事前計算を活用することで、オフラインおよびオンラインフェーズを最適化し、通信量と実行時間を改善する。
  • BERTの完全な推論パイプラインにプロトコルを統合し、元のモデル構造を維持し、再トレーニングを回避する。
  • セキュリティと正しさを保証するため、同型暗号(HE)と秘密分散(SS)を暗号基盤として採用する。
  • GELU(d=3, m=8)や tanh(d=3, m=7)などの関数に対して次元に特化した最適化を適用し、精度と効率のバランスを図る。

実験結果

リサーチクエスチョン

  • RQ1非線形関数(GELU や tanh など)は、パフォーマンスオーバーヘッドを最小限に抑えて、プライバシー保護型Transformer推論環境でどのように安全に評価できるか?
  • RQ2新規の無関心評価手法は、ルックアップテーブルベースの手法と比較して、非線形関数の通信量と実行時間コストを低減できるか?
  • RQ3MPCベースの推論において、精度と効率を維持しつつ、セキュアなsoftmaxおよびレイヤーノーマライゼーションプロトコルをどの程度設計できるか?
  • RQ4再トレーニングを伴わず、元のモデルアーキテクチャを維持しながら、プレーンテキストに近いパフォーマンスを達成できるか?
  • RQ5Iron などの最先端ソリューションと比較して、提案フレームワークは実行時間、通信量、推論精度の点でどの程度優れているか?

主な発見

  • 提案されたOPPEアルゴリズムにより、GELUの通信コストはNFGen(従来の最先端手法)と比較して2.6倍低減され、実行時間は1.5倍低減された。
  • GELUに関して、Eastは現在のSOTAであるIronと比較して、1.5倍の実行時間短縮と2.9倍の通信量削減を達成した。
  • セキュアなsoftmaxおよびレイヤーノーマライゼーションプロトコルは入力次元に線形にスケーリングされ、1000次元の入力に対してそれぞれ約5秒および約2秒の実行時間が必要となった。
  • Eastは、テストされたベンチマークにおいて、プレーンテキストモデルと同一の推論精度を維持し、F1スコア、適合率、再現率、正解率に低下は認めなかった。
  • Ironと比較して、総通信量は1.8倍低減され、実行時間は1.2倍低減され、BERT-Baseの推論において約256秒の時間短縮と約30 GBの通信量削減が達成された。
  • オフラインフェーズでは、ベイバー・トリプルの使用削減のおかげで最大3倍の最適化が達成され、事前計算の効率が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。