Skip to main content
QUICK REVIEW

[論文レビュー] MPCFormer: fast, performant and private Transformer inference with MPC

Dacheng Li, Rulin Shao|arXiv (Cornell University)|Nov 2, 2022
Cryptography and Data Security被引用数 15
ひとこと要約

MPCFormer は、MPC 友好的な関数近似と知識蒸留を組み合わせることで、安全なマルチパーティ計算(MPC)を用いた高速かつプライベートで高パフォーマンスなトランスフォーマー推論を実現する。GLUE ベンチマークにおいて BERT_BASE の 97% のパフォーマンスを維持しながら、BERT_BASE や BERT_LARGE に対して最大 5.9 倍の高速化を達成し、多様なモデルやデータセットにおいて最小限の精度損失で実現している。

ABSTRACT

Enabling private inference is crucial for many cloud inference services that are based on Transformer models. However, existing private inference solutions can increase the inference latency by more than 60x or significantly compromise the inference quality. In this paper, we design the framework MPCFORMER as a practical solution, using Secure Multi-Party Computation (MPC) and Knowledge Distillation (KD). Through extensive evaluations, we show that MPCFORMER significantly speeds up Transformer inference in MPC settings while achieving similar ML performance to the input model. On the IMDb dataset, it achieves similar performance to BERTBASE, while being 5.3x faster. On the GLUE benchmark, it achieves 97% performance of BERTBASE with a 2.2x speedup. MPCFORMER remains effective with different trained Transformer weights such as ROBERTABASE and larger models including BERTLarge. Code is available at https://github.com/MccRee177/MPCFormer.

研究の動機と目的

  • 現在、推論が 60 倍以上遅延するという問題がある、MPC を用いたプライベートなトランスフォーマー推論における高いレイテンシという重要な課題に取り組む。
  • トレーニングを乱す MPC 友好的な近似によって引き起こされるパフォーマンス劣化を克服し、大規模なダウンストリームデータセットに依存しない。
  • 大規模なトランスフォーマー モデルのための実用的なプライベート推論サービスの展開を可能にし、モデルの精度を損なわない。
  • さまざまな事前学習済みモデル(例:BERT_BASE、RoBERTa_BASE、BERT_LARGE)および MPC 友好的な近似と互換性を持つフレームワークを設計する。
  • 効率的な知識蒸留を用いて、MPC 環境下でも低レイテンシかつ高機械学習パフォーマンスを実現する。

提案手法

  • 事前学習済みトランスフォーマー内のボトルネック関数を、MPC 友好的な近似(例:Quad+2ReLU、新しい高速なソフトマックス近似)に置き換えることで、MPC 推論の高速化を図る。
  • 教師モデルの内部表現を用いて、知識蒸留(KD)を適用し、元の教師モデルから近似された学生モデルへ知識を転送する。
  • 学生モデルのトレーニング中に、教師モデルのログティと中間特徴量を監督信号として用い、小規模なダウンストリームデータセットでも効果的な蒸留を可能にする。
  • 埋め込み層およびアテンション層のハイパーパrameterを微調整し、蒸留損失と通常の交差エントロピー損失の両方を組み合わせて学生モデルを訓練する。
  • 蒸留された学生モデルを MPC エンジン(例:CrypTen)にデプロイし、エンドツーエンドのプライベート推論を実現する。
  • データ効率の良いトレーニング戦略を用いて蒸留プロセスを最適化し、大規模なダウンストリームデータセットへの依存を低減する。

実験結果

リサーチクエスチョン

  • RQ1MPC 友好的な近似をトランスフォーマーに効果的に適用しても、プライベート推論における顕著なパフォーマンス劣化が生じないか?
  • RQ2MPC 制約下で近似されたトランスフォーマーをトレーニングする際、知識蒸留がどれほどパフォーマンス損失を緩和できるか?
  • RQ3MPCFormer は、BERT_LARGE を含むさまざまなモデルサイズにどのようにスケーリングできるか?また、蒸留なしのベースラインと比べてどのように差がつくか?
  • RQ4MPC 環境下で蒸留を用いて高いパフォーマンスを達成するために、最小限のダウンストリームデータ量はどれほどか?
  • RQ5教師モデルの重みで初期化された学生モデルは、特に小規模なデータセットにおいて、トレーニングの安定性と最終的なパフォーマンスを向上させるか?

主な発見

  • IMDb データセットでは、BERT_BASE を用いた MPCFormer が 95.0% の精度を達成し、5.3 倍の高速化を実現したが、元のモデルと同等のパフォーマンスを維持した。
  • IMDb における BERT_LARGE では、MPCFormer が 94.5% の精度を達成し、5.9 倍の高速化を実現し、蒸留なしのベースラインを著しく上回った。
  • GLUE ベンチマークでは、MPCFormer が BERT_BASE の平均スコアの 97%(84.6 対 85.3)を達成し、2.2 倍の高速化を実現した。これは優れた一般化性能を示している。
  • MPCFormer は、RoBERTa_BASE を含むさまざまな事前学習済みモデルにおいても高いパフォーマンスを維持しており、多様なアーキテクチャと互換性があることが示された。
  • 知識蒸留により、小規模なデータセットでも効果的なトレーニングが可能である:中規模データセット(例:QNLI)の 2%、小規模データセット(例:MRPC)の 5% あれば高いパフォーマンスが達成できる。
  • 教師モデルの重みで初期化された学生モデルは、ランダム初期化よりも優れたパフォーマンスを示し、特に小規模なダウンストリームデータセットにおいて顕著な向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。