Skip to main content
QUICK REVIEW

[論文レビュー] SESAME: Software defined Enclaves to Secure Inference Accelerators with Multi-tenant Execution

Sarbartha Banerjee, Prakash Ramrakhyani|arXiv (Cornell University)|Jul 14, 2020
Security and Verification in Computing参考文献 57被引用数 6
ひとこと要約

SESAMEは、マルチテナント推論アクセラレータ向けにソフトウェア定義型エナclave(SDE)を導入し、コンpilerチューニング済みのプライベートキューとトラフィックシェーパーを用いることで、脅威モデル固有のセキュリティを実現するとともに、パフォーマンスオーバーヘッドを3.96%〜34.87%の範囲に抑える。このフレームワークは、DAEベースのアクセラレータにおいて計算上の非干渉性を達成し、VGG、ResNet、AlexNetなどのモデルにおけるサイドチャnel漏洩を防止する。

ABSTRACT

Hardware-enclaves that target complex CPU designs compromise both security and performance. Programs have little control over micro-architecture, which leads to side-channel leaks, and then have to be transformed to have worst-case control- and data-flow behaviors and thus incur considerable slowdown. We propose to address these security and performance problems by bringing enclaves into the realm of accelerator-rich architectures. The key idea is to construct software-defined enclaves (SDEs) where the protections and slowdown are tied to an application-defined threat model and tuned by a compiler for the accelerator's specific domain. This vertically integrated approach requires new hardware data-structures to partition, clear, and shape the utilization of hardware resources; and a compiler that instantiates and schedules these data-structures to create multi-tenant enclaves on accelerators. We demonstrate our ideas with a comprehensive prototype -- Sesame -- that includes modifications to compiler, ISA, and microarchitecture to a decoupled access execute (DAE) accelerator framework for deep learning models. Our security evaluation shows that classifiers that could distinguish different layers in VGG, ResNet, and AlexNet, fail to do so when run using Sesame. Our synthesizable hardware prototype (on a Xilinx Pynq board) demonstrates how the compiler and micro-architecture enables threat-model-specific trade-offs in code size increase ranging from 3-7 $\%$ and run-time performance overhead for specific defenses ranging from 3.96$\%$ to 34.87$\%$ (across confidential inputs and models and single vs. multi-tenant systems).

研究の動機と目的

  • アクセラレータ用の従来のハードウェアエナclaveが、最悪事態の仮定による高コストなオーバーヘッドとサイドチャnel漏洩を抱える問題を是正する。
  • 一般用途CPUベースの機密計算とアクセラレータ豊富なアーキテクチャの間のギャップを埋め、ドメイン特化アクセラレータ上で安全かつ効率的な推論を可能にする。
  • エナclave内でアプリケーション固有の脅威モデルを可能にし、パフォーマンスとセキュリティを、一様な保護を強制するのではなく、実際の脅威モデルに応じて滑らかにスケーリング可能にする。
  • コンテンツ競合や観測チャネルによるサイドチャネル漏洩を防ぐために、RTLレベルで新しいハードウェアデータ構造(プライベートキューとトラフィックシェーパー)を設計・統合する。
  • コードスケジューリングとセキュリティアノテーションを最適化することで、パフォーマンスとリソース利用効率を最適化しながら、SDEをコンパイラスタックによって自動生成可能にする。

提案手法

  • 分離アクセス実行(DAE)アクセラレータフレームワークに、コンパイラ、ISA拡張、マイクロアーキテクチャ変更を統合した垂直統合スタックを導入する。
  • RTLレベルで2つの新しいデータ構造を設計:共有ハードウェアリソースをパーティショニングしてコンテンツ競合チャネル漏洩を防ぐプライベートキュー、および秘密データからの観測チャネルを分離するためのトラフィックシェーパー。
  • コンパイラによる自動チューニングを実装し、実行変動性やメモリアクセスパターンを通じた機密情報漏洩を防ぐために、タイリングスケジューリングを最適化する。
  • プログラムフェーズに依存するトラフィック配分をコンパイル時に学習することで、ハードウェアのみの難易度よりも単純なソフトウェア設定可能なトラフィックシェーパーを実現する。
  • ISA拡張とドライバレベルの構成を通じて、脅威モデル固有の防御(プライベートキューとトラフィックシェーピング)を統合し、展開環境に応じた動的チューニングを可能にする。
  • Xilinx Pynq上で合成可能なRTLプロトタイプを用い、VGG、ResNet、AlexNetなどの実世界のモデルを用いたマルチテナントシナリオ(時間的・空間的共有)において、パフォーマンスとセキュリティを評価する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン特化アクセラレータにソフトウェア定義型エナclaveを効果的に適用することで、パフォーマンスオーバーヘッドを低減しつつ、強固なセキュリティ保証を維持できるか?
  • RQ2プライベートキューとトラフィックシェーパーをRTLレベルとコンパイラレベルで共同設計することで、マルチテナントアクセラレータ実行におけるサイドチャネル漏洩を効果的に防止できるか?
  • RQ3一般用途TEEのモノリシックで最悪事態の仮定に基づくセキュリティと比較して、脅威モデル固有のセキュリティチューニングが、どれほどパフォーマンスオーバーヘッドを低減できるか?
  • RQ4時間的共有と空間的共有の両モードにおいて、異なる脅威モデル(オンチップ vs. オフチップ可視性)に応じて、パフォーマンスオーバーヘッドはどのようにスケーリングするか?
  • RQ5提案されたフレームワークは、ディープラーニングモデルの異なるレイヤーを分類器が区別できないようにできているか、すなわちサイドチャネル分析に対して耐性があるか?

主な発見

  • Sesameは、VGG、ResNet、AlexNetの各モデルにおいて、サイドチャネル分類器がレイヤーを区別できないことを実証し、オンチップおよびオフチップ信号漏洩に対する効果的な保護を示した。
  • 時間的共有モードでは、QARMA128を用いた場合3.77%〜25.81%、AES128暗号化を用いた場合4.92%〜34.87%のパフォーマンスオーバーヘッドが、脅威モデルとモデルの複雑さに応じて変動した。
  • 空間的共有モードでは、4つのテナントがリソースを均等に共有する状況下で、オーバーヘッドは低め(QARMA128で3.31%〜12.78%、AES128で4.86%〜16.73%)であり、特にメモリ帯域幅がボトルネックとなっている大規模モデル(AlexNetやVGG)で顕著に低減した。
  • コンパイラアノテーションとハードウェアインスタンス化によるコードサイズは3〜7%増加したが、これは一般用途TEEにおける最悪事態のセキュリティコストに比べて極めて小さい。
  • トラフィックシェーパー部は、ソフトウェアで学習したトラフィックパターンに依存するため、従来のハードウェアのみのシェーパーと比較してRTLの複雑性が低く抑えられ、強固なセキュリティを維持したままである。
  • このフレームワークは、暗号化、整合性チェック、ORAMといった他のTEEプリミティブと合成可能であり、今後の研究でグラフワークロードや一般用途CPUへの対応も可能となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。