Skip to main content
QUICK REVIEW

[論文レビュー] Oblivious Sampling Algorithms for Private Data Analysis

Sajin Sasy, Olga Ohrimenko|arXiv (Cornell University)|Sep 28, 2020
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

本論文は、信頼実行環境(TEEs)と独創的な無関心サンプリングアルゴリズムを活用して、データ分析中に強い微分プライバシー保証を達成するプライベートなサンプリングベースのクエリフレームワークを提案する。リプレースメントなしのサンプリングおよびポアソンサンプリングのメモリアクセスパターンを保護する変種を設計することで、シャッフルと同等のモデル精度を達成しながら、顕著に低いプライバシー損失を実現した。実験的にMNISTおよびCIFAR-10で検証され、同じ精度を達成する条件下でプライバシー予算(ε)が最大5.5倍低いことが示された。

ABSTRACT

We study secure and privacy-preserving data analysis based on queries executed on samples from a dataset. Trusted execution environments (TEEs) can be used to protect the content of the data during query computation, while supporting differential-private (DP) queries in TEEs provides record privacy when query output is revealed. Support for sample-based queries is attractive due to \emph{privacy amplification} since not all dataset is used to answer a query but only a small subset. However, extracting data samples with TEEs while proving strong DP guarantees is not trivial as secrecy of sample indices has to be preserved. To this end, we design efficient secure variants of common sampling algorithms. Experimentally we show that accuracy of models trained with shuffling and sampling is the same for differentially private models for MNIST and CIFAR-10, while sampling provides stronger privacy guarantees than shuffling.

研究の動機と目的

  • TEEsを用いたデータ分析において、メモリアクセスパターンがサンプルインデックスを漏洩するという課題に対処すること。
  • 信頼できないTEEs環境ですら、観察者にサンプルデータレコードのインデックスを隠すことができる、安全でデータに無関心なサンプリングアルゴリズムを設計すること。
  • 微分プライバシー機械学習において、シャッフルと比較してサンプリングベースのアプローチがより強いプライバシー保証を提供するかを評価すること。
  • TEEホストおよび合意形成するデータサイエンティストからもデータを保護する、エンドツーエンドのプライバシー保護クエリフレームワークを提供すること。

提案手法

  • リプレースメントなしのサンプリングに適した新しい無関心サンプリングアルゴリズムを設計し、メモリアクセスパターンがサンプルインデックスを露呈しないように保証すること。
  • TEEsにおけるバッチサンプリング中にプライバシーを保護するためのデータに無関心なポアソンサンプリングの変種を開発すること。
  • 暗号化されたデータセット上で微分プライバシークエリをサポートする、TEEベースのフレームワークにサンプリングアルゴリズムを統合すること。
  • Intel SGXを用いてコードおよびデータの整合性を保証し、実行環境の正しさと機密性を検証するための認証を実施すること。
  • サンプリング手法を用いてMNISTおよびCIFAR-10で深層学習モデルを訓練し、シャッフルベースの訓練と比較して精度とプライバシー損失を評価すること。
  • Rényi微分プライバシーを用いて合計プライバシー損失(ε)を測定し、さまざまなサンプリング手法とシャッフルの間で比較すること。

実験結果

リサーチクエスチョン

  • RQ1TEEsにおけるメモリアクセスパターンからサンプルインデックスを隠せる無関心サンプリングアルゴリズムを設計できるか?
  • RQ2微分プライバシー機械学習において、リプレースメントなしのサンプリングまたはポアソンサンプリングは、シャッフルよりも強いプライバシー保証を提供するか?
  • RQ3サンプリング手法の選択が、プライベートな深層ニューラルネットワークのトレーニングにおけるモデル精度とプライバシー損失(ε)にどのように影響するか?
  • RQ4安全なサンプリングをTEEベースのフレームワークに効率的に統合でき、強力なエンドツーエンドのプライバシー保証を実現できるか?

主な発見

  • 提案された無関心サンプリングアルゴリズムは、信頼できないTEEs環境ですら、メモリアクセスパターンを通じたサンプルインデックスの漏洩を効果的に防止した。
  • 同じトレーニングエポック数の条件下で、リプレースメントなしのサンプリング(SWO)はMNISTでε = 2.13、CIFAR-10でε = 4.89の合計プライバシー損失を示し、シャッフル(ε = 9.39)と比較して顕著に低い値であった。
  • ポアソンサンプリングはMNISTでε = 0.82の合計プライバシー損失を達成し、テストされたすべての手法の中で最も低かったが、同等のモデル精度を維持した。
  • SWOおよびポアソンサンプリングのモデル精度はシャッフルとほぼ同等であった:MNISTでは97.43%(SWO)vs. 97.5%(シャッフル)、CIFAR-10では79.0%(SWO)vs. 79.6%(シャッフル)。
  • 結果から、サンプリングベースのトレーニングがシャッフルよりも強いプライバシー強化を提供することが確認された。CIFAR-10では、同じ精度を達成する条件下で最大5.5倍低いεが得られた。
  • より小さなバッチサイズはさらにプライバシー損失を低減したことが確認され、サンプリングが微分プライバシー学習におけるεの最小化に有効であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。