Skip to main content
QUICK REVIEW

[論文レビュー] An Algorithmic Framework For Differentially Private Data Analysis on Trusted Processors

Joshua E. Allen, Bolin Ding|arXiv (Cornell University)|Jul 2, 2018
Privacy-Preserving Technologies in Data被引用数 10
ひとこと要約

この論文は、Intel SGXのような信頼できるプロセッサを活用することで、ローカルモデルの強いプライバシーとグローバルモデルの高い正確性を組み合わせた、新しいプライバシー枠組みOblivious Differential Privacy (ODP) を導入する。ストリーミングと微分プライバシーの技術を用いて、ハブヘッダーと頻度オラクルのための効率的で、アクセスパターンが入力データに依存しないアルゴリズムを提案し、ローカルモデルと比較して著しく誤差を低減した $(\epsilon, \delta)$-微分プライバシーを達成する。

ABSTRACT

Differential privacy has emerged as the main definition for private data analysis and machine learning. The {\\em global} model of differential privacy, which assumes that users trust the data collector, provides strong privacy guarantees and introduces small errors in the output. In contrast, applications of differential privacy in commercial systems by Apple, Google, and Microsoft, use the {\\em local model}. Here, users do not trust the data collector, and hence randomize their data before sending it to the data collector. Unfortunately, local model is too strong for several important applications and hence is limited in its applicability. In this work, we propose a framework based on trusted processors and a new definition of differential privacy called {\\em Oblivious Differential Privacy}, which combines the best of both local and global models. The algorithms we design in this framework show interesting interplay of ideas from the streaming algorithms, oblivious algorithms, and differential privacy.

研究の動機と目的

  • ローカル微分プライバシー (LDP) が強いユーザーのプライバシー保証を提供する一方で、高い誤差率と応用範囲の制限を抱えるという課題を解決すること。
  • データ収集者ではなく、ハードウェア保護されたプロセッサを信頼できるようにすることで、ローカルモデルとグローバルモデルの間のギャップを埋めること。
  • 新しいODPモデル下で、ハブヘッダーと頻度オラクルのような基本的問題を解くための効率的で、アクセスパターンに依存しないアルゴリズムを設計すること。
  • LDPが多すぎるノイズのため失敗する状況で、実用的で正確なプライベートデータ分析を可能にするODPの有効性を示すこと。

提案手法

  • 信頼実行環境 (TEEs) を活用することで、データ収集者が信頼できない状況でもプライバシーを保証する新しい定義であるOblivious Differential Privacy (ODP) を提唱する。
  • データベースを入力データに依存しない方法で処理することで、アクセスパターンが情報漏洩を引き起こさない、ハブヘッダー問題のためのアクセスに依存しないアルゴリズムを設計する。
  • 二段階アプローチを採用する:第一に、ストリーミング形式でアイテムタイプとカウントのリストを構築する。第二に、カウントにラプラスノイズを適用し、結果をアクセスに依存しない方法でソートする。
  • すべてのデータアクセスパターンが入力データに依存しないように、アクセスに依存しないソーティングとプライベートメモリアクセスを活用することで、微分プライバシーを保持する。
  • プライベートメモリにCount-Min Sketchデータ構造を維持し、クエリ応答のためのラプラスノイズを適用することで、頻度推定値を保持する。
  • 和集合の不等式と尾部確率解析を用いて、レアアイテムの漏洩確率を制限し、特定の条件下で $(\epsilon, \frac{1}{m^{\tau-1}})$-ODP を達成する。

実験結果

リサーチクエスチョン

  • RQ1ローカルモデルの強力なプライバシーとグローバルモデルの高い正確性を両立するプライバシー保護型データ分析フレームワークを設計できるか?
  • RQ2信頼できるプロセッサを活用することで、実用的かつ証明可能なプライバシーを備えた新しい微分プライバシーの定義を実現できるか?
  • RQ3この新しいモデル下で、ハブヘッダーと頻度オラクルのような基本的問題を解くアクセスに依存しないアルゴリズムを構築できるか?
  • RQ4既存のモデルと比較して、新しいODPフレームワークにおけるプライバシーパラメータと誤差のトレードオフはいかなるものか?

主な発見

  • 入力サイズ $n$ とグループ数 $k$ の比が $n/k > \tau \log m$ を満たす場合、ODPフレームワークはハブヘッダー問題に対して $(\epsilon, \frac{1}{m^{\tau-1}})$-微分プライバシーを達成する。これは $k$ が定数である典型的な応用で成立する。
  • すべてのメモリアクセスが入力データに依存しないため、アクセスに依存しないソーティングネットワークを用いて $O(n \log n)$ 時間で実行される。
  • 頻度オラクル問題に関しては、プライベートメモリにCount-Min Sketchを維持し、ラプラスノイズを適用して公開することで、繰り返しの相互作用なしに正確かつプライベートなクエリが可能になる。
  • ローカル微分プライバシーと比較して誤差が低減される:LDPでは異なる要素のカウントで $\Omega(\sqrt{n})$ の誤差が生じるが、ODPでは $O(1/\epsilon)$ の誤差にまで低下し、グローバルモデルの性能に近づく。
  • 元のデータベースに存在しないレアアイテムが漏洩する確率は $\frac{1}{m^{\tau-1}}$ で抑えられ、$m$ が大きく $\tau > 1$ であれば無視できる。
  • 微分プライバシー出力の後処理(例:トップ-$k$ アイテムの選択)もODPの保証を保持するため、エンドツーエンドのプライバシーが保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。