Skip to main content
QUICK REVIEW

[論文レビュー] Privacy Preserving Stream Analytics: The Marriage of Randomized Response and Approximate Computing

Do Le Quoc, Martín Beck|arXiv (Cornell University)|Jan 19, 2017
Privacy-Preserving Technologies in Data参考文献 74被引用数 15
ひとこと要約

PrivApprox は、クライアント側のサンプリングと局所的ノイズ注入を介して、ランダム化応答と近似計算を統合したプライバシー保護型ストリーム分析システムを導入する。これは、微分プライバシーを上回るより強いゼロ知識プライバシーを達成し、ほぼリアルタイムの低レイテンシ処理を実現するとともに、同期不要な分散アーキテクチャにより、利便性とプライバシーのバランスを体系的かつ調整可能に制御する。

ABSTRACT

How to preserve users' privacy while supporting high-utility analytics for low-latency stream processing? To answer this question: we describe the design, implementation, and evaluation of PRIVAPPROX, a data analytics system for privacy-preserving stream processing. PRIVAPPROX provides three properties: (i) Privacy: zero-knowledge privacy guarantees for users, a privacy bound tighter than the state-of-the-art differential privacy; (ii) Utility: an interface for data analysts to systematically explore the trade-offs between the output accuracy (with error-estimation) and query execution budget; (iii) Latency: near real-time stream processing based on a scalable "synchronization-free" distributed architecture. The key idea behind our approach is to marry two existing techniques together: namely, sampling (used in the context of approximate computing) and randomized response (used in the context of privacy-preserving analytics). The resulting marriage is complementary - it achieves stronger privacy guarantees and also improves performance, a necessary ingredient for achieving low-latency stream analytics.

研究の動機と目的

  • データストリーム処理における強力なユーザーのプライバシーと高利便性のリアルタイム分析の間の葛藤を解決すること。
  • 既存のシステムがリアルタイム対応を欠くか、中央集権的かつ信頼できるデータを前提としているという限界を克服すること。
  • 集約者やプロキシに協調や信頼を必要としない、プライバシー保護型分析を可能にするシステムを設計すること。
  • 組み合わせたサンプリングとノイズ注入を通じて、ゼロ知識プライバシーを導入し、微分プライバシーを上回るより緊密なプライバシー保証を達成すること。
  • 分析者が出力の正確さ、誤差推定、計算予算の間のトレードオフを調整可能なインターフェースを提供すること。

提案手法

  • 各ユーザーが設定可能なサンプリング確率 $ s $ に従い、クライアント側で独立してクエリエポックに参加するかどうかを決定する、データソースでのクライアント側サンプリングを適用する。
  • クライアントで局所的ランダム化応答を用いて、送信前に真実の回答を摑み直し、局所的微分プライバシーを確保するとともに、集約者での信頼できるノイズ追加の必要性を排除する。
  • プロキシが調整なしに匿名化され暗号化されたデータストリームを転送する同期不要な分散アーキテクチャを採用し、レイテンシと信頼仮定を低減する。
  • クライアントの個人情報との関連付けを防ぐために、プロキシでソース書き換えを実装し、リンク不能性と匿名性を実現する。
  • サンプリングレートとノイズパラメータの設定が可能なプライバシー・利便性トレードオフインターフェースを統合し、正確さとリソース使用量のバランスを調整可能にする。
  • 組み合わせたアプローチが、微分プライバシーを上回るより強いプライバシーモデルであるゼロ知識プライバシーを達成することを証明し、$ rac{ ho_{zk}}{ ho_{dp}} > 1 $ がすべての $ s \neq 0 $ に対して成り立つことにより、ゼロ知識モデルにおける攻撃者利点が高まることを示している。

実験結果

リサーチクエスチョン

  • RQ1リアルタイムストリーム分析において、サンプリングとランダム化応答を併用することで、より強いプライバシー保証を達成できるか?
  • RQ2同期不要で分散型のアーキテクチャは、プライバシーを保持しつつ、どのように低レイテンシのストリーム処理を可能にするか?
  • RQ3サンプリングと局所的ノイズ注入を組み合わせることで、微分プライバシーを上回るプライバシー向上がどの程度達成できるか?
  • RQ4分析者は、プライバシー保護型ストリーム分析システムにおいて、出力の正確さと実行コストの間で効果的にトレードオフを実現できるか?
  • RQ5提案されたシステムの形式的プライバシー境界は何か? また、微分プライバシーなどの既存モデルと比較してどうなるか?

主な発見

  • システムは、$ rac{ ho_{zk}}{ ho_{dp}} > 1 $ がすべての $ s \neq 0 $ に対して成り立つという不等式により、微分プライバシーを上回るより強いプライバシー保証であるゼロ知識プライバシーを達成していることが証明された。
  • 比 $ rac{ ho_{zk}}{ ho_{dp}} $ は、サンプリングレート $ s $ が低下するにつれて増加し、低いサンプリングレートがゼロ知識モデルのプライバシー利点を強化することを示している。
  • 同期不要なアーキテクチャにより、プロキシや集約者間の調整オーバーヘッドを回避し、ほぼリアルタイムのストリーム処理が可能になった。
  • 匿名性とリンク不能性は、ソース書き換えと暗号化により強制され、脅威モデルの仮定下では、いかなるコンponent も応答を個々のクライアントに結びつけることができない。
  • 分析者が設定可能なサンプリングおよびノイズパラメータを通じて、出力の正確さ(誤差推定付き)と計算予算のトレードオフを探索可能な実用的インターフェースを提供する。
  • サンプリングとランダム化応答の組み合わせにより、分散ストリーム分析において、プライバシー、パフォーマンス、利便性のすべてを同時に向上させるシステムが実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。