Skip to main content
QUICK REVIEW

[論文レビュー] Differentially Private Analysis of Outliers

Rina Okada, Kazuto Fukuchi|arXiv (Cornell University)|Jul 24, 2015
Privacy-Preserving Technologies in Data参考文献 21被引用数 4
ひとこと要約

本稿では、距離に基づく外れ値を分析するための微分プライバシー手法を提案し、滑らかさ感受性と指数機構を用いて、外れ値のカウントと部分空間の発見におけるノイズを低減する。グローバル感受性に基づく手法と比較して、特に高いプライバシー予算において、ノイズを最大30倍も低減し、高次元データにおける実用的な有効性を実現する。

ABSTRACT

This paper investigates differentially private analysis of distance-based outliers. The problem of outlier detection is to find a small number of instances that are apparently distant from the remaining instances. On the other hand, the objective of differential privacy is to conceal presence (or absence) of any particular instance. Outlier detection and privacy protection are thus intrinsically conflicting tasks. In this paper, instead of reporting outliers detected, we present two types of differentially private queries that help to understand behavior of outliers. One is the query to count outliers, which reports the number of outliers that appear in a given subspace. Our formal analysis on the exact global sensitivity of outlier counts reveals that regular global sensitivity based method can make the outputs too noisy, particularly when the dimensionality of the given subspace is high. Noting that the counts of outliers are typically expected to be relatively small compared to the number of data, we introduce a mechanism based on the smooth upper bound of the local sensitivity. The other is the query to discovery top-$h$ subspaces containing a large number of outliers. This task can be naively achieved by issuing count queries to each subspace in turn. However, the variation of subspaces can grow exponentially in the data dimensionality. This can cause serious consumption of the privacy budget. For this task, we propose an exponential mechanism with a customized score function for subspace discovery. To the best of our knowledge, this study is the first trial to ensure differential privacy for distance-based outlier analysis. We demonstrated our methods with synthesized datasets and real datasets. The experimental results show that out method achieve better utility compared to the global sensitivity based methods.

研究の動機と目的

  • 外れ値検出と微分プライバシーの間にある根本的な矛盾に取り組むこと、すなわち、外れ値を特定することは個々のデータを露呈するリスクを伴う。
  • 個々のインスタンスを露呈せずに、外れ値の統計的挙動を明らかにする微分プライバシー準拠のクエリを開発すること。
  • 外れ値カウントと部分空間発見におけるノイズ低減により、高次元データにおける有効性を向上させること。
  • プライバシー制約下で滑らかさ感受性の評価と部分空間スコアリングのための効率的アルゴリズムを設計すること。
  • 合成および実世界のデータセットを用いた実験を通じて、実用的適用可能性を示すこと。

提案手法

  • 外れ値カウントのための滑らかさ感受性に基づくメカニズムを提案し、実際の外れ値数に応じて適応するデータ依存のノイズを活用する。
  • 外れ値カウントの局所感受性の滑らかさ上界を効率的に計算するアルゴリズムを導入し、計算コストを低減する。
  • 外れ値密度が高いための上位-h部分空間を発見するために、カスタマイズされたスコア関数を用いた指数機構を採用し、プライバシー予算の消費を最小限に抑える。
  • 逐次的合成を用いて部分空間を反復的に選択し、微分プライバシーの保証下で精度とプライバシーのバランスをとる。
  • 部分空間における外れ値状態を計算するために、最小包含球アルゴリズムを適用し、頑健な距離に基づく外れ値検出を可能にする。
  • プライバシーパラメータεを用いてラプラスおよびガウスノイズ機構を適用し、(ε, δ)-微分プライバシーを確保する。

実験結果

リサーチクエスチョン

  • RQ1高次元データにおいて、グローバル感受性に基づく手法よりも、微分プライバシー準拠の外れ値カウントがより正確に実現可能か?
  • RQ2滑らかさ感受性は、微分プライバシー下での外れ値カウントに効率的に計算・適用可能か?
  • RQ3カスタマイズされたスコア関数を用いた指数機構は、高次元環境下でもプライバシーを保持しつつ、部分空間発見を改善できるか?
  • RQ4微分プライバシー外れ値分析において、プライバシー予算(ε)と有効性(精度/再現率)のトレードオフはいかなるものか?
  • RQ5標準的なグローバル感受性に基づく手法と比較して、提案手法のノイズの大きさと有効性はどのように異なるか?

主な発見

  • 滑らかさ感受性に基づくメカニズムは、グローバル感受性に基づく手法と比較して、ノイズの標準偏差を最大30倍まで低減した、下限値でさえも同様の結果を示した。
  • ε ≥ 0.7の場合、滑らかさ感受性メカニズムはノイズの標準偏差が7未満にまで低下し、実用的なプライバシー領域において強力な有効性を示した。
  • この手法のノイズは、データ次元数に依存せず、外れ値の数にのみ依存するため、高次元部分空間へのスケーラビリティが保証される。
  • 上位-h部分空間発見におけるhの増加に伴い、精度は低下したが、真の部分空間が選択される確率が高くなったため、再現率は向上した。
  • hが高くなると、逐次的合成の影響が顕著になり、検出確率が上昇するにもかかわらず再現率が低下した。これは、有効性におけるトレードオフを示している。
  • 特に高次元環境下では、効率的なプライバシー予算の使用のおかげで、ベースライン手法よりも高い検出精度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。