Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Clustering in the Anonymized Space with Local Differential Privacy

Lin Sun, Jun Zhao|arXiv (Cornell University)|Jun 27, 2019
Privacy-Preserving Technologies in Data参考文献 26被引用数 12
ひとこと要約

本稿では、アノニマイズされたハミング空間における局所的微分プライバシー(LDP)を実現するため、修正されたビットベクタ(DPBV)符号化メカニズムを用いたプライバシー保護型分散クラスタリングフレームワークを提案する。アノニマイズされた空間における距離情報を保持することで、kClusterアルゴリズムは、分散・ノイズ多きく不完全なデータ上で効果的なクラスタリングを実現し、$(\epsilon,\delta)$-LDPの保証を満たす。$\epsilon \geq 1$の条件下で高い実用性を達成する。本手法は、信頼できるアグリゲータを必要とせず、非インタラクティブかつマルチパーティ型のクラスタリングをサポートする。

ABSTRACT

Clustering and analyzing on collected data can improve user experiences and quality of services in big data, IoT applications. However, directly releasing original data brings potential privacy concerns, which raises challenges and opportunities for privacy-preserving clustering. In this paper, we study the problem of non-interactive clustering in distributed setting under the framework of local differential privacy. We first extend the Bit Vector, a novel anonymization mechanism to be functionality-capable and privacy-preserving. Based on the modified encoding mechanism, we propose kCluster algorithm that can be used for clustering in the anonymized space. We show the modified encoding mechanism can be easily implemented in existing clustering algorithms that only rely on distance information, such as DBSCAN. Theoretical analysis and experimental results validate the effectiveness of the proposed schemes.

研究の動機と目的

  • スパースで不完全かつ個人的なデータの分散クラスタリングにおけるプライバシー漏洩を解決すること。
  • 局所的微分プライバシー(LDP)のもとで、非インタラクティブかつマルチパーティ型クラスタリングを可能にすること。
  • ビットベクタメカニズムを拡張し、アノニマイズド空間における距離情報を保持することでクラスタリングを可能にすること。
  • $(\epsilon,\delta)$-LDPによる強力なプライバシー保証を確保しつつ、クラスタリングの実用性を維持すること。
  • アノニマイズド空間における距離情報のみを用いて動作するクラスタリングアルゴリズムを設計すること。

提案手法

  • スカラ値をハミング空間におけるビットベクタにマッピングするため、微分プライバシーを備えた修正版ビットベクタ(DPBV)メカニズムを提案。
  • 各ビットベクタにノイズを追加することで、局所的微分プライバシーを実現し、元の値の区別がつかないようにする。
  • 構成パラメータ$s$を用いてプライバシー予算$\epsilon$と$\delta$を制御し、$s = \lceil \frac{\ln \delta}{\epsilon - \ln(e^\epsilon + 1)} \rceil$とする。
  • ユークリッド距離がハミング空間にほぼ保存されるように、距離に配慮した符号化戦略を採用。
  • アノニマイズドビットベクタから計算された距離行列のみを用いてクラスタリングを実行するkClusterアルゴリズムを設計。
  • DBSCANなどの既存の距離ベースクラスタリングアルゴリズムとの統合を可能にする。距離情報のみに依存する設計である。

実験結果

リサーチクエスチョン

  • RQ1アノニマイズド空間における距離情報を保持するような、局所的微分プライバシー機構を設計可能か?
  • RQ2LDPの保証のもとで、非インタラクティブかつマルチパーティ型の分散クラスタリングを実現できるか?
  • RQ3アノニマイズド空間におけるプライバシー($\epsilon, \delta$)とクラスタリング実用性のトレードオフはいかほどか?
  • RQ4修正されたビットベクタメカニズムは、再識別を防ぐとともに、クラスタリングのような複雑な分析を可能にするか?
  • RQ5$\epsilon$-LDPを距離に配慮したアノニマイズ化機構で達成できるか、それとも$\delta$-緩和が必要か?

主な発見

  • 提案されたDPBVメカニズムは、アノニマイズド空間を拡大し、適切にキャリブレートされたノイズを追加することで、$(\epsilon,\delta)$-局所的微分プライバシーを達成する。
  • $\epsilon \geq 1$の条件下で、kClusterアルゴリズムは複数回の実行において安定した性能を示し、高いクラスタリング実用性を達成する。
  • ビットベクタ長$s$は、より高いプライバシー要件($\delta$が小さい)や、より強い$\epsilon$保証を求める場合に増加する。
  • $\epsilon = 1$の場合、異なる入力(例:$x=24.3$ と $x=26.2$)の出力確率分布はほぼ区別がつかず、プライバシーが確保される。
  • 大きな$s$が設定されている場合、悪意ある攻撃者が構成パラメータをすべて把握していても、各値の出力確率が小さいため、元の値を信頼性高く再特定できない。
  • 攻撃者が元のデータとそれに対応するビットベクタの両方を学習した場合、距離情報が悪用され、値の回復が可能になるため、コラボレーション攻撃に対して脆弱である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。