Skip to main content
QUICK REVIEW

[論文レビュー] A Submodularity-based Agglomerative Clustering Algorithm for the Privacy Funnel

Ni Ding, Parastoo Sadeghi|arXiv (Cornell University)|Jan 20, 2019
Privacy-Preserving Technologies in Data参考文献 15被引用数 7
ひとこと要約

本稿では、プライバシー・ファンネル(PF)および情報ボトルネック(IB)問題のための、サブモジュラリティに基づく凝集型クラスタリング手法であるIAC-MDSFを提案する。最適なマージ選択を差分サブモジュラ関数(MDSF)として定式化することにより、現在のアスキューのすべての部分集合上で、多項式時間の効率的最適化が可能となり、実世界のデータにおいて、二項マージ手法に比べて収束速度とプライバシー・ユーティリティトレードオフ性能が優れている。

ABSTRACT

For the privacy funnel (PF) problem, we propose an efficient iterative agglomerative clustering algorithm based on the minimization of the difference of submodular functions (IAC-MDSF). For a data curator that wants to share the data $X$ correlated with the sensitive information $S$, the PF problem is to generate the sanitized data $\hat{X}$ that maintains a specified utility/fidelity threshold on $I(X; \hat{X})$ while minimizing the privacy leakage $I(S; \hat{X})$. Our IAC-MDSF algorithm starts with the original alphabet $\hat{\mathcal{X}} := \mathcal{X}$ and iteratively merges the elements in the current alphabet $\hat{\mathcal{X}}$ that minimizes the Lagrangian function $ I(S;\hat{X}) - λI(X;\hat{X}) $. We prove that the best merge in each iteration of IAC-MDSF can be searched efficiently over all subsets of $\hat{\mathcal{X}}$ by the existing MDSF algorithms. We show that the IAC-MDSF algorithm also applies to the information bottleneck (IB), a dual problem to PF. By varying the value of the Lagrangian multiplier $λ$, we obtain the experimental results on a heart disease data set in terms of the Pareto frontier: $ I(S;\hat{X})$ vs. $- I(X;\hat{X})$. We show that our IAC-MDSF algorithm outperforms the existing iterative pairwise merge approaches for both PF and IB and is computationally much less complex.

研究の動機と目的

  • データ公開におけるプライバシー・ユーティリティトレードオフ(PUT)を扱うため、関連する機密情報Sと相関する有用なデータXを洗練するデータ管理者の課題を解決すること。
  • 指定されたユーティリティの閾値I(X;X̂)≥θUを維持しつつ、プライバシー漏洩I(S;X̂)を最小化する効率的なアルゴリズムの開発。
  • 従来の二項マージ手法に比べて高い計算複雑性を示す問題を克服し、すべての部分集合に対して最適なマージ選択をサブモジュラ最適化により可能にすること。
  • 関連性と圧縮の両方を最適化するための情報ボトルネック(IB)問題への拡張を図ること。
  • 既存の反復的二項マージアルゴリズムと比較して、収束速度およびパレートフロンティア支配性能の面で優れた性能を示すこと。

提案手法

  • IAC-MDSFアルゴリズムは、初期アスキューX̂(0):=Xから出発し、反復的に部分集合W⊆X̂(k)をマージすることで、ラグランジュ関数I(S;X̂W)−λI(X;X̂W)を最小化する。
  • 最適なマージは、二つのサブモジュラ関数の差分(MDSF)の最小化問題に還元され、これによりSubM-SuperMやモジュラー関数最小化などの既存のMDSFソルバを用いて多項式時間の局所収束が可能になる。
  • 相互情報量項I(S;X̂W)およびI(X;X̂W)のサブモジュラリティは、エントロピーの性質および−ylog yの対数凸性を用いて証明される。
  • アルゴリズムは決定的遷移p(x̂|x)∈{0,1}を維持し、ソフト遷移を避けることで、部分集合のマージによる効率的なコードブック構築に注力する。
  • ラグランジュ乗数λを変化させることで、プライバシー漏洩I(S;X̂)とユーティリティ損失−I(X;X̂)のパレートフロンティアをトレースする。
  • 本手法はプライバシー・ファンネル(PF)および情報ボトルネック(IB)問題の両方へ適用可能であり、二重の適用可能性を示している。

実験結果

リサーチクエスチョン

  • RQ1二項マージではなく、すべての部分集合に対して最適なデータ要素のマージが可能となり、より優れたプライバシー・ユーティリティトレードオフが達成できるか?
  • RQ2相互情報量項のサブモジュラリティを活用することで、マージ選択プロセスの計算複雑性を低減できるか?
  • RQ3MDSF定式化により、既存の二項マージアルゴリズムと比較して、より高速な収束と向上した性能が達成できるか?
  • RQ4提案手法IAC-MDSFは、既存のベースライン手法と比較して、プライバシー漏洩とユーティリティ損失のパレートフロンティアにおいて、どのように性能を発揮するか?
  • RQ5MDSFに基づくアプローチは、類似の性能向上を達成できる情報ボトルネック問題へ拡張可能か?

主な発見

  • IAC-MDSFアルゴリズムは、[4]で提示された二項マージ手法と比較して、はるかに少ない反復回数で収束することが確認され、ハンガリー心疾患データセットでは数回の反復で収束が観察された。
  • アルゴリズムは、PFおよびIB問題の両方において、より優れたプライバシー・ユーティリティトレードオフを達成しており、得られたパレートフロンティアは、二項マージ手法のそれに対して一般に支配的である。
  • 二項マージの1反復あたりO(|X|²)のコストに比べ、部分集合のマージを1ステップで複数要素に拡張できるため、計算複雑性は顕著に低減された。
  • I(S;X̂W)およびI(X;X̂W)のサブモジュラリティは正式に証明され、f(W)およびg(W)がそれぞれサブモジュラで非増加であることが示され、MDSF定式化が可能である。
  • UCI心疾患データセットにおける実験結果から、IAC-MDSFは、既存手法と比較して、同じユーティリティ水準I(X;X̂)において、より低いプライバシー漏洩I(S;X̂)を達成した。
  • 本手法は、プライバシー・ファンネルおよび情報ボトルネック問題の両方へ適用可能であり、関連する最適化フレームワーク全体にわたり、一般性と頑健性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。