Skip to main content
QUICK REVIEW

[論文レビュー] Differentially private multivariate medians

Kelly Ramsay, Aukosh Jagannath|arXiv (Cornell University)|Oct 12, 2022
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

本稿は、深さ関数を用いた微分プライバシー付き多変量メジアン推定に適用される指数的メカニズムに対する、新しい集中不等式を導入する。最小限の分布的仮定のもとで、Tukey、空間的、統合双対深さなどの深さに基づくメジアンに対する鋭い有限標本の標本複雑性バウンドを確立し、Cauchyのような重い尾を持つ分布ではプライバシーコストが最小限であることを示す。

ABSTRACT

Statistical tools which satisfy rigorous privacy guarantees are necessary for modern data analysis. It is well-known that robustness against contamination is linked to differential privacy. Despite this fact, using multivariate medians for differentially private and robust multivariate location estimation has not been systematically studied. We develop novel finite-sample performance guarantees for differentially private multivariate depth-based medians, which are essentially sharp. Our results cover commonly used depth functions, such as the halfspace (or Tukey) depth, spatial depth, and the integrated dual depth. We show that under Cauchy marginals, the cost of heavy-tailed location estimation outweighs the cost of privacy. We demonstrate our results numerically using a Gaussian contamination model in dimensions up to $d = 100$, and compare them to a state-of-the-art private mean estimation algorithm. As a by-product of our investigation, we prove concentration inequalities for the output of the exponential mechanism about the maximizer of the population objective function. This bound applies to objective functions that satisfy a mild regularity condition.

研究の動機と目的

  • 微分プライバシー付き多変量メジアン推定の有限標本性能保証の欠如に取り組むこと、特にロバストな深さに基づくメジアンに対して。
  • 平均推定を超えて、多変量位置推定におけるプライバシーのコストを理解するギャップを埋めること、特に重い尾を持つまたは汚染されたモデルにおいて。
  • 多変量設定における指数的メカニズムの標本複雑性バウンドを可能にする一般化された正則性条件「(K, F)-正則性」を構築すること。
  • 重い尾を持つ分布(例:Cauchy)では、ロバストネスがプライバシーのオーバーヘッドを上回るため、このような設定ではプライバシーのノイズが無視できるほど小さいことを示すこと。
  • 高次元(d=100まで)で、保証された正確性と計算可能性を備えた、実用的なプライベート深さベースメジアン推定のフレームワークを提供すること。

提案手法

  • 指数的メカニズムにおけるグローバル感度と標本複雑性を制御する新しい正則性条件「(K, F)-正則性」を提案する。
  • やや弱い正則性および連続性仮定の下で、目的関数の母集団最大化者まわりの指数的メカニズム出力の集中不等式を導出する。
  • 深さ関数(例:Tukey、空間的、統合双対深さ)に指数的メカニズムを適用し、深さ最大化者を多変量メジアンとして扱う。
  • VC理論とラプラスメカニズムを用いて、プライベート深さ値とその母集団対応物との乖離をバウンドし、高確率での誤差バウンドを導出する。
  • 情報漏洩のため、全ベクトルの公開には顕著なノイズが必要であることを認識し、サンプル点における深さ値のプライベートサンプリング戦略を採用する。
  • d=100までの次元でガウス混合モデルを用いて数値的妥当性を検証し、最先端のプライベート平均推定器と比較する。

実験結果

リサーチクエスチョン

  • RQ1深さ関数を用いた微分プライバシー付き多変量メジアン推定の有限標本の標本複雑性は何か?
  • RQ2Cauchyのような重い尾を持つ分布では、プライバシーコストとロバストネスコストのどちらが大きいか?
  • RQ3(K, F)-正則性を用いて、多変量設定における指数的メカニズムの鋭い標本複雑性バウンドを導出できるか?
  • RQ4微分プライバシー下で、サンプル点における深さ値の推定において、プライバシーと正確性のトレードオフはどのようなものか?
  • RQ5高次元で汚染されたり重い尾を持つデータにおいて、プライベート深さベースメジアンはプライベート平均推定器に対してどのように性能を発揮するか?

主な発見

  • 提案された (K, F)-正則性条件により、深さベースメジアンの標本複雑性バウンドが O(d log d) に達し、プライベートガウス平均推定の既知の下界と対数要因を除いて一致する。
  • Cauchy分布に従うデータでは、ロバストネスのコスト(すなわち、メジアンの使用)がプライバシーのコストを上回るため、このような設定ではプライバシーのノイズが無視できるほど小さい。
  • VC理論とラプラスメカニズムを用いて、プライベート深さ値の有限標本誤差バウンドを導出し、高確率での集中を示す:Pr(|D̃(x, μ̂n) - D(x, μ)| > t) ≤ (c1n/VC(F))^VC(F) e^{-c2nt²/K²} + e^{-nεt/2K}。
  • プライベート深さベースメジアンの標本複雑性は、Kamathら(2020)によるプライベート平均推定の下界と比較することで、本質的に鋭いことが確認された。
  • サンプル点における深さ値の全ベクトルのプライベート推定は、情報漏洩が顕著なため実用的ではない。これは、サンプリング誤差を上回るノイズレベルを必要とするためである。
  • 代替手段として、小さな ε を用いて N 個のプライベートメジアン点をサンプリングする戦略が有効であり、全ベクトルの公開を回避しつつ、下流の推論を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。