Skip to main content
QUICK REVIEW

[論文レビュー] Private Robust Estimation by Stabilizing Convex Relaxations

Pravesh K. Kothari, Pasin Manurangsi|arXiv (Cornell University)|Dec 7, 2021
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、敵対的外れ値を許容する状況下で、平均、共分散、および高次モーメントのロバスト推定に対する、初めての多項式時間かつサンプル $(\varepsilon,\delta)$-微分プライバシー保証を満たすアルゴリズムを提示する。このアルゴリズムは、証拠を生成するロバスト推定器と推定依存型ノイズ注入を用いる新規フレームワークにより、凸緩和の安定化を実現する。このフレームワークにより、証明可能サブガウスニアン性およびハイパーコントラクト性の下でアフィン不変の保証(マハラノビス、スペクトル、フロベニウスノルム)が得られ、一般の分布的仮定のもとで最適なサンプル複雑性とプライバシー性能を達成する。

ABSTRACT

We give the first polynomial time and sample $(ε, δ)$-differentially private (DP) algorithm to estimate the mean, covariance and higher moments in the presence of a constant fraction of adversarial outliers. Our algorithm succeeds for families of distributions that satisfy two well-studied properties in prior works on robust estimation: certifiable subgaussianity of directional moments and certifiable hypercontractivity of degree 2 polynomials. Our recovery guarantees hold in the "right affine-invariant norms": Mahalanobis distance for mean, multiplicative spectral and relative Frobenius distance guarantees for covariance and injective norms for higher moments. Prior works obtained private robust algorithms for mean estimation of subgaussian distributions with bounded covariance. For covariance estimation, ours is the first efficient algorithm (even in the absence of outliers) that succeeds without any condition-number assumptions. Our algorithms arise from a new framework that provides a general blueprint for modifying convex relaxations for robust estimation to satisfy strong worst-case stability guarantees in the appropriate parameter norms whenever the algorithms produce witnesses of correctness in their run. We verify such guarantees for a modification of standard sum-of-squares (SoS) semidefinite programming relaxations for robust estimation. Our privacy guarantees are obtained by combining stability guarantees with a new "estimate dependent" noise injection mechanism in which noise scales with the eigenvalues of the estimated covariance. We believe this framework will be useful more generally in obtaining DP counterparts of robust estimators. Independently of our work, Ashtiani and Liaw [AL21] also obtained a polynomial time and sample private robust estimation algorithm for Gaussian distributions.

研究の動機と目的

  • 高次元の平均および共分散に対する、敵対的外れ値の定数割合を許容する、最初の微分プライバシー保証付きロバスト推定アルゴリズムを設計すること。
  • 有界サポートや条件数に関する仮定に依存しないように、プライベート推定を一般のサブガウスニアンおよびハイパーコントラクト分布へと拡張すること。
  • 任意の証拠を生成可能で、効率的に解けるロバスト推定アルゴリズムを、強い安定性および有効性保証を持つ微分プライベート版に変換する一般フレームワークを開発すること。
  • 未知分布の条件数に関する事前知識が不要な状況で、乗法的スペクトル誤差および相対的フロベニウス誤差バウンドを達成すること—これはデータホワイトニングや全変動近似に重要である。

提案手法

  • フレームワークは、正しく動作する証拠(witness)を生成できる場合に、パラメータノルムにおける最悪ケースの安定性を保証することで、ロバスト推定の凸緩和(特に、Sum-of-Squares SDP緩和)を安定化する。
  • ノイズが推定された共分散行列の固有値に応じてスケーリングされる、新規の「推定依存型」ノイズ注入機構を導入し、微分プライバシーの強い保証を実現する。
  • 汚染済みデータに対するロバスト重みの計算に、修正された和の平方(SoS)半定値計画法緩和を用い、証明可能サブガウスニアンまたはハイパーコントラクト性を持つ分布を生成する。
  • 安定性は、単一の点の変更による平均および共分散の摂動を制限する潜在関数を介して強制され、理論的保証は証明可能サブガウスニアン性およびハイパーコントラクト性の制約から導出される。
  • 最終的な推定値にノイズを追加する:$\hat{\mu} = \widetilde{\mu} + \widetilde{\Sigma}^{1/2}z$ および $\hat{\Sigma} = \widetilde{\Sigma} + \widetilde{\Sigma}^{1/2}Z\widetilde{\Sigma}^{1/2}$、ここで $z$ および $Z$ はガウスノイズであり、$\gamma_1, \gamma_2$ に従って分散がスケーリングされる。これらのパrameterはデータおよびプライバシーパラメータに依存する。
  • 理論的分析では、安定性バウンドと微分プライバシーを統合し、出力がマハラノビス、スペクトル、およびフロベニウスノルムにおいて $\varepsilon$-微分プライバシーおよび有効性保証を満たすことを証明する。

実験結果

リサーチクエスチョン

  • RQ1有界サポートや条件数に関する仮定が不要な状況で、定数割合の敵対的外れ値を許容する高次元の平均および共分散に対する微分プライベートロバスト推定器を設計可能か?
  • RQ2単一の点の摂動に対する最悪ケースのパrameter安定性を保証するように、ロバスト推定の凸緩和をどのように安定化できるか?
  • RQ3効率的なプライベートロバスト推定と乗法的誤差保証を可能にするために必要な最小限の分布的仮定(例:証明可能サブガウスニアン性、ハイパーコントラクト性)は何か?
  • RQ4未知分布の共分散構造に関する事前知識がなくても、アフィン不変の誤差バウンド(例:マハラノビス、スペクトル、フロベニウス)をプライベートロバスト推定で達成可能か?
  • RQ5任意の証拠を生成可能で、効率的に解けるロバスト推定器を、同等の有効性を持つ微分プライベート版に変換する一般フレームワークを設計可能か?

主な発見

  • 平均のマハラノビスノルム誤差は $O(\sqrt{C} \eta^{3/4})$、共分散の相対的フロベニウスノルム誤差は $O(C \sqrt{\eta})$ を達成する。ここで $C$ はサブガウスニアン性およびハイパーコントラクト性のパラメータを表し、$\eta$ は外れ値率である。
  • サンプル複雑性は $\widetilde{\Omega}\left(\frac{d^8}{\eta^2} \left(1 + \frac{\ln(1/\delta)}{\varepsilon}\right)^4 C^4\right)$ であり、次元および外れ値率の逆数に関して多項式的であり、プライバシーパラメータに関して対数的依存性を有する。
  • このアルゴリズムは、未知共分散に条件数に関する仮定が一切ない状況ですら、プライベートロバスト共分散推定を達成する最初のものである(外れ値なしの場合でも同様)。
  • フレームワークは、推定された共分散の固有値に応じてスケーリングされるノイズを用いる新規の推定依存型ノイズ注入機構により、プライバシー保証を実現する。これにより、強い微分プライバシーが保証される。
  • この手法は、証明可能サブガウスニアン性およびハイパーコントラクト性の下で、データ前処理(例:ホワイトニングや全変動近似)に不可欠なアフィン不変ノルムにおける有効性保証を達成する。
  • アルゴリズムは確率 $9/10$ 以上で成功し、$(\varepsilon,\delta)$-微分プライバシーを満たし、ビット複雑性および入力サイズに関して多項式時間の実行時間を持つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。