Skip to main content
QUICK REVIEW

[論文レビュー] Instance-optimal Mean Estimation Under Differential Privacy

Ziyue Huang, Yuting Liang|arXiv (Cornell University)|Jun 1, 2021
Privacy-Preserving Technologies in Data参考文献 34被引用数 10
ひとこと要約

本稿では、パラメータチューニングを必要とせず、データの特性に適応するインスタンス最適な微分プライバシー平均推定メカニズムを提案する。このメカニズムは、元のセットに既に存在するベクトルのみを置き換えることで異なるデータセット(in-neighbors)に対して最適な誤差バウンドを達成する。手法は、ノルムの百分位数に基づくデータ駆動型クリッピング閾値とガウスノイズを用い、MNIST や高次元ガウス分布を含む実世界データにおいて、従来のヒューリスティック手法やワーストケース最適メカニズムを上回る性能を発揮する。

ABSTRACT

Mean estimation under differential privacy is a fundamental problem, but worst-case optimal mechanisms do not offer meaningful utility guarantees in practice when the global sensitivity is very large. Instead, various heuristics have been proposed to reduce the error on real-world data that do not resemble the worst-case instance. This paper takes a principled approach, yielding a mechanism that is instance-optimal in a strong sense. In addition to its theoretical optimality, the mechanism is also simple and practical, and adapts to a variety of data characteristics without the need of parameter tuning. It easily extends to the local and shuffle model as well.

研究の動機と目的

  • グローバル感度が大きい場合に保守的な座標値のバウンドにより高い誤差を生じる、ワーストケース最適な微分プライバシー平均推定器の実用的限界を解消すること。
  • 固定された百分位数によるクリッピングなどのヒューリスティック手法の欠点を克服し、クリッピング閾値の選定を原理的かつ理論的根拠に基づいて行う方法を提供すること。
  • 既存のベクトルを置き換えることでのみ異なる(in-neighborsと呼ばれる)データセットに焦点を当てた、インスタンス最適性の新しい概念を導入することで、より強く実用的なユーティリティ保証を実現すること。
  • この新しい基準において理論的に最適であり、非ガウス分布や高次元データを含む多様なデータ分布において実用的に効果的なメカニズムを設計すること。
  • ローカルモデルおよびシャッフルモデルへの拡張を行い、分散型および通信制約下の環境でも頑健でスケーラブルであることを示すこと。

提案手法

  • 既存のベクトルのみを置き換えることで異なるデータセット(in-neighbors)を前提とした、インスタンス最適性の新しい概念を提案する。
  • ターゲット誤差を、任意のin-neighborデータセットにおいて定数確率(2/3)で達成可能な最小誤差の下界として定義する。
  • このターゲット誤差の定数倍の誤差を達成するメカニズムを設計し、in-neighbors定義に基づくインスタンス最適性を保証する。
  • データに適応するクリッピング閾値を用いる:次元 $d$ とプライバシーパラメータ $\rho$ に依存する、ベクトルノルムの $(n - \sqrt{2d/\rho})$-番目の百分位数。この方法により、プライバシーを保ちつつノイズを最小限に抑える。
  • ゼロ集中微分プライバシー(zCDP)を用い、クリッピング済みデータのローカル感度に比例するガウスノイズをスケーリングすることで、プライバシーとユーティリティのトレードオフを保証する。
  • ローカルモデルへの拡張において、各座標に対してメカニズムを適用し、高度な合成則を用いてプライバシー保証を合成する。同時に、データの中心化により翻訳不変性を維持する。

実験結果

リサーチクエスチョン

  • RQ1グローバル感度が大きくても実際のデータ変動が小さいような実世界データセットにおいて、最適なユーティリティを達成する微分プライバシー平均推定器を設計できるか?
  • RQ2データ構造に適応するが手動チューニングを必要としない、微分プライバシー平均推定におけるクリッピング閾値の原理的選定法は何か?
  • RQ3ワーストケース最適性よりも強く、かつ実用的であることが保証されるインスタンス最適性の概念は存在するか、特に平均推定において?
  • RQ4このようなインスタンス最適メカニズムをローカルモデルおよびシャッフルモデルに拡張できるか? その際、ユーティリティが損なわれないか?
  • RQ5提案手法は、実世界および合成データセットにおいて、既存のヒューリスティック手法やCOINPRESSなどの最先端手法と比較して、どのように実験的に評価されるか?

主な発見

  • 提案されたメカニズムはin-neighbors定義に基づくインスタンス最適性を達成し、任意のin-neighborデータセットにおいて、最良の可能な誤差の定数倍以内の誤差を保証する。
  • MNISTデータセットにおいて、すべてのプライバシー水準($\rho = 0.1, 0.5, 1$)でCOINPRESSを上回る性能を示し、非ガウス分布への頑健性を実証した。
  • 最適なクリッピング閾値は $d$ と $\rho$ に依存し、提案された百分位数ベースの選択($n - \sqrt{2d/\rho}$-番目の百分位数)は、固定された百分位数ヒューリスティックと比較して著しく誤差を低減する。
  • ローカルモデルにおいて、既知の分散を仮定するCOINPRESSのKnownVarバージョン即ち、分散を事前に知っている場合でさえも、本手法が優れていることを示し、分散型環境下での強力なユーティリティを確認した。
  • メカニズムは翻訳不変性を有する:データの中心をずらしても性能に影響を及えない。これに対して、中心化されていない代替手法は性能に影響を受けるため、本手法のロバストネスを裏付ける。
  • 高次元($d=128$)においても、次元の増加に伴う誤差増加が従来手法よりも抑制され、共分散推定に失敗しても依然として優れた性能を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。