Skip to main content
QUICK REVIEW

[論文レビュー] Mean Estimation with User-level Privacy under Data Heterogeneity

Rachel Cummings, Vitaly Feldman|arXiv (Cornell University)|Jul 28, 2023
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

本稿では、異なる分布から得られる varying なサンプル数を持つユーザーのデータに対して、非線形で切り捨てに基づく推定器を用いることで、ユーザー単位の微分プライバシー下で漸近的に最適な誤差を達成する、差分プライバシー平均推定アルゴリズムを提案する。この手法により、データの非同一性と未知の分散に対応しつつ、プライバシー制約による漸近的コストが生じないことが証明される。

ABSTRACT

A key challenge in many modern data analysis tasks is that user data are heterogeneous. Different users may possess vastly different numbers of data points. More importantly, it cannot be assumed that all users sample from the same underlying distribution. This is true, for example in language data, where different speech styles result in data heterogeneity. In this work we propose a simple model of heterogeneous user data that allows user data to differ in both distribution and quantity of data, and provide a method for estimating the population-level mean while preserving user-level differential privacy. We demonstrate asymptotic optimality of our estimator and also prove general lower bounds on the error achievable in the setting we introduce.

研究の動機と目的

  • ユーザーが異なるサンプルサイズと分布を持つ非同一なデータ環境における平均推定の課題に対処すること。
  • 分布的およびサンプルサイズの非同一性にかかわらず、ユーザー単位のプライバシーを保ちつつ推定精度を維持する差分プライバシーアルゴリズムの開発。
  • 提案された推定器が、漸近的に最適な誤差を達成することを示すこと。
  • 非同一かつプライベートな設定における推定誤差の一般的な下界を確立し、根本的な限界を同定すること。
  • 基礎となるメタ分布およびデータ非同一性に関する弱い仮定の下で、推定器の性能に対する理論的保証を提供すること。

提案手法

  • 各ユーザーのデータが $[0,1]$ 上の未知のメタ分布 $ \mathcal{D} $ から抽出されるベルヌーイ分布の平均 $ p_i $ を持つモデルを導入する。
  • 推定された分散とサンプルサイズに応じて、ユーザーの寄与を適応的に切り捨てる非線形で差分プライベートな推定器を提案する。
  • 2段階の推定プロセスを採用:まずグローバル平均 $ p $ と分散 $ \sigma_p^2 $ を推定し、その後個々のユーザー推定値にプライバシー保護付きの切り捨てを適用する。
  • 高度な合成定理を用いたプライバシー強化と、メタ分布および二項分布サンプリングの集中不等式を適用する。
  • プライバシーを保ちつつ精度を維持するための切り捨て区間 $[\widehat{a}_i, \widehat{b}_i]$ を設計し、その幅が理想区間の定数倍で抑えられることを保証する。
  • メタ分布および二項分布サンプリングに関する高確率的境界を活用し、推定器のロバスト性と安定性を確保する。

実験結果

リサーチクエスチョン

  • RQ1ユーザー単位のデータ非同一性が存在する状況下で、差分プライバシー平均推定器が漸近的に最適な誤差を達成できるか?
  • RQ2ユーザーのデータ分布とサンプルサイズが異なる状況において、プライバシーと推定精度の間の根本的トレードオフは何か?
  • RQ3グローバル分散が未知であっても、ユーザー単位のプライバシーの代償が非同一データ環境下で漸近的に消えるか?
  • RQ41人あたりのサンプル数と潜在的な分布的非同一性の両方に適応するプライベート推定器はどのように設計できるか?
  • RQ5この非同一かつプライベートな平均推定設定における、最もタイトな推定誤差の下界は何か?

主な発見

  • 提案された差分プライバシー推定器は、$ \tilde{O}(\sigma_{\text{ideal}}^2) $ の分散を達成し、非プライベートな最適分散と対数要因を除いて同一である。
  • 推定器は非線形であるため、線形推定器ではデータ非同一性下での最適なプライベート平均推定が達成できないことが示された。
  • 弱い仮定の下で、プライベート推定器の漸近的誤差は非プライベートの下界と一致し、プライバシー制約による漸近的コストがないことを示した。
  • 推定器で用いられる切り捨て区間の幅は、理想区間の幅の定数倍(6)で抑えられており、ロバスト性が保証されている。
  • 新たな下界の技術が開発され、$ \sigma_{\text{ideal}}^2 $ が与えられたモデルとプライバシー制約下で達成可能な最良の分散に近いことが示された。
  • グローバル分散 $ \sigma_p^2 $ が未知であっても、適応的切り捨てと分散推定により推定器が適応的に動作し、効果を発揮することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。