Skip to main content
QUICK REVIEW

[論文レビュー] Differentially private significance tests for regression coefficients

Andrés F. Barrientos, Jerome P. Reiter|arXiv (Cornell University)|May 26, 2017
Privacy-Preserving Technologies in Data参考文献 30被引用数 7
ひとこと要約

本稿では、合成データやノイズの加えられたクエリ出力などのプライバシー保護済みデータから計算された回帰係数の統計的有意性および符号を評価するための微分プライバシー手法を提案する。適切にキャリブレーションされたラプラスノイズを用いた切り捨てられたノイズ付きt統計量を用いることで、元の機密データ上で係数が有意であったかどうかをユーザーが検証可能となり、適切なパrameter設定のもとで真のp値および符号と高い一致を達成する。

ABSTRACT

Many data producers seek to provide users access to confidential data without unduly compromising data subjects' privacy and confidentiality. One general strategy is to require users to do analyses without seeing the confidential data; for example, analysts only get access to synthetic data or query systems that provide disclosure-protected outputs of statistical models. With synthetic data or redacted outputs, the analyst never really knows how much to trust the resulting findings. In particular, if the user did the same analysis on the confidential data, would regression coefficients of interest be statistically significant or not? We present algorithms for assessing this question that satisfy differential privacy. We describe conditions under which the algorithms should give accurate answers about statistical significance. We illustrate the properties of the proposed methods using artificial and genuine data.

研究の動機と目的

  • 分析者が合成データや摂動を加えたクエリ出力などのプライバシー保護済みデータにしかアクセスできない状況において、回帰係数の統計的有意性を評価する課題に対処すること。
  • 元の機密データ上で計算された場合に係数が統計的に有意であったかどうかをユーザーが検証できる手法を提供すること。
  • 検証プロセス自体が微分プライバシーを満たし、データ主体の機密性を保護すること。
  • 精度とプライバシーのバランスを取るためのアルゴリズムパラメータ(M, a)を体系的かつ原則的選定するアプローチを提供すること。
  • 一般の帰無仮説および切片の有意性検定への拡張を図ること。

提案手法

  • 本手法は、摂動を加えた回帰係数および標準誤差に基づき、プライバシー保護されたt統計量を切り捨てることで有意性を推定する。
  • 感度を制限するために切り捨てを施した上で、ε-微分プライバシーを満たすためにt統計量にラプラスノイズを適用する。
  • プライバシー機構下でのt統計量の帰無分布をシミュレートすることで、微分プライバシーを満たすp値および符号を計算する。
  • 有意性検定における誤差の上界を最小化するように、切り捨てレベル(a)およびサンプル数(M)を決定する。
  • 一標本t検定フレームワークを用いて、一般の帰無仮説(例:βj = b)および切片の有意性検定へと拡張する。
  • 検証サーバーが微分プライバシーを満たすp値および符号を提供することで、機密データを露呈せずに結果の信頼性を確保できる。

実験結果

リサーチクエスチョン

  • RQ1元の機密データ上で計算された場合に回帰係数が有意であったかどうかを評価できる微分プライバシー手法を設計できるか?
  • RQ2プライベートな検定結果(p値および符号)が、機密データからの結果とどれほど近いのかをどのように保証できるか?
  • RQ3有意性検定における誤差を最小化しつつプライバシーを維持するパラメータ選定(M, a)は何か?
  • RQ4本手法を一般の帰無仮説(例:βj = b)および切片の有意性検定へと拡張できるか?
  • RQ5さまざまなプライバシー予算のもとで、本手法は実際のデータおよび人工データに対してどのように性能を発揮するか?

主な発見

  • (M=25, a=2)の設定では、微分プライバシーを適用したp値が、機密データからの真のp値と顕著に一致した。特に帰無仮説に反する強い証拠がある係数に対して顕著であった。
  • 符号予測においても高い一致を達成し、p値が大きい係数に関してはわずかなずれが生じるが、それらは本質的に重要性が低い。
  • ε=0.5の場合、推奨される設定は(M=100, a=1)であり、符号の一致は強く保たれ、p値の一致についても許容可能な水準を維持した。
  • ε=1.5の場合、有意性検定における誤差の上界は0.05に最小化され、a=1またはa=2の設定で達成された。t統計量の歪みが小さいため、a=2が好ましい。
  • CPSデータ上で実証したところ、厳しいプライバシー予算下でも真の有意性および符号の検出能力が効果的に保持された。
  • 一般の帰無仮説および切片の検定へも拡張可能であり、プライバシー保護型推論への応用範囲を広げられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。