Skip to main content
QUICK REVIEW

[論文レビュー] A Feasibility Study of Differentially Private Summary Statistics and Regression Analyses for Administrative Tax Data.

Andrés F. Barrientos, Aaron R. Williams|arXiv (Cornell University)|Oct 22, 2021
Privacy-Preserving Technologies in Data参考文献 53被引用数 6
ひとこと要約

本稿では、感受性の高い行政税務データに対する検証サーバーを実現するための微分プライバシー(DP)手法の実用性を評価し、要約統計と回帰分析のためのDP手法を提案・検証している。結果として、DP要約統計は許容できる精度で実現可能であるが、DP回帰推定値と信頼区間は依然として信頼できる使用には不適切なほど不正確であることが示された。

ABSTRACT

Federal administrative tax data are invaluable for research, but because of privacy concerns, access to these data is typically limited to select agencies and a few individuals. An alternative to sharing microlevel data are validation servers, which allow individuals to query statistics without accessing the confidential data. This paper studies the feasibility of using differentially private (DP) methods to implement such a server. We provide an extensive study on existing DP methods for releasing tabular statistics, means, quantiles, and regression estimates. We also include new methodological adaptations to existing DP regression algorithms for using new data types and returning standard error estimates. We evaluate the selected methods based on the accuracy of the output for statistical analyses, using real administrative tax data obtained from the Internal Revenue Service Statistics of Income (SOI) Division. Our findings show that a validation server would be feasible for simple statistics but would struggle to produce accurate regression estimates and confidence intervals. We outline challenges and offer recommendations for future work on validation servers. This is the first comprehensive statistical study of DP methodology on a real, complex dataset, that has significant implications for the direction of a growing research field.

研究の動機と目的

  • 微分プライバシー(DP)手法が、検証サーバーを通じて連邦行政税務データへの安全でプライバシー保護されたアクセスを可能にするかどうかを評価すること。
  • 実際のIRS SOIデータを用いて、表形式統計、平均、分位数、および回帰推定値のDP手法の正確性を評価すること。
  • 既存のDP回帰アルゴリズムを新たに出現するデータタイプに適合させるとともに、標準誤差推定値を出力するように開発・改変すること。
  • DP制約下での高精度な回帰出力を達成するための課題を特定し、今後の研究のための提言を提示すること。

提案手法

  • 実世界の行政税務データ構造に対応できるよう、既存の微分プライバシー(DP)アルゴリズム(表形式統計、平均、分位数)を適応した。
  • 新しいデータタイプをサポートし、標準誤差推定値を出力できるようにDP回帰アルゴリズムを拡張し、統計的推論における利用可能性を向上させた。
  • ユーザーが微分プライバシー保護された統計を直接アクセスせずに照会できる検証サーバーのアーキテクチャを実装した。
  • 実際のIRS Statistics of Income(SOI)データを用いて、要約統計および回帰出力の誤差を測定することで、手法の正確性を評価した。
  • ラプラス、ガウスなどの複数のDPメカニズムと、ノイズキャリブレーション戦略を比較し、プライバシーと正確性のバランスを図った。
  • プライバシー予算(ε)の割り当て戦略を用いて、微分プライバシーを確保するとともに、有用性の損失を最小限に抑えた。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシー(DP)手法は、感受性の高い行政税務データの要約統計(例:平均、分位数、度数)を、許容できる正確性で生成できるか?
  • RQ2実際のIRS SOIデータにDP回帰アルゴリズムを適用した場合、信頼できる推定値と標準誤差をどの程度得られるか?
  • RQ3プライバシー予算(ε)の設定が、DP統計および回帰出力の正確性にどのように影響するか?
  • RQ4複雑な統計分析を税務データに対して実行するためのDP検証サーバーを実装するにあたり、どのような主な課題が生じるか?
  • RQ5DP手法は、個人のプライバシーを損なうことなく、行政データに対する意味のある統計的推論を可能にするか?

主な発見

  • 微分プライバシー(DP)要約統計、特に平均と分位数は、許容できる正確性で公開可能であり、検証サーバーの実現可能性がある。
  • DP回帰推定値は、特に小効果サイズや高次元モデルの場合、著しい正確性の損失を示した。
  • DP回帰アルゴリズムから得られる標準誤差推定値は、信頼区間の有用性を制限するほどしばしば信頼できないものであった。
  • プライバシー予算(ε)が小さくなるほど、DP出力の正確性が顕著に低下し、特に回帰モデルにおいて顕著であった。
  • DP表形式統計は良好に機能したが、DP回帰におけるメソドロジカルな課題は、現在の形では高精度な推論に不適切であることを示した。
  • 本研究は、保護されたデータ上で強固な統計分析を可能にするために、DP回帰分野におけるさらなる研究が不可欠である、主要なギャップを特定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。