Skip to main content
QUICK REVIEW

[論文レビュー] Differentially Private Bayesian Inference for Generalized Linear Models

Tejas Kulkarni, Joonas Jälkö|arXiv (Cornell University)|Nov 1, 2020
Privacy-Preserving Technologies in Data参考文献 50被引用数 5
ひとこと要約

本稿では、一般化線形モデル(GLM)であるロジスティック回帰やポisson回帰に対して、低次のデータモーメントによる十分統計量の近似と、要約統計量レベルでの一回のノイズ注入により、ノイズに配慮した微分プライバシー付きベイズ推論手法を提案する。この手法により、強いプライバシー保証のもとで正確な事後分布推定と不確実性の定量が可能となり、複数のデータセットおよびプライバシー予算において、既存のDP-SGLDベースラインを上回る事後分布の忠実性と安定性を達成する。

ABSTRACT

Generalized linear models (GLMs) such as logistic regression are among the most widely used arms in data analyst's repertoire and often used on sensitive datasets. A large body of prior works that investigate GLMs under differential privacy (DP) constraints provide only private point estimates of the regression coefficients, and are not able to quantify parameter uncertainty. In this work, with logistic and Poisson regression as running examples, we introduce a generic noise-aware DP Bayesian inference method for a GLM at hand, given a noisy sum of summary statistics. Quantifying uncertainty allows us to determine which of the regression coefficients are statistically significantly different from zero. We provide a previously unknown tight privacy analysis and experimentally demonstrate that the posteriors obtained from our model, while adhering to strong privacy guarantees, are close to the non-private posteriors.

研究の動機と目的

  • 一般化線形モデル(GLM)における微分プライバシー付きベイズ推論を可能にし、これは広く使われているが、DPのもとで不確実性の定量が不足しがちな分野である。
  • 入力データXも機微なため自然な事前分布が存在しない回帰などの判別モデルにおけるプライベート推論の課題に対処する。
  • プライバシーに起因するノイズの影響を事後分布の不確実性に定量的に反映させ、係数の有意性に関する統計的推論を可能にする手法を開発する。
  • 線形モデルを超えて、より広いクラスのGLMにまで、十分統計量に基づくDPベイズ手法を拡張する。
  • タイトなプライバシー解析を提供し、実世界のデータセットを用いた実験的評価を通じて実用性を示す。

提案手法

  • 本手法は、GLMにおける入力と出力の連合分布を、有限次のモーメントとしての近似十分統計量で近似する。
  • 中心極限定理に基づく正規近似を用いて、摂動を加えたモーメントの分布をモデル化し、効率的な事後分布計算を可能にする。
  • 摂動された要約統計量の感度を事前分布に組み込むことで、ノイズに配慮した事前分布を構築する。
  • モーメントマッチングを用いて、モデルパラメータをノイズを含む要約統計量に適合させ、摂動済みデータと整合性を保つ。
  • DPメカニズムに対してタイトな感度解析を実施し、合成定理を用いたガウスメカニズムにより正確なプライバシー会計を可能にする。
  • 本手法はロジスティック回帰とポアソン回帰を代表例として採用しており、他の指数型分布族モデルへの拡張可能性も有する。

実験結果

リサーチクエスチョン

  • RQ1十分統計量が存在しない一般化線形モデル(GLM)に、微分プライバシー付きベイズ推論を効果的に適用可能か。また、プライバシーに起因するノイズの影響を不確実性に定量的に反映できるか。
  • RQ2入力データも機微な状況において、DPで注入されたノイズを考慮した事前分布の構築法は何か。
  • RQ3十分統計量のモーメントベース近似が、GLMにおける事後分布の正確性とプライバシー・ユーティリティのトレードオフに与える影響は何か。
  • RQ4DP-SGLDなどの既存のDPベイズ推論ベースラインと比較して、本手法の事後分布の忠実性と安定性はどのように異なるか。
  • RQ5特に係数の絶対値が小さいモデルにおいて、強いプライバシー制約(例:ε ≤ 0.1)のもとでも、本手法は高いユーティリティを維持できるか。

主な発見

  • 成人(adult)および糖尿病(diabetes)データセットにおいて、強力なプライバシー制約(ε ≤ 0.1)のもとでも、本手法で得られたプライベート事後分布は、非プライベート事後分布と非常に近い結果を示した。
  • DP-SGLDベースラインの事後分布は著しく変動が大きく、バイアスがある、または不確実性が不足または過剰であるなど、事後分布推定の不安定性を示した。
  • 真の係数θ = [-0.9, -0.5, 0.3] を持つ合成データにおいて、ε > 0.1 の場合、プライベートおよび非プライベート事後分布の実現累積分布関数(empirical CDF)がほぼ重複しており、強い事後分布回復が確認された。
  • コルモゴロフ・スミルノフ検定のスコアは、εが減少するに従い非増加的傾向を示し、本手法がさまざまなプライバシー予算においても正確性を維持していることを裏付けた。
  • ||θ||₂ ≥ 3 になると、計算コストを抑えるために用いられるテイラー級数近似の打ち切りにより、精度が急激に低下した。
  • 感度解析によりタイトなプライバシー会計が可能となり、要約統計量のノイズ注入に対して一回のプライバシー費用しか発生しない。これは、DP-SGLDのような反復的メソッドとは対照的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。