Skip to main content
QUICK REVIEW

[論文レビュー] Data-Dependent Differentially Private Parameter Learning for Directed Graphical Models

Amrita Roy Chowdhury, Theodoros Rekatsinas|arXiv (Cornell University)|May 30, 2019
Privacy-Preserving Technologies in Data参考文献 59被引用数 4
ひとこと要約

本論文は、データに依存する微分プライバシー(DP)アルゴリズムを提案し、条件付き確率分布(CPD)のプライバシー予算をデータおよびグラフ構造に基づいて最適化することで、有向グラフィカルモデル(DGM)のパラメータ学習に適用する。ノード固有の感度と影響度に応じたノイズ追加をカスタマイズすることで、必要なプライバシー予算を約3倍削減し、ε=1.0で同じ推論効用を達成する。これは、データに依存しないベースラインがε=3.0で達成する水準に相当する。

ABSTRACT

Directed graphical models (DGMs) are a class of probabilistic models that are widely used for predictive analysis in sensitive domains, such as medical diagnostics. In this paper we present an algorithm for differentially private learning of the parameters of a DGM with a publicly known graph structure over fully observed data. Our solution optimizes for the utility of inference queries over the DGM and extit{adds noise that is customized to the properties of the private input dataset and the graph structure of the DGM}. To the best of our knowledge, this is the first explicit data-dependent privacy budget allocation algorithm for DGMs. We compare our algorithm with a standard data-independent approach over a diverse suite of DGM benchmarks and demonstrate that our solution requires a privacy budget that is $3 imes$ smaller to obtain the same or higher utility.

研究の動機と目的

  • データやグラフ構造に適合しないノイズを用いるデータに依存しない微分プライバシー(DP)がDGMパラメータ学習において非効率な効用をもたらす問題に対処する。
  • データに依存する特性とグラフトポロジーに基づいてプライバシー予算を明示的に割り当てることで、DGMにおける推論クエリの誤差を最小化する。
  • CPD間におけるプライバシー予算割り当てのための新規な、データに依存する最適化フレームワークを開発し、効用効率を向上させる。
  • 推論クエリ誤差の理論的境界を提示し、誤差が木幅や最大ノード次数にどのように関連するかを示す。
  • 医療分野などの機微な分野へのDPの実用的導入を可能にする。同等の効用を得るためのプライバシーコストを低減する。

提案手法

  • DGMパラメータ学習を、各条件付き確率分布(CPD)ごとの独立したDP部分問題に分解し、ノードごとの予算割り当てを可能にする。
  • 2段階アプローチを採用:まず、率βでデータのサブセットをサンプリングし、小さなプライバシー予算ε^Iを用いて予備のパラメータと誤差感度を推定する。
  • ノードの影響度を高さ(h_i)、出次数(o_i)、推定パラメータ誤差(δ̃_i)および感度(Δ̃_i^N)で重みづけたデータに依存する最適化目的関数を定式化する。
  • 子ノードの分布にのみ焦点を当てた新しい定式化により、各CPDの感度を計算し、精度とプライバシー会計の両方を向上させる。
  • 重み付き目的関数を用いてプライバシー予算をノード間で最適化する:∑(W[i]·δ̃_i/ε_i) + W[n]·δ̃_n/(ε^B - ε^I - ∑ε_i),ここでW[i] = (h_i+1)(o_i+1)(Δ̃_i^N + 1)。
  • 最適化されたε_i値に合わせてノイズを調整したラプラス機構を適用し、最終モデルがε-BDPを満たすように保証する。

実験結果

リサーチクエスチョン

  • RQ1DGMのCPD間でデータに依存するプライバシー予算割り当てを実施することで、所定の推論効用を達成するための全体的なプライバシー予算を削減できるか?
  • RQ2ノードの影響度(高さ、出次数、パラメータ感度で測定)は、その最適なプライバシー予算割り当てにどのように影響するか?
  • RQ3DP DGMにおける推論クエリ誤差の理論的境界は何か?グラフ構造(例:木幅、最大次数)とどのように関連するか?
  • RQ42段階のサンプリングと最適化パイプラインは、初期パラメータ推定のコストを削減しつつ、効用を維持できるか?
  • RQ5本手法は、データに依存しないDPベースラインと比較して、効用およびプライバシー予算効率の点で優れているか?

主な発見

  • 提案手法は、データに依存しないベースラインがε=3.0で達成する水準と同等またはそれ以上の推論効用を、ε=1.0のプライバシー予算で達成する。
  • 本手法は、テストした4つのDGMベンチマークすべてにおいて、効用を維持または向上させつつ、必要なプライバシー予算を約3倍削減する。
  • 理論的分析により、推論誤差の上界がDGMの木幅に指数関数的に依存する一方、下界は最大ノード次数に依存することが示された。
  • CPDの感度は、子ノードの分布のみに基づいて計算されており、より正確で効率的なノイズ補正を可能にする。
  • 最適化目的関数は、根ノードなどの高影響度ノードを適切に同定し、より高い予算を割り当てることで、全体の推論精度を向上させる。
  • サンプリング率βを用いた2段階アプローチにより、初期推定のプライバシーコスト(ε^I)が低減され、最終パラメータ計算に割り当てられる予算が増加する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。