Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Data Synthesis and Disclosure Risk Quantification: An Application to the Consumer Expenditure Surveys

Jingchen Hu, Terrance D. Savitsky|arXiv (Cornell University)|Sep 26, 2018
Bayesian Methods and Mixture Models参考文献 23被引用数 8
ひとこと要約

本稿では、米国労働統計局の消費者支出調査(CE調査)における合成カントンラベルの生成を目的として、2つのノンパラメトリックベイズ合成器—ディリクレ過程混合の多項分布積(DPMPM)およびディリクレ過程に基づく領域モデル(DP-areal)—を提案する。DPMPMは高いデータ利用価値を維持するが、より高い漏洩リスクを伴う。一方、DP-arealモデルはより強いスムージングによりリスクを低減し、プライバシーと利用価値のトレードオフを評価するための新しい最小および最大漏洩リスクの境界を提供する。

ABSTRACT

The release of synthetic data generated from a model estimated on the data helps statistical agencies disseminate respondent-level data with high utility and privacy protection. Motivated by the challenge of disseminating sensitive variables containing geographic information in the Consumer Expenditure Surveys (CE) at the U.S. Bureau of Labor Statistics, we propose two non-parametric Bayesian models as data synthesizers for the county identifier of each data record: a Bayesian latent class model and a Bayesian areal model. Both data synthesizers use Dirichlet Process priors to cluster observations of similar characteristics and allow borrowing information across observations. We develop innovative disclosure risks measures to quantify inherent risks in the confidential CE data and how those data risks are ameliorated by our proposed synthesizers. By creating a lower bound and an upper bound of disclosure risks under a minimum and a maximum disclosure risks scenarios respectively, our proposed inherent risks measures provide a range of acceptable disclosure risks for evaluating risks level in the synthetic datasets.

研究の動機と目的

  • 消費者支出調査から回答者レベルの地理的データ(カントンラベル)を公開する課題に、プライバシーを確保しながら対処すること。
  • 高い利用価値と低い漏洩リスクを実現する柔軟なノンパラメトリックベイズモデルを構築すること。
  • 合成データにおけるプライバシー保護の評価に役立つ、新たな漏洩リスク指標(最小および最大の内在的リスク)を導入すること。
  • 実際のリスク状況を想定した条件下で、DPMPMおよびDP-areal合成器の利用価値と漏洩リスクの性能を比較すること。
  • 合成データ公開における利用価値とプライバシー保護のトレードオフを定量化することで、統計庁の意思決定を支援すること。

提案手法

  • カントンラベルをカテゴリカル変数として扱い、柔軟なクラスタリングを可能にするディリクレ過程混合の多項分布積(DPMPM)を用いてモデル化する。
  • 年齢、収入、性別などの共通する特徴に基づいてカントンラベルの度数をモデル化する、ディリクルト過程を事前分布に用いたノンパラメトリック領域モデル(DP-areal)を採用する。
  • 地理的スパarsityに対応し、空間構造に関する仮定を避けるためにノンパラメトリック事前分布を適用する。
  • 合成されたカントンラベルの分布的類似性に基づくローカルな利用価値指標を開発する。
  • 合成の前段階で機密データに内在するリスクを定量化するため、漏洩リスクの下限および上限(最小および最大シナリオ)を導入する。
  • 100回の繰り返しサンプリング(S=100)を実施し、漏洩リスクのばらつきを評価し、複数の合成データセット間での合成器の比較を実施する。

実験結果

リサーチクエスチョン

  • RQ1CE調査における感受性の高いカテゴリカル変数(カントンラベル)の合成データを、データ利用価値を保持したまま生成する方法は何か?
  • RQ2元の機密データに内在する漏洩リスクは何か? そして、合成器に依存せずにそのリスクをどのように定量化できるか?
  • RQ3DPMPMおよびDP-areal合成器は、利用価値と漏洩リスクの観点でどのように比較できるか?
  • RQ4空間事前分布に依存せずに、ノンパラメトリックベイズモデルがスパースな地理的データを効果的に処理できるか?
  • RQ5スムージングの影響は、合成データにおける利用価値とプライバシー保護のトレードオフにどのように現れるか?

主な発見

  • DPMPM合成器は、元のカントンラベルデータの分布的特性をより正確に保持する高い利用価値を達成した。
  • DP-areal合成器は、より強いスムージングにより低い漏洩リスクを生じさせ、同じシナリオ下でDPMPMと比較して平均88.15件の正確な属性漏洩にとどまった(DPMPMは115.25件)。
  • 最大漏洩リスクシナリオ下では、DP-arealモデルがDPMPMと比較して属性漏洩リスクを23.5%低減した。
  • 最小漏洩リスク境界は47.25件の正確な属性漏洩、最大は175.33件であり、許容可能なリスクレベルの範囲を明確に示した。
  • 図4bのヒストограм比較により、繰り返しサンプリングの全反復において、DP-arealモデルの漏洩リスクが一貫して低く抑えられていたことが確認された。
  • 本研究は、合成器によるプライバシー向上の文脈を理解する上で、内在的データリスク(最小および最大境界)が不可欠であることを示しており、適切な公開意思決定を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。