[论文解读] Bayesian Data Synthesis and Disclosure Risk Quantification: An Application to the Consumer Expenditure Surveys
本文提出两种非参数贝叶斯合成器——多项式狄利克雷过程混合模型(DPMPM)和基于狄利克雷过程的区域模型(DP-areal),用于生成美国劳工统计局消费者支出调查中的合成县份标签。DPMPM 保留了更高的数据效用,但披露风险更大;而 DP-areal 模型通过增加平滑度降低了风险,新颖的最小与最大披露风险边界为隐私-效用权衡提供了上下文背景。
The release of synthetic data generated from a model estimated on the data helps statistical agencies disseminate respondent-level data with high utility and privacy protection. Motivated by the challenge of disseminating sensitive variables containing geographic information in the Consumer Expenditure Surveys (CE) at the U.S. Bureau of Labor Statistics, we propose two non-parametric Bayesian models as data synthesizers for the county identifier of each data record: a Bayesian latent class model and a Bayesian areal model. Both data synthesizers use Dirichlet Process priors to cluster observations of similar characteristics and allow borrowing information across observations. We develop innovative disclosure risks measures to quantify inherent risks in the confidential CE data and how those data risks are ameliorated by our proposed synthesizers. By creating a lower bound and an upper bound of disclosure risks under a minimum and a maximum disclosure risks scenarios respectively, our proposed inherent risks measures provide a range of acceptable disclosure risks for evaluating risks level in the synthetic datasets.
研究动机与目标
- 为解决在确保隐私的前提下发布消费者支出调查中受访者层面地理数据(县份标签)的挑战。
- 开发灵活的非参数贝叶斯模型,以高数据效用和低披露风险合成分类变量。
- 引入新的披露风险度量——最小与最大固有风险——为评估合成数据中的隐私保护提供上下文。
- 在现实风险情景下,比较两种合成器(DPMPM 与 DP-areal)在效用与披露风险方面的表现。
- 通过量化合成数据发布中数据效用与隐私保护之间的权衡,支持统计机构的决策制定。
提出的方法
- 使用狄利克雷过程混合多项式模型(DPMPM)将县份标签建模为分类变量,允许对相似记录进行灵活聚类。
- 采用基于狄利克雷过程先验的非参数区域模型(DP-areal),根据年龄、收入和性别等共享特征对县份标签计数进行建模。
- 应用非参数先验以处理地理稀疏性,避免对空间结构做出假设。
- 基于合成县份标签分布与原始数据的相似性,开发局部效用度量。
- 引入披露风险的下限与上限(最小与最大情景),以量化合成前保密数据中的固有风险。
- 通过重复抽样(S=100 次迭代)评估披露风险的变异性,并在多个合成数据集之间比较合成器表现。
实验结果
研究问题
- RQ1如何在保留数据效用的同时,为 CE 调查中如县份标签等敏感分类变量生成合成数据?
- RQ2原始保密数据中的固有披露风险是什么?如何在不依赖合成器的情况下对其进行量化?
- RQ3DPMPM 与 DP-areal 合成器在效用与披露风险方面如何比较?
- RQ4非参数贝叶斯模型能否在不依赖空间先验的情况下有效处理稀疏地理数据?
- RQ5平滑度对合成数据中效用与隐私保护之间权衡的影响是什么?
主要发现
- DPMPM 合成器实现了更高的效用,更准确地保留了原始县份标签数据的分布特征。
- DP-areal 合成器由于平滑度更高,披露风险更低,在相同情景下平均精确属性披露数为 88.15,而 DPMPM 为 115.25。
- 在最大披露风险情景下,DP-areal 模型相比 DPMPM 将属性披露风险降低了 23.5%。
- 最小披露风险边界为 47.25 次精确属性披露,最大为 175.33,为可接受风险水平提供了清晰范围。
- DP-areal 模型在所有重复抽样迭代中披露风险均保持更低水平,图 4b 的直方图比较结果证实了这一点。
- 本研究表明,固有数据风险(最小与最大边界)对于理解合成器带来的隐私改进至关重要,有助于实现知情的数据发布决策。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。