[论文解读] Dirichlet Process Mixture Models for Modeling and Generating Synthetic Versions of Nested Categorical Data
本文提出了一种嵌套狄利克雷过程混合模型(NDPMPM),用于建模和生成具有嵌套类别的合成数据(如包含个体的家庭),通过使用群体层级和个体层级的潜在类别来捕捉依赖关系和结构零值。该模型能够准确估计联合分布,并生成保留多变量关系的可擦除公开使用数据集。
We present a Bayesian model for estimating the joint distribution of multivariate categorical data when units are nested within groups. Such data arise frequently in social science settings, for example, people living in households. The model assumes that (i) each group is a member of a group-level latent class, and (ii) each unit is a member of a unit-level latent class nested within its group-level latent class. This structure allows the model to capture dependence among units in the same group. It also facilitates simultaneous modeling of variables at both group and unit levels. We develop a version of the model that assigns zero probability to groups and units with physically impossible combinations of variables. We apply the model to estimate multivariate relationships in a subset of the American Community Survey. Using the estimated model, we generate synthetic household data that could be disseminated as redacted public use files with high analytic validity and low disclosure risks. Supplementary materials for this article are available online.
研究动机与目标
- 开发一种灵活的贝叶斯模型,用于建模嵌套于群体中的多变量类别数据,例如家庭中的个体。
- 考虑同一群体内单位之间的依赖关系,而标准潜在类别模型无法捕捉此类依赖。
- 将结构零值——变量的物理上不可能组合——正式纳入模型,以提升数据的真实性。
- 生成保留联合分布并支持统计推断的合成公开使用数据集,同时确保保密性。
- 将非参数贝叶斯方法扩展至具有复杂依赖结构的分层类别数据,实现完整支持。
提出的方法
- 模型使用狄利克雷过程混合(DPM)先验,以允许在群体层级和个体层级的潜在类别数量上存在不确定性。
- 引入两级潜在类别结构:群体层级类别与嵌套于其内的个体层级类别,从而基于共享特征对群体和个体进行聚类。
- 通过约束混合成分的支持,使模型对物理上不可能的配置(如女儿年龄大于父亲)分配零概率。
- 采用分层先验,使用狄利克雷分布对群体层级和个体层级的多项分布参数进行建模,其形状参数由经验频率或均匀先验提供信息。
- 通过吉布斯抽样进行后验推断,迭代地更新类别分配和参数。
- 通过从后预测分布中抽样生成合成数据集,以保留群体层级和个体层级变量的联合分布。
实验结果
研究问题
- RQ1非参数贝叶斯模型能否有效捕捉嵌套于群体中的单位之间在类别数据中的复杂依赖结构?
- RQ2如何在混合模型中正式纳入结构零值——变量的不可能组合——以用于合成数据生成?
- RQ3NDPMPM是否能生成保留原始数据边际分布、双变量分布和多变量分布的合成数据集?
- RQ4当群体层级和个体层级变量联合建模时,该模型在估计总体参数方面表现如何?
- RQ5先验选择(经验先验 vs. 均匀先验)在多大程度上影响合成数据生成的准确性?
主要发现
- NDPMPM成功估计了嵌套类别数据的联合分布,合成数据集在边际、双变量和三变量概率上与原始数据高度一致。
- 基于经验先验和均匀先验的合成数据点估计值几乎完全相同,表明对先验设定具有鲁棒性。
- 对于规模为2–4人的家庭,所有成员种族相同的概率在原始数据中为.928,在合成数据中为.923–.933,显示出极高的保真度。
- 该模型在估计复杂关系方面保持了高准确性,例如所有家庭成员均为白人且租房的概率(.123),或所有成员均有医疗保障的概率(.807)。
- 在不同混合成分数量下(例如 (F,S) = (30,10) 与 (50,50)),结果保持一致,表明模型具有稳定性与可扩展性。
- 引入结构零值显著提升了数据的真实性,消除了如“女儿年龄大于父亲”等不可能配置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。