Skip to main content
QUICK REVIEW

[论文解读] Evaluation of per-record identification risk and swappability of records in a microdata set via decomposable models

Akimichi Takemura, Yushi Endo|ArXiv.org|Mar 27, 2006
Privacy-Preserving Technologies in Data参考文献 10被引用 4
一句话总结

本文提出了一种系统性方法,用于评估微数据中每条记录的识别风险,并通过可分解对数线性模型实现安全的记录互换。通过使用AIC优化的可分解模型拟合多维列联表,该方法识别出细胞概率估计值较低的高风险(稀有)记录,并实现保持模型边际分布的互换,从而在不扭曲统计推断的前提下实现披露控制。

ABSTRACT

We propose a strategy for disclosure risk evaluation and disclosure control of a microdata set based on fitting decomposable models of a multiway contingency table corresponding to the microdata set. By fitting decomposable models, we can evaluate per-record identification (or re-identification) risk of a microdata set. Furthermore we can easily determine swappability of risky records which does not disturb the set of marginals of the decomposable model. Use of decomposable models has been already considered in the existing literature. The contribution of this paper is to propose a systematic strategy to the problem of finding a model with a good fit, identifying risky records under the model, and then applying the swapping procedure to these records.

研究动机与目标

  • 开发一种系统性方法,利用统计建模评估微数据集中每条记录的识别风险。
  • 识别由于关键变量中特征组合稀少而导致再识别风险较高的记录。
  • 通过保持拟合的可分解模型的充分统计量,实现基于记录互换的披露控制。
  • 提供一种计算上可行的方法,适用于官方统计中常见的大型稀疏列联表。
  • 确保互换不会改变模型的边际分布,从而保持统计推断的有效性。

提出的方法

  • 使用AIC进行模型选择,将可分解对数线性模型拟合至从微数据关键变量导出的多维列联表。
  • 当可能的模型数量过大时(例如,8个变量时超过3000万种),使用算法搜索局部最优可分解模型。
  • 估计每条记录的单元格概率,特别关注样本唯一记录中概率极低的记录作为高风险案例。
  • 实施一种互换程序,以保持与可分解模型团的边际分布一致。
  • 利用Takemura & Hara (2002) 提出的必要和充分条件,判断是否可将一条记录与另一条记录互换而不影响模型的充分统计量。
  • 对于每条高风险记录,通过检查其是否在最小顶点分离集上具有相同值但团上值不同,来搜索候选互换伙伴。

实验结果

研究问题

  • RQ1在具有大量关键变量的大型稀疏微数据集中,如何系统性地评估每条记录的识别风险?
  • RQ2基于列联表中记录的单元格概率,如何有效且计算上可行地识别出再识别风险较高的记录?
  • RQ3如何以保持统计模型充分统计量的方式执行记录互换,从而维持数据的可用性?
  • RQ4可分解模型能否在不依赖迭代估计过程的前提下,高效识别并控制微数据中的披露风险?
  • RQ5在何种条件下,互换两条记录不会改变拟合的可分解模型的边际分布?

主要发现

  • 所提出的方法成功识别出50条样本唯一记录(其估计单元格概率低于10⁻⁸),包括最稀有的两条记录,并实现了互换。
  • 用于寻找局部最优可分解模型的算法能够高效处理大规模可能模型空间(例如,8个变量时超过3000万种),使该方法在计算上可行。
  • 基于共享分离集值但团上值不同的互换条件(条件6)是有效的,并且能快速为大多数高风险记录找到有效的互换伙伴。
  • 可分解模型允许显式、非迭代地估计单元格概率,这对准确评估稀有单元格风险至关重要。
  • 尽管在稀疏大样本设置下存在理论局限性,使用AIC进行模型选择仍提供了实用且相对有效的准则。
  • 该方法保留了模型的充分统计量,确保基于数据的统计推断在披露控制后依然有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。