[论文解读] Practical Bayesian Inference for Record Linkage
本文提出了一种计算高效的贝叶斯记录关联方法,结合惩罚似然估计实现快速点估计,以及受限MCMC采样实现后验推断。通过事后阻塞策略,将MCMC聚焦于高不确定性关联对,从而在大规模数据集上实现可扩展的、具备不确定性感知的关联,成功在大规模人口普查应用中实现94.6%的精确率和95.5%的召回率。
Probabilistic record linkage (PRL) is the process of determining which records in two databases correspond to the same underlying entity in the absence of a unique identifier. Bayesian solutions to this problem provide a powerful mechanism for propagating uncertainty due to uncertain links between records (via the posterior distribution). However, computational considerations severely limit the practical applicability of existing Bayesian approaches. We propose a new computational approach, providing both a fast algorithm for deriving point estimates of the linkage structure that properly account for one-to-one matching and a restricted MCMC algorithm that samples from an approximate posterior distribution. Our advances make it possible to perform Bayesian PRL for larger problems, and to assess the sensitivity of results to varying prior specifications. We demonstrate the methods on simulated data and an application to a post-enumeration survey for coverage estimation in the Italian census.
研究动机与目标
- 解决现有贝叶斯记录关联方法在大规模数据集上计算不可行的问题。
- 开发一种快速、准确的点估计方法,同时考虑一对一匹配约束。
- 通过仅针对不确定关联对的受限MCMC算法,实现后验采样。
- 在模拟数据和真实世界意大利人口普查事后调查中,展示该方法的有效性。
- 为下游分析中使用关联数据时的不确定性传播提供一个框架。
提出的方法
- 提出一种惩罚最大似然方法,联合估计模型参数与关联结构,相较于传统贝叶斯方法显著提升计算效率。
- 引入事后阻塞策略,利用惩罚似然权重定义阻塞块,使MCMC处理的记录对数量减少99.98%。
- 应用受限MCMC算法,仅在事后阻塞块内执行添加/删除/交换操作,支持并行化与可扩展性。
- 使用似然比权重 $ w_{ab} = \log\left(\frac{m(\gamma_{ab})}{u(\gamma_{ab})}\right) $ 汇总记录对匹配与非匹配的证据。
- 在比较项之间施加条件独立假设,以减少参数空间并提升模型可处理性。
- 采用阈值 $ w_0 $ 控制块大小,平衡计算效率与真实匹配的保留率。
实验结果
研究问题
- RQ1惩罚似然方法能否在尊重一对一匹配约束的前提下,为记录关联提供快速、准确的点估计?
- RQ2如何将MCMC采样限制在最不确定的关联对上,以提升计算可扩展性?
- RQ3基于惩罚似然权重的事后阻塞在多大程度上减少了需要MCMC评估的记录对数量?
- RQ4在大规模数据上,惩罚似然估计的精确率与召回率相较于EM+LSAP方法表现如何?
- RQ5受限MCMC算法能否生成可靠的后验样本,以支持下游分析中的不确定性量化?
主要发现
- 惩罚似然方法在包含25,000个真实匹配的大规模模拟数据集上实现了92.7%的召回率与94.6%的精确率,精确率显著优于EM+LSAP方法(62.6%)。
- 受限MCMC算法将召回率提升至95.5%,同时保持94.6%的精确率,表明推断质量得到增强。
- 采用 $ w_0 = 4.9 $ 的事后阻塞将记录对数量从1.6亿对减少至36,356对,实现99.98%的减少率。
- 配对完整性度量为99.5%,表明25,000个真实匹配中有24,877个保留在事后阻塞块中。
- 尽管需重复求解LSAP,惩罚似然方法整体耗时更短(290秒),优于EM+LSAP(320秒)。
- 该方法通过仅聚焦于23,903个事后阻塞块进行MCMC采样,实现了可扩展的后验抽样,每个阻塞块可并行处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。