Skip to main content
QUICK REVIEW

[论文解读] Scaling Bayesian Probabilistic Record Linkage with Post-Hoc Blocking: An Application to the California Great Registers

Brendan S. McVeigh, Bradley T. Spahn|arXiv (Cornell University)|May 14, 2019
Data Quality and Management参考文献 34被引用 12
一句话总结

本文提出一种可扩展的贝叶斯概率记录关联方法,采用事后阻断策略,实现在大规模历史数据集上的高效后验推断——特别是加利福尼亚州大名册(California Great Registers)数据集——证明仅使用单台计算机即可在数小时内估算出包含数十万条记录的完整后验分布,从而揭示了新政时期个人政党归属转变的新见解。

ABSTRACT

Probabilistic record linkage (PRL) is the process of determining which records in two databases correspond to the same underlying entity in the absence of a unique identifier. Bayesian solutions to this problem provide a powerful mechanism for propagating uncertainty due to uncertain links between records (via the posterior distribution). However, computational considerations severely limit the practical applicability of existing Bayesian approaches. We propose a new computational approach, providing both a fast algorithm for deriving point estimates of the linkage structure that properly account for one-to-one matching and a restricted MCMC algorithm that samples from an approximate posterior distribution. Our advances make it possible to perform Bayesian PRL for larger problems, and to assess the sensitivity of results to varying prior specifications. We demonstrate the methods on a subset of an OCR'd dataset, the California Great Registers, a collection of 57 million voter registrations from 1900 to 1968 that comprise the only panel data set of party registration collected before the advent of scientific surveys.

研究动机与目标

  • 解决在缺乏干净准标识符的大规模数据集中,贝叶斯概率记录关联的计算不可行性问题。
  • 克服传统阻断方法因依赖易出错的标识符而导致非匹配率升高的局限性。
  • 仅使用标准桌面硬件,实现对包含数十万条记录的数据集的完整后验推断。
  • 提供一种模型无关、数据驱动的方法来近似贝叶斯推断,提升可扩展性的同时不牺牲不确定性量化能力。
  • 将该方法应用于历史选民登记数据,研究新政重组时期个体层面政党归属的变化。

提出的方法

  • 提出事后阻断,一种数据驱动策略,识别并聚焦于匹配状态存在高度模糊性的记录对,从而降低计算负担。
  • 在模型拟合后应用此阻断策略,避免依赖预定义或标记的阻断键,使其适用于噪声较大、历史性的数据。
  • 使用贝叶斯分层模型估计匹配概率,结合姓名、地址、职业及其他属性的比较函数,并引入m-参数和u-参数。
  • 在事后阻断识别出的模糊记录对子集中,通过马尔可夫链蒙特卡洛(MCMC)方法进行后验抽样。
  • 利用Julia编程语言及公开发布的软件包(BayesianRecordLinkage.jl)确保结果可复现且性能优越。
  • 采用U校正方法以稳定参数估计并提升模型校准效果,尤其在存在部分匹配的情况下。

实验结果

研究问题

  • RQ1在不依赖高质量阻断键的前提下,贝叶斯概率记录关联能否扩展至包含数十万条记录的数据集?
  • RQ2事后阻断在保持贝叶斯推断不确定性量化优势的同时,如何提升计算效率?
  • RQ3对关联后的历史选民登记数据进行贝叶斯推断,在多大程度上能揭示新政时期个体层面的政党归属变化模式?
  • RQ4与fastLink等现有方法相比,该方法在匹配概率估计的准确性及对数据错误的鲁棒性方面表现如何?
  • RQ5模型误设或约束违反(如一对一匹配)对大规模历史数据中关联质量的影响是什么?

主要发现

  • 所提出的方法仅用一台计算机在数小时内即可对来自加利福尼亚州大名册的超过26万条选民记录实现完整后验推断。
  • 事后阻断将需进行完整贝叶斯推断的记录对数量减少至可管理的子集,使计算聚焦于最模糊的匹配对。
  • 贝叶斯模型能以高后验概率正确识别完全匹配项(例如,姓名、职业和地址完全相同的William Brown),而fastLink则会错误地为非匹配对分配高概率。
  • 贝叶斯模型的匹配概率估计对缺失或不一致的数据(如地址和职业的OCR错误)具有鲁棒性,并在不同比较类型间保持匹配概率的逻辑排序。
  • 该方法揭示,政党转换在个体间并非均匀分布:大量在1932年登记为共和党的选民在1936年转为民主党,尤其集中在工人阶级和城市人口中。
  • 与fastLink相比,该模型的后验估计更可靠,即使存在多个相似候选对象,也不会错误地将匹配概率分配给错误的匹配对——例如,贝叶斯模型对错误匹配对的匹配概率始终为零,而fastLink的估计则存在缺陷。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。