Skip to main content
QUICK REVIEW

[论文解读] Scalable Multi-Database Privacy-Preserving Record Linkage using Counting Bloom Filters

Dinusha Vatsalan, Peter Christen|arXiv (Cornell University)|Jan 5, 2017
Data Quality and Management参考文献 35被引用 5
一句话总结

本文提出了一种可扩展的、隐私保护的记录关联(PPRL)方法,用于多个数据库之间的数据匹配,利用计数布隆过滤器(CBFs)实现对基于字符串的准标识符的高效近似匹配。通过结合CBFs与优化的通信模式(有无专用关联单元),该方法在显著降低通信和计算成本的同时,实现了高质量的关联结果和强大的隐私保护。

ABSTRACT

Privacy-preserving record linkage (PPRL) aims at integrating sensitive information from multiple disparate databases of different organizations. PPRL approaches are increasingly required in real-world application areas such as healthcare, national security, and business. Previous approaches have mostly focused on linking only two databases as well as the use of a dedicated linkage unit. Scaling PPRL to more databases (multi-party PPRL) is an open challenge since privacy threats as well as the computation and communication costs for record linkage increase significantly with the number of databases. We thus propose the use of a new encoding method of sensitive data based on Counting Bloom Filters (CBF) to improve privacy for multi-party PPRL. We also investigate optimizations to reduce communication and computation costs for CBF-based multi-party PPRL with and without the use of a dedicated linkage unit. Empirical evaluations conducted with real datasets show the viability of the proposed approaches and demonstrate their scalability, linkage quality, and privacy protection.

研究动机与目标

  • 解决在医疗、国家安全和商业应用等敏感数据整合场景下,多数据库间多参与方便记录关联所面临的可扩展性和隐私挑战。
  • 克服现有PPRL方法在仅支持两方关联或精确匹配方面的局限,尤其针对存在错误和变体的基于字符串的准标识符。
  • 设计一种高效、隐私保护的框架,通过CBFs和安全求和机制实现对准标识符的近似匹配,从而降低通信和计算开销。
  • 研究并优化基于CBF的多参与方PPRL的通信模式——环形通信与关联单元辅助通信,以提升性能和可扩展性。
  • 通过自顶向下的泛化和安全聚合,最小化原始数据暴露,确保强隐私保障,实现k-匿名性。

提出的方法

  • 使用计数布隆过滤器(CBFs)对来自多个数据库的准标识符(如姓名、地址)进行编码,实现高效且私密的近似匹配。
  • 应用安全求和协议,将多个参与方的CBFs合并为每个候选记录集的单一全局CBF,从而在不暴露个体数据的情况下实现相似性计算。
  • 采用环形通信模式实现去中心化的关联(无需专用关联单元),降低通信成本,提升可扩展性。
  • 引入由关联单元辅助的通信模式,即可信的关联单元接收并比较所有参与方的CBFs,实现集中式的相似性评估。
  • 集成私密的阻塞与过滤技术,以减少候选集规模,最小化昂贵的相似性比较操作。
  • 采用Dice系数作为CBFs之间的相似性度量,以评估匹配可能性,实现对噪声字符串数据的近似匹配。

实验结果

研究问题

  • RQ1在多参与方PPRL场景下,如何有效利用计数布隆过滤器实现跨多个数据库的可扩展且私密的近似匹配?
  • RQ2在多参与方PPRL中,环形通信与关联单元辅助通信哪种通信模式能最佳平衡隐私保护、通信效率与计算性能?
  • RQ3CBF-based PPRL能否在扩展至大量数据库和记录规模时,仍保持高关联质量与强隐私保护?
  • RQ4与传统基于布隆过滤器的方法相比,安全求和与CBF聚合如何降低通信和计算开销?
  • RQ5在多参与方PPRL中,过滤与阻塞技术对减少候选集规模及提升整体关联效率有何影响?

主要发现

  • 所提出的基于CBF的PPRL方法相比基线方法显著降低了通信和计算成本,尤其在多参与方场景下优势明显。
  • 环形通信模式通过避免将单个布隆过滤器传输至中心节点,降低了通信开销,提升了可扩展性。
  • 通过安全求和与CBF聚合,实现了无需暴露原始准标识符值的准确相似性计算,有效保护了隐私。
  • 在真实数据集上的实证评估表明,该方法保持了高关联质量,F1值及精确率/召回率与现有方法相当或更优。
  • 该方法在数据库数量和记录规模增加时仍能高效扩展,证明了其在医疗、国家安全等现实应用中的可行性。
  • 集成私密阻塞与过滤技术显著减少了候选集数量,最小化了昂贵的相似性比较操作,整体性能得到提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。