Skip to main content
QUICK REVIEW

[论文解读] A DNF Blocking Scheme Learner for Heterogeneous Datasets

Mayank Kejriwal, Daniel P. Miranker|arXiv (Cornell University)|Jan 8, 2015
Data Quality and Management参考文献 22被引用 9
一句话总结

本论文提出了首个针对异构数据集(包括RDF图和结构差异显著的表格)的无监督DNF阻断方案学习器。它通过属性表实现动态模式构建,并采用基于实例的模式匹配器(Dumas),在无需人工标注的情况下实现有效阻断,其性能在六个真实世界数据集对上与监督基线方法相当。

ABSTRACT

Entity Resolution concerns identifying co-referent entity pairs across datasets. A typical workflow comprises two steps. In the first step, a blocking method uses a one-many function called a blocking scheme to map entities to blocks. In the second step, entities sharing a block are paired and compared. Current DNF blocking scheme learners (DNF-BSLs) apply only to structurally homogeneous tables. We present an unsupervised algorithmic pipeline for learning DNF blocking schemes on RDF graph datasets, as well as structurally heterogeneous tables. Previous DNF-BSLs are admitted as special cases. We evaluate the pipeline on six real-world dataset pairs. Unsupervised results are shown to be competitive with supervised and semi-supervised baselines. To the best of our knowledge, this is the first unsupervised DNF-BSL that admits RDF graphs and structurally heterogeneous tables as inputs.

研究动机与目标

  • 为解决在RDF图和结构差异显著的表格等异构数据模型中,DNF阻断方案学习器的缺失问题。
  • 实现在无需预先存在或完美模式映射的前提下,无监督学习DNF阻断方案。
  • 通过与现有无监督第二步实体解析方法集成,支持端到端的无监督实体解析。
  • 仅使用两个可调参数,在真实世界异构数据集对上展示出稳健性能。
  • 提供一个通用流程,可将先前的DNF-BSL方法作为特例涵盖,同时处理模式异构性和噪声。

提出的方法

  • 通过运行时提取属性,构建RDF数据集的动态属性表表示,实现在无静态元数据的情况下进行模式推断。
  • 使用基于实例的模式匹配器(Dumas)生成噪声模式映射和重复项候选,将其作为训练信号循环利用。
  • 采用仅含两个参数(k:析取项数量,κ:重复项置信度阈值)的DNF-BSL,实现稳健的无监督方案学习。
  • 引入一种新型GBPs(广义布尔谓词)集合G,以表达复杂阻断条件,提升方案的表达能力。
  • 在模式匹配不可用时,通过回退机制集成流程,确保广泛适用性。
  • 通过理论运行时间分析与实证验证,确认其可扩展性与性能表现。

实验结果

研究问题

  • RQ1无监督DNF阻断方案学习器能否有效应用于异构数据集,包括RDF图和结构差异显著的表格?
  • RQ2在存在模式异构性的情况下,所提出的无监督流程性能与监督及半监督基线方法相比如何?
  • RQ3在无需人工调参的情况下,极简参数配置(k和κ)在多样化领域中能达到多大程度的稳健性能?
  • RQ4使用动态属性表表示是否能有效支持缺乏正式模式的RDF数据集的阻断?
  • RQ5与增加k相比,GBPs集合G的表达能力对性能与可扩展性的影响如何?

主要发现

  • 尽管未使用人工标注的训练数据,该无监督流程在六个真实世界数据集对上的性能与监督基线方法相当。
  • 即使在存在噪声模式映射的情况下,系统仍保持高性能,表明对不完美模式匹配具有鲁棒性。
  • 与增加k相比,使用更具表达力的GBPs集合G可显著提升性能,且统计上具有显著优势。
  • 仅需少量噪声样本(低n)即可达到足够性能,验证了该方法在工业应用中的高效性与实用性。
  • 该流程的运行时间可随k值可预测地扩展,实证结果证实了理论运行时间计算,支持其可扩展性。
  • 该方法可将先前的DNF-BSL方法作为特例涵盖,适用于同构表格、RDF数据集以及RDF-表格异构性场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。