[论文解读] Scaling Author Name Disambiguation with CNF Blocking
本文提出了一种新颖的合取范式(CNF)阻断方法,用于在大型学术数据库(如PubMed)中实现可扩展的作者姓名消歧(AND)。通过学习以CNF形式表示的阻断谓词——在逻辑上与传统的DNF方法互为对偶——该方法在10.5分钟内减少了82.17%的候选配对,同时保持了高完整性(PC=0.99),并通过生成互不相交的块实现了高效的并行聚类。
An author name disambiguation (AND) algorithm identifies a unique author entity record from all similar or same publication records in scholarly or similar databases. Typically, a clustering method is used that requires calculation of similarities between each possible record pair. However, the total number of pairs grows quadratically with the size of the author database making such clustering difficult for millions of records. One remedy for this is a blocking function that reduces the number of pairwise similarity calculations. Here, we introduce a new way of learning blocking schemes by using a conjunctive normal form (CNF) in contrast to the disjunctive normal form (DNF). We demonstrate on PubMed author records that CNF blocking reduces more pairs while preserving high pairs completeness compared to the previous methods that use a DNF with the computation time significantly reduced. Thus, these concepts in scholarly data can be better represented with CNFs. Moreover, we also show how to ensure that the method produces disjoint blocks so that the rest of the AND algorithm can be easily paralleled. Our CNF blocking tested on the entire PubMed database of 80 million author mentions efficiently removes 82.17% of all author record pairs in 10 minutes.
研究动机与目标
- 解决在PubMed等大规模学术数据库中作者姓名消歧(AND)的可扩展性挑战,其中配对相似度计算随记录数量呈二次增长。
- 克服启发式阻断方法的低效性和不平衡性,特别是由于常见姓氏导致极大块状数据,从而主导计算时间。
- 在现有基于DNF的机器学习阻断方法基础上进行改进,提出一种在逻辑上与之对偶的基于CNF的方法,实现更快的早期拒绝和更高的完整性。
- 通过将CNF阻断方法扩展为生成互不相交的块,确保与并行聚类的兼容性,避免块间记录重叠。
- 在完整PubMed数据库(8000万条作者提及)上验证该方法的有效性,实现高配对减少率且计算成本低。
提出的方法
- 使用合取范式(CNF)学习阻断函数,其中每个阻断谓词是析取项的合取(例如,(fn,first(5)) ∨ (fn,compatible)),从而实现对非匹配配对的高效早期拒绝。
- 使用基于增益函数(如F1分数、Jaccard系数)的贪心顺序覆盖算法,迭代选择最优谓词项加入CNF公式,以优化完整性和效率。
- 通过在第一阶段强制采用纯合取结构,将CNF阻断扩展为生成互不相交的块,确保每条记录仅属于一个块,从而实现聚类阶段的原生并行化。
- 利用CNF与DNF之间的逻辑对偶性:DNF使用合取的析取,而CNF使用析取的合取,从而实现对非匹配配对的更快剪枝。
- 引入一种新谓词“compatible”,用于处理缺失或模糊的值(如中间名、名字变体),提升在真实学术数据中的鲁棒性。
- 在PubMed数据上采用监督式训练设置评估该方法,通过PC(配对完整性)和RR(减少率)指标与DNF阻断和遮罩聚类方法进行性能对比。
实验结果
研究问题
- RQ1基于CNF的阻断方法是否在作者姓名消歧任务中,相较于现有基于DNF的机器学习阻断方法,在配对减少率、完整性和处理速度方面表现更优?
- RQ2由于CNF阻断能够实现对非匹配配对的早期拒绝,是否能实现比DNF阻断更快的处理速度?
- RQ3能否在不显著损失完整性的前提下,将CNF阻断方法扩展为生成互不相交的块,从而实现高效的并行聚类?
- RQ4在真实世界的大规模数据库(如PubMed,8000万条作者提及)上,所提出的CNF阻断方法在配对减少率和运行时间方面的表现如何?
- RQ5“compatible”谓词在处理缺失或可变的姓名字段时,对提升鲁棒性和完整性起到了何种作用?
主要发现
- 该CNF阻断方法在仅用24个线程运行10.5分钟内,即在完整PubMed数据库(8000万条作者提及)中减少了82.17%的全部可能作者记录配对。
- 在配对完整性(PC)为0.99时,CNF阻断的阻断时间为1.39秒,显著快于DNF阻断(2.09秒)和遮罩聚类(0.44秒),尽管遮罩聚类速度最快但召回率较低。
- CNF阻断在完整性和效率方面均优于DNF阻断,尤其在高PC水平(>0.9)时表现更优,表明学术数据概念在CNF形式下表达更佳。
- 学习得到的CNF阻断函数频繁使用“compatible”谓词,表明其在处理缺失或可变姓名字段方面具有显著有效性。
- 互不相交的CNF阻断扩展在PC=0.99时达到1.57秒的阻断时间,实现了原生并行化的聚类阶段。
- CNF方法的逻辑结构支持更快的早期拒绝:由于CNF是析取项的合取,只要有一项析取项不满足,配对即可立即被拒绝,而DNF需检查所有项。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。