Skip to main content
QUICK REVIEW

[论文解读] Random Forest DBSCAN for USPTO Inventor Name Disambiguation

Kunho Kim, Madian Khabsa|arXiv (Cornell University)|Feb 4, 2016
Data Quality and Management参考文献 22被引用 12
一句话总结

本文提出了一种可扩展的、基于机器学习的美国专利商标局(USPTO)专利数据库中的发明人姓名消歧方法,采用随机森林分类器计算成对相似度,并使用DBSCAN进行聚类。该方法在USPTO PatentsView竞赛数据集上达到最先进性能,6.5小时内处理1200万条发明人提及记录,F1分数超过所有竞争算法。

ABSTRACT

Name disambiguation and the subsequent name conflation are essential for the correct processing of person name queries in a digital library or other database. It distinguishes each unique person from all other records in the database. We study inventor name disambiguation for a patent database using methods and features from earlier work on author name disambiguation and propose a feature set appropriate for a patent database. A random forest was selected for the pairwise linking classifier since they outperform Naive Bayes, Logistic Regression, Support Vector Machines (SVM), Conditional Inference Tree, and Decision Trees. Blocking size, very important for scaling, was selected based on experiments that determined feature importance and accuracy. The DBSCAN algorithm is used for clustering records, using a distance function derived from random forest classifier. For additional scalability clustering was parallelized. Tests on the USPTO patent database show that our method successfully disambiguated 12 million inventor mentions within 6.5 hours. Evaluation on datasets from USPTO PatentsView inventor name disambiguation competition shows our algorithm outperforms all algorithms in the competition.

研究动机与目标

  • 解决大规模专利数据库中因常见姓氏、姓名变体及拼写错误导致的发明人姓名歧义问题。
  • 开发针对专利元数据的特征集,以提升与通用作者姓名消歧特征相比的消歧准确率。
  • 设计一种可扩展的并行化系统,能够高效处理数百万条发明人记录。
  • 通过混合随机森林与DBSCAN的流水线,在USPTO PatentsView发明人姓名消歧竞赛中超越现有算法。

提出的方法

  • 基于从专利元数据中提取的自定义特征集(包括姓名变体、隶属关系和出版历史)训练随机森林分类器。
  • 将发明人记录之间的成对相似度计算为随机森林分类器判断为同一发明人的投票比例。
  • 使用随机森林生成的距离函数对DBSCAN聚类进行处理,将记录分组为独立的发明人簇。
  • 应用阻塞策略以降低计算复杂度,并将块分配至多个核心以实现并行处理。
  • 采用内存感知的阻塞策略以管理因常见姓名导致的大块数据,尽管内存仍是瓶颈。
  • 使用标准指标(精确率、召回率和F1分数)在USPTO PatentsView竞赛数据集上评估该方法。

实验结果

研究问题

  • RQ1在发明人姓名消歧任务中,基于专利特异性特征训练的随机森林分类器是否优于SVM、朴素贝叶斯和逻辑回归等传统分类器?
  • RQ2将基于随机森林的相似度函数与DBSCAN聚类结合,是否能获得优于其他聚类或分类方法的消歧准确率?
  • RQ3所提出的阻塞与并行化策略在1200万条记录的专利数据库上对可扩展性与运行时性能有何影响?
  • RQ4与现有解决方案相比,该方法在USPTO PatentsView竞赛中在召回率和F1分数方面提升了多少?

主要发现

  • 该方法在所有测试集上的平均F1分数为0.9882 ± 0.0029,显著优于竞赛优胜者的F1分数0.9827 ± 0.0035(p = 0.03125,单尾Wilcoxon检验)。
  • 随机森林分类器的最小袋外(OOB)误差率为0.05%,表明其在成对分类任务中具有高度可靠性。
  • 系统在12核机器上6.5小时内成功处理了1200万条发明人提及记录,证明了其并行化处理下的强可扩展性。
  • 由于样本量更大且更准确地代表整体数据库分布,该方法在“常见特征”数据集上表现略优。
  • 召回率低于精确率,表明阻塞策略减少了部分真实匹配的检测,提示阻塞策略仍有改进空间。
  • 基于随机森林投票学习的距离函数比手工设计的度量方法更有效,从而实现了更优的聚类性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。