Skip to main content
QUICK REVIEW

[论文解读] Author Name Disambiguation in Bibliographic Databases: A Survey

Muhammad Shoaib, Ali Daud|arXiv (Cornell University)|Apr 14, 2020
Data Quality and Management参考文献 95被引用 10
一句话总结

本综述提出了一种用于书目数据库中作者姓名消歧的全面框架,采用五步法:数据集准备、属性选择、相似性度量应用、模型选择及聚类评估。系统性地对相似性度量和模型进行分类,为解决DBLP、Citeseer和Scopus等系统中的作者身份冲突问题提供了结构化方法,主要贡献在于分类体系构建与未来研究方向指引。

ABSTRACT

Entity resolution is a challenging and hot research area in the field of Information Systems since last decade. Author Name Disambiguation (AND) in Bibliographic Databases (BD) like DBLP , Citeseer , and Scopus is a specialized field of entity resolution. Given many citations of underlying authors, the AND task is to find which citations belong to the same author. In this survey, we start with three basic AND problems, followed by need for solution and challenges. A generic, five-step framework is provided for handling AND issues. These steps are; (1) Preparation of dataset (2) Selection of publication attributes (3) Selection of similarity metrics (4) Selection of models and (5) Clustering Performance evaluation. Categorization and elaboration of similarity metrics and methods are also provided. Finally, future directions and recommendations are given for this dynamic area of research.

研究动机与目标

  • 解决DBLP、Citeseer和Scopus等书目数据库中的作者姓名歧义问题。
  • 识别现有实体消解方法中作者姓名消歧方法的核心问题与局限性。
  • 提出一种通用的五步框架,以系统化处理作者消歧任务。
  • 对AND研究中使用的相似性度量和模型进行分类与分析。
  • 为推进该领域发展提供未来研究方向与建议。

提出的方法

  • 本文提出五步框架:(1) 数据集准备,(2) 选择出版物属性(如标题、会议/期刊、合作者),(3) 应用相似性度量(如Jaccard、余弦相似度、编辑距离),(4) 模型选择(如聚类、分类、学习排序),(5) 使用标准指标进行性能评估。
  • 将相似性度量分类为基于内容的(如标题、摘要)和基于元数据的(如会议/期刊、合作者)类型,并详细描述其使用方法与局限性。
  • 该框架支持无监督与有监督学习方法,特别强调聚类技术在将同一作者的引用归为一组中的应用。
  • 采用标准信息检索与聚类指标(如F1值、精确率、召回率、Rand指数)评估模型性能。
  • 该方法在多种书目数据库中得到应用,凸显了数据质量与结构的差异。
  • 通过推荐标准化评估协议与基准数据集,强调可复现性。

实验结果

研究问题

  • RQ1书目数据库中作者姓名消歧的根本挑战是什么?
  • RQ2如何设计一种标准化、可复用的框架,以应对异构数据源中的AND问题?
  • RQ3在不同类型书目数据中,哪些相似性度量与模型表现最佳?
  • RQ4AND系统的性能指标与评估策略的关键是什么?
  • RQ5作者消歧研究中的开放性研究空白与未来方向有哪些?

主要发现

  • 五步框架为AND提供了系统化且可扩展的方法,提升了研究间的可复现性与可比性。
  • 在低噪声环境下,基于元数据的相似性度量(如合作者网络、发表会议/期刊)通常优于基于内容的度量。
  • 结合多种相似性度量的混合方法在消歧准确率上优于单一度量方法。
  • 聚类模型仍占主导地位,但有监督与深度学习方法在具备足够标注数据时展现出日益增长的潜力。
  • 性能评估在不同研究中仍不一致,凸显了建立标准化基准的迫切需求。
  • 未来研究应聚焦于低资源环境、跨数据库对齐,以及知识图谱的集成以提升消歧效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。