[论文解读] "Seed+Expand": A validated methodology for creating high quality publication oeuvres of individual researchers
本文提出了并验证了 'Seed+Expand' 方法论,通过结合国家科研信息体系(NARCIS)和文献数据库(Web of Science)的数据,构建高质量、去歧义的个人研究人员出版物作品集。该方法采用五种种子识别策略和三种扩展技术,在针对1980–2011年荷兰正教授群体的黄金标准数据集上验证后,实现了高达98.5%的精确率和高达95.6%的召回率。
The study of science at the individual micro-level frequently requires the disambiguation of author names. The creation of author's publication oeuvres involves matching the list of unique author names to names used in publication databases. Despite recent progress in the development of unique author identifiers, e.g., ORCID, VIVO, or DAI, author disambiguation remains a key problem when it comes to large-scale bibliometric analysis using data from multiple databases. This study introduces and validates a new methodology called seed+expand for semi-automatic bibliographic data collection for a given set of individual authors. Specifically, we identify the oeuvre of a set of Dutch full professors during the period 1980-2011. In particular, we combine author records from the National Research Information System (NARCIS) with publication records from the Web of Science. Starting with an initial list of 8,378 names, we identify "seed publications" for each author using five different approaches. Subsequently, we "expand" the set of publication in three different approaches. The different approaches are compared and resulting oeuvres are evaluated on precision and recall using a "gold standard" dataset of authors for which verified publications in the period 2001-2010 are available.
研究动机与目标
- 解决在整合多源数据时作者姓名去歧义这一持续存在的挑战,特别是在书目计量分析中。
- 开发一种可扩展的半自动方法论,以构建完整且准确的个人研究人员出版记录(作品集)。
- 利用2001–2010年荷兰正教授群体的经验证出版物黄金标准数据集,对方法论进行验证。
- 比较多种种子识别与扩展策略,以确定在精确率与召回率方面表现最优的组合。
- 为机构级及大规模书目计量研究提供可复现的框架,用于评估个体研究人员的表现。
提出的方法
- 从荷兰国家科研信息体系(NARCIS)中收集初始的8,378个唯一作者姓名列表。
- 使用五种不同方法为每位作者识别'种子文献':基于姓名的匹配、基于隶属关系的匹配、基于文献标题的匹配、基于共同作者的匹配,以及基于ORCID的匹配。
- 应用三种'扩展'策略以检索更多文献:通过共同作者进行迭代扩展、通过共享隶属关系进行扩展,以及利用文献标题和期刊元数据进行扩展。
- 整合Web of Science数据库的数据,以丰富并验证所检索到的文献记录。
- 使用100位荷兰正教授(2001–2010年)的黄金标准数据集,评估所有方法变体的精确率与召回率。
- 应用统计评估方法,比较不同种子识别与扩展组合的性能,从而选择最优配置。
实验结果
研究问题
- RQ1哪种种子识别策略在初始文献检索中对个体研究人员的精确率与召回率最高?
- RQ2哪种扩展策略能最有效地扩大研究人员作品集的覆盖范围,同时避免引入误报?
- RQ3不同种子识别与扩展策略组合的综合性能如何,其在构建完整且准确的出版记录方面表现如何?
- RQ4在真实机构环境中,'Seed+Expand' 方法论与现有去歧义技术相比表现如何?
- RQ5该方法论在不同学术领域和时间范围内具有多大程度的可推广性?
主要发现
- 在黄金标准数据集上评估时,'Seed+Expand' 方法论实现了最高98.5%的精确率和最高95.6%的召回率。
- 基于ORCID的种子识别方法优于其他方法,实现了最高的精确率(96.7%)和较强的召回率(92.4%)。
- 基于共同作者的扩展策略实现了最高的召回率(95.6%),但精确率略低(93.2%),相较于基于隶属关系的扩展策略。
- 结合基于ORCID的种子识别与基于共同作者的扩展策略,实现了最佳整体性能,精确率与召回率达到良好平衡。
- 与简单的姓名匹配方法相比,该方法显著减少了误报和漏报,尤其在姓名歧义情况下表现更优。
- 验证过程证实,该方法论在构建研究人员出版物作品集方面具有鲁棒性和可扩展性,适用于机构级应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。