Skip to main content
QUICK REVIEW

[论文解读] Librarian-in-the-Loop: A Natural Language Processing Paradigm for Detecting Informal Mentions of Research Data in Academic Literature

Lizhou Fan, Sara Lafia|arXiv (Cornell University)|Mar 10, 2022
Topic Modeling被引用 4
一句话总结

本文提出了一种‘图书馆员参与其中’的自然语言处理(NLP)范式,用于检测学术文献中非正式提及的研究数据集,结合迭代式人工标注与机器学习,以提升数据集名称的命名实体识别(NER)性能。该方法利用ICPSR图书馆员的专业知识生成高质量训练数据,从而构建出一个稳健、领域特定的NLP模型,增强数据引用发现能力,并支持全面的研究数据影响力度量。

ABSTRACT

Data citations provide a foundation for studying research data impact. Collecting and managing data citations is a new frontier in archival science and scholarly communication. However, the discovery and curation of research data citations is labor intensive. Data citations that reference unique identifiers (i.e. DOIs) are readily findable; however, informal mentions made to research data are more challenging to infer. We propose a natural language processing (NLP) paradigm to support the human task of identifying informal mentions made to research datasets. The work of discovering informal data mentions is currently performed by librarians and their staff in the Inter-university Consortium for Political and Social Research (ICPSR), a large social science data archive that maintains a large bibliography of data-related literature. The NLP model is bootstrapped from data citations actively collected by librarians at ICPSR. The model combines pattern matching with multiple iterations of human annotations to learn additional rules for detecting informal data mentions. These examples are then used to train an NLP pipeline. The librarian-in-the-loop paradigm is centered in the data work performed by ICPSR librarians, supporting broader efforts to build a more comprehensive bibliography of data-related literature that reflects the scholarly communities of research data users.

研究动机与目标

  • 解决在正式引用系统中常被忽略的学术文献中非正式提及研究数据集的挑战。
  • 通过自动化检测非正式数据集引用,减轻数据引用目录手工整理的工作负担。
  • 通过捕捉具有持久标识符之外的提及,提升ICPSR数据相关文献目录的完整性。
  • 开发一种可扩展的、人机协同的NLP流水线,整合领域专业知识与机器学习,以提升检测数据集提及的性能。
  • 通过更广泛地发现学术文献中数据的再利用,支持更准确的研究数据影响力度量的构建。

提出的方法

  • 基于正则表达式和关键词模式,采用三级句子提取方法(HIGH、MID、LOW),识别包含潜在数据集提及的候选句子。
  • 使用Prodigy进行迭代式NER标注,包含三种标注模式:ner.manual(初始标注)、ner.correct(错误修正)和ner.teach(对模型预测进行二元接受/拒绝)。
  • 借助图书馆员的专业知识,迭代优化NER标签(DATASET跨度)并改进基于规则的模式,提升模型的泛化能力与准确性。
  • 在累积的人工标注数据上训练基于机器学习的NER模型,利用图书馆员的领域知识在反馈循环中启动并优化模型。
  • 将基于模式的检测(如“American National Election Survey”、“ANES”)与学习型NER相结合,提升识别数据集名称及缩写的精确度。
  • 将所得高质量、领域特定的数据集作为未来学术传播与科学学研究中NLP研究的基准。

实验结果

研究问题

  • RQ1当研究数据集在学术文献中非正式提及且缺乏持久标识符时,如何系统性地检测这些提及?
  • RQ2当图书馆员专业知识以迭代方式整合进NLP模型训练时,与纯自动化方法相比,其在提升数据集提及检测能力方面有多大程度的改善?
  • RQ3将基于规则的模式匹配与人机协同NER标注相结合,对模型性能与标注效率有何影响?
  • RQ4‘图书馆员参与其中’的工作流程能否生成高质量、可重用的NLP训练数据集,以检测学术文本中的数据集提及?
  • RQ5该方法如何支持在社会科学研究群体中开发更全面的研究数据影响力度量?

主要发现

  • ‘图书馆员参与其中’的NLP范式通过结合人类专业知识与迭代模型训练,显著提升了对非正式数据集提及的检测能力。
  • 在Prodigy中使用迭代标注(ner.manual、ner.correct、ner.teach)可实现复杂或模糊语境下数据集名称跨度的高效且准确标注。
  • 该模型在识别数据集提及方面实现了高精确度,使图书馆员能将整理工作集中于高置信度候选对象,而非进行全面的手动筛查。
  • 所生成的NER模型与标注数据集可作为未来计算社会科学与学术传播研究的高质量基准。
  • 该方法使ICPSR目录得以扩展,涵盖更广泛的数据再利用引用,从而增强数据影响力度量的全面性。
  • 该工作流程具备可扩展性与适应性,为资源有限的机构,特别是社会科学数据档案馆,提供可持续的数据整理范式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。