Skip to main content
QUICK REVIEW

[论文解读] LDKP: A Dataset for Identifying Keyphrases from Long Scientific Documents

Debanjan Mahata, Naveen Agarwal|arXiv (Cornell University)|Mar 29, 2022
Advanced Text Analysis Techniques被引用 6
一句话总结

本文介绍了LDKP,一个包含约130万篇和10万篇长科学文献的大规模数据集,涵盖全文内容和丰富的元数据,旨在解决现有关键词提取(KPE)和关键词生成(KPG)数据集依赖于短标题和摘要所带来的局限性。通过将现有的KP20K和OAGKx关键词数据集映射到S2ORC语料库中的全文论文,LDKP将文档平均长度从约8句提升至190句以上,同时将输入文本中关键词的比例从约53%提高到最高76%,从而实现了对长篇真实世界文档中KPE/KPG模型的更真实评估。

ABSTRACT

Identifying keyphrases (KPs) from text documents is a fundamental task in natural language processing and information retrieval. Vast majority of the benchmark datasets for this task are from the scientific domain containing only the document title and abstract information. This limits keyphrase extraction (KPE) and keyphrase generation (KPG) algorithms to identify keyphrases from human-written summaries that are often very short (approx 8 sentences). This presents three challenges for real-world applications: human-written summaries are unavailable for most documents, the documents are almost always long, and a high percentage of KPs are directly found beyond the limited context of title and abstract. Therefore, we release two extensive corpora mapping KPs of ~1.3M and ~100K scientific articles with their fully extracted text and additional metadata including publication venue, year, author, field of study, and citations for facilitating research on this real-world problem.

研究动机与目标

  • 解决现有关键词提取(KPE)和关键词生成(KPG)研究中因依赖短篇人工撰写的摘要而非完整科学文献而产生的关键空白。
  • 克服现有数据集的局限性,这些数据集将关键词识别限制在仅8至10句话内,无法反映现实世界中文档的长度和内容分布。
  • 提供一个可扩展、公开可用的数据集,包含完整科学文章及其关联关键词,以支持现代深度学习模型的训练与评估。
  • 通过包含出版场所、年份、作者、引用及引用上下文等丰富元数据,促进长文档关键词提取的研究。
  • 在长文档上评估KPE/KPG模型,使输入文本中关键词的比例更高——LDKP3K中最高达76.11%,远超现有数据集的约50%–57%。

提出的方法

  • 使用论文标题作为链接键,将现有的关键词数据集(KP20K和OAGKx)映射到S2ORC语料库中的完整科学论文。
  • 通过将变体形式(如'1. Introduction'、'I. Introduction')统一替换为标准化的章节标题格式(如'Introduction'、'Methodology'),实现所有文档中章节标题的一致化。
  • 过滤掉低质量关键词,如单字词、纯数字条目以及错误解析的短语(如'2,4- dichlorophenoxyacetic acid'被拆分为多个标记)。
  • 为LDKP3K(10万篇文档)和LDKP10K(130万篇文档)创建三个数据划分(小、中、大),以支持在计算资源受限平台上的训练。
  • 保留学科领域、引用及元数据信息(如出版场所、年份、DOI、PubMed ID),以增强数据集在下游研究中的价值。
  • 通过仔细采样和手动验证标题冲突,确保学科领域在训练、验证和测试划分中分布均衡。

实验结果

研究问题

  • RQ1当在长篇科学文献而非短篇摘要上进行评估时,现有KPE和KPG模型的泛化能力如何?
  • RQ2当文档平均长度从约8句提升至190句以上时,输入文本中关键词的比例会如何变化?
  • RQ3在包含丰富元数据(如引用、出版场所、年份)的全文文档上训练的模型,其关键词提取性能是否优于仅在摘要数据上训练的模型?
  • RQ4文档长度和关键词分布对现代深度学习模型在关键词提取与生成任务中的性能有何影响?
  • RQ5不同数据划分(小、中、大)如何影响大规模数据集上KPE/KPG研究的可复现性与可扩展性?

主要发现

  • LDKP3K数据集包含10万篇完整科学论文,每篇平均280.67句话,是现有数据集平均句数(8.87句)的30倍。
  • LDKP10K数据集包含130万篇完整科学论文,每篇平均194.76句话,显著扩展了长文档KPE数据的规模。
  • 输入文本中可找到的关键词比例从OAGKx的52.7%提升至LDKP10K的63.65%,从KP20K的57.4%提升至LDKP3K的76.11%,表明输入覆盖度有显著提升。
  • LDKP数据集包含丰富的元数据,如出版场所、年份、作者、引用及引用上下文,支持更细致的下游分析与模型训练。
  • 数据集以多种规模(小、中、大)提供,支持在Google Colab等计算资源有限的平台上训练,提升了计算资源有限的研究人员的可及性。
  • 训练、验证和测试划分中的学科领域分布均衡,如图1和图2的可视化结果所示,确保了模型评估的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。