Skip to main content
QUICK REVIEW

[论文解读] Two Huge Title and Keyword Generation Corpora of Research Articles

Erion Çano, Ondřej Bojar|arXiv (Cornell University)|Feb 11, 2020
Advanced Text Analysis Techniques参考文献 48被引用 4
一句话总结

本文介绍了两个大规模、公开可用的语料库——OAGSX(3400万条记录)用于文本摘要,OAGKX(2300万条记录)用于关键词生成——其数据源自开放学术图谱(Open Academic Graph)。作者对科研论文元数据进行预处理,并采用抽取式与生成式神经方法建立性能基线,结果表明尽管训练时间更长,生成式模型在性能上仍优于抽取式模型。

ABSTRACT

Recent developments in sequence-to-sequence learning with neural networks have considerably improved the quality of automatically generated text summaries and document keywords, stipulating the need for even bigger training corpora. Metadata of research articles are usually easy to find online and can be used to perform research on various tasks. In this paper, we introduce two huge datasets for text summarization (OAGSX) and keyword generation (OAGKX) research, containing 34 million and 23 million records, respectively. The data were retrieved from the Open Academic Graph which is a network of research profiles and publications. We carefully processed each record and also tried several extractive and abstractive methods of both tasks to create performance baselines for other researchers. We further illustrate the performance of those methods previewing their outputs. In the near future, we would like to apply topic modeling on the two sets to derive subsets of research articles from more specific disciplines.

研究动机与目标

  • 为神经序列到序列模型在文本摘要与关键词生成任务中日益增长的大规模训练数据需求提供解决方案。
  • 从科研论文元数据中创建并发布两个大规模、高质量、可自由访问的语料库。
  • 在数据的代表性子集上,使用抽取式与生成式方法建立性能基准。
  • 通过全量数据的主题建模,为未来研究提供特定主题的子语料库支持。

提出的方法

  • 从开放学术图谱(OAG)——一个大规模学术知识网络——中获取元数据(标题、摘要、关键词)。
  • 对数据进行细致的清洗与预处理,确保3400万条OAGSX与2300万条OAGKX记录在一致性和质量上达到高标准。
  • 评估多种抽取式与生成式模型:TopicRank、RAKE、Maui(有监督抽取式)、CopyRNN与CovRNN(具备注意力、覆盖与复制机制的生成式模型)。
  • 使用ROUGE分数评估文本摘要性能,使用F1@k评估关键词生成性能,比较从语料库中提取的迷你数据集上的模型表现。
  • 采用带有注意力、覆盖与复制机制的神经序列到序列模型,以提升生成式关键词生成的效果。
  • 对文本长度及摘要、标题与关键词之间的词汇相似性进行统计分析,以刻画语料库的特征。

实验结果

研究问题

  • RQ1在大规模科研论文标题与关键词生成任务中,抽取式与生成式神经模型的性能表现如何比较?
  • RQ2模型架构与训练时间对生成标题与关键词的质量有何影响?
  • RQ3大规模、免费可用的科研论文元数据语料库能否显著提升文本摘要与关键词生成系统的性能?
  • RQ4具备复制与覆盖机制的生成式模型在多大程度上能减少关键词生成中的幻觉与重复现象?
  • RQ5对这些语料库进行主题建模,能否生成用于更聚焦研究的领域特定子语料库?

主要发现

  • 生成式模型如CopyRNN与CovRNN在F1@7指标上达到峰值29.15%,显著高于抽取式方法,表明其在关键词生成任务中表现更优。
  • 生成式模型,尤其是CovRNN,在OAGKX基准测试中全面超越所有抽取式方法,包括Maui、TopicRank与RAKE。
  • 训练生成式模型约需三天时间,而抽取式方法仅需数分钟,凸显性能与计算成本之间的权衡。
  • 平均每篇论文的关键词数量为5.9个,这解释了各类方法在F1@7与F1@10指标上的表现相近。
  • 尽管生成的关键词在语法上正确,但许多存在与真实标签部分或完全不匹配的情况,部分模型还生成了新颖但错误的短语,如“大鼠死亡率”(mortality of rats)。
  • 据作者所知,OAGSX与OAGKX语料库是目前同类中规模最大的、可自由获取的科研论文标题与关键词生成任务数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。