Skip to main content
QUICK REVIEW

[论文解读] ParaSCI: A Large Scientific Paraphrase Dataset for Longer Paraphrase Generation

Qingxiu Dong, Xiaojun Wan|arXiv (Cornell University)|Jan 21, 2021
Topic Modeling参考文献 23被引用 4
一句话总结

ParaSCI 是一个大规模科学改写数据集,包含来自 ACL 和 arXiv 的 350,044 对改写句对,通过论文内和论文间模式(如重复贡献和术语定义)构建而成。该数据集可有效支持长篇科学改写生成,相较于在 Quora 或 MSCOCO 等通用领域数据集上训练的模型,基于 ParaSCI 训练的模型能生成更长、更多样化且富含知识的输出。

ABSTRACT

We propose ParaSCI, the first large-scale paraphrase dataset in the scientific field, including 33,981 paraphrase pairs from ACL (ParaSCI-ACL) and 316,063 pairs from arXiv (ParaSCI-arXiv). Digging into characteristics and common patterns of scientific papers, we construct this dataset though intra-paper and inter-paper methods, such as collecting citations to the same paper or aggregating definitions by scientific terms. To take advantage of sentences paraphrased partially, we put up PDBERT as a general paraphrase discovering method. The major advantages of paraphrases in ParaSCI lie in the prominent length and textual diversity, which is complementary to existing paraphrase datasets. ParaSCI obtains satisfactory results on human evaluation and downstream tasks, especially long paraphrase generation.

研究动机与目标

  • 为解决科学领域中缺乏大规模、长篇改写数据集的问题,该问题阻碍了科学改写生成的发展。
  • 开发一种方法,不仅能在完整句子中发现改写关系,还能在部分改写片段中识别,以最大化利用现有科学文本。
  • 构建一个高质量、多样化且长篇的改写数据集,专为科学 NLP 任务设计,特别是生成任务和数据增强。
  • 实现神经网络模型的训练,使其能够生成科学上准确、上下文丰富且结构复杂的改写句。

提出的方法

  • 通过利用论文内方法(如重复贡献)和论文间方法(如引用同一文献、跨论文对同一术语的定义)提取改写对,构建 ParaSCI 数据集。
  • 设计 PDBERT,一种微调后的 BERT 模型,可识别两句话中语义等价的部分,即使仅部分改写亦可识别。
  • 通过拼接现有改写对生成伪训练数据,用于训练 PDBERT 以发现部分改写片段。
  • 使用人工评估和自动指标对候选改写对进行过滤和验证,以确保数据质量。
  • 发布两个子集:ParaSCI-ACL(33,981 对)和 ParaSCI-arXiv(316,063 对),均公开可用。
  • 在 ParaSCI 上训练并评估改写生成模型,并与在 Quora 和 MSCOCO 上训练的模型进行性能对比。

实验结果

研究问题

  • RQ1能否通过论文内和论文间模式,系统性地从科学文献中构建大规模、长篇改写数据集?
  • RQ2像 PDBERT 这类模型能否有效识别科学文本中的部分改写片段,从而提升数据利用率?
  • RQ3在 ParaSCI 上训练的改写生成模型是否在长篇复杂科学句子上的表现优于在通用领域数据集上训练的模型?
  • RQ4在 ParaSCI 上训练的模型在生成的改写句中,对科学术语、缩写和领域特定知识的使用程度如何?

主要发现

  • ParaSCI 包含 350,044 个高质量改写对——其中 33,981 对来自 ACL,316,063 对来自 arXiv——是首个大规模科学改写数据集。
  • 在 ParaSCI 上训练的模型能生成更长、结构更复杂的句子,且包含更丰富的科学术语和正确的缩写使用方式;而基于 Quora 或 MSCOCO 训练的模型则产生短小、不完整或结构相似的输出。
  • PDBERT 能够成功识别部分改写句子中的语义等价部分,从而发现原本可能被丢弃的宝贵改写模式。
  • 人工评估确认,ParaSCI 生成的改写句更具多样性且上下文更恰当,尤其适用于长篇科学内容。
  • 基于 ParaSCI 训练的模型生成的句子中包含了领域特定知识,例如实体规模(如 Penn Discourse Treebank 包含 2,312 篇文章)和专业缩写(如 'moses' 代表基于短语的机器翻译系统)。
  • 该数据集展现出强大的迁移能力,基于 ParaSCI 训练的模型在长篇改写生成任务中,无论在自动评估还是人工评估中,均优于在通用数据集上训练的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。