Skip to main content
QUICK REVIEW

[論文レビュー] ParaSCI: A Large Scientific Paraphrase Dataset for Longer Paraphrase Generation

Qingxiu Dong, Xiaojun Wan|arXiv (Cornell University)|Jan 21, 2021
Topic Modeling参考文献 23被引用数 4
ひとこと要約

ParaSCI は、ACL および arXiv から抽出した 350,044 ペair のパラフレーズを含む大規模な科学的パラフレーズデータセットであり、繰り返し寄与や用語定義といったインラインおよびインターペーパーのパターンを用いて構築されたものである。このデータセットにより、長文の科学的パラフレーズ生成が効果的に可能となり、Quora や MSCOCO といった一般ドメインのデータセットで訓練されたモデルとは異なり、ParaSCI で訓練されたモデルはより長く、多様性に富み、知識が豊富な出力を生成する。

ABSTRACT

We propose ParaSCI, the first large-scale paraphrase dataset in the scientific field, including 33,981 paraphrase pairs from ACL (ParaSCI-ACL) and 316,063 pairs from arXiv (ParaSCI-arXiv). Digging into characteristics and common patterns of scientific papers, we construct this dataset though intra-paper and inter-paper methods, such as collecting citations to the same paper or aggregating definitions by scientific terms. To take advantage of sentences paraphrased partially, we put up PDBERT as a general paraphrase discovering method. The major advantages of paraphrases in ParaSCI lie in the prominent length and textual diversity, which is complementary to existing paraphrase datasets. ParaSCI obtains satisfactory results on human evaluation and downstream tasks, especially long paraphrase generation.

研究の動機と目的

  • 科学分野における大規模かつ長文のパラフレーズデータセットの不足に起因する科学的パラフレーズ生成の障害を解消すること。
  • 完全な文だけでなく、部分的にパラフレーズされたセグメントに対してもパラフレーズを発見する手法を開発し、既存の科学的テキストの利用を最大化すること。
  • 科学的 NLP タスク、特に生成およびデータ拡張を想定して、高品質で多様性に富み、長文のパラフレーズデータセットを構築すること。
  • 科学的に正確で、文脈的に豊富で、構造的に複雑なパラフレーズを生成できるニューラルモデルの訓練を可能にすること。

提案手法

  • インラインペーパー手法(例:繰り返し寄与)およびインターペーパー手法(例:同一の研究への引用、複数の論文における同一用語の定義)を用いてパラフレーズペアを抽出することで、ParaSCI を構築する。
  • 部分的にパラフレーズされた文の間で意味的に同等の部分を特定できるように、微調整された BERT モデル PDBERT を設計する。
  • 既存のパラフレーズペアをつなぎ合わせることで、PDBERT の部分的パラフレーズ発見のための偽トレーニングデータを生成する。
  • 人間による評価と自動指標を用いて候補となるパラフレーズペアをフィルタリングおよび検証し、高品質を確保する。
  • 2 つのサブセットをリリースする:ParaSCI-ACL(33,981 ペア)および ParaSCI-arXiv(316,063 ペア)、両方とも公開可能である。
  • ParaSCI で訓練および評価したパラフレーズ生成モデルを、Quora や MSCOCO で訓練したモデルと比較して性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1インラインおよびインターペーパーのパターンを用いて、科学文献から体系的に大規模かつ長文のパラフレーズデータセットを構築できるか?
  • RQ2PDBERT のようなモデルは、科学的テキストにおける部分的パラフレーズセグメントを効果的に同定できるか?これにより、データ利用が向上するか?
  • RQ3ParaSCI で訓練されたパラフレーズ生成モデルは、一般ドメインのデータセットと比較して、長く複雑な科学的文に対して優れた性能を示すか?
  • RQ4ParaSCI で訓練されたモデルは、生成されたパラフレーズに科学用語、省略語、分野固有の知識をどの程度組み込んでいるか?

主な発見

  • ParaSCI には 350,044 件の高品質なパラフレーズペアが含まれており、ACL から 33,981 ペア、arXiv から 316,063 ペアが含まれており、これは最初の大規模な科学的パラフレーズデータセットである。
  • Quora や MSCOCO で訓練されたモデルとは異なり、ParaSCI で訓練されたモデルは、より長く、構造的に複雑で、科学用語が豊富に含まれ、適切な省略語の使用がなされた出力を生成する。一方、Quora や MSCOCO で訓練されたモデルは、短く、不完全または構造的に類似した出力しか生成しない。
  • PDBERT は、部分的にパラフレーズされた文の意味的に同等の部分を効果的に同定でき、そうでなければ無視されてしまう貴重なパラフレーズパターンの発見を可能にした。
  • 人間による評価により、ParaSCI からのパラフレーズは、特に長文の科学的コンテンツにおいて、より多様で文脈的に適切であることが確認された。
  • ParaSCI で訓練されたモデルが生成した文には、エンティティのサイズ(例:Penn Discourse Treebank に 2,312 節の記事がある)や技術的省略語(例:フレーズベースの MT システムを指す「moses」)といった分野固有の知識が含まれている。
  • このデータセットは高い転送性を示しており、長文のパラフレーズ生成において、自動評価および人間評価の両方で、一般データセットで訓練されたモデルよりも、ParaSCI で訓練されたモデルが優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。