Skip to main content
QUICK REVIEW

[論文レビュー] Two Huge Title and Keyword Generation Corpora of Research Articles

Erion Çano, Ondřej Bojar|arXiv (Cornell University)|Feb 11, 2020
Advanced Text Analysis Techniques参考文献 48被引用数 4
ひとこと要約

本稿では、オープン学術グラフ(OAG)から抽出した研究論文のメタデータをもとに、テキスト要約用のOAGSX(3400万件)およびキーワード生成用のOAGKX(2300万件)という2つの大規模で公開可能なコーパスを紹介する。著者らは研究論文のメタデータを前処理し、抽出型および要約型のニューラル手法を用いて性能のベンチマークを設定した。その結果、長時間の学習を要するものの、要約型モデルが抽出型モデルを上回ることを示した。

ABSTRACT

Recent developments in sequence-to-sequence learning with neural networks have considerably improved the quality of automatically generated text summaries and document keywords, stipulating the need for even bigger training corpora. Metadata of research articles are usually easy to find online and can be used to perform research on various tasks. In this paper, we introduce two huge datasets for text summarization (OAGSX) and keyword generation (OAGKX) research, containing 34 million and 23 million records, respectively. The data were retrieved from the Open Academic Graph which is a network of research profiles and publications. We carefully processed each record and also tried several extractive and abstractive methods of both tasks to create performance baselines for other researchers. We further illustrate the performance of those methods previewing their outputs. In the near future, we would like to apply topic modeling on the two sets to derive subsets of research articles from more specific disciplines.

研究の動機と目的

  • テキスト要約およびキーワード生成のためのニューラルシーケンス・ツー・シーケンスモデルにおける大規模な学習データの増加するニーズに対処すること。
  • 研究論文メタデータから、大規模で高品質で自由に利用可能な2つのコーパスを構築し、公開すること。
  • データの代表的サブセットを用いて、抽出型および要約型手法の両方を用いて性能ベンチマークを確立すること。
  • 全データセットのトピックモデリングを通じて、将来的な分野特化型サブコーパスの研究を可能にすること。

提案手法

  • オープン学術グラフ(OAG)—大規模な学術知識ネットワーク—から、タイトル、要約、キーワードなどのメタデータを収集した。
  • 3400万件のOAGSXおよび2300万件のOAGKXレコード全体にわたって一貫性と品質を確保するため、慎重なデータクリーニングおよび前処理を実施した。
  • 複数の抽出型および要約型モデル(TopicRank、RAKE、Maui(教師あり抽出型)、CopyRNN、CovRNN(カバレッジおよびコピーメカニズムを備えた要約型))を評価した。
  • テキスト要約にはROUGEスコア、キーワード生成にはF1@kを用い、コーパスから抽出したミニセット上でモデルの性能を比較した。
  • 注意機構、カバレッジ、コピーメカニズムを備えたニューラルシーケンス・ツー・シーケンスモデルを用いて、要約型キーワード生成の性能を向上させた。
  • 要約、タイトル、キーワード間のテキスト長および語彙的類似性の統計的分析を実施し、コーパスの特徴を同定した。

実験結果

リサーチクエスチョン

  • RQ1大規模な研究論文のタイトルおよびキーワード生成タスクにおいて、抽出型と要約型のニューラルモデルの性能はどのように比較されるか?
  • RQ2モデルアーキテクチャおよび学習時間の影響は、生成されたタイトルおよびキーワードの品質にどのような影響を与えるか?
  • RQ3大規模で自由に利用可能な研究論文メタデータのコーパスは、テキスト要約およびキーワード生成システムの性能を顕著に向上させることができるか?
  • RQ4コピーやカバレッジ機構を備えた要約型モデルは、キーワード生成における誤り(幻覚や繰り返し)をどの程度軽減できるか?
  • RQ5これらのコーパスに対するトピックモデリングは、より焦点を絞った研究を可能にする分野特化型サブコーパスを生成できるか?

主な発見

  • 要約型モデル(CopyRNNおよびCovRNN)は、抽出型手法を大きく上回るF1@7スコア(最高29.15%)を達成しており、キーワード生成における優れた性能を示した。
  • 特にCovRNNは、Maui、TopicRank、RAKEといったすべての抽出型手法を上回った。OAGKXベンチマークにおいて、要約型モデルが顕著に優位であった。
  • 要約型モデルの学習には約3日間を要したが、抽出型手法は数分で結果が得られた。性能と計算コストのトレードオフが顕著に現れた。
  • 1件あたりの平均キーワード数は5.9個であり、これがF1@7とF1@10のスコアに類似性をもたらした。
  • 文法的に正しくても、多くの生成キーワードは正解キーワードと部分的または完全に一致せず、一部のモデルは「ラットの死亡率」のような新しいが誤りのフレーズを生成した。
  • OAGSXおよびOAGKXコーパスは、著者らの知る限り、研究論文のタイトルおよびキーワード生成タスクにおける、同種で最大規模の自由に利用可能なデータセットである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。