Skip to main content
QUICK REVIEW

[論文レビュー] DiscoFuse: A Large-Scale Dataset for Discourse-Based Sentence Fusion

Mor Geva, Eric Malmi|arXiv (Cornell University)|Feb 27, 2019
Text Readability and Simplification参考文献 24被引用数 17
ひとこと要約

本稿では、Wikipedia やスポーツ関連記事からルールベースの融合文分解手法を用いて自動生成された、6000万件の話法的文融合例からなる大規模データセットである DiscoFuse を紹介する。この手法により、ニューラルモデルの有効な事前学習が可能となり、WebSplit などの下流の融合タスクにおいて顕著な性能向上が達成された。これは、低リソース環境における転移学習の分野において、DiscoFuse の有用性を示している。

ABSTRACT

Sentence fusion is the task of joining several independent sentences into a single coherent text. Current datasets for sentence fusion are small and insufficient for training modern neural models. In this paper, we propose a method for automatically-generating fusion examples from raw text and present DiscoFuse, a large scale dataset for discourse-based sentence fusion. We author a set of rules for identifying a diverse set of discourse phenomena in raw text, and decomposing the text into two independent sentences. We apply our approach on two document collections: Wikipedia and Sports articles, yielding 60 million fusion examples annotated with discourse information required to reconstruct the fused text. We develop a sequence-to-sequence model on DiscoFuse and thoroughly analyze its strengths and weaknesses with respect to the various discourse phenomena, using both automatic as well as human evaluation. Finally, we conduct transfer learning experiments with WebSplit, a recent dataset for text simplification. We show that pretraining on DiscoFuse substantially improves performance on WebSplit when viewed as a sentence fusion task.

研究の動機と目的

  • ニューラル文融合モデルのための、大規模かつ高品質な学習データの不足を解決すること。
  • 生テキストコーパスから多様な文融合例を自動生成できるスケーラブルなルールベース手法の開発。
  • DiscoFuse の有効性を、シーケンス・ツー・シーケンスモデルの学習および関連タスクにおける転移学習の観点から評価すること。
  • 接続詞、先行参照、並列構造などのさまざまな話法的現象におけるモデル性能の分析。
  • DiscoFuse での事前学習が、WebSplit などの下流の融合タスクにおける性能向上に寄与することの実証。

提案手法

  • 接続詞挿入、代名詞化、並列化といった一般的な融合操作を逆転させることで、融合文を2つの独立文に分解する手作業で設計されたルールを適用する。
  • ルールベースの分解パイプラインを Wikipedia およびスポーツ関連記事の2つの大規模コーパスに適用し、それぞれ1600万件および4400万件の例を生成する。
  • 生成された例から学習するため、変換器アーキテクチャを用いたシーケンス・ツー・シーケンスモデルを構築する。
  • クラウドソーシングを活用した人間による評価を通じて、分割された文の品質と一貫性を評価し、85%の理解率を達成した。
  • WebSplit データセットを用いた逆方向の文融合タスクのため、DfWiki で事前学習し、その後 WebSplit で微調整する転移学習実験を実施する。
  • SARI スコアおよび F1 スコアを用いて、自動評価および人間評価の両方の指標でモデル性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1人為的アノテーションを一切用いずに、生テキストからルールベースの手法で大規模かつ高品質な文融合例を生成できるか?
  • RQ2DiscoFuse で学習したニューラルモデルは、接続詞挿入や代名詞選択といったさまざまな話法的現象にどの程度一般化できるか?
  • RQ3WebSplit のような限られたデータを有する下流の融合タスクにおいて、DiscoFuse での事前学習が性能向上にどの程度寄与するか?
  • RQ4現在のモデルが、文融合における話法的現象を処理する際の主な失敗モードは何か?
  • RQ5自動生成された例の質は、人間がアノテートしたデータと比較して、一貫性および意味的整合性の観点でどの程度高いか?

主な発見

  • DiscoFuse データセットには、Wikipedia およびスポーツ関連記事から抽出された6000万件の文融合例が含まれており、そのうち85%の分割例が人間のアノテーターによって一貫性があると評価された。
  • 変換器ベースのモデルは、同格構造や関係節といった構造的融合操作では良好な性能を示したが、話法的接続詞挿入や代名詞選択では著しく困難を示した。
  • DfWiki(1600万件)で事前学習し、WebSplit で微調整することで、WebSplit 単体での学習に比べて SARI スコアが9%向上し、'追加された n-gram' の F1 スコアは相対的に33%向上した。
  • モデルの '追加された n-gram' における F1 スコア(10.4)は依然として低く、特に簡略化が進んだデータでは言い換えやコンテンツ回復に課題があることが示された。
  • 転移学習の設定から、DiscoFuse はターゲットデータの分布が異なる場合でも、融合タスクに有用な誘導的バイアスを提供することが示され、一般化能力の有効性が裏付けられた。
  • ルールベースの生成手法は、対比、原因、例示といった多様な話法的現象を効果的に捉えており、'unless' では最大68.9%、'so that' では67.0%の一致精度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。