Skip to main content
QUICK REVIEW

[論文レビュー] Controllable Text Simplification with Explicit Paraphrasing

Mounica Maddela, Fernando Alva-Manchego|arXiv (Cornell University)|Oct 21, 2020
Text Readability and Simplification参考文献 66被引用数 7
ひとこと要約

本論文は、文の分割と削除に言語学的に根拠を持つルールとニューラル再表現モデルを組み合わせたハイブリッドテキスト簡略化モデルを提案する。これにより、簡略化スタイルに対するより高い制御性が可能となる。新たなデータ拡張手法を導入することで、モデルはパラフレージの質と出力長、分割頻度、語のコピー率の制御性を向上させ、最先端の性能を達成した。

ABSTRACT

Text Simplification improves the readability of sentences through several rewriting transformations, such as lexical paraphrasing, deletion, and splitting. Current simplification systems are predominantly sequence-to-sequence models that are trained end-to-end to perform all these operations simultaneously. However, such systems limit themselves to mostly deleting words and cannot easily adapt to the requirements of different target audiences. In this paper, we propose a novel hybrid approach that leverages linguistically-motivated rules for splitting and deletion, and couples them with a neural paraphrasing model to produce varied rewriting styles. We introduce a new data augmentation method to improve the paraphrasing capability of our model. Through automatic and manual evaluations, we show that our proposed model establishes a new state-of-the-art for the task, paraphrasing more often than the existing systems, and can control the degree of each simplification operation applied to the input texts.

研究の動機と目的

  • エンドツーエンドのシーケンス・トゥ・シーケンスモデルが主に削除に依存しており、パラフレージ能力に欠けるという限界を解消すること。
  • 文の分割、削除、語彙的パラフレージの細かく制御可能な制御を可能にすることで、簡略化出力の制御性を向上させること。
  • 中間の簡略化出力を基にした新しいデータ拡張戦略を用いることで、ニューラルパラフレージングモデルの多様性と効果性を高めること。
  • 複数の人的参照を備えた、テキスト簡略化における語彙的パラフレージの評価をより良く行うために、Newsela-Turkという新しい評価ベンチマークを構築すること。
  • シンボリックルールとニューラル生成を組み合わせたハイブリッドアーキテクチャが、自動評価および人的評価の両方で、既存のエンドツーエンドモデルを上回ることを示すこと。

提案手法

  • モデルはまず、文の分割と削除を通じて中間的簡略化を生成する言語学的に根拠のあるルールを適用し、候補出力を複数生成する。
  • ペairワイズのニューラルランク付けモデルが、簡略化の質に基づいて中間出力から最高品質の候補を選択する。
  • 選択された候補は、中間出力で微調整されたニューラルパラフレージングモデルを用いて再書き直され、語彙的多様性とスムーズさが向上する。
  • 中間的簡略化を訓練例として使用することで、新たなデータ拡張手法を導入し、パラフレージングモデルの多様な言い換え生成能力を高める。
  • コピー率(cp)というハイパーパrameterで制御される、入力からの語のコピー割合にソフト制約を課すことで、パラフレージの強度を調整可能にする。
  • 特定の構造的基準を満たす候補を選択することで、文の分割数と削除率に対する動的制御を実現する。

実験結果

リサーチクエスチョン

  • RQ1ルールベースの簡略化とニューラルパラフレージングを分離したハイブリッドモデルは、エンドツーエンドのseq2seqモデルに比べて、より優れたパラフレージング性能を達成できるか?
  • RQ2モデルは、簡略化出力における文の分割度、削除度、語彙的パラフレージング度をどの程度制御できるか?
  • RQ3中間的簡略化出力を用いたデータ拡張は、ニューラルパラフレージングの多様性と質を顕著に向上させるか?
  • RQ4提案されたモデルは、既存の最先端システムよりも、人的に編集された参照に近い簡略化を生成できるか?
  • RQ5本モデルは、テキスト簡略化におけるパラフレージング品質を評価することを目的とした、新たに設計された評価ベンチマークでどの程度の性能を示すか?

主な発見

  • 提案モデルはNewselaテストセットにおいて、自動評価および人的評価の両方で、以前のエンドツーエンドモデルを上回る新しいSARIスコアを達成した。
  • 以前のシステムに比べて、モデルは顕著に多くのパラフレージングを実行しており、出力の17.0%が新しい語を導入している(過去の研究では0.7–11.2%)。これは、語彙的多様性が強いことを示している。
  • モデルは簡略化スタイルに対して効果的な制御を示している。cpが0.8のとき、31.8%の文の分割と3.0%の同一出力を生成しており、多様性が非常に高い。
  • 複数の人的参照を備えたNewsela-Turkデータセットにより、パラフレージングの評価がより信頼性が高まり、モデルが既存のシステムよりも人的参照に近い出力を生成することが明らかになった。
  • データ拡張手法により、パラフレージングモデルの多様で、流暢で意味のある再表現生成能力が顕著に向上したことが、自動的および手動的評価の両方で確認された。
  • モデルは削除への過剰依存を軽減しており、同一出力はたったの3.0%にとどまっているが、同時に高い文の流暢さと意味保持性を維持しており、過去のモデルがしばしば短く劣化した出力を生成するのとは対照的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。