Skip to main content
QUICK REVIEW

[論文レビュー] Attributed Rhetorical Structure Grammar for Domain Text Summarization

Ruqian Lu, Shengluan Hou|arXiv (Cornell University)|Sep 3, 2019
Topic Modeling参考文献 51被引用数 8
ひとこと要約

本稿では、ドメイン知識、修辞構造理論(RST)、および属性文法を統合することで、知識駆動型で文法に基づく要約を可能にする、属性修辞構造文法(ARSG)を提案する。ドメイン関係を非終端記号としてモデル化し、修辞的関係をそれらの関係の属性として扱うことで、限られた学習データからの学習が可能となり、低リソースドメインにおける効果的な要約が可能になるとともに、最小限の再訓練でドメイン間でのモデル転送が可能になる。

ABSTRACT

This paper presents a new approach of automatic text summarization which combines domain oriented text analysis (DoTA) and rhetorical structure theory (RST) in a grammar form: the attributed rhetorical structure grammar (ARSG), where the non-terminal symbols are domain keywords, called domain relations, while the rhetorical relations serve as attributes. We developed machine learning algorithms for learning such a grammar from a corpus of sample domain texts, as well as parsing algorithms for the learned grammar, together with adjustable text summarization algorithms for generating domain specific summaries. Our practical experiments have shown that with support of domain knowledge the drawback of missing very large training data set can be effectively compensated. We have also shown that the knowledge based approach may be made more powerful by introducing grammar parsing and RST as inference engine. For checking the feasibility of model transfer, we introduced a technique for mapping a grammar from one domain to others with acceptable cost. We have also made a comprehensive comparison of our approach with some others.

研究の動機と目的

  • 専門的ドメイン要約において限られたラベル付き学習データが利用可能な状況、特に専門的中国語テキストのような低リソースドメインにおける課題に対処すること。
  • 純粋にデータ駆動型のアプローチの限界を克服するため、構造的ドメイン知識と話法分析を統合すること。
  • 修辞構造理論(RST)を用いた文法ベースの推論エンジンを開発し、語彙的結束法を越えて要約品質を向上させること。
  • 再訓練を完全に新たに実施するのではなく、文法のマッピングによってドメイン間での効率的なモデル転送を可能にすること。
  • 一貫性(RST)と結束性(語彙的チェーン)を統合したフレームワークを通じて、拡張可能で調整可能な要約システムを構築すること。

提案手法

  • 非終端記号がドメイン関係(例:'production', 'output')を表す属性修辞構造文法(ARSG)を定義し、修辞的関係(例:'cause', 'elaboration')をそれらの関係の属性として扱う。
  • 機械学習を用いて小規模なドメイン固有の学習テキストから確率的規則を学習し、下位から上位への先行順序解析戦略を採用する。
  • RSTを推論エンジンとして統合し、修辞的関係に基づいて核(コア)となる話法単位と付随する(支援的)話法単位を特定することで要約をガイドする。
  • 従来の語彙的チェーンを「語彙的コア」に変換し、ドメインの概念とより適切に一致させ、一貫性モデリングを向上させる。
  • ドメイン固有の概念を対応させながら、構造的規則を保持するように、1つのドメイン(例:WET)の文法を別のドメイン(例:ID)に変換するトランスダクション技術を実装する。
  • RSTに基づく解析と属性ベースのフィルタリングを用いて、要約の長さと焦点を制御可能な調整可能な要約アルゴリズムを設計する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン知識とRSTを統合した文法ベースのアプローチは、低リソースドメインにおける要約パフォーマンスを向上させることができるか?
  • RQ2ARSGは、ドメイン固有の要約において大規模な学習データの欠如をどの程度補うことができるか?
  • RQ3完全な再訓練なしにARSGモデルを1つのドメインから別のドメインにどの程度転送できるか?
  • RQ4RSTに基づく一貫性モデリングと語彙的コアに基づく結束性モデリングを組み合わせることで、要約品質はどの程度向上するか?
  • RQ5提案されたモデル転送技術は、新しい応用分野におけるドメイン固有要約器の構築コストをどの程度低減できるか?

主な発見

  • ARSGアプローチは、限られた学習データでも高い要約精度(ROUGE-2)を達成し、cheg2016neural やグラフベース手法といった抽出型ベースラインを上回る。
  • 文法マッピングによるモデル転送は、新しいドメインモデルの構築にかかる作業負荷を、実験8および表8で示されるように、元の学習コストのおよそ1/5にまで削減する。
  • RSTと語彙的コアの組み合わせにより、上位から下位への一貫性と下位から上位への結束性を統合し、熟達性と情報量の両方を向上させる。
  • ドメイン転送において強い実現可能性を示した:WET(天気)で学習した文法は、ID(産業開発)ドメインに効果的に適応可能で、妥当なパフォーマンスを示した。
  • DUC2002において、ARSGモデルは従来のグラフベース手法およびニューラルベースラインよりも高いROUGEスコアを達成しており、特に学習データが限られた状況で顕著であった。
  • フレームワークは調整可能な要約をサポートしており、RSTに基づく解析と属性ベースのフィルタリングを用いて、要約の長さと焦点を制御可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。