Skip to main content
QUICK REVIEW

[論文レビュー] Liputan6: A Large-scale Indonesian Dataset for Text Summarization

Fajri Koto, Jey Han Lau|arXiv (Cornell University)|Nov 2, 2020
Topic Modeling参考文献 31被引用数 14
ひとこと要約

本稿では、インドネシア語ニュースポータル「Liputan6.com」から収集した215,827件のドキュメント要約ペairを含む大規模なインドネシア語テキスト要約データセット「Liputan6」を紹介する。著者らは単語言語および多言語Bertを用いて、抽出的および生成的要約のベンチマークモデルを開発し、誤差分析の結果、低ROUGEスコアの多くはモデルの失敗ではなく、ROUGEの言い換えや省略語への感受性に起因することが判明した。

ABSTRACT

In this paper, we introduce a large-scale Indonesian summarization dataset. We harvest articles from Liputan6.com, an online news portal, and obtain 215,827 document-summary pairs. We leverage pre-trained language models to develop benchmark extractive and abstractive summarization methods over the dataset with multilingual and monolingual BERT-based models. We include a thorough error analysis by examining machine-generated summaries that have low ROUGE scores, and expose both issues with ROUGE it-self, as well as with extractive and abstractive summarization models.

研究の動機と目的

  • テキスト要約向けの大規模かつ公開可能なインドネシア語NLPデータセットの不足に対処すること。
  • 抽出的および生成的要約研究を支援するベンチマークデータセットを構築すること。
  • 事前学習済みBertベースのモデルがインドネシア語テキスト要約においてどの程度効果的であるかを評価すること。
  • 要約モデルおよびROUGE評価指標の詳細な誤差分析を実施すること。
  • 正規のテストセットと非常に生成的な要約を含むテストセットの2つのテストセットを含むデータセットをリリースし、モデルの評価を堅牢にする。

提案手法

  • 2000年10月から2010年10月までの10年間にわたり、インドネシア語ニュースポータル「Liputan6.com」から215,827件のドキュメント–要約ペアを収集した。
  • HTMLエンティティの削除、小文字化、句読点を用いたヒューリスティクスによる文分割を含む前処理を実施した。
  • 正規のテストセットと、より生成的な要約を含む「Xtreme」バージョンの2つのテストセットを構築した。
  • 抽出的および生成的要約タスクの両方において、単語言語および多言語Bertモデルを微調整した。
  • ROUGEスコアを用いてモデルを評価し、低ROUGEスコアの出力に対して定性的な誤差分析を実施した。
  • 低ROUGEスコアは、主にモデルの誤った生成やカバー率の低さではなく、言い換え、省略語、語彙的変化に起因することが判明した。

実験結果

リサーチクエスチョン

  • RQ1単語言語および多言語Bertベースのモデルは、インドネシア語テキストの抽出的および生成的要約をどの程度効果的に生成できるか?
  • RQ2ROUGEスコアは、インドネシア語要約出力の質をどの程度正確に反映しているか?
  • RQ3インドネシア語要約における低ROUGEスコアの主な原因は何か?それはモデルの失敗によるものか、評価の限界によるものか?
  • RQ4要約の生成的性質は時間経過とともにどのように変化し、モデルの汎化性能にどのような影響を与えるか?
  • RQ5大規模かつ公開可能なインドネシア語要約データセットは、低リソースNLP分野の最先端技術を向上させることができるか?

主な発見

  • Liputan6データセットには215,827件のドキュメント–要約ペアが含まれており、これは非英語要約データセットの中で最大クラスに属し、以前の最大のインドネシア語データセットよりも10倍以上大きい。
  • 「Xtreme」テストセットでは、4-gramの新規n-gramが87.5%に達しており、正規のセット(82.4%)と比較して顕著に生成的コンテンツが多いことが示された。
  • ROUGEスコアは言い換えや省略語に対して非常に感受性が高く、語彙的変化により、高品質な要約でも低ROUGEスコアを示す事例が多数存在した。
  • カバー率と焦点の欠如が、低品質要約の主な原因であり、BertExtAbsモデルの要約の100%がカバー率の問題を抱えていた。
  • 誤った生成(ホールスキュレーション)は主な問題ではなかった。低品質要約の約20%しか事実と異なる内容を含んでいなかった。
  • 誤差分析の結果、インドネシア語の語形の豊富さと頻繁な省略語の使用が、ROUGE評価に問題をもたらしていることが判明した。これは、要約が事実的に正しい場合でもROUGEスコアを低下させる要因となっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。