Skip to main content
QUICK REVIEW

[論文レビュー] GameWikiSum: a Novel Large Multi-Document Summarization Dataset

Diego Antognini, Boi Faltings|arXiv (Cornell University)|Feb 17, 2020
Topic Modeling参考文献 15被引用数 9
ひとこと要約

この論文では、プロのビデオゲームレビューと対応するWikipediaのプレイガイド節から構成される大規模でドメイン特化型の複数文書要約データセット、GameWikiSumを紹介する。このデータセットは14,652件のサンプルを含み、抽出型および抽象的要約モデルの学習を可能にする。C_SKIP や SemSentSum といった埋め込みベースのモデルが最先端の性能を達成しており、ニュース中心のコーパスにとどまらない複数文書要約の発展に貢献する可能性を示している。

ABSTRACT

Today's research progress in the field of multi-document summarization is obstructed by the small number of available datasets. Since the acquisition of reference summaries is costly, existing datasets contain only hundreds of samples at most, resulting in heavy reliance on hand-crafted features or necessitating additional, manually annotated data. The lack of large corpora therefore hinders the development of sophisticated models. Additionally, most publicly available multi-document summarization corpora are in the news domain, and no analogous dataset exists in the video game domain. In this paper, we propose GameWikiSum, a new domain-specific dataset for multi-document summarization, which is one hundred times larger than commonly used datasets, and in another domain than news. Input documents consist of long professional video game reviews as well as references of their gameplay sections in Wikipedia pages. We analyze the proposed dataset and show that both abstractive and extractive models can be trained on it. We release GameWikiSum for further research: https://github.com/Diego999/GameWikiSum.

研究の動機と目的

  • 非ニュース系の複数文書要約データセットが不足している現状に対処するため、ドメイン特化型コーパスを構築すること。
  • 高品質で専門的なビデオゲームレビューとWikipediaのプレイガイド節を用いて、洗練された抽出型および抽象的要約モデルの学習を可能にすること。
  • ノイズの多い検索エンジンの結果や手作業によるアノテーションに依存する既存のデータセットの限界を乗り越えるために、構造的で高品質なソース素材を活用すること。
  • 今後の複数文書要約分野の研究を可能にする、スケーラブルで再現可能で公開可能なデータセットを提供すること。

提案手法

  • Metacriticから265,000件のプロのビデオゲームレビューと、26,000件のWikipediaプレイガイド節をクローリングすることでデータセットを構築した。
  • ゲーム名と構造化されたメタデータを用いたヒューリスティックなマッチングにより、ゲームレビューと対応するWikipediaページを一致させた。
  • Wikipediaのプレイガイド節から要約を抽出した。これらの節は一貫性があり標準化されたスタイルで書かれており、品質が保証されている。
  • データセットは抽出型および抽象的要約の両方をサポートするように設計されており、入力ドキュメントはプロのレビュー、参照要約はWikipediaのプレイガイド節である。
  • ROUGE-L、ROUGE-1、ROUGE-2 といった標準的なROUGEメトリクスを用いて、抽出型と抽象的アプローチの性能を比較評価した。
  • ベースラインモデルにはTextRank、LexRank、SumBasic、C_SKIP、SemSentSum、Conv2Conv、およびトランスフォーマー基盤のモデルが含まれる。

実験結果

リサーチクエスチョン

  • RQ1プロのビデオゲームレビューとWikipediaプレイガイド節を用いて、大規模でドメイン特化型の複数文書要約データセットを構築できるか?
  • RQ2GameWikiSumのような非ニュース系で高品質、ドメイン特化型のデータセットにおいて、抽出型および抽象的要約モデルの性能はどのように現れるか?
  • RQ3埋め込みベースのモデルは、従来の頻度ベースやヒューリスティックベースのモデルと比べて、この新しいデータセットでどの程度優れているか?
  • RQ4一部のWikipediaベースのコーパスに比べて規模が小さいものの、このデータセットはSeq2Seqやトランスフォーマー基盤のアーキテクチャのような高度なモデルの学習を可能にするか?

主な発見

  • GameWikiSumは14,652件のサンプルを含み、一般的に使用される複数文書要約データセットと比べて約100倍も大きい。
  • C_SKIP や SemSentSum といった埋め込みベースのモデルが、TextRank や LexRank、SumBasic といった従来のモデルを上回る優れた性能を示した。
  • 抽象的モデルのConv2ConvはC_SKIPにROUGE-2スコアで僅か0.05しか差をつけていなかったため、複雑さを考慮しても非常に高い性能を発揮していた。
  • 通常のトランスフォーマー・モデルはConv2Convに劣っており、言語モデルバージョンはデータ不足のため著しく性能が悪かった。
  • 結果から、プロのレビューとWikipediaのプレイガイド節が意味的に整合していることが確認され、このデータセットが複数文書要約に有効であることが裏付けられた。
  • このデータセットは抽出型および抽象的モデルの両方の学習を可能にし、ニュース中心の応用にとどまらない分野の発展に貢献する可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。