Skip to main content
QUICK REVIEW

[論文レビュー] Template-free Data-to-Text Generation of Finnish Sports News

Jenna Kanerva, Samuel Rönnqvist|arXiv (Cornell University)|Oct 4, 2019
Natural Language Processing Techniques参考文献 22被引用数 10
ひとこと要約

本論文は、構造化されたアイスホッケーの試合統計からフィンランド語のスポーツニュースを生成する、テンプレートフリーでエンドツーエンドのニューラルネットワークモデルを提示する。手動でニュース記事と試合イベントを対応付けることで、高品質な学習コーパスを構築し、ジャーナリストが75–90%の出力を直接機械生成ニュースやポストエディティングに使用可能と評価した grammatically fluent なテキストを生成した。これは、生データでの学習に比べて幻覚(hallucination)が著しく低減された結果である。

ABSTRACT

News articles such as sports game reports are often thought to closely follow the underlying game statistics, but in practice they contain a notable amount of background knowledge, interpretation, insight into the game, and quotes that are not present in the official statistics. This poses a challenge for automated data-to-text news generation with real-world news corpora as training data. We report on the development of a corpus of Finnish ice hockey news, edited to be suitable for training of end-to-end news generation methods, as well as demonstrate generation of text, which was judged by journalists to be relatively close to a viable product. The new dataset and system source code are available for research purposes at https://github.com/scoopmatic/finnish-hockey-news-generation-paper.

研究の動機と目的

  • 神経的シーケンス・トゥ・シーケンス・モデルを用いて、フィンランド語のスポーツジャーナリズム向けにテンプレートフリーでエンドツーエンドのデータ・トゥ・テキスト生成システムを開発すること。
  • 手作業で選別された、イベントに紐づけられたフィンランド語のアイスホッケーのニュースコーパスを構築することで、データ・トゥ・テキスト生成における事実の幻覚(factual hallucination)の課題に取り組むこと。
  • ニューラル生成が、機械生成ニュースとしての使用やポストエディティングのドラフトとしての使用に十分な水準に達したプロフェッショナルな水準に近いテキストを生成できるかどうかを評価すること。
  • 非統計的洞察、背景知識、解釈的言語を含む、現実世界のジャーナリズム・コンテンツを用いたエンドツーエンドのモデル学習の可能性を検討すること。

提案手法

  • 1994–2018年の公式試合統計とSTTのニュース記事を対応付けることで、3,454試合分のフィンランド語アイスホッケーのニュースコーパスを構築した。
  • ニュース記事内のテキストスパンを特定の試合イベント(例:ゴール、ペナルティ)と手作業で対応させ、事実の幻覚のない学習データセットを構築した。
  • 対応済みデータセット上でシーケンス・トゥ・シーケンス・ニューラルモデルを学習させ、入力の統計から完全な試合レポートを生成するようにした。
  • 2名のSTTジャーナリストによる人間評価を通じて、出力のポストエディティング適合性と直接公開適合性を評価した。
  • 生成テキストとジャーナリストが編集したバージョンとの間の編集距離を測定するため、語誤り率(WER)を用い、句読点を含む・含まないの両方で評価した。
  • 複数イベントを含む文の生成における限界を検討し、データ拡張およびサブワードユニットによる今後の改善策を検討した。

実験結果

リサーチクエスチョン

  • RQ1生のジャーナリズム的コンテンツに非統計的要素を含める場合に、テンプレートフリーでエンドツーエンドのニューラルモデルが、事実的に正確で文法的に流暢なフィンランド語のスポーツニュースを生成できるか。
  • RQ2ニュース記事と試合イベントを手作業で対応付けることで、生のニュースデータを使用する場合に比べて、データ・トゥ・テキスト生成における事実の幻覚はどの程度低減されるか。
  • RQ3生成されたテキストは、実際のニュース制作プロセス、特に機械生成ニュースパイプラインにおいてどの程度使用可能か。
  • RQ4生成されたフィンランド語スポーツレポートにおける主な誤りカテゴリは何か。また、それらはデータやモデルの改善によって体系的に是正可能か。
  • RQ5エンドツーエンドのモデルは、一度に複数イベントの要約を一括して生成できるか。それとも、品質を確保するにはイベントごとの段階的生成が依然として必要か。

主な発見

  • ポストエディティング用のジャーナリスト編集版と比較した場合、モデルは文法的に流暢なテキストを生成し、語誤り率(WER)は9.9%(句読点なしでは11.2%)であった。
  • 最終的に直接公開可能なバージョンと比較した場合、WERは22.0%(句読点なしでは24.4%)に上昇し、出力の75–90%が重大な修正なしで使用可能であることを示した。
  • 事実の誤りは主に、名前の誤ってコピー、イベントタイプの誤分類、時間の誤った記述に起因しており、今後の修正の主なターゲットであると考えられる。
  • ニュース記事と試合イベントの手作業による対応付けは、幻覚を著しく低減した。これは、現実世界のジャーナリズムデータを用いた信頼性の高いエンドツーエンドシステムの学習に不可欠であることが証明された。
  • イベントごとの生成は、不自然な繰り返しや文レベルの不自然さを引き起こした。これは、将来的に複数イベントまたは文書レベルの生成に向けた研究の必要性を示している。
  • 本研究で使用したデータセット、モデルコード、および元のコーパスは、低リソース言語や非英語のデータ・トゥ・テキスト生成分野における今後の研究を支援するために公開されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。