Skip to main content
QUICK REVIEW

[論文レビュー] TVRecap: A Dataset for Generating Stories with Character Descriptions.

Mingda Chen, Kevin Gimpel|arXiv (Cornell University)|Sep 18, 2021
Topic Modeling参考文献 35被引用数 4
ひとこと要約

TVRecap は、ファンのウェブサイトから収集した 26,000 件のプロフェッショナルに書かれたテレビエピソードの要約から構築された大規模なデータセットであり、短い要約と広範なキャラクター文書から詳細でキャラクターに富んだ物語を生成することを要件としている。階層的ニューラルモデルにオラクルコンテンツセレクタを組み合わせた手法が自動評価指標で最高の性能を示し、制約付き物語生成および抽象的要約研究におけるデータセットの価値を実証した。

ABSTRACT

We introduce TVRecap, a story generation dataset that requires generating detailed TV show episode recaps from a brief summary and a set of documents describing the characters involved. Unlike other story generation datasets, TVRecap contains stories that are authored by professional screenwriters and that feature complex interactions among multiple characters. Generating stories in TVRecap requires drawing relevant information from the lengthy provided documents about characters based on the brief summary. In addition, by swapping the input and output, TVRecap can serve as a challenging testbed for abstractive summarization. We create TVRecap from fan-contributed websites, which allows us to collect 26k episode recaps with 1868.7 tokens on average. Empirically, we take a hierarchical story generation approach and find that the neural model that uses oracle content selectors for character descriptions demonstrates the best performance on automatic metrics, showing the potential of our dataset to inspire future research on story generation with constraints. Qualitative analysis shows that the best-performing model sometimes generates content that is unfaithful to the short summaries, suggesting promising directions for future work.

研究の動機と目的

  • 複雑なキャラクター間の対話と詳細な記述を特徴とする、大規模でプロフェッショナルに作成された物語生成データセットの構築。
  • 短い要約と広範なキャラクター文書を活用して、一貫性があり文脈的に正確な物語を生成する課題に対処すること。
  • 物語生成タスクの入力と出力を逆転させることで、要約抽出のベンチマークを提供すること。
  • 長大なキャラクター記述から関連情報を効果的に選択・統合できる神経ネットワークモデルの研究を促進すること。
  • 生成された物語の正確性と質が、元の要約とキャラクター詳細にどの程度適合しているかを評価すること。

提案手法

  • ファンが寄稿したウェブサイトから TVRecap を構築し、平均 1,868.7 モーフィムの長さを持つ 26,000 件のエピソード要約を収集した。
  • 要約とキャラクター文書を処理して詳細な要約を生成する階層的物語生成フレームワークを設計した。
  • キャラクター文書から最も関連性の高い情報を特定・統合するためのオラクルコンテンツセレクタ機構を実装した。
  • 自動評価指標を用いてモデルを評価し、さまざまなコンテンツ選択戦略の性能を比較した。
  • 要約を入力とし、要約を出力とする形にデータセットを再利用し、要約抽出タスクに応用した。
  • 生成されたコンテンツと入力要約との間の事実的一致性を評価するための定性的分析を実施した。

実験結果

リサーチクエスチョン

  • RQ1神経ネットワークモデルは、短い要約と広範なキャラクター記述のみを用いて、詳細で一貫性のあるテレビエピソードの要約を効果的に生成できるか?
  • RQ2オラクルコンテンツセレクタを用いることで、ベースライン手法と比較して物語生成のパフォーマンスがどの程度向上するか?
  • RQ3複雑なキャラクター間の対話が存在する中で、生成された物語が元の短い要約にどの程度忠実に保たれるか?
  • RQ4TVRecap は要約抽出タスクの有効なベンチマークとして機能できるか?
  • RQ5モデルが入力要約から逸脱する際の主な失敗モードは何か?

主な発見

  • オラクルコンテンツセレクタを備えた階層的ニューラルモデルが、自動評価指標で最高のパフォーマンスを達成した。
  • データセットには 26,000 件のプロフェッショナルに書かれたエピソード要約が含まれており、1件あたりの平均長さは 1,868.7 モーフィムである。
  • 最高のパフォーマンスを示したモデルでも、入力要約と整合しない内容を生成するケースが時折発生しており、忠実性の向上が求められる。
  • 入力と出力を逆転させることで、TVRecap は要約抽出タスクの妥当かつ挑戦的なベンチマークとして機能する。
  • 定性的分析の結果、モデルの出力に事実誤認が生じたり、元の要約から逸脱するケースが確認された。
  • 結果から、長大なキャラクター記述を効果的に統合できるようになることは、物語生成分野における重要な課題のままであると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。