[論文レビュー] "My Way of Telling a Story": Persona based Grounded Story Generation
本稿では、会話データセットから得たパーソナ特徴を視覚的ストーリーテリングに転送し、段階的なエンコーダ・デコーダの変更を用いて物語のスタイルを制御する、パーソナベースの接地付きストーリー生成フレームワークを提案する。LEPCモデルは、パーソナ分類精度を向上させつつも高いROUGEスコアを維持し、画像に根ざしたストーリー生成における効果的なパーソナの統合を示している。
Visual storytelling is the task of generating stories based on a sequence of images. Inspired by the recent works in neural generation focusing on controlling the form of text, this paper explores the idea of generating these stories in different personas. However, one of the main challenges of performing this task is the lack of a dataset of visual stories in different personas. Having said that, there are independent datasets for both visual storytelling and annotated sentences for various persona. In this paper we describe an approach to overcome this by getting labelled persona data from a different task and leveraging those annotations to perform persona based story generation. We inspect various ways of incorporating personality in both the encoder and the decoder representations to steer the generation in the target direction. To this end, we propose five models which are incremental extensions to the baseline model to perform the task at hand. In our experiments we use five different personas to guide the generation process. We find that the models based on our hypotheses perform better at capturing words while generating stories in the target persona.
研究の動機と目的
- 大規模なパーソナアノテート済みストーリーデータセットが不足しているにもかかわらず、多様なパーソナで視覚的ストーリーを生成すること。
- 会話ベースのパーソナデータセットから得たパーソナアノテーションを視覚的ストーリーテリングタスクに転送すること。
- エンコーダおよびデコーダ表現にパーソナを統合するための段階的なニューラルモデル拡張を構築・評価すること。
- パーソナ統合モデルが、物語の整合性と内容の正確性を保ちながら、ターゲットパーソナ特性を反映した物語を生成できるかどうかを評価すること。
- 自動的および定性的なメトリクスを用いて、パーソナ条件付き視覚的ストーリーテリングのためのベースライン評価プロトコルを確立すること。
提案手法
- ベースラインとして、事前学習済みの視覚的ストーリー生成モデル(Kim et al., 2018)を用いる。
- 微調整を用いて、会話データセット(例:personachat)からのパーソナ埋め込みを視覚的ストーリーテリングタスクに転送する。
- 5つの段階的モデル変種(MPP、LEPC、LEPD、SEPC、SEPD)を提案。各モデルはエンコーダおよびデコーダの異なる層(単語レベル、文脈レベル、または両者)にパーソナを統合する。
- 画像特徴とパーソナ埋め込みのラテン融合を用いて、物語生成をガイドする。
- 生成された物語がターゲットパーソナクラスタと一致するかを評価するため、パーソナ分類ヘッドを適用する。
- 参照物語との内容および構造的類似性を自動評価するため、ROUGE-Lを用いる。
実験結果
リサーチクエスチョン
- RQ1会話データセットからのパーソナ埋め込みを、根拠のある画像ベースの文脈で視覚的ストーリー生成をガイドするために効果的に転送できるか?
- RQ2アーキテクチャ的変更(例:単語レベル vs. 文脈レベルにパーソナを統合)の中で、生成された物語におけるターゲットパーソナ特性を最も効果的に保持するのはどれか?
- RQ3異なるパーソナ統合戦略が、パーソナ分類精度とROUGEスコアの両方にどのように影響を与えるか?
- RQ4モデルが物語の各文に少なくとも1つのパーソナ関連語を生成できる程度はどの程度で、物語の整合性が損なわれないか?
- RQ5パーソナ忠実度と自動生成品質の間にトレードオフがあるか。もしあるなら、それを軽減できるか?
主な発見
- LEPCモデルは、5つのパーソナクラスタのほとんどで最高のパーソナ分類精度を達成し、競争力のあるROUGE-Lスコアを維持している。
- 提案されたすべてのモデル(MPP、LEPC、LEPD、SEPC、SEPD)は、定性的分析により、各文に少なくとも1つのターゲットパーソナに一致する語を生成していることが確認された。
- 単語レベルにのみパーソナを統合するSEPCおよびSEPDモデルは、ROUGEおよび分類精度の両面で劣った性能を示しており、単独の単語レベル統合の限界を示している。
- glocalベースラインモデルはパーソナ固有の語彙を捉えておらず、一方、パーソナ統合モデルは関連する文に「excited」、「happy」、「surprised」などの感情的に一貫した語を生成している。
- 定性的分析により、LEPCおよびLEPDモデルはSEPCおよびSEPDと比較して、トーンおよび感情の一貫性をよりよく維持していることが確認された。
- 本研究では、パーソナ忠実度とROUGEスコアの最適化の間にトレードオフが存在することが明らかになった。これは、単語埋め込みを剥がすと言語モデルの事前学習知識が損なわれる可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。