Skip to main content
QUICK REVIEW

[論文レビュー] StoryDALL-E: Adapting Pretrained Text-to-Image Transformers for Story Continuation

Adyasha Maharana, Darryl Hannan|arXiv (Cornell University)|Sep 13, 2022
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本稿では、DALL-E Mega などの事前学習済みテキストから画像への変換モデルを、ソース画像のコピーに向けたクロスアテンションと、順序的な文脈を扱うグローバルなストーリー符号化器を用いてリトロフィットすることで、物語の続きを生成するための方法、StoryDALL-E を提案する。この手法は、ストーリー継続ベンチマークで最先端の性能を達成し、GANベースのモデルを上回り、一貫性がありキャラクターの同一性を保った視覚的物語を生成でき、未学習のプロットに対しても一般化性能が向上する。

ABSTRACT

Recent advances in text-to-image synthesis have led to large pretrained transformers with excellent capabilities to generate visualizations from a given text. However, these models are ill-suited for specialized tasks like story visualization, which requires an agent to produce a sequence of images given a corresponding sequence of captions, forming a narrative. Moreover, we find that the story visualization task fails to accommodate generalization to unseen plots and characters in new narratives. Hence, we first propose the task of story continuation, where the generated visual story is conditioned on a source image, allowing for better generalization to narratives with new characters. Then, we enhance or 'retro-fit' the pretrained text-to-image synthesis models with task-specific modules for (a) sequential image generation and (b) copying relevant elements from an initial frame. Then, we explore full-model finetuning, as well as prompt-based tuning for parameter-efficient adaptation, of the pre-trained model. We evaluate our approach StoryDALL-E on two existing datasets, PororoSV and FlintstonesSV, and introduce a new dataset DiDeMoSV collected from a video-captioning dataset. We also develop a model StoryGANc based on Generative Adversarial Networks (GAN) for story continuation, and compare it with the StoryDALL-E model to demonstrate the advantages of our approach. We show that our retro-fitting approach outperforms GAN-based models for story continuation and facilitates copying of visual elements from the source image, thereby improving continuity in the generated visual story. Finally, our analysis suggests that pretrained transformers struggle to comprehend narratives containing several characters. Overall, our work demonstrates that pretrained text-to-image synthesis models can be adapted for complex and low-resource tasks like story continuation.

研究の動機と目的

  • 既存のストーリー可視化モデルが未学習のキャラクターおよびプロットに一般化できないという限界を克服するため、ストーリー継続という新しいタスクを導入すること。
  • 事前学習済みテキストから画像へのモデルが、初期のソース画像を条件として、一貫性があり順序的な画像ストーリーを生成できるようにすること。
  • 低リソースのストーリー継続タスクに適した、パラメータ効率の良い、リトロフィットされた変換器の適応手法を開発すること。
  • 新しいデータセット DiDeMoSV を導入し、既存のデータセット(PororoSV, FlintstonesSV)をストーリー継続設定に再形式化して評価に用いること。
  • リトロフィットされた変換器ベースのモデルと GAN ベースのベースライン(StoryGANc)の性能を比較すること。

提案手法

  • 事前学習済みテキストから画像への変換モデルに、ソース画像からの視覚的要素のコピーに向けたクロスアテンション層をリトロフィットして、以降のフレームに適用する。
  • 複数のキャプションとフレームにわたる長距離の物語的文脈をモデル化するため、自己アテンションを備えたグローバルなストーリー符号化器を導入する。
  • 事前学習済み知識を順序的な画像生成に適応させるために、ストーリー継続データセット上でモデル全体をエンドツーエンドで微調整する。
  • パラメータ効率の良い代替手法として、完全な微調整の代わりにプロンプトベースのチューニングを検討する。
  • 画像およびキャプション表現を向上させるために、BART エンコーダーと VQGAN-VAE をベースにした DALL-E Mega アーキテクチャを用いる。
  • ビデオキャプションデータセットから派生した 3 つのデータセット(PororoSV, FlintstonesSV, および新たに導入された DiDeMoSV)で訓練および評価を行う。

実験結果

リサーチクエスチョン

  • RQ1リトロフィットされたモジュールを用いて、事前学習済みテキストから画像へのモデルをストーリー継続タスクに効果的に適応させることで、視覚的一致性および物語の一貫性が向上するか?
  • RQ2ソース画像に条件付けられることで、ストーリー可視化において未学習のキャラクターおよびプロットへの一般化が向上するか?
  • RQ3リトロフィットされた変換器ベースのモデルの性能は、GAN ベースのモデル(StoryGANc)と比較してどのように異なるか?
  • RQ4モデルは、学習データに存在しない新しい視覚的コンセプトを生成するために、事前学習済み知識をどの程度活用できるか?
  • RQ5物語に登場するキャラクターの数が、モデルがフレーム間で視覚的一致性を維持する能力に与える影響はどの程度か?

主な発見

  • メガ-StoryDALL-E モデルは PororoSV で 23.48 の FID スコアを達成し、StoryDALL-E(25.90)と比較して 2.42 ポints の改善を示しており、より大規模かつ能力の高い事前学習モデルを用いる利点を裏付けている。
  • PororoSV におけるキャラクター分類 F1 スコアが 38.48 から 39.91 に向上し、フレーム間でのキャラクターの同一性認識が向上していることが示された。
  • PororoSV におけるフレーム精度が 17.26 から 18.01 に上昇し、生成された画像とキャプションの整合性が向上していることが示された。
  • モデルは、ソース画像からの視覚的要素を以降のフレームに正確にコピーしており、物語の一貫性を保ち、視覚的ドリフトを低減している。
  • 「クッキーを作る」「歩く」など、視覚的に明確な行動に対して優れた性能を示しており、アクション中心の視覚的生成能力が強いことが示された。
  • 改善が見られたものの、3 名以上のキャラクターを含む物語では、多キャラクターの一貫性を維持するのが困難であることが判明し、主な限界点であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。