Skip to main content
QUICK REVIEW

[논문 리뷰] StoryDALL-E: Adapting Pretrained Text-to-Image Transformers for Story Continuation

Adyasha Maharana, Darryl Hannan|arXiv (Cornell University)|2022. 09. 13.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 DALL-E Mega와 같은 사전 훈련된 텍스트-이미지 트랜스포머를 활용해 스토리 계속하기 작업에 적합하도록 개선한 StoryDALL-E를 소개한다. 이는 원본 이미지 복사에 적합한 크로스 어텐션과 순차적 맥락을 처리하기 위한 글로벌 스토리 인코더를 통한 리터미네이션(역적합)을 통해 이루어지며, 스토리 계속하기 벤치마크에서 최신 기술 수준의 성능을 달성한다. 기존 GAN 기반 모델들을 능가하며, 더 나은 일반화 능력을 통해 일관되고 캐릭터 일관성이 유지되는 시각적 내러티브 생성이 가능하다.

ABSTRACT

Recent advances in text-to-image synthesis have led to large pretrained transformers with excellent capabilities to generate visualizations from a given text. However, these models are ill-suited for specialized tasks like story visualization, which requires an agent to produce a sequence of images given a corresponding sequence of captions, forming a narrative. Moreover, we find that the story visualization task fails to accommodate generalization to unseen plots and characters in new narratives. Hence, we first propose the task of story continuation, where the generated visual story is conditioned on a source image, allowing for better generalization to narratives with new characters. Then, we enhance or 'retro-fit' the pretrained text-to-image synthesis models with task-specific modules for (a) sequential image generation and (b) copying relevant elements from an initial frame. Then, we explore full-model finetuning, as well as prompt-based tuning for parameter-efficient adaptation, of the pre-trained model. We evaluate our approach StoryDALL-E on two existing datasets, PororoSV and FlintstonesSV, and introduce a new dataset DiDeMoSV collected from a video-captioning dataset. We also develop a model StoryGANc based on Generative Adversarial Networks (GAN) for story continuation, and compare it with the StoryDALL-E model to demonstrate the advantages of our approach. We show that our retro-fitting approach outperforms GAN-based models for story continuation and facilitates copying of visual elements from the source image, thereby improving continuity in the generated visual story. Finally, our analysis suggests that pretrained transformers struggle to comprehend narratives containing several characters. Overall, our work demonstrates that pretrained text-to-image synthesis models can be adapted for complex and low-resource tasks like story continuation.

연구 동기 및 목표

  • 기존 스토리 시각화 모델이 새로운 캐릭터와 스토리에 일반화하는 데 한계가 있음을 해결하기 위해, '스토리 계속하기'라는 새로운 작업을 도입한다.
  • 사전 훈련된 텍스트-이미지 모델이 초기 원본 이미지를 조건으로 하여 일관되고 순차적인 이미지 스토리를 생성할 수 있도록 하여 시각적 일관성을 향상시킨다.
  • 저자원 스토리 계속하기 작업에 적합한 파라미터 효율적인 리터미네이션 적응 방식을 개발한다.
  • 새로운 데이터셋인 DiDeMoSV를 도입하고, 기존 데이터셋(PororoSV, FlintstonesSV)을 스토리 계속하기 설정으로 재구성하여 평가에 활용한다.
  • 리터미네이션된 트랜스포머 모델의 성능을 GAN 기반 베이스라인(StoryGANc)과 비교하여 내러티브 일관성이 유지되는 이미지 시퀀스 생성 능력을 평가한다.

제안 방법

  • 후행 프레임에 원본 이미지의 시각적 요소를 복사하기 위해 사전 훈련된 텍스트-이미지 트랜스포머에 크로스 어텐션 레이어를 통합하여 리터미네이션한다.
  • 다중 캡션과 프레임 간 장거리 내러티브 맥락을 모델링하기 위해 자기 어텐션을 갖는 글로벌 스토리 인코더를 도입한다.
  • 사전 훈련된 지식이 순차적 이미지 생성에 적합하도록 스토리 계속하기 데이터셋에서 전체 모델을 엔드 투 엔드로 미세조정한다.
  • 파라미터 효율적인 대안으로 프롬프트 기반 튜닝을 탐색하여 전체 미세조정의 대체 방법을 모색한다.
  • 더 나은 이미지 및 캡션 표현을 위해 BART 인코더와 VQGAN-VAE 기반의 DALL-E Mega 아키텍처를 사용한다.
  • 비디오 캡션 데이터셋에서 유도된 PororoSV, FlintstonesSV, 그리고 새로 도입된 DiDeMoSV 총 3개의 데이터셋에서 훈련 및 평가를 수행한다.

실험 결과

연구 질문

  • RQ1리터미네이션 모듈을 활용해 사전 훈련된 텍스트-이미지 모델을 스토리 계속하기 작업에 효과적으로 적응시킬 수 있는가? 이는 시각적 일관성과 내러티브 일관성 향상에 기여하는가?
  • RQ2원본 이미지에 조건을 두는 것이 새로운 캐릭터와 스토리에 대한 일반화 능력을 향상시키는 데 기여하는가?
  • RQ3리터미네이션된 트랜스포머 기반 모델의 성능이 스토리 계속하기 작업에서 GAN 기반 모델(StoryGANc)과 비교해 어떻게 되는가?
  • RQ4모델이 사전 훈련된 지식을 얼마나 잘 활용하여 훈련 데이터에 등장하지 않은 새로운 시각적 개념을 생성할 수 있는가?
  • RQ5내러티브에 포함된 캐릭터 수가 모델이 프레임 간 시각적 일관성을 유지하는 능력에 어떤 영향을 미치는가?

주요 결과

  • mega-StoryDALL-E 모델은 PororoSV에서 23.48의 FID 스코어를 기록하여 StoryDALL-E(25.90) 대비 2.42점 향상시켰으며, 더 큰 능력을 지닌 사전 훈련된 모델을 사용할 경우의 이점이 입증되었다.
  • PororoSV에서 캐릭터 분류 F1 점수는 38.48에서 39.91로 상승하여, 프레임 간 캐릭터 정체성 인식 능력이 향상됨을 보여준다.
  • PororoSV에서 프레임 정확도는 17.26에서 18.01로 상승하여 생성된 이미지와 캡션 간의 정렬도 향상됨을 시사한다.
  • 모델은 원본 이미지의 시각적 요소를 후속 프레임에 성공적으로 복사하여 내러티브의 연속성을 유지하고 시각적 드리프트를 감소시킨다.
  • 모델은 '쿠키 만들기', '걷기'와 같은 명백한 시각적 동작에 대해 뛰어난 성능을 보이며, 동작 중심의 시각적 생성 능력이 뛰어나다.
  • 다른 개선에도 불구하고, 3명 이상의 캐릭터를 포함한 내러티브에서는 다중 캐릭터 일관성 유지를 어려워하며, 이는 주요 한계로 지적된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.