Skip to main content
QUICK REVIEW

[논문 리뷰] Synthesizing Coherent Story with Auto-Regressive Latent Diffusion Models

Xichen Pan, Pengda Qin|arXiv (Cornell University)|2022. 11. 20.
Generative Adversarial Networks and Image Synthesis인용 수 12
한 줄 요약

이 논문은 텍스트 캡션과 이전에 생성된 이미지를 조건으로 하여 일관된 시각적 스토리를 생성하는 자동회귀 잠재 확산 모델인 AR-LDM을 제안한다. 이 모델은 스토리 시각화 및 이어쓰기 작업에서 최신 기술 수준(SoTA) 성능을 달성한다. 또한 실제 세계의 스토리 합성에 적합한 VIST 데이터셋을 도입하고, 적응을 통해 알려지지 않은 캐릭터에 일반화할 수 있도록 하여 이전 방법에 비해 일관성과 품질을 크게 향상시켰다.

ABSTRACT

Conditioned diffusion models have demonstrated state-of-the-art text-to-image synthesis capacity. Recently, most works focus on synthesizing independent images; While for real-world applications, it is common and necessary to generate a series of coherent images for story-stelling. In this work, we mainly focus on story visualization and continuation tasks and propose AR-LDM, a latent diffusion model auto-regressively conditioned on history captions and generated images. Moreover, AR-LDM can generalize to new characters through adaptation. To our best knowledge, this is the first work successfully leveraging diffusion models for coherent visual story synthesizing. Quantitative results show that AR-LDM achieves SoTA FID scores on PororoSV, FlintstonesSV, and the newly introduced challenging dataset VIST containing natural images. Large-scale human evaluations show that AR-LDM has superior performance in terms of quality, relevance, and consistency.

연구 동기 및 목표

  • 다중 문장 서술에서 일관되고 일관된 시각적 스토리를 생성하는 데 도전하는 문제를 해결하기 위해, 확산 모델에서 다루지 않은 분야에 초점을 맞춘다.
  • 텍스트적 맥락과 이전에 생성된 이미지를 모두 조건으로 하여 스토리 프레임 간의 이미지 생성 일관성을 향상시킨다.
  • 간단한 적응 방법을 통해 알려지지 않은 캐릭터(예: 대명사)에 일반화할 수 있도록 한다.
  • 자연 이미지 기반의 스토리 시퀀스를 포함하는 새로운 데이터셋인 VIST를 사용하여 실제 세계의 스토리 합성에 대한 평가를 수행한다.
  • 대규모 인간 평가를 통해 시각적 품질, 관련성, 일관성 측면에서 우수한 성능을 입증한다.

제안 방법

  • AR-LDM은 텍스트를 위한 CLIP와 다중모달 이미지-텍스트 이해를 위한 BLIP을 결합한 히스토리 인식 인코딩 모듈을 사용한다.
  • 모델은 자동회귀적 생성 전략을 사용하며, 각 프레임은 현재 캡션과 이전에 생성된 이미지 및 캡션의 히스토리를 조건으로 한다.
  • 이미지 잠재공간에서 훈련된 잠재 확산 프레임워크를 활용하여 고해상도, 다양성 있고 일관성 있는 이미지를 생성한다.
  • 새로운 적응 방법을 도입하여 참조 이미지-텍스트 쌍에 대해 미세조정함으로써 알려지지 않은 캐릭터의 신원 일관성을 유지한다.
  • 모델은 캡션과 이전의 시각-텍스트 맥락을 모두 참조하는 크로스 어텐션 메커니즘을 갖춘, 스토리 시퀀스 전체에 걸쳐 엔드 투 엔드로 훈련된다.
  • 기본 프레임 또는 초깃막 캡션 시퀀스를 조건으로 하여 스토리 시각화 및 이어쓰기 작업을 모두 지원한다.

실험 결과

연구 질문

  • RQ1확산 모델은 고립된 이미지가 아닌 다중 프레임에 걸쳐 일관된 시각적 스토리를 효과적으로 생성하도록 적응할 수 있는가?
  • RQ2다중 문장 서술에서 생성된 이미지 시퀀스 간에 시각적 일관성과 관련성을 어떻게 유지할 수 있는가?
  • RQ3명시적 감독 없이도 모델이 알려지지 않은 캐릭터(예: 대명사로 지칭되는 자)에 일반화할 수 있는가?
  • RQ4기존의 GAN 기반 및 자동회귀 기반 모델과 비교할 때, 제안된 방법은 시각적 품질, 관련성, 일관성 측면에서 어떤 성능을 보이는가?
  • RQ5자연 이미지와 순서 기반 캡션을 포함하는 새로운 데이터셋은 실제 세계의 스토리 합성 능력을 더 잘 평가할 수 있는가?

주요 결과

  • AR-LDM은 PororoSV 데이터셋에서 최신 기술 수준(FID 점수 16.59)을 달성하였으며, 이는 이전의 스토리 시각화 방법 대비 70%의 상대적 향상이다.
  • FlintstonesSV 및 VIST를 포함한 모든 평가 데이터셋에서, AR-LDM은 스토리 이어쓰기 성능에서 약 20%의 상대적 향상을 보였다.
  • 대규모 인간 평가 결과, AR-LDM은 이전 방법에 비해 시각적 품질, 관련성, 일관성 측면에서 뛰어난 성능을 보였으며, 인간 평가자들이 모든 기준에서 AR-LDM의 출력을 선호하였다.
  • 적응을 통해 알려지지 않은 캐릭터에 성공적으로 일반화되어, 모호한 대명사나 묘사로 인한 일관성 없는 생성을 크게 줄였다.
  • VIST 데이터셋의 도입은 더 현실적인 스토리 합성 평가를 가능하게 하였으며, AR-LDM은 자연 이미지 기반 콘텐츠를 갖춘 이 벤치마크에서 뛰어난 성능을 보였다.
  • 실패 케이스 분석 결과, 어텐션 메커니즘이 관련이 없는 문장 간의 의미적 내용을 혼동할 수 있음을 확인하였으며, 향후 연구에서는 텍스트 인코딩의 향상 필요성이 제기된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.