Skip to main content
QUICK REVIEW

[논문 리뷰] StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation

Yupeng Zhou, Daquan Zhou|arXiv (Cornell University)|2024. 05. 02.
Video Analysis and Summarization인용 수 4
한 줄 요약

이 논문은 일관적인 이미지 및 영상 생성을 위한 훈련 불필요 방법인 StoryDiffusion을 소개한다. Consistent Self-Attention를 사용하여 참조 토큰을 자기주의 계산에 통합함으로써 신원 및 복장 일관성을 향상시킨다. 또한 부드럽고 안정적인 영상 생성을 위한 의미론적 운동 예측기(Semantic Motion Predictor)를 제안하며, 정량적 지표와 사용자 연구에서 최신 기술들을 능가한다.

ABSTRACT

For recent diffusion-based generative models, maintaining consistent content across a series of generated images, especially those containing subjects and complex details, presents a significant challenge. In this paper, we propose a new way of self-attention calculation, termed Consistent Self-Attention, that significantly boosts the consistency between the generated images and augments prevalent pretrained diffusion-based text-to-image models in a zero-shot manner. To extend our method to long-range video generation, we further introduce a novel semantic space temporal motion prediction module, named Semantic Motion Predictor. It is trained to estimate the motion conditions between two provided images in the semantic spaces. This module converts the generated sequence of images into videos with smooth transitions and consistent subjects that are significantly more stable than the modules based on latent spaces only, especially in the context of long video generation. By merging these two novel components, our framework, referred to as StoryDiffusion, can describe a text-based story with consistent images or videos encompassing a rich variety of contents. The proposed StoryDiffusion encompasses pioneering explorations in visual story generation with the presentation of images and videos, which we hope could inspire more research from the aspect of architectural modifications. Our code is made publicly available at https://github.com/HVision-NKU/StoryDiffusion.

연구 동기 및 목표

  • 텍스트-이미지 및 텍스트-영상 확산 모델에서 장기간의 생성 이미지 및 영상 간에 주체의 일관성—특히 신원과 복장—유지를 해결하기 위한 도전 과제를 다루기 위해.
  • 세부 조정 또는 광범위한 데이터가 필요 없는 경량의 훈련 불필요 방법을 개발하여 일관성을 향상시키기 위해.
  • 부드러운 전환을 갖춘 고품질의 장기 시각적 스토리텔링을 가능하게 하기 위해 일관성을 영상 생성으로 확장하기 위해.
  • 확산 기반 생성 모델에서 제어 가능성과 일관성을 향상시키기 위한 아키텍처 수정을 탐색하기 위해.

제안 방법

  • 참조 이미지에서 샘플링한 토큰을 키 및 값 행렬에 통합함으로써 자기주의를 향상시키는 플러그 앤 플레이 모듈인 Consistent Self-Attention을 도입한다. 이는 재학습을 방지하기 위해 공유된 Q-K-V 가중치를 사용한다.
  • 메모리 소비를 줄이고 장기 스토리 생성을 지원하기 위해 시간 차원에 따라 슬라이딩 윈도우 메커니즘을 적용한다.
  • 두 이미지 간의 운동을 의미론적 공간에서 추정하는 의미론적 운동 예측기를 제안하여 안정적이고 일관된 영상 전환 생성을 가능하게 한다.
  • Consistent Self-Attention를 사전 훈련된 운동 모듈과 결합하여 시각적 일관성과 시간적 부드러움이 향상된 영상을 생성한다.
  • 추가 훈련 없이 기존 사전 훈련된 확산 모델과 통합 가능한 제로샷, 추론 시점 접근 방식을 사용한다.
  • 각 스토리 세그먼트를 단일 이미지 또는 영상 프레임으로 매핑하는 프롬프트 기반 스토리 분해 전략을 활용하여 일관성 있는 생성을 실현한다.

실험 결과

연구 질문

  • RQ1세부 조정 없이 추가 훈련 없이 자기주의를 수정하여 텍스트-이미지 생성에서 이미지 간 일관성을 향상시킬 수 있는가?
  • RQ2장기간의 생성된 이미지 및 영상 간에 일관된 주체의 신원과 복장을 어떻게 유지할 수 있는가?
  • RQ3의미론적 공간에서의 운동 예측은 잠재 공간 기반 운동 예측보다 더 안정적인 영상 전환을 유도하는가?
  • RQ4경량의 플러그 앤 플레이 모듈이 최소한의 계산 오버헤드로 최신 기술 성능을 달성할 수 있는가?
  • RQ5IP-Adapter 및 PhotoMaker과 같은 기존 제어 방법과 비교해 본다면, 제안된 방법은 사용자가 인식하는 일관성과 제어 가능성 측면에서 어떻게 다른가?

주요 결과

  • StoryDiffusion는 주체 일관성 있는 이미지 생성에서 사용자 선호도 점수 72.8%를 기록하여 IP-Adapter(10.4%)와 PhotoMaker(16.8%)를 크게 앞서며 성능을 뛰어넘었다.
  • 전환 영상 생성에서 StoryDiffusion는 사용자 선호도 82%를 기록하여 SEINE(11.6%)와 SparseCtrl(6.4%)를 뛰어넘었다.
  • 정량적으로 StoryDiffusion는 LPIPS-frames 0.1635와 CLIPSIM-frames 0.9870를 기록하며, 모든 네 가지 지표에서 SEINE 및 SparseCtrl를 초월했다.
  • 절단 실험을 통해 Consistent Self-Attention에서 샘플링 비율 0.5가 일관성과 확산 과정에 미치는 간섭 사이의 최적 균형을 확보함을 확인했다.
  • PhotoMaker와 조합해도 신원과 복장을 성공적으로 유지함으로써 확장성과 플러그 앤 플레이 호환성을 입증했다.
  • 의미론적 운동 예측기는 정량적 지표와 정성적 사용자 평가를 통해 잠재 공간 기반 방법보다 더 안정적인 영상을 생성함을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.