Skip to main content
QUICK REVIEW

[논문 리뷰] StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text

Roberto Henschel, Levon Khachatryan|arXiv (Cornell University)|2024. 03. 21.
Video Analysis and Summarization인용 수 4
한 줄 요약

StreamingT2V는 짧은 기억을 위한 조건부 어텐션 모듈(CAM)과 장기 기억을 위한 외형 유지 모듈(APM)을 도입함으로써, 고해상도, 일관되고 동적인 장시간 영상 생성(최대 1200 프레임)을 가능하게 하는 자동회귀적 텍스트-비디오 확산 모델이다. 이는 부드러운 전환과 최소한의 영상 정지 현상을 보장한다. 이 모델은 운동 일관성과 시간적 일관성에서 최신 기술 수준의 성능을 달성하며, MAWE 및 SCuts와 같은 핵심 지표에서 기존 방법들을 능가한다.

ABSTRACT

Text-to-video diffusion models enable the generation of high-quality videos that follow text instructions, making it easy to create diverse and individual content. However, existing approaches mostly focus on high-quality short video generation (typically 16 or 24 frames), ending up with hard-cuts when naively extended to the case of long video synthesis. To overcome these limitations, we introduce StreamingT2V, an autoregressive approach for long video generation of 80, 240, 600, 1200 or more frames with smooth transitions. The key components are:(i) a short-term memory block called conditional attention module (CAM), which conditions the current generation on the features extracted from the previous chunk via an attentional mechanism, leading to consistent chunk transitions, (ii) a long-term memory block called appearance preservation module, which extracts high-level scene and object features from the first video chunk to prevent the model from forgetting the initial scene, and (iii) a randomized blending approach that enables to apply a video enhancer autoregressively for infinitely long videos without inconsistencies between chunks. Experiments show that StreamingT2V generates high motion amount. In contrast, all competing image-to-video methods are prone to video stagnation when applied naively in an autoregressive manner. Thus, we propose with StreamingT2V a high-quality seamless text-to-long video generator that outperforms competitors with consistency and motion. Our code will be available at: https://github.com/Picsart-AI-Research/StreamingT2V

연구 동기 및 목표

  • 기존 텍스트-비디오 확산 모델이 시간적 불일치와 영상 정지 현상으로 인해 장시간 일관성 있는 영상을 생성하지 못하는 한계를 해결하기 위해.
  • 단일 영상 모델을 장시간 시퀀스로 연장할 때 운동 다이내믹스와 외형 일관성의 열화를 극복하기 위해.
  • 장시간 영상 생성 동안 고수준의 시점 및 개체 특징을 유지하는 메모리 증강 자동회귀 프레임워크를 설계하기 위해.
  • 청크화된 아티팩트를 유발하지 않도록 비디오 향상 모델을 자동회귀적 생성에 원활하게 통합하기 위해.
  • 다양한 입력 해상도와 모델 아키텍처에 대해 강건하며 고품질의 확장 가능한 영상 생성을 달성하기 위해.

제안 방법

  • 이전 영상 청크의 특징에 조건을 줌으로써 현재 영상 생성을 조절하는 조건부 어텐션 모듈(CAM)을 도입하여 부드러운 전환을 보장한다.
  • 첫 번째 영상 프레임에서 고수준의 시점 및 개체 특징을 추출하고 유지함으로써 시간이 지남에 따라 외형 이탈을 방지하는 외형 유지 모듈(APM)을 활용한다.
  • 별도의 비디오 향상기구를 자동회귀 파이프라인에 통합할 때, 겹치는 영상 청크를 원활하게 결합하기 위해 무작위 블렌딩 전략을 적용한다.
  • 장기적 외형 일관성을 위해 고정된 앵커 프레임을 기준으로 삼아 CLIP 기반 조건화에서 발생하는 도메인 이동 문제를 줄인다.
  • SDEdit 방법을 자동회귀 비디오 향상에 적응하여 24프레임 겹침 청크에 적용하고, 무작위 블렌딩을 통해 시간적 불일치를 방지한다.
  • 다양한 기본 텍스트-비디오 모델과 호환되며 향후 더 나은 기본 모델로의 향상이 가능하도록 확장 가능한 프레임워크를 설계한다.

실험 결과

연구 질문

  • RQ1영상 정지나 시점 전환 없이 장시간 영상 시퀀스에서 자동회귀적 텍스트-비디오 생성을 어떻게 일관성 있게 유지할 수 있는가?
  • RQ2자동회귀적 영상 생성 중에 장기적인 시각적 일관성(예: 개체 정체성, 시점 레이아웃)을 효과적으로 유지할 수 있는 메커니즘은 무엇인가?
  • RQ3비디오 향상 모델을 자동회귀적 영상 생성에 통합할 때 시간적 불일치를 유발하지 않도록 하기 위해선 어떻게 해야 하는가?
  • RQ4어떤 정도로 주의 기반 조건화 메커니즘이 운동 다이내믹스와 전환의 부드러움을 유지하는 데 있어 프레임 기반 또는 CLIP 기반 조건화보다 뛰어나게 작용하는가?
  • RQ5기존 기준 모델 대비 메모리 증강 아키텍처가 장시간 텍스트-비디오 생성에서 운동 품질과 시간적 일관성을 얼마나 크게 향상시킬 수 있는가?

주요 결과

  • StreamingT2V는 모든 경쟁 오픈소스 방법 중에서 가장 낮은 MAWE 점수(10.87)를 기록하여 뛰어난 운동 일관성과 영상 정지 현상 감소를 입증한다.
  • SCuts 점수는 0.04로 가장 낮게 기록되었으며, FreeNoise와 SEINE만이 이를 따라가지만, 이들과 달리 높은 운동 다이내믹스를 유지하고 거의 정적 영상이 생성되지 않는다.
  • CLIP 점수는 31.30으로 경쟁자 중 두 번째로 높은 수준을 기록하여 APM에서 유도된 장기적 메모리 덕분에 강력한 텍스트 정렬 능력을 보여준다.
  • APM은 외형 이탈을 크게 감소시켜 1200프레임 영상 전반에 걸쳐 개체 및 시점 특징을 유지함을 정량적·정성적 분석으로 입증한다.
  • 무작위 블렌딩 전략은 겹치는 청크에 걸쳐 비디오 향상기구를 일관되게 적용하여 향상된 장시간 영상에서 시간적 아티팩트를 방지한다.
  • Qualitative 결과는 스무스하고 아티팩트 없는 전환과 정지 현상 없음을 보여주며, 모든 평가된 방법보다 운동 다이내믹스와 시간적 일관성에서 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.