Skip to main content
QUICK REVIEW

[논문 리뷰] Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising

Fuyun Wang, Wenshuo Chen|arXiv (Cornell University)|2023. 05. 29.
Generative Adversarial Networks and Image Synthesis인용 수 7
한 줄 요약

이 논문은 추가 학습 없이도 오프더섀프트( off-the-shelf ) 단일 영상 확산 모델을 활용하여 다중 텍스트 조건부 장영상 생성 및 편집이 가능한 새로운 프레임워크인 Gen-L-Video를 제안한다. 겹치는 단일 영상 클립을 통한 시간적 공통 노이즈 제거와 양방향 교차 프레임 어텐션을 활용함으로써, 수백 프레임에 걸쳐 높은 프레임 일致성과 의미적 일치도를 달성하며, 정량적 및 정성적 평가에서 고립된 노이즈 제거 및 기존 방법들을 크게 능가한다.

ABSTRACT

Leveraging large-scale image-text datasets and advancements in diffusion models, text-driven generative models have made remarkable strides in the field of image generation and editing. This study explores the potential of extending the text-driven ability to the generation and editing of multi-text conditioned long videos. Current methodologies for video generation and editing, while innovative, are often confined to extremely short videos (typically less than 24 frames) and are limited to a single text condition. These constraints significantly limit their applications given that real-world videos usually consist of multiple segments, each bearing different semantic information. To address this challenge, we introduce a novel paradigm dubbed as Gen-L-Video, capable of extending off-the-shelf short video diffusion models for generating and editing videos comprising hundreds of frames with diverse semantic segments without introducing additional training, all while preserving content consistency. We have implemented three mainstream text-driven video generation and editing methodologies and extended them to accommodate longer videos imbued with a variety of semantic segments with our proposed paradigm. Our experimental outcomes reveal that our approach significantly broadens the generative and editing capabilities of video diffusion models, offering new possibilities for future research and applications. The code is available at https://github.com/G-U-N/Gen-L-Video.

연구 동기 및 목표

  • 기존 텍스트-영상 모델이 일반적으로 <24 프레임 이하의 짧은 영상에 국한되고 단일 텍스트 조건부에 국한되는 한계를 해결하기 위해.
  • 다양한 의미적 세그먼트에 걸쳐 다중 텍스트 프롬프트를 활용하여 일관되고 논리적인 장영상 생성을 가능하게 하기 위해.
  • 추가 학습 없이도 기존 단일 영상 확산 모델을 장영상 생성 및 편집에 일반화된 프레임워크로 확장하기 위해.
  • 장영상에서 높은 프레임 일관성과 텍스트 일치도를 유지하면서도 객체 교체, 스타일 전이, 자세 제어 등의 편집 작업을 지원하기 위해.
  • 자기연쇄적 장영상 생성에서 발생하는 콘텐츠 열화와 추론 비효율성을 해결하기 위해 겹치는 클립 노이즈 제거 전략을 사용하기 위해.

제안 방법

  • 장영상은 겹치는 단일 영상 클립의 시퀀스로 간주되어 시간 경계를 넘는 공동 노이즈 제거가 가능하도록 한다.
  • 각 단일 영상 클립은 서로 다른 텍스트 조건 하에서 기존 오프더섀프 텍스트-영상 확산 모델을 통해 독립적으로 노이즈 제거된다.
  • 이웃 클립을 겹쳐서 사용함으로써 시간적 공통 노이즈 제거 전략을 적용한다 (예: 스트라이드=4, 클립 길이=16 프레임), 클립 경계에서의 일관성을 향상시킨다.
  • 노이즈 제거 과정에서 시간 방향으로 앞뒤로 정보가 유입될 수 있도록 양방향 교차 프레임 어텐션을 도입하여 시간적 일관성을 향상시킨다.
  • 일괄 튜닝 파이프라인에서 영상 클립 식별자를 사용하여 운동 연속성을 유지하고 무작위 노이즈 사용 시 콘텐츠 일관성 문제를 방지한다.
  • 노이즈 제거된 클립들을 통합하고 원래의 장영상으로 복원함으로써, 학습 없이도 추상적인 장영상 생성기로 기능하는 프로세스를 완성한다.

실험 결과

연구 질문

  • RQ1추가 학습 없이 오프더섀프 단일 영상 확산 모델을 활용하여 수백 프레임에 이르는 장영상 생성이 효과적으로 가능할 수 있는가?
  • RQ2다양한 영상 세그먼트에서 의미적 일관성을 유지하면서도 다중 텍스트 조건부 장영상 생성을 어떻게 지원할 수 있는가?
  • RQ3클립들이 독립적으로 노이즈 제거될 경우, 어떤 시간적 노이즈 제거 전략이 장영상에서 높은 프레임 일관성을 달성하는가?
  • RQ4희소 인과 어텐션 대비 양방향 교차 프레임 어텐션은 시간적 일관성에 얼마나 더 높은 기여를 하는가?
  • RQ5제안된 프레임워크는 객체 교체, 배경 변경, 스타일 전이, 마스크 가이던스 기반 영상 인painting 등의 다양한 편집 작업을 지원할 수 있는가?

주요 결과

  • Gen-L-Video는 고립된 노이즈 제거 대비 93.18(비교 대상: 91.65)의 프레임 일관성 점수를 기록하여 시간적 일관성 향상이 뚜렷하게 입증되었다.
  • 텍스트 일치도 점수는 21.18(비교 대상: 21.16)이며, 분산 값은 0.48(비교 대상: 0.57)로, 더 안정적이고 정확한 텍스트-영상 일치를 나타낸다.
  • 인간 선호 평가 결과, Gen-L-Video는 고립된 노이즈 제거 대비 85.38%의 높은 선호도를 보이며 프레임 일관성과 텍스트 일치도에서 유의미한 우월성을 입증했다.
  • 이 프레임워크는 객체 교체, 배경 변경, 스타일 전이, 자세 제어 등 다양한 편집 작업을 일관된 결과로 성공적으로 지원한다.
  • 단절 실험 결과, 양방향 교차 프레임 어텐션은 희소 인과 어텐션 대비 초기 프레임에서의 일관성 저하를 줄이는 데 기여함을 확인했다.
  • 이 방법은 재학습 없이도 기존의 사전 학습된 모델만으로도 수백 프레임에 이르는 장영상 생성이 가능하며, 자기연쇄적 접근 방식의 콘텐츠 열화 및 비효율성 문제를 피할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.