Skip to main content
QUICK REVIEW

[논문 리뷰] FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling

Haonan Qiu, Menghan Xia|arXiv (Cornell University)|2023. 10. 23.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

FreeNoise는 사전 훈련된 확산 모델에서 장기적인 시간적 상관관계를 확보하고 창문 기반 어텐션 융합을 통해 고해상도 장동영상을 생성하기 위해 초기 노이즈를 재스케줄링하고, 토너먼트 없는 방법을 제안한다. 또한 미세조정 없이 다중 텍스트 조건을 지원하기 위해 운동 주입 기법을 도입하여 뿌리기만 17%의 추가 추론 시간으로 최신 기술 수준의 영상 품질을 달성한다—기존 방법의 255% 비용보다 훨씬 낮다.

ABSTRACT

With the availability of large-scale video datasets and the advances of diffusion models, text-driven video generation has achieved substantial progress. However, existing video generation models are typically trained on a limited number of frames, resulting in the inability to generate high-fidelity long videos during inference. Furthermore, these models only support single-text conditions, whereas real-life scenarios often require multi-text conditions as the video content changes over time. To tackle these challenges, this study explores the potential of extending the text-driven capability to generate longer videos conditioned on multiple texts. 1) We first analyze the impact of initial noise in video diffusion models. Then building upon the observation of noise, we propose FreeNoise, a tuning-free and time-efficient paradigm to enhance the generative capabilities of pretrained video diffusion models while preserving content consistency. Specifically, instead of initializing noises for all frames, we reschedule a sequence of noises for long-range correlation and perform temporal attention over them by window-based function. 2) Additionally, we design a novel motion injection method to support the generation of videos conditioned on multiple text prompts. Extensive experiments validate the superiority of our paradigm in extending the generative capabilities of video diffusion models. It is noteworthy that compared with the previous best-performing method which brought about 255% extra time cost, our method incurs only negligible time cost of approximately 17%. Generated video samples are available at our website: http://haonanqiu.com/projects/FreeNoise.html.

연구 동기 및 목표

  • 기존 영상 확산 모델이 짧은 영상 클립에서 훈련되며 추론 시 고해상도 장동영상 생성에 실패하는 한계를 해결하기 위해.
  • 미세조정 없이 다중 텍스트 조건을 지원하여 시간에 따라 동적인 콘텐츠 변화를 가능하게 하기 위해.
  • 내용 일관성과 최소한의 계산 오버헤드를 유지하면서 장동영상 생성을 향상시키는 방법을 개발하기 위해.
  • 초기 노이즈의 역할이 시간 모델링에 미치는 영향과 영상 생성 품질에 끼치는 영향을 조사하기 위해.

제안 방법

  • 장기적인 시간적 상관관계를 확보하기 위해 고정된 무작위 노이즈 프레임의 순서를 재스케줄링하는 토너먼트 없는 파라다임인 FreeNoise를 제안한다.
  • 내부 무작위성과 장기적 일관성을 갖춘 노이즈 시퀀스를 생성하기 위해 로컬 노이즈 셔플링을 도입한다. 이는 장기적인 영상 길이에서 일관된 콘텐츠를 가능하게 한다.
  • 중복된 시간 윈도우를 적용하여 사전 훈련된 시간 어텐션 모듈이 더 긴 시퀀스를 처리할 수 있도록 창문 기반 어텐션 융합을 활용한다. 다른 모델 구성 요소에 추가적인 계산 비용이 들지 않는다.
  • 특정 디노이징 단계에서 새로운 운동 신호를 주입함으로써 다중 프롬프트 영상 생성을 지원하기 위해 운동 주입을 설계한다. 이는 물체 형태 복구 단계와 정렬된다.
  • 두 단계의 디노이징 전략을 적용한다. 첫 번째 프롬프트는 레이아웃과 물체 형태를 제어하고, 두 번째 프롬프트는 후속 단계에서 주입되어 운동 변화를 도입한다.
  • 모델의 미세조정 없이 여러 사전 훈련된 모델(VideoCrafter, AnimateDiff, LaVie)에 적용하여 광범위한 적용 가능성과 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1초기 노이즈 분포가 확산 모델에서 장기적인 영상 생성 품질과 일관성에 미치는 영향은 어떠한가?
  • RQ2노이즈 재스케줄링을 통해 미세조정 없이도 추가적인 계산 비용 없이 더 긴 영상 생성이 가능한가?
  • RQ3다중 텍스트 조건을 효과적으로 영상 확산 모델에 통합하여 시간에 따라 변화하는 시나리오 전환을 지원할 수 있는가?
  • RQ4최적의 시점과 레이어에서 새로운 운동 신호를 주입하여 시각적 일관성을 유지하고 매끄러운 전환을 가능하게 할 수 있는가?
  • RQ5창문 기반 어텐션 메커니즘이 사전 훈련된 시간 모듈의 수용 영역을 확장하면서 추가적인 추론 오버헤드 없이 작동할 수 있는가?

주요 결과

  • FreeNoise는 이전 최고 성능 방법의 255% 비용에 비해 뿌리기 뿐만 17%의 추가 추론 시간으로 장기적인 영상 생성에서 최신 기술 수준의 영상 품질을 달성한다.
  • 제거 분석 결과, 노이즈 재스케줄링에서 스트라이드 4가 계산 비용을 두 배로 늘리지 않으면서도 충분한 콘텐츠 일관성을 제공하는 것으로 확인되었다.
  • 운동 주입은 한 번의 영상에서 뛰기에서 서서히 멈추는 행동으로의 전환과 같은 매끄러운 전환을 성공적으로 가능하게 하였으며, 시각적 잡음이 최소한이었다.
  • 새로운 운동이 주입되더라도 주요 주제(예: 말, Bowls)의 외관이 장기적인 영상 시퀀스 동안 유지됨을 확인하였다.
  • 창문 기반 어텐션 융합은 기존 사전 훈련된 시간 어텐션 모듈만으로도 임의의 긴 영상 길이를 처리할 수 있도록 가능하게 하였다.
  • 다양한 벤치마크에서 정성적 및 정량적 결과로 검증된 바와 같이, 이 방법은 장거리 영상 간의 콘텐츠 일관성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.