Skip to main content
QUICK REVIEW

[논문 리뷰] StableVideo: Text-driven Consistency-aware Diffusion Video Editing

Wenhao Chai, Xun Guo|arXiv (Cornell University)|2023. 08. 18.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

StableVideo는 프레임 간 전파와 계층적 애트라스 표현을 활용하여 편집된 객체의 기하학적·시간적 일관성을 보장하는 텍스트 기반 확산 영상 편집 프레임워크를 소개한다. 최신 기술보다 낮은 계산 복잡도로 뛰어난 편집 품질을 달성하며, Tune-A-Video 및 Text2LIVE와 같은 접근 방식보다 정량적·정성적 지표에서 모두 뛰어난 성능을 보인다.

ABSTRACT

Diffusion-based methods can generate realistic images and videos, but they struggle to edit existing objects in a video while preserving their appearance over time. This prevents diffusion models from being applied to natural video editing in practical scenarios. In this paper, we tackle this problem by introducing temporal dependency to existing text-driven diffusion models, which allows them to generate consistent appearance for the edited objects. Specifically, we develop a novel inter-frame propagation mechanism for diffusion video editing, which leverages the concept of layered representations to propagate the appearance information from one frame to the next. We then build up a text-driven video editing framework based on this mechanism, namely StableVideo, which can achieve consistency-aware video editing. Extensive experiments demonstrate the strong editing capability of our approach. Compared with state-of-the-art video editing methods, our approach shows superior qualitative and quantitative results. Our code is available at \href{https://github.com/rese1f/StableVideo}{this https URL}.

연구 동기 및 목표

  • 확산 기반 영상 편집에서 시간적 일관성이 부족한 문제, 특히 프레임 간 객체 외관 변화에 대응하기 위해.
  • 시점 변화로 인한 기하학적 왜곡이 발생하는 직접 애트라스 편집의 한계를 극복하기 위해.
  • 기존 기하학적 구조와 운동을 유지하면서도 배경 및 전경 객체에 대해 고해상도의 텍스트 기반 편집을 가능하게 하기 위해.
  • 기존 확산 기반 영상 편집 방법보다 계산 복잡도를 낮추기 위해.

제안 방법

  • 핵심 프레임 간 외관을 부분 애트라스 표현을 통해 정렬하는 프레임 간 전파 메커니즘을 도입하여 기하학적 일관성을 유지한다.
  • 텍스트 프롬프트에 기반해 핵심 프레임을 편집하는 확산 모델을 활용하며, 이전 프레임의 전파된 외관을 기반으로 노이즈 제거를 유도한다.
  • 편집된 애트라스를 핵심 프레임 편집에서 재구성하기 위해 집합 네트워크를 사용하여 모든 영상 프레임으로의 정확한 매핑을 보장한다.
  • 신경계층 애트라스(Neural Layered Atlas, NLA)를 활용해 영상을 전경 및 배경 레이어로 분해함으로써 정밀한 객체 수준의 편집을 가능하게 한다.
  • 프레임 간 전파 모듈에서 실현 가능성과 외관 일관성 간 균형을 맞추기 위해 초기화 파라미터 $ t_0 $ 를 적용하며, 이는 이진 탐색을 통해 최적화된다.
  • 전경 및 배경 편집에 동일한 확산 기반 모델을 공유함으로써 효율적이고 확장 가능한 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1복잡한 운동과 시점 변화가 있는 장시간 영상 시퀀스에서 텍스트 기반 확산 모델이 일관된 외관 편집을 달성할 수 있는가?
  • RQ2확산 모델을 사용해 특정 객체를 영상에서 편집할 때 시간적 일관성을 어떻게 유지할 수 있는가?
  • RQ3프레임 간 전파를 사용한 핵심 프레임 편집이 직접 애트라스 편집보다 시각적 정확도와 일관성 측면에서 뛰어나게 되는가?
  • RQ4확산 기반 영상 편집에서 실현 가능성과 외관 일관성 사이의 최적의 트레이드오프는 무엇인가?
  • RQ5사전 학습된 확산 모델과 계층적 표현을 활용해 경량이면서도 일관성 있는 영상 편집 프레임워크를 구축할 수 있는가?

주요 결과

  • StableVideo는 CLIP 점수 0.2713을 기록했으며, Tune-A-Video(0.2787)와 유사한 성능을 보였지만, LPIPS-P(0.1613 vs. 0.6346)와 LPIPS-T(0.0386 vs. 0.1851)에서 뚜렷한 우월성을 보이며 더 높은 일관성을 입증했다.
  • 밀도 있는 광학 흐름 일관성 평가에서 StableVideo는 전경 편집 시 3.34, 복합 편집 시 11.48의 점수를 기록했으며, Tune-A-Video(4.63 및 12.74)와 Text2LIVE(1.99 및 7.39)를 모두 앞섰다.
  • 절단 실험을 통해 $ t_0 \approx 0.8 $ 인 프레임 간 전파가 실현 가능성과 외관 일관성 사이의 최적 균형을 이룬다는 것이 확인되었다.
  • 직접 애트라스 편집은 심각한 기하학적 왜곡과 일관성 결여를 야기하며, 핵심 프레임 편집에 전파 기반 기법이 반드시 필요함을 입증했다.
  • ‘积雪 겨울의 오렌지 SUV’ 편집 사례에서 장거리 운동과 시점 변화 조건에서도 높은 일관성을 유지하는 것으로 나타났다.
  • 비정형 변형의 경우 실패를 보이며, 복잡한 객체 역학을 다루는 데 현재의 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.