Skip to main content
QUICK REVIEW

[논문 리뷰] MagicProp: Diffusion-based Video Editing via Motion-aware Appearance Propagation

Hanshu Yan, Jun Hao Liew|arXiv (Cornell University)|2023. 09. 02.
Generative Adversarial Networks and Image SynthesisComputer Science인용 수 3
한 줄 요약

MagicProp는 영상 확산 모델을 기반으로 한 비디오 편집 프레임워크로, 편집을 외형 편집과 운동 인식 외형 전파로 분리한다. 이미지 확산 모델을 통해 편집된 参照 프레임을 사용하고, 운동 신호와 参照 외형을 통합한 조건부 확산 모델(PropDPM)을 사용해 순차적으로 이후 프레임을 생성함으로써 높은 시간적 일관성과 최소한의 잡음으로 유연한 지역 편집을 달성한다.

ABSTRACT

This paper addresses the issue of modifying the visual appearance of videos while preserving their motion. A novel framework, named MagicProp, is proposed, which disentangles the video editing process into two stages: appearance editing and motion-aware appearance propagation. In the first stage, MagicProp selects a single frame from the input video and applies image-editing techniques to modify the content and/or style of the frame. The flexibility of these techniques enables the editing of arbitrary regions within the frame. In the second stage, MagicProp employs the edited frame as an appearance reference and generates the remaining frames using an autoregressive rendering approach. To achieve this, a diffusion-based conditional generation model, called PropDPM, is developed, which synthesizes the target frame by conditioning on the reference appearance, the target motion, and its previous appearance. The autoregressive editing approach ensures temporal consistency in the resulting videos. Overall, MagicProp combines the flexibility of image-editing techniques with the superior temporal consistency of autoregressive modeling, enabling flexible editing of object types and aesthetic styles in arbitrary regions of input videos while maintaining good temporal consistency across frames. Extensive experiments in various video editing scenarios demonstrate the effectiveness of MagicProp.

연구 동기 및 목표

  • 유연한 지역별 비디오 편집을 가능하게 하면서도 시간적 일관성을 유지하는 데 도전 과제를 해결할 것.
  • 비디오 편집을 두 단계로 분리: 외형 편집과 운동 인식 전파로써 영구성과 일관성을 균형 잡는 것.
  • 강력한 이미지 편집 기법을 사용해 배경, 전경 또는 전역 영역을 자유롭게 편집할 수 있도록 할 것.
  • 각 프레임 간 외형 유지 정확도와 운동 일관성을 보존하는 조건부 확산 모델을 개발할 것.
  • 기존 방법들이 일관성을 위해 편집 가능성이나 반대로 편집 가능성을 위해 일관성을 희생하는 한계를 극복할 것.

제안 방법

  • 입력 비디오에서 단일 参照 프레임을 선택하고, 텍스트 프롬프트, 세그멘테이션 마스크 등 이미지 편집 기법을 적용해 내용이나 스타일을 수정할 것.
  • 이전 프레임, 参照 프레임, 운동 시퀀스(예: 깊이 맵)를 조건으로 하여 PropDPM이라는 순차적 확산 모델을 사용해 나머지 프레임을 생성할 것.
  • 가벼운 외형 어댑터를 설계하여 参照 프레임의 클래스 수준(CLIP) 및 픽셀 수준(VAE) 특징을 확산 모델의 크로스 어텐션 레이어에 통합할 것.
  • 훈련과 추론 간 노이즈 스케줄을 일치시키기 위해 제로 종단 신호 대 잡음비(SNR) 훈련 전략을 적용하여 색상 이동 및 시각적 품질 향상을 개선할 것.
  • Triplets(참조, 이전, 목표) 프레임 조합을 사용해 WebVid-10M와 기업 내 고해상도 비디오 데이터셋을 병합하여 PropDPM을 훈련할 것.
  • 깊이 맵과 세그멘테이션 마스크와 같은 제어 신호를 활용해 정밀한 공간적 편집을 유도하면서도 운동 일관성을 유지할 것.
Figure 1: Video editing via MagicProp: global, background, and foreground editing are all supported.
Figure 1: Video editing via MagicProp: global, background, and foreground editing are all supported.

실험 결과

연구 질문

  • RQ1이미지 편집과 순차적 확산 모델을 조합한 이중 단계 프레임워크가 비디오 편집에서 높은 편집 가능성과 강력한 시간적 일관성을 동시에 달성할 수 있는가?
  • RQ2참조 외형과 운동 신호를 조건으로 하는 확산 모델이 프레임 간 시각적 정확도를 얼마나 효과적으로 유지할 수 있는가?
  • RQ3제로 종단 SNR 훈련 스케줄이 생성된 프레임과 参照 간 색상 및 스타일 일치를 얼마나 향상시키는가?
  • RQ4제안된 외형 어댑터가 의미론적 및 픽셀 수준 특징을 얼마나 정확하게 융합하여 정확한 외형 전달을 유도하는가?
  • RQ5순차적 확산 접근법을 사용할 때 허용 가능한 품질로 편집 가능한 비디오 길이의 상한선은 어느 정도인가?

주요 결과

  • MagicProp는 복잡한 다중 객체 편집이나 스타일 전이를 포함한 복잡한 편집에서도 높은 품질의 비디오 편집과 강력한 시간적 일관성을 달성한다.
  • 제로 종단 SNR 훈련 전략은 색상 이동 잡음을 크게 감소시켜 기존 DDPM 노이즈 스케줄 대비 시각적 정확도를 향상시킨다.
  • 외형 어댑터는 CLIP 기반 의미 토큰과 VAE 기반 픽셀 특징을 효과적으로 융합하여 생성된 프레임에 정확한 외형 전달을 가능하게 한다.
  • 텍스트 프롬프트나 세그멘테이션 마스크를 사용해 전경, 배경 또는 전역 영역을 자유롭게 편집할 수 있다.
  • 30 프레임까지는 높은 시각적 품질을 유지하지만, 이를 초월하면 순차적 오차 누적이 원인이 되어 과도하게 부드럽게 뻣뻣한 느낌과 잡음이 발생한다.
  • 광범위한 실험을 통해 MagicProp가 기존의 이미지 기반 및 순서 기반 비디오 편집 방법보다 편집 가능성과 시간적 일관성 측면에서 뛰어난 성능을 보였다.
Figure 2: The pipeline of MagicProp.
Figure 2: The pipeline of MagicProp.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.