Skip to main content
QUICK REVIEW

[논문 리뷰] Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models

Hyeonho Jeong, Jong Chul Ye|arXiv (Cornell University)|2023. 10. 02.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

Ground-A-Video는 훈련 없이, 제로샷으로 작동하는 비디오 편집 프레임워크를 제안하며, 공간적으로 분리된 지정(경계 상자와 캡션)과 공간적으로 연속적인 조건(광학 흐름 및 깊이 맵)을 통합하여 정밀하고 시간적으로 일관된 다중 속성 편집을 가능하게 한다. 이를 위해 교차 프레임 게이팅 어텐션, 모odulated 크로스 어텐션, 광학 흐름 유도 잠재 스무딩을 도입하여 편집 정확도와 프레임 일관성을 향상시켰으며, 정성적 및 정량적 기준에서 기존 방법들을 능가한다.

ABSTRACT

Recent endeavors in video editing have showcased promising results in single-attribute editing or style transfer tasks, either by training text-to-video (T2V) models on text-video data or adopting training-free methods. However, when confronted with the complexities of multi-attribute editing scenarios, they exhibit shortcomings such as omitting or overlooking intended attribute changes, modifying the wrong elements of the input video, and failing to preserve regions of the input video that should remain intact. To address this, here we present a novel grounding-guided video-to-video translation framework called Ground-A-Video for multi-attribute video editing. Ground-A-Video attains temporally consistent multi-attribute editing of input videos in a training-free manner without aforementioned shortcomings. Central to our method is the introduction of Cross-Frame Gated Attention which incorporates groundings information into the latent representations in a temporally consistent fashion, along with Modulated Cross-Attention and optical flow guided inverted latents smoothing. Extensive experiments and applications demonstrate that Ground-A-Video's zero-shot capacity outperforms other baseline methods in terms of edit-accuracy and frame consistency. Further results and code are available at our project page (http://ground-a-video.github.io).

연구 동기 및 목표

  • 기존의 비디오 편집 방법이 다중 속성 편집에서 겪는 한계, 즉 의미적 불일치, 일관되지 않은 프레임 전환, 예기치 않은 수정 등을 해결하기 위해.
  • 비디오 데이터에 대한 디퓨전 모델의 파라미터를 미세조정하지 않고도 높은 정확도와 시간적으로 일관된 비디오 편집을 가능하게 하기 위해.
  • 공간적으로 분리된(지정) 및 공간적으로 연속적인(광학 흐름, 깊이) 조건을 통합하여 제어력과 일관성을 향상시키기 위해.
  • 입력 비디오의 변경되지 않은 영역을 유지하면서도 특정 속성만 정확히 수정하기 위해.
  • 텍스트-이미지 기초 모델과 역전환 기반 기법을 유일한 도구로 사용하여 제로샷 비디오 편집의 가능성을 입증하기 위해.

제안 방법

  • 시간적으로 순차적으로 공간적으로 국한된 조건을 고려하여 지정 정보를 비디오 프레임 전반에 걸쳐 일관되게 전파하기 위해 교차 프레임 게이팅 어텐션을 도입한다.
  • 텍스트-이미지 모델에서 유도된 서로 다른 최적화 수준의 무조건적 임bedding 간 효과적인 상호작용을 가능하게 하기 위해 모odulated 크로스 어텐션을 제안한다.
  • 정적 영역에서의 아티팩트를 줄이고 시간적 일관성을 향상시키기 위해 역전환된 잠재 표현에 광학 흐름 기반 스무딩을 적용한다.
  • 구조적 일관성을 유지하기 위해 팽창된 ControlNet을 통해 깊이 맵과 광학 흐름 맵과 같은 제어 조건을 사용한다.
  • 경계 상자 좌표와 텍스트 캡션을 지정으로 사용하여 복잡한 의미적 편집을 분리하고 정밀한 속성 수정을 유도한다.
  • 이중 단계 프로세스를 활용한다: 비디오 역전환 이후, 지정 및 구조적 조건를 통합한 디퓨전 기반 편집을 수행한다.

실험 결과

연구 질문

  • RQ1지정 정보는 제로샷 비디오 편집에서 편집 정확도와 시간적 일관성을 향상시키는 데 효과적으로 활용될 수 있는가?
  • RQ2공간적으로 연속적인(광학 흐름, 깊이) 조건과 공간적으로 분리된(경계 상자) 조건의 통합은 비디오 편집 성능에 어떤 영향을 미치는가?
  • RQ3훈련 없이도 비디오 데이터셋에 대한 미세조정 없이 고해상도의 다중 속성 비디오 편집을 달성할 수 있는가?
  • RQ4교차 프레임 게이팅 어텐션은 편집 정확도와 프레임 일관성을 유지하는 데 있어 프레임 독립 어텐션 메커니즘보다 뛰어나게 작용하는가?
  • RQ5지정의 교차에서 유도된 인painting 마스크는 변경되지 않은 비디오 영역을 얼마나 잘 보존하는가?

주요 결과

  • 사용자 연구와 정량적 지표를 통해 검증된 lin 결과, Ground-A-Video는 기준 방법 대비 다중 속성 편집에서 뛰어난 편집 정확도와 프레임 일관성을 확보하였다.
  • 제거 분석 결과, 광학 흐름 기반 잠재 스무딩이 정적 영역에서의 아티팩트를 크게 감소시켜 재구성 품질을 향상시킨다는 것이 확인되었다.
  • 깊이 맵을 사용한 ControlNet 가이던스는 복잡한 물체(예: 토끼, 펜구인)의 정확한 구조 재구성에 필수적임을 입증하였다.
  • 교차 프레임 게이팅 어텐션은 특히 '남성 → 아이언맨'과 같은 속성 편집 작업에서 의미적 불일치와 외관의 차이를 줄여 주었다.
  • 지정의 교차에서 유도된 마스크를 사용한 인페인팅은 변경되지 않은 영역을 식별하고 보호함으로써 보존 정확도를 향상시켰다.
  • 이 방법은 자세 맵 가이던스를 활용한 제로샷 텍스트-비디오 생성도 가능하게 하여 편집 외적 응용 가능성까지 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.