Skip to main content
QUICK REVIEW

[논문 리뷰] CVPR 2023 Text Guided Video Editing Competition

Jay Zhangjie Wu, Xiuyu Li|arXiv (Cornell University)|2023. 10. 24.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

이 논문은 CVPR 2023 텍스트 가이드드 비디오 편집(TGVE) 경쟁을 소개하며, 스타일, 배경, 객체, 다중 편집 변화를 포함한 각각 4개의 편집 프롬프트를 가진 총 76개의 비디오로 구성된 표준화된 벤치마크 데이터셋을 제안한다. 우승한 방법인 Team CAMP의 이중단계 비디오 편집(2SVE) 파이프라인은 ControlNet, Segment Anything Model(SAM), OpenCLIP 및 미세조정된 MSVD 데이터를 활용하여 편집 정확도와 시간적 일관성을 높였으며, 인간 평가의 59.1%에서 베이스라인을 능가했다.

ABSTRACT

Humans watch more than a billion hours of video per day. Most of this video was edited manually, which is a tedious process. However, AI-enabled video-generation and video-editing is on the rise. Building on text-to-image models like Stable Diffusion and Imagen, generative AI has improved dramatically on video tasks. But it's hard to evaluate progress in these video tasks because there is no standard benchmark. So, we propose a new dataset for text-guided video editing (TGVE), and we run a competition at CVPR to evaluate models on our TGVE dataset. In this paper we present a retrospective on the competition and describe the winning method. The competition dataset is available at https://sites.google.com/view/loveucvpr23/track4.

연구 동기 및 목표

  • 텍스트 가이드드 비디오 편집(TGVE) 모델 평가를 위한 표준화된 벤치마크가 부족한 문제를 해결하기 위해, 이는 분야 내 진전과 모델 비교를 저해한다.
  • 스타일, 배경, 객체 및 다중 변화를 포함한 다양한 편집 유형을 다루는 76개의 비디오로 구성된 공개 가능하고 고품질의 데이터셋을 구축한다.
  • CVPR 2023에서 자동화된 평가 지표와 인간 평가 지표를 모두 활용하여 TGVE 모델을 평가하는 경쟁을 조직한다.
  • 통제된, 개방된 경쟁을 통해 기존 TGVE 방법의 강점과 약점을 분석하고, 투명한 평가를 실시한다.
  • 향후 연구 및 개발을 가능하게 하는 재현 가능한 개방형 벤치마크를 확립한다.

제안 방법

  • 경쟁용 데이터셋은 100개의 공공 라이선스 비디오(DAVIS, YouTube, Videvo)에서 유래하였으며, 품질과 다양성을 고려해 76개로 필터링되었고, 각 비디오는 480×480 해상도로 자르고 내려받아 32 또는 128 프레임으로 변환되었다.
  • 각 비디오는 지상 진술 캡션과 함께 4개의 편집 프롬프트(스타일 변경, 배경 변경, 객체 변경, 다중 변경)로 애너테이션 처리되었으며, LLM을 활용한 반복적 프롬프팅 및 인간 검증을 통해 작성되었다.
  • 우승한 방법인 이중단계 비디오 편집(2SVE) 파이프라인은 텍스트 및 이미지 프롬프트를 조건으로 하는 확산 모델을 사용해 편집에 맞는 프레임을 먼저 생성한 후, ControlNet과 VPA(비디오 프롬프트 앵커)를 활용해 결과를 보정하여 공간적 및 시간적 일관성을 확보한다.
  • 2SVE 파이프라인은 정밀한 객체 마스킹을 위해 Segment Anything Model(SAM)을 통합하고, 텍스트-이미지 정렬을 향상시키기 위해 OpenCLIP을 활용하며, MSVD 데이터셋에 대해 미세조정하여 프롬프트-비디오 정렬을 향상시켰다.
  • 신규로 도입된 다중 프레임 비디오 렌더링(MVSD) 기법은 첫 번째 및 이전 프레임의 출력을 참조로 삼아 인painting을 수행하여 스타일 일관성을 향상시키고 프레임 간 플리커를 감소시켰다.
  • 목표 세그먼트 처리(TSP) 기법을 사용해 인painting 마스크를 보정함으로써, 인접 프레임의 간섭을 최소화하면서도 구조적 일관성과 운동 일관성을 유지한다.

실험 결과

연구 질문

  • RQ1텍스트 가이드드 비디오 편집 모델 평가의 핵심 과제는 무엇이며, 이를 공정하게 비교할 수 있는 표준화된 벤치마크를 어떻게 설계할 수 있는가?
  • RQ2ControlNet, SAM, CLIP 등의 다양한 아키텍처 구성 요소가 TGVE에서 편집 정확도와 시간적 일관성에 기여하는 방식은 무엇인가?
  • RQ3이중단계 학습 및 추론 파이프라인은 종단 간(end-to-end) 방법에 비해 비디오 편집 품질을 얼마나 향상시킬 수 있는가?
  • RQ4인간 평가자들은 다양한 편집 유형에서 생성된 편집의 현실성, 일관성 및 프롬프트 일치도를 어떻게 평가하는가?
  • RQ5MSVD와 같은 기존 데이터셋에 대한 미세조정이 프롬프트-비디오 정렬 및 편집 품질 향상에 어떤 역할을 하는가?

주요 결과

  • TGVE 2023 경쟁 데이터셋은 총 76개의 비디오와 304개의 편집 프롬프트를 포함하며, 스타일, 배경, 객체, 다중 변화 유형을 커버하고 있으며, 경쟁 사이트에서 공개 가능하다.
  • Team CAMP의 이중단계 비디오 편집(2SVE) 파이프라인은 모든 편집 유형에서 인간 평가의 59.1%에서 베이스라인 모델을 능가하여 경쟁에서 우승했다.
  • 2SVE 방법은 높은 시각적 품질과 강력한 시간적 일관성을 달성했으며, 특히 스타일 전이 및 객체 편집 작업에서 플리커가 최소화되고 구조적 세부 정보가 유지되었다.
  • SAM을 통한 인스턴스 세그먼테이션과 ControlNet을 통한 공간 제어의 통합은 정확한 국소화 및 불필요한 편집을 줄이는 데 기여했다.
  • MSVD 데이터셋에 대한 미세조정은 특히 다중 변경이나 미세한 스타일 이동을 포함한 복잡한 편집에서 프롬프트-비디오 정렬을 향상시켰다.
  • 인간 평가 결과, 2SVE 파이프라인은 배경과 운동 구조를 유지하는 데서 특히 뛰어난 자연스러움, 일관성, 프롬프트 일치도를 보였으며, 베이스라인 모델보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.