[논문 리뷰] Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts
Make-A-Protagonist는 텍스트 및 시각적 단서를 활용하여 사전 훈련된 고정된 전문가들의 앙상블을 활용해 프로토콜의 제약 없이 개인화된 비디오 편집을 가능하게 하는 일반적인 비디오 편집 프레임워크를 소개한다. 마스크 기반 노이즈 제거 샘플링과 확산 기반 비디오 생성 모델을 조합함으로써 고해상도 편집을 달성하며, 프로토콜 교체, 배경 편집, 텍스트 기반 비디오 편집 작업에서 텍스트 전용 또는 단일 기반 방법보다 뛰어난 성능을 보인다.
The text-driven image and video diffusion models have achieved unprecedented success in generating realistic and diverse content. Recently, the editing and variation of existing images and videos in diffusion-based generative models have garnered significant attention. However, previous works are limited to editing content with text or providing coarse personalization using a single visual clue, rendering them unsuitable for indescribable content that requires fine-grained and detailed control. In this regard, we propose a generic video editing framework called Make-A-Protagonist, which utilizes textual and visual clues to edit videos with the goal of empowering individuals to become the protagonists. Specifically, we leverage multiple experts to parse source video, target visual and textual clues, and propose a visual-textual-based video generation model that employs mask-guided denoising sampling to generate the desired output. Extensive results demonstrate the versatile and remarkable editing capabilities of Make-A-Protagonist.
연구 동기 및 목표
- 기존의 텍스트 전용 또는 단일 기반 비디오 편집 모델이 설명하기 어려운 개인화된 콘텐츠를 다루는 데에 한계가 있다는 문제를 해결하기 위해.
- 사용자가 텍스트로 쉽게 기술하기 어려운 개인적 정체성을 가진 프로토콜로 프로토콜을 교체할 수 있는 세밀하고 제어 가능한 비디오 편집을 가능하게 하기 위해.
- 사전 훈련된 고정된 모델을 전문가로 활용함으로써 미세조정 또는 데이터 주석 작업이 필요 없도록 하기 위해.
- 배경의 구조와 운동의 정합성을 유지하면서 일관되고 고품질의 비디오 생성을 달성하기 위해.
제안 방법
- 프로토콜의 시각적 특징을 추출하기 위해 비디오 캡션 및 비디오 질의 응답을 위해 BLIP-2를 활용한다.
- 텍스트 기반 설명에서 인스턴스 마스크를 생성하여 비디오 프레임 간의 프로토콜 위치 및 추적을 가능하게 하기 위해 Grounded-SAM과 XMem을 활용한다.
- CLIP 비전 및 DALL-E 2 프리러너를 사용해 시각적 및 텍스트적 단서를 인코딩하여 이미지 및 텍스트 임베딩을 생성한다.
- 구조적 일관성을 유지하기 위해 깊이 및 자세 조건을 통합한 ControlNet을 통합한다.
- 확산 샘플링 중에 시각적 및 텍스트 임베딩과 세그멘테이션 마스크를 융합하기 위해 마스크 기반 노이즈 제거 샘플링 전략을 적용한다.
- 사전 훈련된 이미지에서 비디오로의 확산 모델을 사용하며, 시간 모듈을 통합하고 텍스트에서 이미지로의 프리러너에서 초기화하여 편집된 비디오를 생성한다.
실험 결과
연구 질문
- RQ1사전 훈련된 모델의 미세조정 없이도 시각적 및 텍스트적 단서를 활용해 일반적인 비디오 편집 프레임워크가 프로토콜을 효과적으로 교체할 수 있는가?
- RQ2사전 훈련된 전문가의 앙상블이 설명하기 어려운 개인화된 프로토콜을 다룰 때 미세조정된 모델과 비교해 어떻게 성능을 내는가?
- RQ3표준 텍스트 전용 편집에 비해 마스크 기반 노이즈 제거 샘플링 전략이 얼마나 편집의 정밀도와 일관성 향상에 기여하는가?
- RQ4프로토콜 교체 외에도 배경 편집 및 프로토콜이 포함된 텍스트 기반 비디오 편집 작업에서 이 프레임워크는 어떻게 성능을 내는가?
- RQ5사전 훈련된 모델이 이러한 편집 시나리오에서 유도하는 주요 실패 원인과 편향은 무엇인가?
주요 결과
- Make-A-Protagonist는 프로토콜이 텍스트 임베딩에 잘 반영되지 않는 평범한 개인일지라도, 시각적 및 텍스트적 단서를 사용해 비디오 내 프로토콜 편집을 성공적으로 수행한다.
- 모델의 미세조정 없이도 뛰어난 성능을 내며, 다양한 편집 작업에서 강력한 제로샷 일반화 능력을 입증한다.
- 정성적 비교 결과, DreamBooth-V는 참조 자세에 과적합되어 자연스럽지 않은 운동을 생성하지만, Make-A-Protocton은 낮은 DINO 점수에도 불구하고 더 우수한 운동 실재감을 유지한다.
- 실패 케이스 분석을 통해 원본 비디오에 과적합되며, 특히 프롬프트가 모델의 사전 지식과 일치하지 않는 경우(예: '호랑이'라는 표현이 모호하거나 잘못된 우선순위를 가질 경우) 사전 훈련된 텍스트에서 이미지로의 모델에 편향이 존재함을 확인했다.
- 더 정밀한 프롬프트, 예를 들어 '흰 호랑이'를 사용할 경우 주제의 정밀도가 향상되고 중간 단계나 왜곡된 주제 생성이 감소함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.