[논문 리뷰] VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models
이 논문은 Disen-Mix 미세조정과 인간-중심 재미세조정을 활용하여 주제 정체성을 유지하고 특성 유착을 완화하는 새로운 프레임워크인 VideoDreamer를 소개한다. 제안된 MultiStudioBench 벤치마크에서 최신 기술 수준의 성능을 달성하며, 새로운 동작과 배경을 포함하면서도 여러 사용자 정의 주제의 시각적 특징을 충실하게 유지하는 시간적으로 일관된 고해상도 영상을 생성한다.
Customized text-to-video generation aims to generate text-guided videos with user-given subjects, which has gained increasing attention. However, existing works are primarily limited to single-subject oriented text-to-video generation, leaving the more challenging problem of customized multi-subject generation unexplored. In this paper, we fill this gap and propose a novel VideoDreamer framework, which can generate temporally consistent text-guided videos that faithfully preserve the visual features of the given multiple subjects. Specifically, VideoDreamer adopts the pretrained Stable Diffusion with temporal modules as its base video generator, taking the power of the text-to-image model to generate diversified content. The video generator is further customized for multi-subjects, which leverages the proposed Disen-Mix Finetuning and Human-in-the-Loop Re-finetuning strategy, to tackle the attribute binding problem of multi-subject generation. Additionally, we present a disentangled motion customization strategy to finetune the temporal modules so that we can generate videos with both customized subjects and motions. To evaluate the performance of customized multi-subject text-to-video generation, we introduce the MultiStudioBench benchmark. Extensive experiments demonstrate the remarkable ability of VideoDreamer to generate videos with new content such as new events and backgrounds, tailored to the customized multiple subjects.
연구 동기 및 목표
- 여러 사용자 정의 주제가 포함된 영상에서 주제 정체성을 유지해야 하는 사용자 맞춤형 다중 주제 텍스트 기반 영상 생성 분야에 대한 연구 부족을 해결하기 위해.
- 다른 주제의 시각적 특징이 생성된 프레임에서 뒤섞여 구분되지 않게 되는 특성 유착 문제를 해결하기 위해.
- 주제 정체성을 유지하면서도 높은 시간적 일관성과 텍스트 충실도를 유지하는 미세조정 전략을 개발하기 위해.
- 사용자 맞춤형 다중 주제 텍스트 기반 영상 생성 모델을 평가하기 위한 종합적인 벤치마크인 MultiStudioBench를 도입하기 위해.
- 새로운 이벤트와 배경을 포함하면서도 여러 사용자 맞춤 주제를 충실하게 통합하는 영상 생성을 가능하게 하기 위해.
제안 방법
- 기본 영상 생성기를 위해 잠재 코드 운동 동역학과 시간적 프레임 간 상호작용 어텐션을 활용한 사전 학습된 Stable Diffusion 모델을 적응시킨다.
- 혼합 주제 이미지의 노이즈 제거를 보조 작업으로 활용하여 주제 특징을 분리하고 인위적 스티칭을 줄이는 Disen-Mix 미세조정을 제안한다.
- 과적합을 방지하고 일반화 능력을 향상시키기 위해 공유 주제 정체성 조건, 공유 스티치 조건, 이미지 고유의 임베딩을 활용한다.
- 인간의 피드백을 반복적으로 활용하여 모델을 정교화하고 이미지 혼합으로 인한 시각적 아티팩트를 줄이는 인간-중심 재미세조정(HLR)을 도입한다.
- Disen-Mix와 HLR를 결합한 다단계 미세조정 파이프라인을 활용하여 주제 충실도를 향상시키고 시각적 아티팩트를 감소시킨다.
- 다양한 주제와 프롬프트를 포함한 MultiStudioBench를 활용하여 주제 충실도, 프롬프트 준수도, 시간적 일관성, 아티팩트 수준을 평가한다.
실험 결과
연구 질문
- RQ1텍스트 기반 영상 생성 모델은 단일 영상 내에서 여러 사용자 정의 주제의 시각적 정체성을 효과적으로 유지할 수 있는가?
- RQ2다중 주제 텍스트 기반 영상 생성 과정에서 특성 유착 문제는 어떻게 완화할 수 있는가?
- RQ3기본 모델 대비 Disen-Mix 미세조정이 얼마나 효과적으로 시각적 아티팩트를 감소시키고 주제 분리를 향상시키는가?
- RQ4인간-중심 재미세조정은 모델 출력을 정교화하고 인위적 스티칭 효과을 줄이는 데 얼마나 효과적인가?
- RQ5제안된 프레임워크는 새로운 동작과 배경을 포함하면서도 높은 주제 충실도와 시간적 일관성을 유지할 수 있는가?
주요 결과
- 비교 방법들 중에서 VideoDreamer는 가장 높은 DINO 점수(0.501)와 가장 낮은 스티치 점수(0.036)를 기록하여 주제 정체성 유지 능력과 아티팩트 최소화 능력이 뛰어나다는 것을 보여준다.
- 인간-중심 재미세조정을 통해 3주제 설정에서 스티치 점수가 0.178에서 0.045로 감소하여 시각적 스티칭 문제를 크게 줄였다.
- 제거 실험 결과, 이미지 고유의 임베딩과 공유 스티치 조건(PN)이 모두 필수적임을 확인하였으며, 이들을 제거할 경우 스티치 점수가 0.287로 상승한다.
- VideoDreamer는 모든 지표에서 DreamBooth와 SVDiff를 능가한다: 높은 CLIP-T(0.306)와 시간적 일관성(0.943)을 유지하면서도 아티팩트를 최소화한다.
- 정성적 결과에서는 VideoDreamer가 주제 정체성을 성공적으로 유지하고 새로운 동작과 배경을 포함한 일관된 영상을 생성하는 데 성공한 반면, 기준 모델들은 정체성 혼동이나 아티팩트 문제를 겪는다.
- 이 프레임워크는 다양한 주제 조합과 복잡한 프롬프트, 다중 이벤트 및 다중 환경 시나리오에서도 강력한 일반화 능력을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.