[논문 리뷰] Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation
이 논문은 움직임-구조가 정렬된 비디오 클립을 검색하고 이를 바탕으로 텍스트-비디오 생성을 유도함으로써 일관되고 캐릭터 일관성을 유지하는 스토리 중심 비디오 생성을 위한 리트리ieval 증강형 비디오 생성 프레임워크인 Animate-A-Story를 제안한다. 이는 기존 베이스라인 대비 캐릭터 충실도와 일관성을 향상시키는 새로운 개념 개인화 방법인 TimeInv를 도입하여 비디오 및 이미지 개인화 작업에서 최신 기술 수준의 성능을 달성한다.
Generating videos for visual storytelling can be a tedious and complex process that typically requires either live-action filming or graphics animation rendering. To bypass these challenges, our key idea is to utilize the abundance of existing video clips and synthesize a coherent storytelling video by customizing their appearances. We achieve this by developing a framework comprised of two functional modules: (i) Motion Structure Retrieval, which provides video candidates with desired scene or motion context described by query texts, and (ii) Structure-Guided Text-to-Video Synthesis, which generates plot-aligned videos under the guidance of motion structure and text prompts. For the first module, we leverage an off-the-shelf video retrieval system and extract video depths as motion structure. For the second module, we propose a controllable video generation model that offers flexible controls over structure and characters. The videos are synthesized by following the structural guidance and appearance instruction. To ensure visual consistency across clips, we propose an effective concept personalization approach, which allows the specification of the desired character identities through text prompts. Extensive experiments demonstrate that our approach exhibits significant advantages over various existing baselines.
연구 동기 및 목표
- 제어된 레이아웃, 운동, 일관된 캐릭터 외형을 갖춘 고품질이고 논리적인 스토리 중심 비디오 생성의 과제를 해결하기 위해.
- 기존 텍스트-비디오 모델이 시점 구성과 운동 구조를 제어하는 데 한계를 보이는 문제를 극복하기 위해.
- 새로운 개인화 방법을 통해 리트리ieval 증강형 비디오 생성에서 발생하는 캐릭터 일관성 문제를 해결하기 위해.
- 구성 일관성을 유지하면서도 사용자가 캐릭터 정체성과 외형을 제어할 수 있도록 하기 위해.
제안 방법
- 텍스트 쿼리 기반으로 장면과 운동 맥락 검색을 위해 움직임-구조가 정렬된 비디오 클립을 추출하기 위해 표준 외부 비디오 검색 시스템을 사용한다.
- 검색된 운동 구조와 텍스트 프롬프트를 유도로 사용하는 구조 지도형 텍스트-비디오 합성 모델을 적용한다.
- 메인 모델 파라미터를 미세조정하지 않고도 개인화된 개념을 위한 학습 가능한 임bedding을 최적화하는 시간대별 가변 텍스트 역전환 방법인 TimeInv를 도입한다.
- 텍스트 프롬프트와 기준 이미지를 기반으로 TimeInv를 통해 개념 개인화를 적용하여 클립 간 일관된 캐릭터 정체성을 유지한다.
- 두 단계 학습 전략을 사용한다: 첫 번째로 WebVid에서 캐릭터당 200개의 실제 비디오를 추출하여 정규화; 두 번째로 추론 중 데이터 증강과 분류기 없는 가이던스를 적용한다.
- TimeInv를 Custom Diffusion와 결합하여 어텐션 모듈의 키와 밸류를 업데이트함으로써 시각적 충실도를 향상시키고 잡음 요소를 줄인다.
실험 결과
연구 질문
- RQ1표준 텍스트-비디오 모델 대비 리트리ieval 증강형 비디오 생성이 구조적 일관성과 현실성 있는 스토리 중심 비디오 생성에 얼마나 기여하는가?
- RQ2TimeInv와 같은 개인화된 개념 표현 방법이 다양한 장면과 비디오 클립 간에 캐릭터 정체성을 얼마나 효과적으로 유지하는가?
- RQ3제안된 프레임워크는 운동 구조 제어와 캐릭터 외형 개인화 간의 갈등을 어느 정도 해결하는가?
- RQ4리트리ieval과 개인화의 통합이 정량적 및 정성적 지표 모두에서 기존 베이스라인 대비 더 뛰어난 성능을 내는가?
주요 결과
- 제안된 프레임워크는 비디오 생성 품질에서 최신 기술 수준의 성능을 달성하였으며, 테디베어의 경우 의미 유사도 점수 0.295와 정체성 충실도 0.853을 기록하여 DreamBooth, Textual Inversion, Custom Diffusion를 모두 초월한다.
- TimeInv는 고양이의 정체성 충실도 점수 0.902를 기록하여 Textual Inversion(0.743)를 크게 앞서며, 의미 정렬과 시각적 일관성 측면에서 다른 방법과 동등하거나 이를 초월한다.
- 정성적 결과에서는 TimeInv가 DreamBooth 및 Textual Inversion 대비 잡음과 과적합을 줄이며 배경 다양성과 더 나은 캐릭터 디테일 유지에 기여한다.
- TimeInv는 이미지 개인화 작업으로도 잘 일반화되며, Custom Diffusion와 결합했을 때 배경 다양성과 개념 구성성 향상 효과를 입증한다.
- 효과적인 구조와 외형 분리 덕분에, 프레임워크는 배경과 운동이 변하더라도 다양한 스토리 장면 간에 일관된 캐릭터 렌더링을 성공적으로 유지한다.
- 제거 실험을 통해 리트리ieval 기반의 구조 가이던스와 TimeInv 개인화의 조합이 비디오 일관성과 캐릭터 충실도를 모두 크게 향상시킨다는 점이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.