[논문 리뷰] DreamPose: Fashion Image-to-Video Synthesis via Stable Diffusion
DreamPose는 Stable Diffusion를 포즈 및 이미지 조건부로 개선하여 단일 정지 이미지와 인간 신체 자세 시퀀스에서 사진처럼 사실적인 패션 비디오를 생성하는 확산 기반 방법이다. 이는 이중 CLIP-VAE 인코더, 5자세 조건부 처리, 그리고 UNet 및 VAE 디코더의 주제별 미세조정을 통해 시간적 일관성, 외관 충실도, 운동 현실감에서 최신 기술 수준의 성능을 달성한다.
We present DreamPose, a diffusion-based method for generating animated fashion videos from still images. Given an image and a sequence of human body poses, our method synthesizes a video containing both human and fabric motion. To achieve this, we transform a pretrained text-to-image model (Stable Diffusion) into a pose-and-image guided video synthesis model, using a novel fine-tuning strategy, a set of architectural changes to support the added conditioning signals, and techniques to encourage temporal consistency. We fine-tune on a collection of fashion videos from the UBC Fashion dataset. We evaluate our method on a variety of clothing styles and poses, and demonstrate that our method produces state-of-the-art results on fashion video animation.Video results are available on our project page.
연구 동기 및 목표
- 패션 사진의 보편성에도 불구하고 현실적이고 시간적으로 일관된 패션 비디오의 부족을 해결하기 위해.
- 단일 입력 이미지와 자세 시퀀스만을 사용하여 인간 운동과 옷 자질의 정밀한 제어가 가능한 고정밀도 이미지 애니메이션을 가능하게 하기 위해.
- 기존 비디오 확산 모델의 한계, 즉 낮은 시간적 일관성과 텍스트 조건부에 대한 의존도를 해결하기 위해.
- 사전 학습된 확산 모델에 자세 및 이미지 조건부를 통합하여 패션 비디오 합성에서 외관 충실도와 운동의 매끄러움을 향상시키기 위해.
- 광범위한 데이터나 복잡한 다단계 네트워크 없이도 주제별 애니메이션을 달성하기 위해.
제안 방법
- UBC 패션 데이터셋에서 먼저 훈련한 후, 단일 입력 이미지에 대한 주제별 미세조정을 수행하는 새로운 이중 단계 전략을 사용해 사전 학습된 텍스트-이미지 Stable Diffusion 모델을 미세조정한다.
- CLIP 텍스트 인코더를 이중 CLIP-VAE 이미지 인코더 및 어댑터 모듈로 대체하여 이미지 임베딩과 잠재 임베딩을 함께 모델링하고 재구성함으로써 외관 충실도를 향상시킨다.
- 목표 프레임 중심의 연속된 다섯 자세의 시퀀스를 디노이징 U-Net에 조건부로 적용하여 시간적 일관성을 향상시킨다.
- 주의 메커니즘과 입력 주입 경로를 수정하여 이미지 및 자세 조건부를 모두 지원하는 새로운 아키텍처를 도입한다.
- 주제별로 UNet, 어댑터 모듈, VAE 디코더를 미세조정하여 프레임 간 신원 및 질감 세부 정보를 유지한다.
- 각 디노이징 단계에서 자세 표현을 입력 노이즈에 연결하여 노이즈 주입 메커니즘을 적용한다.

실험 결과
연구 질문
- RQ1사전 학습된 이미지 확산 모델이 단일 이미지와 자세 시퀀스에서 고품질의 사진처럼 사실적인 패션 비디오를 효과적으로 생성하도록 적절히 적응시킬 수 있는가?
- RQ2단일 자세 조건부보다 다중 연속 자세 조건부가 시간적 일관성에 어떻게 기여하는가?
- RQ3UNet과 VAE 디코더의 주제별 미세조정이 외관 충실도 향상과 플리커링 감소에 얼마나 기여하는가?
- RQ4이중 CLIP-VAE 인코더가 표준 CLIP 이미지 인코더보다 옷의 세부 사항과 신원 보존에 얼마나 효과적인가?
- RQ5이 방법의 실패 사례는 무엇이며, 개선된 자세 추정 또는 추가 지도 학습을 통해 이를 완화할 수 있는가?
주요 결과
- 모든 모델 성능이 최고 수준을 기록함: L1 (0.019), SSIM (0.900), VGG (0.207), LPIPS (0.056), 타 모델보다 뛰어난 성능을 보임.
- 단일 CLIP 이미지 인코더만을 사용한 아블레이션(Ours_CLIP)은 외관 품질 저하가 심각하게 나타나, 세부 사항 보존을 위해 이중 CLIP-VAE 인코더의 필요성을 입증함.
- VAE 디코더의 주제별 미세조정은 선명도 향상과 과적합 감소에 기여함을 보여주며, Ours_No-VAE-FT는 Ours_CLIP보다 개선된 지표를 기록함.
- 단일 자세만을 사용한 경우(Ours_1-pose)는 유사한 수치적 점수에도 불구하고 플리커링과 운동 불안정성이 발생함으로써, 다중 프레임 자세 정보의 중요성을 입증함.
- 1-포즈 변형에 시간적 스무딩을 적용한 경우(Ours_smooth)는 성능이 극적으로 악화되어, 운동 아티팩트는 사전 설계된 아키텍처가 후처리보다 더 효과적으로 해결할 수 있음을 시사함.
- 실패 사례로는 사지가 옷에 녹아들거나, 환상적인 특징이 생성되며, 뒷면을 햖을 때 방향 오류가 발생함으로써, 자세 추정 및 기하학적 추론의 한계를 드러냄.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.