[논문 리뷰] Dancing Avatar: Pose and Text-Guided Human Motion Videos Synthesis with Image Diffusion Model
Dancing Avatar는 텍스트 프롬프트와 자세 시퀀스를 기반으로 사전 훈련된 텍스트-to-이미지(T2I) 확산 모델을 사용하여 고품질이고 시간적으로 일관된 인간 운동 영상 영상을 생성하는 새로운 프레임워크를 제안한다. 내 프레임, 간헐적 프레임, 배경 정렬 모듈를 도입함으로써 최신의 텍스트-to-비디오(T2V) 방법에 비해 더 뛰어난 영상 품질, 외형 일관성, 시간적 일관성을 달성한다.
The rising demand for creating lifelike avatars in the digital realm has led to an increased need for generating high-quality human videos guided by textual descriptions and poses. We propose Dancing Avatar, designed to fabricate human motion videos driven by poses and textual cues. Our approach employs a pretrained T2I diffusion model to generate each video frame in an autoregressive fashion. The crux of innovation lies in our adept utilization of the T2I diffusion model for producing video frames successively while preserving contextual relevance. We surmount the hurdles posed by maintaining human character and clothing consistency across varying poses, along with upholding the background's continuity amidst diverse human movements. To ensure consistent human appearances across the entire video, we devise an intra-frame alignment module. This module assimilates text-guided synthesized human character knowledge into the pretrained T2I diffusion model, synergizing insights from ChatGPT. For preserving background continuity, we put forth a background alignment pipeline, amalgamating insights from segment anything and image inpainting techniques. Furthermore, we propose an inter-frame alignment module that draws inspiration from an auto-regressive pipeline to augment temporal consistency between adjacent frames, where the preceding frame guides the synthesis process of the current frame. Comparisons with state-of-the-art methods demonstrate that Dancing Avatar exhibits the capacity to generate human videos with markedly superior quality, both in terms of human and background fidelity, as well as temporal coherence compared to existing state-of-the-art approaches.
연구 동기 및 목표
- 일관된 외형과 배경을 갖춘 고품질 인간 운동 영상 생성에 있어 텍스트-to-비디오(T2V) 확산 모델의 한계를 해결하기 위해.
- 품질 저하가 발생하는 미세조정된 T2V 모델을 피하기 위해 사전 훈련된 텍스트-to-이미지(T2I) 확산 모델을 비디오 합성에 활용하기 위해.
- 다양한 자세와 동적 움직임에도 불구하고 프레임 간 인간 외형의 일관성을 유지하기 위해.
- 인간 운동 합성 중에 배경의 일관성을 유지하기 위해.
- 자기연쇄적이고 정렬 기반 메커니즘을 통해 인접 프레임 간 시간적 일관성을 향상시키기 위해.
제안 방법
- 사전 훈련된 T2I 확산 모델을 사용하여 자세 시퀀스와 텍스트 프롬프트를 조건으로 하여 비디오 프레임을 자기연쇄적으로 생성한다.
- 내 프레임 정렬 모듈은 ChatGPT에서 유래한 텍스트 지도형 인간 캐릭터 지식을 T2I 모델에 융합하여 프레임 간 외형 안정성을 향상시킨다.
- 배경 정렬 파이프라인은 Segment Anything 및 이미지 보정 기법을 조합하여 프레임 간 일관된 배경을 유지한다.
- 간헐적 프레임 정렬 모듈은 이전 프레임을 현재 프레임 합성의 조건부 가이드로 사용하여 시간적 일관성을 강화한다.
- 기본 확산 아키텍처를 재학습하지 않고도 외형과 배경 일관성을 임베딩하기 위해 T2I 모델에 대한 미세조정을 통합한다.
- 파이프라인은 각 프레임을 순차적으로 처리하여 입력 자세와 텍스트에 대응하면서도 전반적인 시점 일관성을 유지한다.
실험 결과
연구 질문
- RQ1사전 훈련된 텍스트-to-이미지(T2I) 확산 모델이 고품질이고 시간적으로 일관된 인간 운동 영상 생성에 효과적으로 재사용될 수 있는가?
- RQ2자세 시퀀스와 텍스트 프롬프트에서 영상 합성할 때 프레임 간 일관된 인간 외형을 유지하는 방법은 무엇인가?
- RQ3동적 인간 운동 합성 중에 배경 일관성을 유지할 수 있는 메커니즘은 무엇인가?
- RQ4간헐적 프레임 가이드를 갖춘 자기연쇄적 프레임 생성이 영상 합성에서 시간적 일관성을 얼마나 향상시킬 수 있는가?
- RQ5내 프레임, 간헐적 프레임, 배경 정렬 모듈가 함께 영상 품질과 일관성을 얼마나 향상시키는가?
주요 결과
- Dancing Avatar는 가장 낮은 포즈 MSE(0.0012)와 가장 높은 텍스트 정렬 CLIP 점수(0.891)를 기록하여 입력 조건의 정렬 수준이 뛰어나다는 것을 보여준다.
- 모델은 가장 낮은 프레임 MSE(0.0041)와 프레임 L1(0.021) 값을 기록하여 인접 프레임 간 강력한 시간적 일관성을 보여준다.
- 신체 CLIP 점수(0.852)와 배경 CLIP 점수(0.876)가 가장 높아 시간에 따라 내용의 융합성이 향상됨을 확인한다.
- 절단 실험 결과, 내 프레임 정렬 모듈을 제거하면 신체 CLIP 점수가 0.065 감소하여 외형 일관성에 심각한 악화가 발생함을 시사한다.
- 간헐적 프레임 정렬 모듈의 부재는 프레임 MSE를 0.0018 증가시키고 프레임 L1을 0.0032 증가시켜 세부 수준의 일관성 유지를 위한 그 역할을 확인한다.
- 배경 정렬은 핵심적이다: 이를 생략하면 배경 CLIP 점수가 0.112 감소하여 프레임 간 갑작스럽고 일관성 없는 배경 변화가 발생한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.