[논문 리뷰] HumanDiffusion: a Coarse-to-Fine Alignment Diffusion Framework for Controllable Text-Driven Person Image Generation
HumanDiffusion는 개방형 어휘 기반 기술과 의미적 자세 맵을 사용하여 제어 가능하고 텍스트 기반의 인체 이미지 생성을 위한 확산 기반 프레임워크를 제안한다. 이는 스타일화된 메모리 검색(SMR) 모듈과 다중 해상도 교차 모odal리티 정렬(MCA) 모듈을 통해 군집에서 세분화된 정렬 전략을 구현하며, DeepFashion 데이터셋에서 이미지 품질, 충실도 및 편집 가능성 측면에서 최신 기술 수준의 성능을 달성한다.
Text-driven person image generation is an emerging and challenging task in cross-modality image generation. Controllable person image generation promotes a wide range of applications such as digital human interaction and virtual try-on. However, previous methods mostly employ single-modality information as the prior condition (e.g. pose-guided person image generation), or utilize the preset words for text-driven human synthesis. Introducing a sentence composed of free words with an editable semantic pose map to describe person appearance is a more user-friendly way. In this paper, we propose HumanDiffusion, a coarse-to-fine alignment diffusion framework, for text-driven person image generation. Specifically, two collaborative modules are proposed, the Stylized Memory Retrieval (SMR) module for fine-grained feature distillation in data processing and the Multi-scale Cross-modality Alignment (MCA) module for coarse-to-fine feature alignment in diffusion. These two modules guarantee the alignment quality of the text and image, from image-level to feature-level, from low-resolution to high-resolution. As a result, HumanDiffusion realizes open-vocabulary person image generation with desired semantic poses. Extensive experiments conducted on DeepFashion demonstrate the superiority of our method compared with previous approaches. Moreover, better results could be obtained for complicated person images with various details and uncommon poses.
연구 동기 및 목표
- 사전 설정된 어휘 대신 자유형 서술어를 사용하여 사용자 친화적이고 영향력 있는 텍스트 기반 인체 이미지 생성을 가능하게 하기 위해.
- 복잡한 인간 외형에 대한 다중 모달리티 특징 융합 및 정렬의 한계를 해결하기 위해.
- 복잡한 자세에서 다양하고 세밀한 인체 이미지를 생성할 때 이미지 품질과 구조적 일관성을 향상시키기 위해.
- 지속적인 편집을 지원하여 텍스트 또는 의미적 맵을 통해 국소적 편집을 가능하게 하되, 변경되지 않은 영역은 유지하기 위해.
- 실제 구현에 적합한 컴act한 아키텍처로 종단 간 훈련을 달성하기 위해.
제안 방법
- 확산 전에 외관 특징를 정교화하기 위해 분리된 메모리 네트워크를 사용하는 스타일화된 메모리 검색(SMR) 모듈을 도입하여 세분화된 특징 추출을 향상시킨다.
- 다중 해상도 수준에서 텍스트 및 이미지 표현 간의 군집에서 세분화된 정렬을 수행하는 다중 해상도 교차 모달리티 정렬(MCA) 모듈을 활용한다.
- 각 노이즈 제거 단계에서 CLIP로부터 유도된 텍스트 임bedding과 이미지 특징 간의 정렬을 위해 종단 간 훈련이 가능한 확산 모델 아키텍처를 사용하며, 교차 어텐션 메커니즘을 통합한다.
- 부분 편집을 위한 이중 노이즈 제거 전략(전역 및 국소)을 도입하여, 텍스트 프롬프트가 국소적 특징 정밀화를 이끌지만 나머지 이미지는 유지되도록 한다.
- 생성 과정 중 공간적 레이아웃과 구조를 안내하기 위해 의미적 자세 맵을 조건부 사전 지식으로 활용한다.
- 편집 과정에서 CLIP 기반 특징 거리 최소화를 통해 텍스트 프롬프트가 대상 이미지 영역과 정렬되도록 한다(예: 회색에서 파란색으로 재킷 색상 변경).
실험 결과
연구 질문
- RQ1확산 기반 프레임워크는 개방형 어휘 기반 기술과 의미적 자세 맵을 사용하여 고해상도, 제어 가능한 인체 이미지 생성을 달성할 수 있는가?
- RQ2다양한 스케일과 해상도에서 텍스트 및 이미지 특징 간의 교차 모달리티 정렬을 어떻게 향상시킬 수 있는가?
- RQ3기존 방법이 실패하는 복잡한 자세나 가림 상황에서도 모델은 다양하고 고해상도의 인체 이미지를 생성할 수 있는가?
- RQ4모델은 텍스트나 의미적 맵을 사용하여 이미지의 나머지 부분을 변경하지 않고도 얼마나 민첩하게 국소적 편집을 지원할 수 있는가?
- RQ5제안된 군집에서 세분화된 정렬 메커니즘은 기존 방법 대비 이미지 품질과 캡션 정렬 측면에서 어떻게 비교되는가?
주요 결과
- HumanDiffusion는 DeepFashion 데이터셋에서 Fréchet Inception Distance(FID) 31.28을 기록하여, Text2Human(30.89) 및 기타 기준 모델보다 이미지 품질 측면에서 뛰어난 성능을 보였다.
- 모델은 LPIPS 점수 0.2001로 낮고, MS-SSIM 점수 0.7736로 높아 기존 방법 대비 우수한 시각적 충실도와 구조적 유사성을 나타냈다.
- HumanDiffusion는 특히 측면 얼굴이나 교차한 다리와 같은 복잡한 상황에서 Text2Human 및 기타 GAN 기반 모델보다 더 사실적이고 다양한 이미지를 생성했다.
- 사용자 선호도 평가에서 HumanDiffusion는 이미지의 사실성과 캡션 유사성 측면에서 모두 높은 점수를 기록하여 기준 모델을 초월했다.
- 모델은 옷 색상이나 스타일 변경과 같은 국소적 편집을 성공적으로 수행하며 나머지 이미지 영역을 유지함으로써 강력한 제어 가능성을 입증했다.
- 가림 자세나 세밀한 질감이 있는 어려운 케이스에서는 HumanDiffusion가 기존의 Text2Human에서 흔히 발생하는 다리 혼합 및 자연스럽지 않은 에 bord distortion 등의 아티팩트를 줄였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.