[논문 리뷰] Unpaired Pose Guided Human Image Generation
이 논문은 쌍이 맞지 않는 자세 유도 인간 이미지 생성을 위한 엔드 투 엔드 생성 적대 신경망을 제안하며, 인스턴스 수준 또는 클래스 수준의 의류 제어를 통해 자세 스케치에서 고해상도의 현실적인 인간 이미지를 합성할 수 있도록 한다. 모델은 쌍이 맞는 훈련 데이터나 3D 자세 애너테이션을 요구하지 않으며, 쌍이 맞지 않는 3D 메쉬와 이미지를 활용함으로써 기존의 작업보다 더 높은 실존성(fool-rate: 53%)을 달성하여 최신 기술 수준의 현실성을 확보한다.
This paper studies the task of full generative modelling of realistic images of humans, guided only by coarse sketch of the pose, while providing control over the specific instance or type of outfit worn by the user. This is a difficult problem because input and output domain are very different and direct image-to-image translation becomes infeasible. We propose an end-to-end trainable network under the generative adversarial framework, that provides detailed control over the final appearance while not requiring paired training data and hence allows us to forgo the challenging problem of fitting 3D poses to 2D images. The model allows to generate novel samples conditioned on either an image taken from the target domain or a class label indicating the style of clothing (e.g., t-shirt). We thoroughly evaluate the architecture and the contributions of the individual components experimentally. Finally, we show in a large scale perceptual study that our approach can generate realistic looking images and that participants struggle in detecting fake images versus real samples, especially if faces are blurred.
연구 동기 및 목표
- 쌍이 맞는 훈련 데이터 없이 자세 스케치에서 현실적이며 제어 가능한 인간 이미지를 생성할 수 있도록 하는 것.
- 특정 의류 인스턴스와 더 넓은 의류 카테고리(예: 티셔츠, 드레스)에 대한 세밀한 제어를 제공하는 것.
- 3D 메쉬의 파트 애너테이션과 실사 이미지를 사용하여 훈련함으로써 애너테이션 부담을 줄이는 것.
- 두 단계 훈련 파ipeline이 필요 없도록, 하나의 엔드 투 엔드 모델에서 자세와 외형 제어를 통합하는 것.
- 특히 얼굴 부분이 흐리게 처리된 상황에서의 인지 평가에서 이미지의 현실성과 fool-rate를 향상시키는 것.
제안 방법
- 내용 조건부 생성 적대 신경망(cGAN)을 사용하며, 내용 조건부 생성자와 현실성 강제하는 판별자로 구성된다.
- 자세, 정체성, 의류 스타일을 별도로 제어할 수 있도록 분리된 잠재 공간을 활용하여 조건부 샘플링을 가능하게 한다.
- 입력 스케치를 잠재 표현으로 매핑하는 자세 인코더 아키텍처를 통합하여 생성자를 안내한다.
- 기준 이미지 네트워크를 통해 소스 이미지의 외형과 스타일을 잠재 공간에 인코딩함으로써 인스턴스 수준의 제어를 가능하게 한다.
- 쌍이 맞지 않는 데이터를 사용하는 훈련 제도: 파트 애너테이션이 있는 3D 메쉬와 실사 이미지로, 고비용의 3D 자세 피팅을 피한다.
- 클래스 레이블(예: '드레스')을 통한 조건부 샘플링과 특정 복장 인스턴스에 기반한 이미지 변환을 모두 지원한다.
실험 결과
연구 질문
- RQ1생성 모델이 쌍이 맞는 훈련 데이터 없이 자세 스케치만으로 현실적인 인간 이미지를 생성할 수 있는가?
- RQ2모델이 특정 의류 인스턴스와 더 넓은 의류 카테고리에 대해 세밀한 제어를 달성할 수 있는가?
- RQ33D 메쉬와 실사 이미지에 대해 쌍이 맞지 않는 훈련을 통해, 쌍이 맞는 방법과 비교해도 높은 품질의 이미지 합성을 달성할 수 있는가?
- RQ4특히 인지 평가에서 기존의 인간 이미지 생성 기술 대비 모델의 현실성은 어떻게 비교되는가?
- RQ5동일한 아키텍처가 인간 생성을 넘어서 다른 이미지 번역 작업에 일반화 가능한가?
주요 결과
- 대규모 인지 평가 연구에서 모델은 27%의 fool-rate를 기록하여 이미지 생성의 강력한 현실성을 입증한다 (n=478).
- 얼굴 영역이 흐리게 처리된 경우, fool-rate는 53%로 상승하여 모델이 특히 얼굴 외부 영역에서 매우 신뢰할 만한 이미지를 생성함을 보여준다.
- 절단 실험을 통해 자세 인코더와 조건부 생성자가 고품질의 이미지 합성에 필수적임을 확인한다.
- 모델은 자세 안내에도 불구하고 색상, 질감, 의류 스타일에 있어 상당한 클래스 내 변동성을 가지며 다양한 현실적인 이미지를 성공적으로 생성한다.
- 이 아키텍처는 다른 작업으로도 잘 일반화되며, 사진에서 그림으로의 번역 등에도 적용 가능하여 표준 이미지 간 번역 방법(예: CycleGAN)이 지원하지 않는 스타일 제어 및 잠재 공간 샘플링 기능을 제공한다.
- 실패 사례는 주로 드문 자세나 시점 각도에서 발생하므로, 더 다양한 훈련 데이터로 모델의 일반화 능력을 향상시킬 수 있을 것이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.