[논문 리뷰] Neural Texture Extraction and Distribution for Controllable Person Image Synthesis
이 논문은 목표 자세 분포에 따라 참조 이미지에서 분리된 의미적 신경 텍스처를 추출하고 재구성하는 새로운 신경 텍스처 추출 및 분포(NTED) 프레임워크를 제안한다. 이는 이중 주의를 활용하여 참조 이미지에서 계층적인 의미적 신경 텍스처를 추출하고, 목표 자세 분포에 따라 재구성한다. 신경 텍스처 융합 및 최적화를 통해 고해상도(512×352)이고 고성능인 이미지 생성이 가능하며, 외관 제어가 명시적으로 가능하다.
We deal with the controllable person image synthesis task which aims to re-render a human from a reference image with explicit control over body pose and appearance. Observing that person images are highly structured, we propose to generate desired images by extracting and distributing semantic entities of reference images. To achieve this goal, a neural texture extraction and distribution operation based on double attention is described. This operation first extracts semantic neural textures from reference feature maps. Then, it distributes the extracted neural textures according to the spatial distributions learned from target poses. Our model is trained to predict human images in arbitrary poses, which encourages it to extract disentangled and expressive neural textures representing the appearance of different semantic entities. The disentangled representation further enables explicit appearance control. Neural textures of different reference images can be fused to control the appearance of the interested areas. Experimental comparisons show the superiority of the proposed model. Code is available at https://github.com/RenYurui/Neural-Texture-Extraction-Distribution.
연구 동기 및 목표
- 자세와 외관에 대한 명시적 제어가 가능한 제어 가능한 인물 이미지 합성을 가능하게 하기 위해.
- 장거리 공간적 의존성과 효율적인 공간 변형을 모델링하는 데 있어 CNN과 표준 주의의 한계를 해결하기 위해.
- 얼굴, 머리카락, 옷과 같은 의미적 실체(예: 얼굴, 머리카락, 옷)를 나타내는 분리된 표현력 있는 신경 텍스처를 추출하여 세밀한 외관 제어를 가능하게 하기 위해.
- 복잡한 변형과 가림을 포함한 경우에도 잡음이 발생하지 않는 경량이고 효율적인 공간 변형 모듈을 개발하기 위해.
- 다양한 참조에서 유래한 신경 텍스처를 원활하게 융합하여 일관된 외관 조작을 가능하게 하기 위해.
제안 방법
- NTED 연산은 참조 특징 맵에서 계층적인 의미적 신경 텍스처를 추출하기 위해 이중 주의를 사용한다.
- 추출 단계는 공간에 민감한 주의를 사용하여 참조 이미지의 특징을 수집하여 의미적 실체를 분리한다.
- 분포 단계는 목표 자세에서 학습된 공간 분포에 기반한 소프트 주의 선택을 통해 신경 텍스처를 재구성한다.
- 다중 스케일 생성 네트워크는 NTED 모듈을 통합하여 조건부 의미 분포를 예측하고 이미지를 재구성한다.
- 다양한 참조에서 유래한 신경 텍스처를 융합하기 위한 보간 계수를 자동으로 탐색하는 최적화 방법이 도입된다.
- 사진적 사실성과 지각적 품질을 보장하기 위해 표준 GAN 손실 함수를 사용하여 모델을 훈련시킨다.

실험 결과
연구 질문
- RQ1신경 텍스처 기반 접근 방식이 기존의 CNN이나 플로우 기반 방법보다 더 정확하고 잡음이 없는 이미지 변형을 달성할 수 있는가?
- RQ2분리된 신경 텍스처가 얼굴, 머리카락, 옷과 같은 의미적 실체를 얼마나 효과적으로 표현하여 외관 제어를 가능하게 하는가?
- RQ3제안된 NTED 연산이 고해상도 이미지 합성에서 효율성과 성능 면에서 표준 주의 메커니즘을 초월할 수 있는가?
- RQ4다른 참조 이미지에서 유래한 신경 텍스처를 얼마나 잘 융합하여 일관되고 현실적인 이미지를 생성할 수 있는가?
- RQ5복잡한 변형 조건에서도 새로운 자세, 의복, 신원에 대해 모델이 잘 일반화되는가?
주요 결과
- 제안된 모델은 Fréchet Inception Distance(FID) 8.6838과 지각적 LPIPS 점수 0.1752를 기록하여 베이스라인, 스타일 기반, 표준 주의 모델을 모두 초월한다.
- 표준 주의 모델(219.94 G) 대비 경쟁적인 SSIM(0.7182)와 낮은 FLOPs(103.99 G)를 기록하여 높은 효율성을 입증한다.
- 정성적 결과는 심각한 자세 변화나 가림 조건에서도 복잡한 텍스처와 구조를 충실하게 재구성함을 보여준다.
- 신경 텍스처 융합을 통한 외관 제어는 옷과 얼굴 특징을 서로 다른 참조에서 유래한 바탕으로 원활하게 융합하여 일관된 결과를 생성한다.
- 절단 분석 결과 NTED 모듈이 기존 방법 대비 텍스처의 정확도와 공간 일관성을 크게 향상시킴을 확인한다.
- 실패 사례는 주로 표현이 부족한 자세, 의복, 또는 자연계의 신원에서 발생하며, 더 다양한 훈련 데이터로 개선 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.