[논문 리뷰] TryOnGAN: Body-Aware Try-On via Layered Interpolation
TryOnGAN은 쌍체의 훈련 데이터 없이도 신체 인식형 의류 전이를 가능하게 하는, 포즈 조건부 기반의 StyleGAN2 기반 신규한 실사 수준의 가상 시착 기법을 제안한다. 이는 각 레이어의 잠재 공간 보간을 통해 구현되며, 512×512 해상도 이미지에서 최신 기술 수준의 성능을 달성한다. 신체 형태, 피부 색상, 정체성을 유지하면서도 의류를 자연스럽게 융합하며, 최적화된 레이어별 보간 계수 덕분에 실제 및 생성된 이미지 모두에서 뛰어난 성능을 발휘한다.
Given a pair of images-target person and garment on another person-we automatically generate the target person in the given garment. Previous methods mostly focused on texture transfer via paired data training, while overlooking body shape deformations, skin color, and seamless blending of garment with the person. This work focuses on those three components, while also not requiring paired data training. We designed a pose conditioned StyleGAN2 architecture with a clothing segmentation branch that is trained on images of people wearing garments. Once trained, we propose a new layered latent space interpolation method that allows us to preserve and synthesize skin color and target body shape while transferring the garment from a different person. We demonstrate results on high resolution 512x512 images, and extensively compare to state of the art in try-on on both latent space generated and real images.
연구 동기 및 목표
- 기존의 가상 시착 방법이 신체 형태의 변형, 피부 색상 일관성, 그리고 자연스러운 의류 융합을 간과하는 데서 기인하는 한계를 해결하기 위해.
- 쌍체의 훈련 데이터 없이도 고해상도(512×512) 이미지에서 고 fidelity 시착을 수행할 수 있는 방법을 개발하기 위해.
- 대상 사람의 정체성과 신체 구조를 유지하면서도 복잡한 의류 무늬와 질감을 정확히 전달할 수 있도록 하기 위해.
- 수동 조정을 피하기 위해 각 레이어별 최적의 보간 계수를 자동으로 계산하는 잠재 공간 최적화 전략을 설계하기 위해.
- 쌍체의 데이터를 사용하여 다양한 신체 유형, 자세, 의류 스타일에 걸쳐 일반화 능력을 입증하기 위해.
제안 방법
- 10만 장의 쌍체가 없는 패션 이미지에 대해 훈련된 수정된 StyleGAN2 아키텍처로, 포즈 조건부 생성기와 의류 세그멘테이션 브랜치를 통합한다.
- 생성기의 각 레이어에 대해 최적화된 계수를 이용해 잠재 공간 내에서 레이어별로 보간을 수행함으로써 대상자와 의류 이미지를 융합한다.
- 정체성 손실(얼굴 및 머리카락에 중점), 국소화 손실(편집을 의류 영역으로 제한), 의류 손실(형상, 색상, 질감 전달)을 포함하는 다성분 손실 함수에 의해 최적화가 이뤄진다.
- 실제 이미지 시착의 경우, 입력 이미지를 StyleGAN 잠재 공간에 사영한 후 보간을 수행하며, 생성된 이미지의 경우 이 단계를 생략한다.
- 최적화 중에 생성된 이미지를 세그멘테이션함으로써 외부 세그멘테이션 모델 없이도 정확한 영역별 편집이 가능하도록 아키텍처를 설계하였다.
- 생성기를 2D 인간 신체 자세에 조건부로 설정함으로써, 합성 중에 대상자의 자세를 제어할 수 있도록 하여 교차 자세 시착을 지원한다.
실험 결과
연구 질문
- RQ1쌍체의 훈련 데이터 없이도 GAN 기반 방법이 정체성, 피부 색상, 신체 형태를 유지하면서 고 fidelity 가상 시착을 달성할 수 있는가?
- RQ2레이어별 잠재 공간 보간은 탐욕적 또는 고정된 파rameter 방법에 비해 의류 세부 사항과 정체성 특징을 얼마나 잘 유지하는가?
- RQ3이 방법은 의류 이미지의 복잡한 무늬와 기하학적 패턴을 대상자에게 얼마나 잘 전달할 수 있는가?
- RQ4자세 조건부 설정은 다양한 신체 자세에서 시착 결과의 품질과 제어 가능성에 어떤 영향을 미치는가?
- RQ5손실 함수 구성 요소들(정체성, 국소화, 의류)이 최종 합성 품질과 의미적 일관성에 어떤 영향을 미치는가?
주요 결과
- TryOnGAN은 512×512 해상도의 실제 및 생성된 이미지에서 최신 기술 수준의 성능을 달성하였으며, 실사 수준의 품질, 신체 형태의 충실도, 피부 색상 유지 측면에서 기존 방법들을 능가한다.
- 레이어별 최적화 접근법은 끈적임 길이, 질감 패턴 등의 세부 사항 전달 측면에서 탐욕적 탐색 방법에 비해 뚜렷한 향상을 보였으며, 정성적 비교를 통해 이를 입증하였다.
- 생성된 이미지에서 TryOnGAN은 기하학적 패턴과 복잡한 질감과 같은 고주파 세부 정보를 성공적으로 전달하여 최적화 방법의 잠재력을 극대화하였다.
- 제거 실험 결과, 정체성, 국소화, 의류 손실의 세 구성 요소가 모두 사진 수준의 결과와 올바른 의미적 편집을 위해 필수적임을 확인하였다.
- 이 방법은 피부와 신체 부위를 일관되게 합성하여, 예를 들어 긴 소매 의류를 짧은 소매 대상자에게 전달할 경우 더 많은 팔 노출을 효과적으로 표현하였다.
- 강력한 성능에도 불구하고, 극단적인 자세나 대표성이 떨어지는 의류에서는 성능 저하가 발생하며, 실제 이미지 결과는 현재의 잠재 공간 사영 품질에 의해 제한된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.