[논문 리뷰] StyleGAN-Human: A Data-Centric Odyssey of Human Generation
이 논문은 230만 장의 전신 이미지를 포함한 대규모 다각도 데이터셋(SHHQ)을 활용한 데이터 중심적 접근 방식인 StyleGAN-Human를 소개한다. 이는 무조건적 사진 수준의 인간 이미지 생성을 위한 것으로, 데이터 크기(4만 장 이상), 자세에 대한 균형 잡힌 분포, 신체 중심 정렬이 생성 품질을 크게 향상시킨다는 것을 입증한다. 공개된 모델 자료집과 편집 벤치마크를 통해 향후 인간 생성 및 편집 분야의 연구를 가능하게 한다.
Unconditional human image generation is an important task in vision and graphics, which enables various applications in the creative industry. Existing studies in this field mainly focus on "network engineering" such as designing new components and objective functions. This work takes a data-centric perspective and investigates multiple critical aspects in "data engineering", which we believe would complement the current practice. To facilitate a comprehensive study, we collect and annotate a large-scale human image dataset with over 230K samples capturing diverse poses and textures. Equipped with this large dataset, we rigorously investigate three essential factors in data engineering for StyleGAN-based human generation, namely data size, data distribution, and data alignment. Extensive experiments reveal several valuable observations w.r.t. these aspects: 1) Large-scale data, more than 40K images, are needed to train a high-fidelity unconditional human generation model with vanilla StyleGAN. 2) A balanced training set helps improve the generation quality with rare face poses compared to the long-tailed counterpart, whereas simply balancing the clothing texture distribution does not effectively bring an improvement. 3) Human GAN models with body centers for alignment outperform models trained using face centers or pelvis points as alignment anchors. In addition, a model zoo and human editing applications are demonstrated to facilitate future research in the community.
연구 동기 및 목표
- 무조건적 인간 이미지 생성 분야에서 데이터 중심 분석의 부족을 해결하기 위해, 특히 데이터 크기, 분포, 정렬에 중점을 두고 분석한다.
- 1024×512 해상도 이상의 23만 장이 넘는 다양한 전신 이미지를 포함한 고품질 대규모 데이터셋(SHHQ)을 수집하고 애너테이션한다.
- 데이터 엔지니어링 요소—데이터 크기, 데이터 분포, 데이터 정렬—이 StyleGAN 기반 인간 생성 품질에 미치는 영향을 조사한다.
- 공개 모델 자료집을 구축하여 커뮤니티가 사용할 수 있도록 1024×512 및 512×256 해상도에서 세 가지 아키텍처(StyleGAN, StyleGAN2, 앨리어스프리 StyleGAN)의 6개 사전 훈련된 StyleGAN 모델을 제공한다.
- 사전 훈련된 모델를 활용해 얼굴 편집 기법(예: PTI, InterFaceGAN)을 전신 인간 생성에 적응시켜 인간 편집 벤치마크를 개발하고 검증한다.
제안 방법
- 다양한 자세와 의류 질감을 애너테이션한 23만 장의 고해상도 전신 이미지로 구성된 Stylish-Humans-HQ(SHHQ) 데이터셋을 수집하고 정제했다.
- 생성 품질에 대한 데이터 양의 영향을 평가하기 위해, 4만에서 23만 장까지 다양한 데이터 크기로 기존 StyleGAN 기반 모델을 훈련시켰다.
- 장꼬리형 및 균형 잡힌 데이터 분포를 사용한 훈련을 비교하여, 희귀한 얼굴 자세와 의류 질감에 미치는 영향을 분석했다.
- 키포인트 기반 정규화를 사용해 훈련 중 데이터 정렬을 위한 세 가지 방법(얼굴 중심, 골반 지점, 신체 중심)을 평가했다.
- 사전 훈련된 모델를 활용해 얼굴 중심 편집 기법(PTI, InterFaceGAN, StyleSpace, SeFa)을 전신 이미지에 적응시켜 인간 편집 벤치마크를 구축했다.
- 재현 가능성과 후속 응용을 위해 6개 모델(3개 아키텍처 × 2개 해상도)과 코드를 함께 공개했다.
실험 결과
연구 질문
- RQ1기본적인 StyleGAN 아키텍처를 사용할 때 고해상도의 무조건적 인간 이미지 생성 모델을 훈련하기 위해 필요한 최소 데이터 크기는 얼마인가?
- RQ2특히 얼굴 자세와 의류 질감에서 데이터 분포의 불균형은 희귀하거나 부족한 속성의 생성 품질에 어떤 영향을 미치는가?
- RQ3얼굴 중심, 골반 지점, 신체 중심 중 어떤 정렬 전략이 StyleGAN 기반 인간 이미지 생성 모델 훈련에서 가장 우수한 성능을 낼 수 있는가?
주요 결과
- 기본적인 StyleGAN 아키텍처를 사용할 때 고해상도의 무조건적 인간 이미지 생성 모델을 훈련하기 위해 최소 4만 장의 이미지가 필요하다.
- 얼굴 자세에 대한 데이터 분포를 균형 잡을 경우 희귀 자세의 생성 품질이 향상되지만, 의류 질감 분포를 균형 잡는 것은 유의미한 향상 효과를 가져오지 못한다.
- 신체 중심 정렬을 사용한 모델이 얼굴 중심 또는 골반 지점 정렬을 사용한 모델보다 우수한 성능을 보이며, 이는 더 뛰어난 구조적 일관성을 의미한다.
- 공개된 모델 자료집을 통해 최신 얼굴 편집 기법(예: InterFaceGAN, PTI)을 효과적으로 전신 인간 이미지에 적용할 수 있으며, 사진 수준의 자연스러운 편집 결과를 도출할 수 있다.
- InsetGAN 기반의 얼굴와 신체의 병합은 별도의 모델에서 생성된 얼굴과 신체를 융합하여 다양한 구성의 일관성 있는 전신 이미지를 생성하며, 이는 모델 자료집이 다성분 생성에 유용함을 입증한다.
- 인간 편집 벤치마크는 인간의 특성들을 잠재 공간에서 분리하는 것이 얼굴에 비해 더 복잡하며, 이는 특성 제어의 과제를 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.