Skip to main content
QUICK REVIEW

[논문 리뷰] XingGAN for Person Image Generation

Hao Tang, Song Bai|arXiv (Cornell University)|2020. 07. 17.
Generative Adversarial Networks and Image Synthesis참고 문헌 42인용 수 10
한 줄 요약

이 논문은 XingGAN을 제안하며, 새로운 생성적 적대적 네트워크로서 두 개의 연결된 브랜치—형태 기반 외관 기반(SA) 및 외관 기반 형태 기반(AS)—를 사용하여 외관 및 형태 특징을 새로운 SA 및 AS 블록을 통해 공동으로 모델링하고 상호 주의를 부여한다. 이 방법은 Market-1501과 DeepFashion에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 이전 방법 대비 인ception 스코어에서 최대 0.233 향상되고 마스크-SSIM에서 0.009 향상되었다.

ABSTRACT

We propose a novel Generative Adversarial Network (XingGAN or CrossingGAN) for person image generation tasks, i.e., translating the pose of a given person to a desired one. The proposed Xing generator consists of two generation branches that model the person's appearance and shape information, respectively. Moreover, we propose two novel blocks to effectively transfer and update the person's shape and appearance embeddings in a crossing way to mutually improve each other, which has not been considered by any other existing GAN-based image generation work. Extensive experiments on two challenging datasets, i.e., Market-1501 and DeepFashion, demonstrate that the proposed XingGAN advances the state-of-the-art performance both in terms of objective quantitative scores and subjective visual realness. The source code and trained models are available at https://github.com/Ha0Tang/XingGAN.

연구 동기 및 목표

  • 기존의 GAN 기반 인물 이미지 생성 방법이 공동 외관 및 형태 의존성을 효과적으로 모델링하지 못하는 한계를 해결하기 위해.
  • 외관 및 형태 표현 간 상호 강화를 가능하게 하여 생성된 인물 이미지의 시각적 정밀도와 자세 정렬을 향상시키기 위해.
  • 연속적이고 상호 주의 기반 특징 정제를 통해 점진적으로 세부적인 인물 이미지를 합성하는 새로운 아키텍처를 설계하기 위해.
  • 어려운 벤치마크에서 제안된 공액 주의 융합 및 이중 브랜치 생성기 설계의 효과성을 검증하기 위해.

제안 방법

  • Xing 생성기는 두 개의 병렬 브랜치인 SA(형태 기반 외관) 및 AS(외관 기반 형태)를 사용하며, 각각 Xing 블록의 시퀀스를 통해 외관 및 형태 특징을 반복적으로 정제한다.
  • 각 Xing 블록은 양방향 외관 및 형태 모odal에서 동시에 주의 맵을 생성하는 SA 및 AS 서브 블록을 포함하여 이종 특징 간 상호작용을 가능하게 한다.
  • 공액 주의 융합(Co-attention Fusion, CAF) 모듈은 양 모달에서 공동으로 계산된 주의 맵을 사용하여 최종 외관 및 형태 특징을 융합하여 생성 품질을 향상시킨다.
  • 이중 판별자 설정을 사용하며, 외관 기반 판별자와 형태 기반 판별자를 모두 생성자와 함께 엔드 투 엔드로 훈련시킨다.
  • 네트워크는 엔드 투 엔드 방식으로 훈련되어 두 브랜치가 상호 보완적 지도를 통해 점차적으로 특징 표현을 향상시킬 수 있도록 한다.
  • 모델은 인ception 스코어(IS), 마스크-IS, SSIM, 마스크-SSIM 등의 지표를 사용하여 Market-1501과 DeepFashion에서 평가된다.

실험 결과

연구 질문

  • RQ1외관 및 형태 특징 간의 상호 주의가 단일 모달 주의를 초월하여 인물 이미지 생성 품질을 향상시킬 수 있는가?
  • RQ2연속적이고 이중 브랜치 생성기 설계가 단일 브랜치 또는 잔차 기반 베이스라인 대비 더 나은 자세 정렬과 시각적 현실감을 제공하는가?
  • RQ3제안된 공액 주의 융합 모듈이 이미지 합성에 있어 외관 및 형태 표현을 효과적으로 융합하는가?
  • RQ4XingGAN 프레임워크는 큰 자세 변형과 복잡한 옷차림 변형을 포함하는 어려운 데이터셋에 일반화 가능한가?

주요 결과

  • XingGAN은 Market-1501에서 새로운 최신 기술 수준 인ception 스코어 3.708을 달성하여 이전 최고 성능 방법보다 0.233 포인트 향상되었다.
  • DeepFashion에서 XingGAN은 마스크-SSIM 0.816을 기록하여 기준선 대비 0.009 향상되어 구조적 정렬에서 뛰어난 성능을 보였다.
  • 제거 실험 결과, 공액 주의 융합(Co-attention Fusion, CAF) 모듈은 'SA+AS' 기준선 대비 마스크-IS를 0.065 향상시키고 마스크-SSIM을 0.009 향상시켰다.
  • 9개의 Xing 블록을 사용할 경우 최적의 성능을 달성하며, 더 많은 블록을 추가하면 성능이 저하되어 효과적인 상호 주의를 위해 소수의 블록만으로도 충분함을 시사한다.
  • 5개의 블록을 가진 Xing 생성기는 대부분의 지표에서 13개 블록을 가진 ResNet 및 PATN 생성기보다 뛰어난 성능을 보였으며, 이는 샘플 효율성과 표현력의 우수성을 확인한다.
  • 시각화 결과, 공액 주의 맵이 입력 및 생성된 특징 간 상호 보완적이고 의미 있는 주의 패턴을 학습하고 있음을 확인하였으며, 이는 현실감과 일관성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.