Skip to main content
QUICK REVIEW

[논문 리뷰] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guided Image Generation

Hao Tang, Dan Xu|arXiv (Cornell University)|2019. 08. 02.
Generative Adversarial Networks and Image Synthesis참고 문헌 52인용 수 9
한 줄 요약

이 논문은 세 개의 사이클형 하위 네트워크(한 개의 이미지 생성 사이클과 두 개의 키포인트 생성 사이클)를 통해 키포인트 유도 이미지 생성과 키포인트 재구성을 동시에 학습하는 새로운 생성 적대적 네트워크인 사이클 인 사이클 GAN(C²GAN)을 제안한다. 이미지 및 키포인트 모odal 간 이중 방향, 종단 간 최적화를 가능하게 함으로써, C²GAN은 얼굴 표정 및 인물 자세 생성 작업에서 최신 기술 대비 더 사진처럼 현실적인 세부 사항을 갖춘 이미지를 생성한다.

ABSTRACT

In this work, we propose a novel Cycle In Cycle Generative Adversarial Network (C$^2$GAN) for the task of keypoint-guided image generation. The proposed C$^2$GAN is a cross-modal framework exploring a joint exploitation of the keypoint and the image data in an interactive manner. C$^2$GAN contains two different types of generators, i.e., keypoint-oriented generator and image-oriented generator. Both of them are mutually connected in an end-to-end learnable fashion and explicitly form three cycled sub-networks, i.e., one image generation cycle and two keypoint generation cycles. Each cycle not only aims at reconstructing the input domain, and also produces useful output involving in the generation of another cycle. By so doing, the cycles constrain each other implicitly, which provides complementary information from the two different modalities and brings extra supervision across cycles, thus facilitating more robust optimization of the whole network. Extensive experimental results on two publicly available datasets, i.e., Radboud Faces and Market-1501, demonstrate that our approach is effective to generate more photo-realistic images compared with state-of-the-art models.

연구 동기 및 목표

  • 희소 키포인트 감독 하에 복잡한 조건(예: 가림, 다양한 조명)에서도 사진처럼 현실적인 이미지를 생성하는 데 도전한다.
  • 여러 도메인으로 확장하기 어려운 기존의 비일치 이미지 간 번역 모델의 한계를 극복하며, 인간 자세나 제스처 생성과 같은 무한 도메인 작업에서 실패하는 문제를 해결한다.
  • 상호 감독을 통해 이미지 및 키포인트 생성의 공동 학습을 가능하게 하여 강건성과 세부 사항의 정확도를 향상시킨다.
  • 이미지 재구성과 조건부 입력에서 정확한 키포인트 레이아웃 예측을 동시에 수행할 수 있는 통합된 종단 간 훈련 가능한 프레임워크를 개발한다.

제안 방법

  • 키포인트 중심 생성자와 이미지 중심 생성자를 갖춘 이중 생성자 아키텍처를 도입하며, 이를 사이클형으로 종단 간 연결한다.
  • 세 개의 사이클형 하위 네트워크를 구성한다: 하나의 이미지 간 사이클(image → keypoint → image)과 두 개의 키포인트 간 사이클(keypoint → image → keypoint)로, 이중 방향 재구성을 가능하게 한다.
  • 생성된 이미지의 현실성과 예측된 키포인트 레이아웃의 일관성을 강화하기 위해 적대적 훈련과 판별기(discriminators)를 사용한다.
  • 재구성된 이미지와 키포인트가 원본 입력과 밀접하게 일치하도록 보장하기 위해 사이클 일관성 손실(cycle consistency loss)을 적용하여 모odal 간 추가적인 감독을 제공한다.
  • 적대적 손실, 사이클 일관성 손실, 지각적 손실을 포함한 병합된 손실 함수를 사용하여 전체 네트워크를 종단 간 최적화한다.
  • 최소한의 아키텍처 조정으로도 임의의 이미지 크기에서 추론이 가능하게 하여 유연한 구현을 지원한다.

실험 결과

연구 질문

  • RQ1통합된 생성 모델이 사이클형 교차 모달 감독을 통해 이미지 및 키포인트 생성을 동시에 향상시킬 수 있는가?
  • RQ2제안된 C²GAN 프레임워크는 키포인트 유도 얼굴 표정 및 인물 자세 생성에서 최신 기술 대비 어떻게 성능을 발휘하는가?
  • RQ3이미지 및 키포인트 생성자 간의 사이클 상호작용이 생성 품질 향상과 모드 붕괴 감소에 얼마나 기여하는가?
  • RQ4모델은 가림 및 다양한 조명 조건과 같은 복잡한 실제 세계 시나리오에서도 다양한 이미지 크기로 일반화 가능한가?
  • RQ5이미지 및 키포인트 생성의 공동 학습은 단일 모달 접근법에 비해 더 나은 지각적 품질과 구조적 정확도를 제공하는가?

주요 결과

  • Radboud Faces 데이터셋에서 C²GAN은 모든 지표(FID, LPIPS, SSIM, IS)에서 랜드마크 유도 얼굴 표정 생성 작업에서 최고 성능을 기록하며, GPGAN, PG² 및 기타 최신 기술 모델을 능가한다.
  • Market-1501 데이터셋에서 C²GAN은 PG² 및 PoseGAN보다 더 현실적이고 세부 사항이 풍부한 인물 이미지를 생성하며, 신원, 의복 및 모자와 같은 액세서리까지 잘 유지한다.
  • PG² 및 PoseGAN이 의미 있는 출력을 생성하지 못하는 부분적 가림이나 복잡한 배경 등의 도전적인 경우에도 C²GAN은 정확한 인물과 자세를 성공적으로 생성한다.
  • 키포인트 생성자는 매우 정확한 키포인트 예측(예: 얼굴 랜드마크 및 인간 신체 관절)을 생성하며, 정량적 및 정성적 평가에서 생성된 키포인트 레이아웃이 진짜 값과 매우 유사하다.
  • C²GAN은 키포인트 유도 인물 이미지 생성에서 PG² 및 DPIG보다 AMT(R2G), 마스크-SSIM, 마스크-IS 지표에서 경쟁력 있는 성능을 기록하며, IS 지표에서는 PoseGAN과 동등한 성능을 보이며 다른 지표에서 더 우수한 성능을 기록한다.
  • 강력한 사이클 제약과 명시적 교차 모달 감독 덕분에 C²GAN은 키포인트 유도 작업에서 모드 붕괴에 강건하며, 입력에 특화된 콘텐츠를 충실하게 재구성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.