Skip to main content
QUICK REVIEW

[논문 리뷰] Sparsely Grouped Multi-task Generative Adversarial Networks for Facial Attribute Manipulation

Jichao Zhang, Yezhi Shu|arXiv (Cornell University)|2018. 05. 19.
Generative Adversarial Networks and Image Synthesis참고 문헌 65인용 수 3
한 줄 요약

이 논문은 한 번의 입력으로 다수의 출력을 생성하는 GAN 아키텍처인 희소 그룹화 생성 적대 신경망(SG-GAN)을 제안한다. 이는 각 속성 그룹당 몇 개의 레이블된 샘플만으로도 고품질의 얼굴 속성 조작을 가능하게 한다. 레이블이 없는 데이터에 대해 정교화된 잔차 이미지 학습과 무 supervision 학습을 통합함으로써, SG-GAN은 희소 그룹화된 데이터셋에서 뛰어난 성능을 달성한다. 이는 최소한의 지도 학습 조건에서도 기존의 기준 모델을 능가하거나 동등하게 성능을 유지하며, 정체성과 배경 세부 정보를 잘 유지한다.

ABSTRACT

Recent Image-to-Image Translation algorithms have achieved significant progress in neural style transfer and image attribute manipulation tasks. However, existing approaches require exhaustively labelling training data, which is labor demanding, difficult to scale up, and hard to migrate into new domains. To overcome such a key limitation, we propose Sparsely Grouped Generative Adversarial Networks (SG-GAN) as a novel approach that can translate images on sparsely grouped datasets where only a few samples for training are labelled. Using a novel one-input multi-output architecture, SG-GAN is well-suited for tackling sparsely grouped learning and multi-task learning. The proposed model can translate images among multiple groups using only a single commonly trained model. To experimentally validate advantages of the new model, we apply the proposed method to tackle a series of attribute manipulation tasks for facial images. Experimental results demonstrate that SG-GAN can generate image translation results of comparable quality with baselines methods on adequately labelled datasets and results of superior quality on sparsely grouped datasets. The official implementation is publicly available:https://github.com/zhangqianhui/Sparsely-Grouped-GAN.

연구 동기 및 목표

  • 각 속성 그룹당 몇 개의 레이블된 샘플만으로도 학습이 가능한 희소 그룹화된 데이터셋을 활용해 지도 학습 기반의 이미지 간 번역의 높은 레이블 비용 문제를 해결하기 위해.
  • StarGAN 및 ResidualGAN과 같은 기존 모델이 완전히 레이블링된 쌍화된 데이터가 필요하거나, 쌍이 없는 희소 레이블링 상황에서 어려움을 겪는 문제를 해결하기 위해.
  • 각 속성에 대해 모델 재학습이 필요 없이 다중 작업 얼굴 속성 조작을 수행할 수 있는 통합된 단일 모델 아키텍처를 개발하기 위해.
  • 새로운 잔차 학습 메커니즘을 통해 생성 적대 학습의 안정성을 높이고, 번역된 이미지에서 정체성과 배경 콘텐츠를 유지하기 위해.

제안 방법

  • 단일 공유 생성자와 판별자를 사용하여 다수의 얼굴 속성 번역을 동시에 학습하는 일입력 다출력 GAN 아키텍처를 제안한다.
  • 입력과 잔차 특징 간 산술적 관계를 더 잘 학습하기 위해 요소별 덧셈 대신 특징 병합을 사용하는 정교화된 잔차 이미지 학습(RRIL) 구성 요소를 도입한다.
  • 레이블가 없는(그룹화되지 않은) 샘플을 손실 계산에서 제외하는 수정된 복원 손실을 적용하여, 희소 그룹화된 데이터에서 효과적인 학습을 가능하게 한다.
  • 레이블가 없는 데이터에 대한 무 supervision 학습을 활용하여 분류 정확도를 향상시키고 생성 적대 학습의 안정성을 높인다.
  • 각 속성 그룹당 소수의 샘플만 레이블링된 희소 그룹화된 데이터셋 설정을 사용하며, 나머지 샘플은 무 supervision 사전 학습에 활용한다.
  • 생성 적대 손실과 정체성 손실을 적용하여 콘텐츠를 유지하고 고해상도의 현실적인 이미지 번역을 생성한다.

실험 결과

연구 질문

  • RQ1각 그룹당 몇 개의 레이블된 샘플만으로도 단일 GAN 모델이 다수의 속성에 대해 고품질의 얼굴 속성 조작을 달성할 수 있는가?
  • RQ2희소 데이터 환경에서 표준 잔차 학습 대비 제안된 정교화된 잔차 이미지 학습 메커니즘이 이미지 번역 품질을 어떻게 향상시키는가?
  • RQ3레이블가 없는 데이터에 대한 무 supervision 학습이 희소 그룹화 학습 환경에서 학습 안정성과 성능 향상에 얼마나 기여하는가?
  • RQ4희소 레이블로 훈련되었을 때, SG-GAN은 StarGAN 및 ResidualGAN과 비교해 시각적 품질과 정체성 유지 측면에서 어떻게 성능을 내는가?
  • RQ5일부 훈련 샘플의 원래 레이블이 누락되었을 때, 복원 손실 설계가 성능에 어떤 영향을 미치는가?

주요 결과

  • SG-GAN은 각 그룹당 500개의 레이블된 샘플로만 훈련되어도 StarGAN 및 ResidualGAN와 같은 최신 기술 모델과 동등하거나 뛰어난 이미지 번역 품질을 달성한다.
  • 정교화된 잔차 이미지 학습(RRIL) 구성 요소는 번역 품질을 크게 향상시키며, 성별 속성 예측 정확도를 잔차 학습 없이 18.77%에서 RRIL 적용 시 93.26%로 높였다.
  • SG-GAN(500)과 SG-GAN(5000)은 SG-GAN(ALL)과 거의 동일한 성능을 보이며, 제한된 레이블 데이터에 대해 뛰어난 강인성을 입증했다.
  • 정체성 및 배경 특징을 효과적으로 유지하며, 정체성 유지 점수(예: SG-GAN(All)은 72, ResidualGAN은 63)에서 뚜렷한 우수성을 보였다.
  • 레이블가 없는 샘플을 손실 계산에서 제외하는 수정된 복원 손실 덕분에, 기존 StarGAN이 실패하는 희소 그룹화된 데이터에서도 안정적인 학습이 가능했다.
  • 시각적 비교 결과, 동일한 희소 데이터로 훈련되었을 때 SG-GAN은 StarGAN보다 더 선명하고 현실적인 결과를 생성했으며, 특히 얼굴 구조 유지 측면에서 뛰어났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.