Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Adversarial Network with Multi-Branch Discriminator for Cross-Species Image-to-Image Translation

Ziqiang Zheng, Zhibin Yu|arXiv (Cornell University)|2019. 01. 24.
Generative Adversarial Networks and Image Synthesis참고 문헌 47인용 수 4
한 줄 요약

이 논문은 단일 디스criminator를 다수의 더 작은, 파rameter 효율적인 브랜치로 분할함으로써 생성적 적대적 네트워크(GAN)의 성능을 향상시켜 다종의 생물 간 이미지 간 이미지 번역을 가능하게 하는 다중 브랜치 디스criminator 아키텍처인 GAN-MBD를 제안한다. 이 방법은 생성 품질을 향상시키고 모델 파라미터를 줄여, 인간, 고양이, 개를 포함한 여러 종에 걸쳐 높은 성능의 번역을 가능하게 하며, 표준 GPU에서 메모리 사용을 최소화하면서도 효율성을 유지한다.

ABSTRACT

Current approaches have made great progress on image-to-image translation tasks benefiting from the success of image synthesis methods especially generative adversarial networks (GANs). However, existing methods are limited to handling translation tasks between two species while keeping the content matching on the semantic level. A more challenging task would be the translation among more than two species. To explore this new area, we propose a simple yet effective structure of a multi-branch discriminator for enhancing an arbitrary generative adversarial architecture (GAN), named GAN-MBD. It takes advantage of the boosting strategy to break a common discriminator into several smaller ones with fewer parameters, which can enhance the generation and synthesis abilities of GANs efficiently and effectively. Comprehensive experiments show that the proposed multi-branch discriminator can dramatically improve the performance of popular GANs on cross-species image-to-image translation tasks while reducing the number of parameters for computation. The code and some datasets are attached as supplementary materials for reference.

연구 동기 및 목표

  • 다양한 종 간 의미 수준의 콘텐츠 일치가 요구되는 다종 생물 간 이미지 간 이미지 번역 문제를 해결하기 위해.
  • 기존 GAN이 높은 성능의 GPU와 긴 학습 시간을 요구하는 등의 계산 부담을 줄이기 위해.
  • 모델 복잡성이나 파라미터 수를 늘리지 않고도 유명한 GAN의 생성 및 합성 능력을 향상시키기 위해.
  • 두 종 간 번역뿐만 아니라 세 종 이상을 동시에 번역할 수 있도록 하기 위해.
  • 추가 파라미터 없이도 이미지 품질을 향상시킬 수 있는 후처리 정제 기법을 개발하기 위해.

제안 방법

  • 다중 브랜치 디스criminator(MBD)는 단일 대규모 디스criminator를 다수의 더 작은 평행 브랜치로 분해하여, 부스팅 전략에 영감을 받아 설계된다.
  • 각 브랜치는 특징의 부분 집합을 처리함으로써, 다양한 종 간에 더 강력하고 다양한 분류 표현을 학습할 수 있도록 한다.
  • MBD 아키텍처는 플러그 앤 플레이 방식으로, Pix2pix, CycleGAN, StarGAN과 같은 기존 GAN과 호환되며, 아키텍처의 대대적인 수정 없이 성능을 향상시킬 수 있다.
  • 재사용 및 정제하는 후처리 파이프라인을 도입하여 반복적으로 생성된 출력을 정제함으로써 이미지 품질을 더욱 향상시킨다.
  • 예를 들어, 네 개의 브랜치를 사용할 경우 StarGAN의 디스criminator 파라미터 수를 45.41M에서 11.89M로 크게 감소시키며, 번역의 정밀도를 향상시킨다.
  • 실험은 1에서 64개의 브랜치까지의 다중 브랜치 설계를 사용하여, 다양한 GAN 프레임워크에서의 확장성과 효율성을 입증한다.

실험 결과

연구 질문

  • RQ1다중 브랜치 디스criminator 아키텍처는 파라미터 수를 줄이면서도 다양한 종 간 이미지 간 이미지 번역 성능을 향상시킬 수 있는가?
  • RQ2MBD 아키텍처는 표준 GAN 및 다중 디스criminator 변종 대비 생성 품질과 학습 효율성 측면에서 어떻게 비교되는가?
  • RQ3재사용 및 정제하는 후처리 방법은 파라미터 수를 늘리지 않고도 이미지 품질을 향상시킬 수 있는가?
  • RQ4MBD 프레임워크는 Pix2pix, CycleGAN, StarGAN과 같은 다양한 GAN 아키텍처에 일반화되는가?
  • RQ5제안된 방법은 인간, 고양이, 개와 같이 세 종 이상 간의 효과적인 다종 생물 간 번역을 가능하게 하는가?

주요 결과

  • MBD 아키텍처는 GAN의 총 파라미터 수를 최대 75%까지 감소시키며, 성능 향상까지 이끌어낸다. 예를 들어, 네 개의 브랜치를 사용할 경우 StarGAN의 총 파라미터 수는 58.31M에서 24.79M로 감소한다.
  • 제안된 GAN-MBD는 다종 생물 간 이미지 간 이미지 번역 분야에서 최신 기준(SOTA) 성능을 달성하며, StarGAN-4BR를 통해 인간, 고양이, 개 간의 성공적인 번역을 구현한다.
  • 재사용 및 정제하는 후처리 단계는 CelebA, Cat2dog 등 다양한 데이터셋에서의 정성적 결과를 통해 다종 생물 작업에서 이미지 품질을 향상시킨다.
  • 기준 모델 대비 학습 시간이 최대 15% 감소한다: 예를 들어, 표준 StarGAN 대비 StarGAN-4br는 1000단계당 315.42ms로 학습되며, 기존 모델은 373.44ms이다.
  • MBD 기반의 CycleGAN은 다수의 디스criminator를 사용한 표준 CycleGAN과 비교해 유사하거나 더 뛰어난 이미지 품질을 달성하지만, 파라미터 수는 크게 줄어든다.
  • 이 방법은 제한된 메모리가 있는 단일 1080 Ti GPU에서도 고성능 이미지 번역을 가능하게 하여 실세계 적용에 유용하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.