Skip to main content
QUICK REVIEW

[논문 리뷰] CSGAN: Cyclic-Synthesized Generative Adversarial Networks for Image-to-Image Transformation

Kishan Babu Kancharagunta, Shiv Ram Dubey|arXiv (Cornell University)|2019. 01. 11.
Generative Adversarial Networks and Image Synthesis참고 문헌 32인용 수 12
한 줄 요약

이 논문은 CSGAN을 제안하며, 다양한 도메인 간 이미지 간 상호 변환을 향상시키기 위해 사이클화된 이미지 간 일관성을 강제하는 순환-합성 손실(CS 손실)을 도입한 새로운 이미지-이미지 번역 프레임워크이다. 이 방법은 CUHK 얼굴 스케치-사진 데이터셋에서 Pix2Pix, CycleGAN, PS2GAN 등의 최신 기법들과 비교해 정량적·정성적 지표 모두에서 뛰어난 성능을 보이며, 특히 낮은 LPIPS와 높은 SSIM 점수로 인해 구조적 유사성과 인지적 유사성에서 뛰어난 성능을 발휘한다.

ABSTRACT

The primary motivation of Image-to-Image Transformation is to convert an image of one domain to another domain. Most of the research has been focused on the task of image transformation for a set of pre-defined domains. Very few works are reported that actually developed a common framework for image-to-image transformation for different domains. With the introduction of Generative Adversarial Networks (GANs) as a general framework for the image generation problem, there is a tremendous growth in the area of image-to-image transformation. Most of the research focuses over the suitable objective function for image-to-image transformation. In this paper, we propose a new Cyclic-Synthesized Generative Adversarial Networks (CSGAN) for image-to-image transformation. The proposed CSGAN uses a new objective function (loss) called Cyclic-Synthesized Loss (CS) between the synthesized image of one domain and cycled image of another domain. The performance of the proposed CSGAN is evaluated on two benchmark image-to-image transformation datasets, including CUHK Face dataset and CMP Facades dataset. The results are computed using the widely used evaluation metrics such as MSE, SSIM, PSNR, and LPIPS. The experimental results of the proposed CSGAN approach are compared with the latest state-of-the-art approaches such as GAN, Pix2Pix, DualGAN, CycleGAN and PS2GAN. The proposed CSGAN technique outperforms all the methods over CUHK dataset and exhibits the promising and comparable performance over Facades dataset in terms of both qualitative and quantitative measures. The code is available at https://github.com/KishanKancharagunta/CSGAN.

연구 동기 및 목표

  • 다양한 도메인 간 이미지-이미지 변환을 위한 통합적이고 일반화 가능한 프레임워크를 개발함으로써, 작업별 또는 쌍화된 데이터에 의존하는 기존 방법의 한계를 극복하는 것.
  • 기존 GAN 기반 이미지 번역 모델에서 발생하는 아티팩트와 구조적 일관성 문제를 해결하기 위해, 합성된 이미지와 사이클화된 이미지 간 일관성을 강제하는 새로운 손실 함수를 도입하는 것.
  • 특히 얼굴 사진-스케치 합성과 같은 도전적인 과제에서 픽셀 수준의 정확성과 인지적 품질을 모두 향상시키는 것.
  • CUHK 및 CMP Facades와 같은 벤치마크 데이터셋에서 정성적 및 정량적 평가를 통해 제안된 CSGAN 프레임워크의 효과성을 검증하는 것.

제안 방법

  • CSGAN 프레임워크는 CycleGAN과 유사하게 두 개의 생성자(G_AB 및 G_BA)와 두 개의 판별자(D_A 및 D_B)를 사용하지만, 합성된 이미지와 사이클화된 이미지 간의 일관성을 강제하기 위해 새로운 순환-합성 손실(CS 손실)을 도입한다.
  • CS 손실은 도메인 A에서의 합성 이미지(G_AB(x))와 도메인 B에서의 사이클화된 이미지(G_BA(G_AB(x))) 간의 L1 손실로 계산된다.
  • 전체 목적 함수는 세 가지 손실의 조합으로 이루어지며, 각각은 적대적 손실(실사성 향상), 사이클-일관성 손실(재구성), 그리고 새로운 순환-합성 손실(다중 도메인 간 일관성)이다.
  • CS 손실은 합성 출력과 사이클화 출력 간의 차이를 벌리지 않도록 하여 아티팩트를 최소화함으로써, 복합 손실을 사용해 백프로파게이션을 통해 엔드 투 엔드로 네트워크를 훈련시킨다.
  • 표준 GAN 및 사이클-GAN 훈련 프로토콜을 사용하여 쌍화된 데이터셋(CUHK)과 쌍화되지 않은 데이터셋(Facades) 모두에서 평가가 수행되며, 훈련 및 추론이 이루어진다.
  • 구현은 PyTorch를 사용하였으며, 공개적으로 제공되며 https://github.com/KishanKancharagunta/CSGAN 에서 확인할 수 있다.

실험 결과

연구 질문

  • RQ1합성된 이미지와 사이클화된 이미지 간 일관성을 강제하는 새로운 손실 함수가 이미지-이미지 번역 성능을 향상시킬 수 있는가?
  • RQ2제안된 순환-합성 손실(CS 손실)이 기존 GAN 기반 방법과 비교해 아티팩트를 감소시키고 구조적 및 인지적 품질을 향상시키는가?
  • RQ3CSGAN은 쌍화된(CUHK) 및 쌍화되지 않은(Facades) 이미지 번역 벤치마크에서 최신 기법들과 비교해 어떻게 성능을 발휘하는가?
  • RQ4CS 손실은 픽셀 수준의 정확성과 인지적 유사성 간의 트레이드오프를 어느 정도 향상시키는가?

주요 결과

  • CUHK 얼굴 스케치-사진 데이터셋에서 CSGAN은 최고의 SSIM(0.898)과 가장 낮은 LPIPS(0.121)를 기록하여 지표 이미지와의 구조적 및 인지적 유사성에서 뛰어난 성능을 보였다.
  • CUHK 데이터셋에서 CSGAN은 가장 낮은 MSE(0.0028)와 가장 높은 PSNR(28.5 dB)를 기록하여 강력한 픽셀 수준 재구성 정확성을 입증하였다.
  • CMP Facades 데이터셋에서 CSGAN은 최고의 PSNR(26.7 dB)와 SSIM(0.861)를 기록하며, CycleGAN 및 DualGAN에 비해 정성적 일관성과 아티팩트 감소에서 뛰어난 성능을 보였다.
  • 정성적 결과에서는 CSGAN이 GAN, Pix2Pix, DualGAN, PS2GAN, CycleGAN 대비 더 적은 아티팩트, 더 나은 색상 일관성, 더 현실적인 질감을 생성하는 것으로 나타났다.
  • 제거 실험 결과, 순환-합성 손실의 추가가 성능 향상에 크게 기여하며, 특히 구조적 왜곡과 배경 노이즈 감소에 효과적임을 확인하였다.
  • 이 방법은 쌍화된 및 쌍화되지 않은 데이터셋 모두에서 뛰어난 강인성을 보이며, 인지적 품질 향상과 환영 효과 감소에 일관되게 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.