Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Spatial Pyramid Attentive Pooling in Image Synthesis and Image-to-Image Translation

Wei Sun, Tianfu Wu|arXiv (Cornell University)|2019. 01. 18.
Generative Adversarial Networks and Image Synthesis참고 문헌 50인용 수 8
한 줄 요약

이 논문은 GAN과 CycleGAN에서 특징 융합을 향상시키기 위해 압도적 공간 피라미드 풀링, 캐스케이드 어텐션, 잔차 연결을 통합한 경량이며 일반적인 아키텍처 모듈인 공간 피라미드 주의 풀링(SPAP)을 제안한다. SPAP는 학습 가능한 어텐션을 통해 다중 척도의 맥락 모델링을 가능하게 하여 이미지 합성 및 이미지 간 번역 품질을 향상시키며, 기존 방법들보다 파rameter 수가 적은 상태에서 최신 기술 수준 또는 유사한 성능을 달성한다.

ABSTRACT

Image synthesis and image-to-image translation are two important generative learning tasks. Remarkable progress has been made by learning Generative Adversarial Networks (GANs)~\cite{goodfellow2014generative} and cycle-consistent GANs (CycleGANs)~\cite{zhu2017unpaired} respectively. This paper presents a method of learning Spatial Pyramid Attentive Pooling (SPAP) which is a novel architectural unit and can be easily integrated into both generators and discriminators in GANs and CycleGANs. The proposed SPAP integrates Atrous spatial pyramid~\cite{chen2018deeplab}, a proposed cascade attention mechanism and residual connections~\cite{he2016deep}. It leverages the advantages of the three components to facilitate effective end-to-end generative learning: (i) the capability of fusing multi-scale information by ASPP; (ii) the capability of capturing relative importance between both spatial locations (especially multi-scale context) or feature channels by attention; (iii) the capability of preserving information and enhancing optimization feasibility by residual connections. Coarse-to-fine and fine-to-coarse SPAP are studied and intriguing attention maps are observed in both tasks. In experiments, the proposed SPAP is tested in GANs on the Celeba-HQ-128 dataset~\cite{karras2017progressive}, and tested in CycleGANs on the Image-to-Image translation datasets including the Cityscape dataset~\cite{cordts2016cityscapes}, Facade and Aerial Maps dataset~\cite{zhu2017unpaired}, both obtaining better performance.

연구 동기 및 목표

  • GAN과 CycleGAN에서 생성 학습을 향상시키는 일반적이고 가벼운 아키텍처 모듈을 설계하는 것.
  • 기본적인 아트로우스 공간 피라미드 풀링(ASPP)의 생성 작업에서의 한계를 극복하기 위해 다중 척도 특징 집약을 위한 학습 가능한 어텐션을 도입하는 것.
  • 다중 수용성장치 모델링, 어텐션 기반 융합, 잔차 학습을 조합하여 생성자와 판별자 양쪽의 특징 표현을 향상시키는 것.
  • 모델 복잡도를 크게 증가시키지 않으면서도 이미지 합성 및 이미지 간 번역에서 더 높은 이미지 품질과 구조적 충실도를 달성하는 것.

제안 방법

  • SPAP는 특징 맵으로부터 다중 척도 맥락을 캡처하기 위해 확장률이 다른 어텐션 컨볼루션을 통합한다.
  • 피라미드 수준 간에 점진적으로 특징을 융합하기 위해 캐스케이드 어텐션 메커니즘을 도입하며, 이는 굵은 수준에서 미세 수준 또는 반대로 수행될 수 있다.
  • 공간 위치에 따라 특징 중요도를 조절하기 위해 학습 가능한 위치 기반 완전 연결 레이어를 사용해 어텐션 가중치를 계산한다.
  • 원본 입력과 어텐션 조절 특징의 볼록 조합을 통해 잔차 연결을 적용하며, 정보 유지 및 최적화 향상을 위한 학습 가능한 게이트를 포함한다.
  • 이 모듈은 플러그 앤 플레이 방식으로 GAN과 CycleGAN의 생성자 및 판별자 아키텍처의 표준 레이어에 쉽게 대체할 수 있다.
  • 이 방법은 무조건적 이미지 합성(SNDCGAN을 사용해 Celeba-HQ-128에서 수행)과 비쌍체 이미지 간 번역(CycleGAN을 사용해 Cityscapes, Facade, Aerial Maps 데이터셋에서 수행)에서 평가된다.

실험 결과

연구 질문

  • RQ1통합된 아키텍처 모듈이 GAN과 CycleGAN의 생성자 및 판별자에서 다중 척도 특징 융합을 향상시킬 수 있는가?
  • RQ2피라미드 수준 간에 캐스케이드 어텐션 메커니즘을 도입하면 생성 작업에서 기본 ASPP 융합 방식보다 성능이 뛰어나지는가?
  • RQ3SPAP는 모델 깊이나 파rameter 수를 크게 늘리지 않으면서도 이미지 합성 및 이미지 간 번역에서 이미지 품질과 구조적 충실도를 향상시킬 수 있는가?
  • RQ4SPAP는 특히 PatchGAN 기반 모델에서 판별자의 효과적 수용성장치에 어떤 영향을 미치는가?
  • RQ5SPAP는 스택드된 CycleGAN과 점진적 훈련을 사용하는 더 복잡한 모델인 SCAN과 유사한 성능을 달성할 수 있는가?

주요 결과

  • SPAP는 Celeba-HQ-128에서 기본 CycleGAN과 SNDCGAN보다 우수한 성능을 보이며, 더 현실적이고 세밀한 얼굴 이미지를 생성하고 FID 및 IS 점수를 향상시킨다.
  • 이미지 간 번역 작업에서 SPAP는 Cityscapes, Facade, Aerial Maps 데이터셋에서 SCAN과 비교해 더 나은 또는 유사한 결과를 달성하며, 더 높은 PSNR 및 SSIM 값을 기록한다.
  • Map ⇔ Aerial 데이터셋에서 SPAP를 적용한 모델은 PSNR 27.8과 SSIM 0.86을 기록하여 CycleGAN을 초월하고 SCAN 성능에 근접한다.
  • SPAP의 어텐션 맵은 굵은 수준 특징이 전반적인 맥락(예: 배경, 머리카락)에 집중하는 반면, 미세 수준 특징은 국소적 세부 사항(예: 눈, 안경)에 집중함을 보여주어 척도 인식 어텐션의 효과적인 작동을 입증한다.
  • SNDCGAN에서 판별자의 수용성장치는 52에서 100으로 증가하고, PatchGAN 기반 모델에서는 236×236로 증가하며, 깊이나 파rameter 수를 늘리지 않아도 구조적 구분 능력이 향상된다.
  • 상당히 작지만, SPAP는 스택드된 CycleGAN과 점진적 훈련을 사용하는 더 복잡한 SCAN 모델과 유사한 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.