Skip to main content
QUICK REVIEW

[논문 리뷰] Artist Style Transfer Via Quadratic Potential

Rahul Bhalley, Jianlin Su|arXiv (Cornell University)|2019. 02. 14.
Generative Adversarial Networks and Image Synthesis참고 문헌 31인용 수 4
한 줄 요약

이 논문은 제곱 잠재 거리(divergence, QP)를 사용하여 GAN 학습을 안정화시키고 리프시츠 제약 조건을 필요로 하지 않으면서도, 식별성(identity) 및 사이클 일致성(cycle-consistency) 손실을 통합하고, 전치 합성곱 대신 업샘플링을 사용하여 셰이커보드 무늬 아티팩트를 제거하는 새로운 아티스트 스타일 전이 방법인 CycleGAN-QP를 제안한다. 이 방법은 반디지, 모네, 시잔, 우키요에 등 다양한 예술 스타일에 걸쳐 고화질이며 아티팩트가 없는 스타일화된 이미지를 생성한다.

ABSTRACT

In this paper we address the problem of artist style transfer where the painting style of a given artist is applied on a real world photograph. We train our neural networks in adversarial setting via recently introduced quadratic potential divergence for stable learning process. To further improve the quality of generated artist stylized images we also integrate some of the recently introduced deep learning techniques in our method. To our best knowledge this is the first attempt towards artist style transfer via quadratic potential divergence. We provide some stylized image samples in the supplementary material. The source code for experimentation was written in PyTorch and is available online in my GitHub repository.

연구 동기 및 목표

  • 아티스트 스타일 전이에 특화된 GAN 기반 이미지-이미지 번역에서의 불안정성과 학습 곤란 문제를 해결한다.
  • 기존의 분산을 대체하여 제곱 잠재 거리(QP)를 도입함으로써 비지도 이미지 번역에서의 학습 안정성과 수렴성을 향상시킨다.
  • 전치 합성곱을 근접 이웃 업샘플링과 그 다음에 오는 합성곱으로 대체하여 생성된 스타일화된 이미지에서 셰이커보드 무늬 아티팩트를 제거한다.
  • 사이클 일치성과 식별성 손실을 통합하여 쌍방향으로 실제 이미지와 예술 이미지 도메인 간의 고 fidelity 스타일 전이 및 재구성 성능을 달성한다.
  • 다양한 예술 스타일, 즉 반디지, 모네, 시잔, 우키요에 등에서 최소한의 하이퍼파라미터 튜닝으로도 효과적인 일반화 성능을 입증한다.

제안 방법

  • 비평가 네트워크의 학습 목표로 제곱 잠재 거리(QP)를 도입하여, 비평가에 대한 1-리프시츠 제약 조건이 필요 없이도 안정적인 GAN 학습을 가능하게 한다.
  • QP 분산을 기반으로 한 비평가 손실을 제안하여, WGAN이나 표준 GAN과 비교해 기울기 소실 문제를 피하고 학습을 단순화한다.
  • 내용 보존 및 재구성 정확도 향상을 위해 생성자 목표 함수에 사이클 일치성 및 식별성 손실 항목을 통합한다.
  • 생성자 내 전치 합성곱 레이어를 근접 이웃 업샘플링과 그 다음에 오는 합성곱으로 대체하여 셰이커보드 무늬 아티팩트를 억제한다.
  • 고정된 학습률 0.0002, β1=0.5, β2=0.999를 사용하여 Adam 옵timizer로 생성자 및 비평가 네트워크를 엔드 투 엔드로 학습한다.
  • 평균 및 표준편차가 채널당 0.5인 정규화를 사용하여, 랜덤 수평 반전 및 중심 자르기 기반 데이터 증강을 수행하며, 해상도를 256×256로 조정한다.

실험 결과

연구 질문

  • RQ1제곱 잠재 거리(QP)가 비평가 가중치 클리핑 또는 스펙트럴 정규화를 요구하지 않고도 GAN 기반 아티스트 스타일 전이에서 학습 안정성과 수렴성을 향상시킬 수 있는가?
  • RQ2기본 GAN 및 WGAN 대비 제안된 QP-GAN 프레임워크는 스타일 전이에서 영상 품질과 아티팩트 억제 측면에서 어떻게 비교되는가?
  • RQ3전치 합성곱을 업샘플링 + 합성곱으로 대체할 경우 생성된 스타일화된 이미지에서 셰이커보드 무늬 아티팩트가 얼마나 감소하는가?
  • RQ4사이클 일치성과 식별성 손실의 조합이 스타일 전이 중 내용 보존과 재구성 품질 향상에 얼마나 기여하는가?
  • RQ5반디지, 모네, 시잔, 우키요에 등 다양한 예술 스타일에 대해 최소한의 하이퍼파라미터 튜닝으로도 일반화 성능이 유지되는가?

주요 결과

  • 제안된 CycleGAN-QP 방법은 반디지, 모네, 시잔, 우키요에 등 다양한 예술 스타일에 걸쳐 고화질의 스타일화된 이미지를 성공적으로 생성하였으며, 정성적 샘플을 통해 이를 입증하였다.
  • 전치 합성곱을 근접 이웃 업샘플링과 그 다음에 오는 합성곱으로 대체함으로써 생성된 이미지에서 셰이커보드 무늬 아티팩트가 완전히 제거되었다.
  • 제곱 잠재 거리를 사용한 학습으로 안정적인 학습이 가능했으며, 명시적 비평가 가중치 제약 또는 기울기 페널티가 필요로 하지 않았다.
  • 단일 NVIDIA K80 GPU에서 15,000 반복(우키요에의 경우 12,000 반복) 동안 학습을 수행하였으며, 학습 실행 당 약 1.25일이 소요되었다.
  • 식별성 및 사이클 일치성 손실의 사용으로 재구성 품질이 향상되어, 스타일화된 출력에서 원본 콘텐츠 이미지를 회복할 수 있었다.
  • 실험 기간 동안 모드 붕괴 또는 학습 실패가 보고되지 않아, 비지도 아티스트 스타일 전이 분야에서 최신 기술 수준의 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.