Skip to main content
QUICK REVIEW

[논문 리뷰] Powers of layers for image-to-image translation

Hugo Touvron, Matthijs Douze|arXiv (Cornell University)|2020. 08. 13.
Generative Adversarial Networks and Image Synthesis참고 문헌 43인용 수 5
한 줄 요약

이 논문은 단일 가속화 잔차 블록을 고정된 오토에코더의 잠재 공간에서 반복적으로 적용하는 가벼운 파라미터 효율성 아키텍처인 Powers of Layers (PoL)를 소개한다. 이는 쌍화되지 않은 이미지 간 번역 작업에서 CycleGAN과 유사하거나 뛰어난 성능을 달성하면서도 훨씬 적은 파라미터를 사용하며, 변환 강도를 제어 가능하게 하고 다양한 작업 간 조합성을 제공한다.

ABSTRACT

We propose a simple architecture to address unpaired image-to-image translation tasks: style or class transfer, denoising, deblurring, deblocking, etc. We start from an image autoencoder architecture with fixed weights. For each task we learn a residual block operating in the latent space, which is iteratively called until the target domain is reached. A specific training schedule is required to alleviate the exponentiation effect of the iterations. At test time, it offers several advantages: the number of weight parameters is limited and the compositional design allows one to modulate the strength of the transformation with the number of iterations. This is useful, for instance, when the type or amount of noise to suppress is not known in advance. Experimentally, we provide proofs of concepts showing the interest of our method for many transformations. The performance of our model is comparable or better than CycleGAN with significantly fewer parameters.

연구 동기 및 목표

  • 쌍화되지 않은 훈련 데이터 없이 스타일 전이, 노이즈 제거, 흐림 제거 등의 쌍화되지 않은 이미지 간 번역 작업을 해결한다.
  • 모델 크기를 최소화하면서도 높은 성능을 유지하는 파라미터 효율성 아키텍처를 개발한다.
  • 단일 잔차 블록의 반복 횟수를 조절하여 추론 시 변환 강도를 동적으로 제어할 수 있도록 한다.
  • 공유된 잠재공간에 다수의 작업별 잔차 블록을 스택하여 변환의 조합성을 지원한다.
  • 반복적 조합의 최적화를 안정화시켜 지수 효과로 인한 성능 열화를 방지하는 훈련 기법을 제공한다.

제안 방법

  • 입력 이미지의 잠재 표현을 추출하기 위해 사전 훈련된 고정된 가중치 오토에코더를 사용한다.
  • 잠재공간에서 도메인 A에서 도메인 B로의 변환을 학습하기 위해 단일 잔차 블록을 훈련한다.
  • 추론 시 잔차 블록을 반복적으로 적용하며, 반복 횟수로 변환 강도를 조절한다.
  • 반복된 변환의 최적화를 안정화시키고 발산을 방지하기 위해 점진적인 훈련 스케줄을 구현한다.
  • 훈련 중에는 변환을 유도하기 위해 판별자를 사용하지만, 적대적 피드백에 기반해 자동으로 반복 정지를 허용한다.
  • 공유된 잠재공간에 작업별로 고정된 잔차 블록을 스택하여 변환의 조합을 가능하게 한다.

실험 결과

연구 질문

  • RQ1고정된 오토에코더의 잠재공간에서 재사용 가능한 단일 잔차 블록이 쌍화되지 않은 이미지 간 번역에서 경쟁력 있는 성능을 달성할 수 있는가?
  • RQ2단일 잔차 블록을 반복 적용하는 방식이 재훈련 없이도 제어 가능한 변환 강도를 제공할 수 있는가?
  • RQ3동일한 잠재공간이 다수의 이미지 조작(예: 노이즈 제거 후 스타일 전이)을 조합하여 지원할 수 있는가?
  • RQ4FID, 시각적 품질, 파라미터 효율성 측면에서 제안된 방법이 CycleGAN에 비해 어떤 성능을 보이는가?
  • RQ5아키텍처 변경 없이 고해상도 이미지 및 복잡한 작업(예: 흐림 제거, 블록 노이즈 제거)으로 일반화 가능한가?

주요 결과

  • Summer→Winter 작업에서 PoL는 FID 평균 46.1을 기록했고, CycleGAN의 48.8과 비교해 우수하거나 유사한 성능을 보였다. Horse→Zebra 작업에서는 PoL가 53.0, CycleGAN가 89.7을 기록하여 성능이 뛰어나다는 것을 확인했다.
  • Monet→Photo 번역 작업에서 PoL는 FID 70.3을 기록했고, CycleGAN의 60.3과 비교해도 파라미터 수가 적음에도 강력한 성능을 보였다.
  • 시각적 품질을 유지하거나 향상시키면서도 CycleGAN에 비해 모델 파라미터를 크게 줄였으며, 특히 고해상도 설정에서 두드러진 성능 향상을 보였다.
  • 고해상도 훈련을 통해 모델은 저해상도 모델이 불가능한 정확한 스케일의 점박이 무늬와 같은 세부 정보를 생성할 수 있었다.
  • 잠재공간에서 변환을 조합하는 방식(예: 노이즈 제거 후 스타일 전이)이 중간 단계에서 복원 및 재인코딩을 거치는 것보다 더 우수한 결과를 얻었다.
  • 추론 시 판별자를 사용해 최적의 반복 횟수를 동적으로 결정함으로써 적응적인 변환 강도를 구현할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.