Skip to main content
QUICK REVIEW

[논문 리뷰] Mix and match networks: encoder-decoder alignment for zero-pair image translation

Yaxing Wang, Joost van de Weijer|arXiv (Cornell University)|2018. 04. 06.
Generative Adversarial Networks and Image Synthesis참고 문헌 30인용 수 8
한 줄 요약

이 논문은 공통 잠재공간에 다중 인코더-디코더 쌍을 정렬함으로써 페어되지 않은 데이터 간의 이미지 번역을 가능하게 하는 '믹스 앤 매치 네트워크' 프레임워크를 제안한다. 자동에코더, 보조 정보(예: 풀링 인덱스), 일관성 손실을 활용하여, 제로샷 깊이-세그먼테이션 번역 및 확장 가능한 언페어드 스타일 전이에서 최신 기술을 초월하는 성능을 달성했으며, mIoU 기준으로 CycleGAN 및 pix2pix 기준 모델보다 2배 이상 향상되었다.

ABSTRACT

We address the problem of image translation between domains or modalities for which no direct paired data is available (i.e. zero-pair translation). We propose mix and match networks, based on multiple encoders and decoders aligned in such a way that other encoder-decoder pairs can be composed at test time to perform unseen image translation tasks between domains or modalities for which explicit paired samples were not seen during training. We study the impact of autoencoders, side information and losses in improving the alignment and transferability of trained pairwise translation models to unseen translations. We show our approach is scalable and can perform colorization and style transfer between unseen combinations of domains. We evaluate our system in a challenging cross-modal setting where semantic segmentation is estimated from depth images, without explicit access to any depth-semantic segmentation training pairs. Our model outperforms baselines based on pix2pix and CycleGAN models.

연구 동기 및 목표

  • 원천 도메인과 목표 도메인 간에 페어링된 훈련 데이터가 존재하지 않는 제로-페어 이미지 번역 문제를 해결하기 위해.
  • 재훈련 없이도 훈련된 이미지 번역 모델이 새로운 도메인 조합으로도 적용 가능하도록 가능성을 확보하기 위해.
  • 다양한 모odalities와 도메인 간 보다 우수한 일반화를 위해 인코더와 디코더 간의 정렬을 향상시키기 위해.
  • 선형 복잡도를 사용하여 O(N²)에서 O(N)으로 복잡도를 감소시켜, 다수의 도메인으로의 언페어드 이미지 번역을 확장 가능하게 하기 위해.

제안 방법

  • 가용한 페어링된 데이터(예: RGB-to-depth, RGB-to-segmentation)를 바탕으로 다수의 인코더-디코더 쌍을 훈련하고, 공통 잠재공간에 정렬한다.
  • 잠재 표현의 정규화와 재구성 품질 향상을 위해 자동에코더를 활용한다.
  • 번역 과정에서 공간적 구조를 유지하기 위해 풀링 인덱스를 보조 정보로 통합한다.
  • 다른 인코더와 디코더 간의 표현을 정렬하기 위해 잠재공간 일관성 손실을 적용한다.
  • 추론 시, 소스 도메인 인코더와 타겟 도메인 디코더를 연결하여 새로운 번역을 구성한다.
  • 다양한 모odalities(예: RGB와 깊이)의 잠재 벡터를 가중 평균을 사용해 융합함으로써 다중 모odal 입력으로의 확장

실험 결과

연구 질문

  • RQ1제한된 페어링된 데이터에서 훈련된 인코더-디코더 쌍이 정렬되어, 새로운 도메인 간 제로-페어 번역이 가능할 수 있는가?
  • RQ2풀링 인덱스와 같은 보조 정보가 제로-페어 번역에서 공간적 구조 재구성에 어떻게 기여하는가?
  • RQ3일관성 손실과 노이즈 주입이 도메인 간 전이 가능성에 얼마나 기여하는가?
  • RQ4기존의 언페어드 방법에 비해 믹스 앤 매치 프레임워크가 많은 도메인으로 효율적으로 확장 가능한가?
  • RQ5페어링된 훈련 데이터 없이도 깊이-세그먼테이션 번역과 같은 도전적인 다중 모odal 작업에 효과적으로 일반화되는가?

주요 결과

  • 제안된 방법은 기존 기준 대비 mIoU에서 약 12%에서 ~27%로 2배 이상 향상되어, 제로-페어 깊이-세그먼테이션 번역에서 뚜렷한 성능 향상을 달성했다.
  • 믹스 앤 매치 네트워크는 제로-페어 깊이-세그먼테이션 번역에서 pix2pix 및 CycleGAN 모델을 모두 능가하며, 최고 성능을 보인 구성(D→S)이 특히 의미 있는 클래스와 윤곽을 정확하게 식별했다.
  • 풀링 인덱스 형태의 보조 정보는 다중 모달 설정에서 재구성 품질 향상에 기여하며, 모달리티 변화에 대해 강건한 성능을 보였다.
  • 프레임워크는 확장 가능한 언페어드 이미지 번역을 가능하게 하였다: N개의 도메인에 대해 O(N²)에서 O(N)으로 복잡도 감소를 위해 단지 N−1개의 인코더와 N개의 디코더가 필요하다.
  • 스타일 전이 및 색상화 작업에서, 다수의 CycleGAN 기반 믹스 앤 매치 네트워크는 재훈련 없이도 11가지 색상과 5가지 예술 스타일 간에 새로운 번역을 성공적으로 수행했다.
  • 다중 모달 일관성 손실과 잠재공간 노이즈 주입의 사용은 제로-페어 환경에서 성능 향상과 일반화 능력을 더욱 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.