[논문 리뷰] Conditional Image-to-Image Translation
이 논문은 조건부 GAN과 이중 학습을 사용하여 목표 도메인 이미지에 조건을 주어 번역 결과에 세밀한 제어를 가능하게 하는 조건부 이미지 간 번역을 제안한다. 이 방법은 도메인에 영향을 받지 않는 특징과 도메인에 특화된 특징을 분리하여 다양한 제어 가능한 출력을 가능하게 하며, 사용자 연구 검증을 통해 얼굴 간 번역 및 에지에서 신발/가방으로의 번역 작업에서 뛰어난 성능을 보였다.
Image-to-image translation tasks have been widely investigated with Generative Adversarial Networks (GANs) and dual learning. However, existing models lack the ability to control the translated results in the target domain and their results usually lack of diversity in the sense that a fixed image usually leads to (almost) deterministic translation result. In this paper, we study a new problem, conditional image-to-image translation, which is to translate an image from the source domain to the target domain conditioned on a given image in the target domain. It requires that the generated image should inherit some domain-specific features of the conditional image from the target domain. Therefore, changing the conditional image in the target domain will lead to diverse translation results for a fixed input image from the source domain, and therefore the conditional input image helps to control the translation results. We tackle this problem with unpaired data based on GANs and dual learning. We twist two conditional translation models (one translation from A domain to B domain, and the other one from B domain to A domain) together for inputs combination and reconstruction while preserving domain independent features. We carry out experiments on men's faces from-to women's faces translation and edges to shoes&bags translations. The results demonstrate the effectiveness of our proposed method.
연구 동기 및 목표
- 고정된 입력에 대해 결정론적인 출력을 생성하는 기존의 이미지 간 번역 모델에서의 제어력과 다양성 부족 문제를 해결하기 위해.
- 목표 도메인의 참조 이미지에 조건을 주어 번역된 이미지 스타일을 세밀하게 조작할 수 있도록 하기 위해.
- 소스 이미지의 도메인에 영향을 받지 않는 특징을 유지하면서 조건부 목표 도메인 이미지의 도메인 특화된 특징을 전달하는 방법을 개발하기 위해.
- 쌍방향 데이터 없이 GAN과 이중 학습을 사용하여 재구성 및 도메인 일관성을 보장함으로써 이를 달성하기 위해.
제안 방법
- 모델은 도메인 A에서 B로, 그리고 B에서 A로의 두 개의 조건부 번역 네트워크를 사용하며, 공통된 특징 추출 백본을 공유한다.
- 소스 이미지와 조건부 이미지에 대해 별도의 인코더를 사용하여 도메인에 영향을 받지 않는 특징과 도메인에 특화된 특징을 분리한다.
- 생성된 이미지가 현실적이며 목표 도메인에 속함을 보장하기 위해 조건부 GAN에 적대적 손실을 적용하여 훈련한다.
- 도메인에 영향을 받지 않는 특징과 도메인에 특화된 특징 양쪽에 대해 재구성 손실을 적용하여 이중 학습을 수행함으로써 정체성과 구조를 유지한다.
- 재구성 정밀도와 특징 일관성을 향상시키기 위해 도메인 특화된 특징에서 생성자로의 스킵 연결을 사용한다.
- 적대적 손실, 사이클 일관성 손실, 그리고 두 도메인 유형에 대한 특징 재구성 손실을 병합하여 종합적으로 훈련한다.
실험 결과
연구 질문
- RQ1고정된 소스 입력에 대해 목표 도메인 이미지에 조건을 주는 것이 다양한 제어 가능한 이미지 간 번역 결과를 가능하게 하는가?
- RQ2도메인에 영향을 받지 않는 특징와 도메인에 특화된 특징는 이미지 번역에서 효과적으로 분리되고 조작될 수 있는가?
- RQ3쌍방향 데이터 없이도 쌍방향 예제 없이 조건부 번역 모델을 훈련시키기 위해 비쌍방향 데이터를 효과적으로 활용할 수 있는가?
- RQ4고품질의 조건부 번역을 위해 필수적인 아키텍처 구성 요소(예: 스킵 연결, 특징 재구성)는 무엇인가?
- RQ5기존의 GAN 기반 및 이중 학습 방법과 비교해 볼 때, 제안된 방법은 시각적 품질과 사용자 선호도 측면에서 어떻게 성능을 내는가?
주요 결과
- 제안된 cd-GAN 모델은 기준 모델(cd-GAN-rec, cd-GAN-nof 등)보다 이미지 품질과 특징 일관성에서 뛰어나며, 특히 도메인에 영향을 받지 않는 구조를 유지하는 데서 두드러진 성능을 보였다.
- 17명의 참가자로 실시한 사용자 연구 결과, 제안된 모델이 생성한 이미지는 다른 방법보다 조건부 이미지의 도메인 특화된 특징과 유사도가 유의미하게 높았다.
- 제거 실험 결과, 스킵 연결과 특징 재구성 손실이 고해상도 이미지 재구성과 특징 분리에 필수적임을 확인하였다.
- 모델은 도메인 특화된 특징만을 사용하여도 조건부 이미지의 스타일과 유사한 이미지를 성공적으로 생성하였으며, 이는 효과적인 특징 추출을 검증하였다.
- 도메인에 영향을 받지 않는 특징만을 사용할 경우, 소스 이미지의 주요 형태를 유지함으로써 구조적 요소와 스타일 요소의 분리가 성공적으로 이루어졌음을 확인하였다.
- 얼굴 간 번역 및 에지에서 신발/가방으로의 번역 작업 결과는 대칭 및 비대칭 번역 환경 모두에서 본 방법의 효과성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.