[논문 리뷰] TransGaGa: Geometry-Aware Unsupervised Image-to-Image Translation
TransGaGa는 이미지 표현을 별개의 외관 및 기하학 잠재 공간으로 분리함으로써 큰 형태 변화에 대응하는 강력한 이미지 간 번역을 가능하게 하는 기하학적 인식의 비지도 이미지-이미지 번역 프레임워크를 제안한다. 조건부 VAE와 KL 발산, 스킵 연결을 활용하고, 사이클 일致성 및 VGG 손실을 적용함으로써, 근접 강체 및 비강체 물체 번역과 같은 도전적인 작업에서 최신 기술 수준(SOTA) 성능을 달성하며, 예시 기반 번역을 통한 다중 모odal 생성도 가능하게 한다.
Unsupervised image-to-image translation aims at learning a mapping between two visual domains. However, learning a translation across large geometry variations always ends up with failure. In this work, we present a novel disentangle-and-translate framework to tackle the complex objects image-to-image translation task. Instead of learning the mapping on the image space directly, we disentangle image space into a Cartesian product of the appearance and the geometry latent spaces. Specifically, we first introduce a geometry prior loss and a conditional VAE loss to encourage the network to learn independent but complementary representations. The translation is then built on appearance and geometry space separately. Extensive experiments demonstrate the superior performance of our method to other state-of-the-art approaches, especially in the challenging near-rigid and non-rigid objects translation tasks. In addition, by taking different exemplars as the appearance references, our method also supports multimodal translation. Project page: https://wywu.github.io/projects/TGaGa/TGaGa.html
연구 동기 및 목표
- 기존의 비지도 이미지-이미지 번역 방법이 도메인 간 큰 기하학적 변화를 다루는 데 실패하는 문제를 해결하기 위해.
- 번역의 강성 향상을 위해 외관과 기하학의 분리된 표현 학습을 가능하게 하기 위해.
- 쌍화된 훈련 데이터 없이도 다중 모달 및 예시 기반 이미지 번역을 지원하기 위해.
- 형태 차이가 큰 도메인 간 번역 시 자세 및 구조 일致성 유지하기 위해.
제안 방법
- 조건부 VAE와 KL 발산, 스킵 연결 설계를 사용하여 이미지 공간을 외관 및 기하학 잠재 공간의 카티esian 곱으로 분리한다.
- 기하학과 외관의 독립적이고 상호 보완적인 표현을 학습하도록 유도하기 위해 기하학 사전 손실을 도입한다.
- 전용 트랜스포머를 사용하여 분리된 외관 및 기하학 잠재 공간에서 별도로 번역을 수행한다.
- 원본 이미지와 번역된 이미지 간의 구조 일치성 및 자세 일치성을 유지하기 위해 사이클 일치성 손실을 적용한다.
- 생성된 이미지의 현실성 향상을 위해 VGG 지각 손실을 사용한다.
- 목표 도메인 이미지의 외관 특징을 전달함으로써 예시 기반 생성을 가능하게 하되, 번역된 기하학을 유지한다.
실험 결과
연구 질문
- RQ1도메인 간 큰 기하학적 변화에 대응하는 비지도 이미지-이미지 번역이 가능하게 할 수 있는가?
- RQ2비지도 방식으로 외관과 기하학을 효과적으로 분리할 수 있는가? 이는 번역 품질 향상에 기여하는가?
- RQ3분리된 잠재 공간이 다중 모달 및 예시 기반 이미지 생성을 지원할 수 있는가?
- RQ4사이클 일치성, KL 손실, VGG 손실과 같은 핵심 구성 요소가 번역 성능에 어떻게 기여하는가?
주요 결과
- TransGaGa는 말에서 코끼리로, 고양이 얼굴에서 인간 얼굴으로의 근접 강체 및 비강체 물체 번역과 같은 도전적인 번역 작업에서 최신 기술 수준(SOTA) 성능을 달성한다.
- 기하학이 입력 예시의 형태와 관계없이 충실하게 유지되는 바와 같이, 예시 기반 번역에서 높은 자세 일치성을 유지함으로써 성능이 뛰어나다는 게 입증된다.
- 분리된 잠재 공간에서의 선형 보간은 기하학과 외관 양쪽에서 매끄러운 전이를 생성하여 조밀하고 의미 있는 다양체 커버리지가 있음을 나타낸다.
- 절단 실험 결과, 사이클 일치성 손실은 자세 유지에 매우 중요하며, VGG 손실은 뿌연 현상 감소 및 현실성 향상에 기여한다.
- 인간 얼굴에서 고양이 얼굴로의 변환 작업에서 인간 평가에서 23.9%의 속임수 비율을 기록하며, 개선된 변종들보다 뛰어난 성능을 보였다.
- 사이클 일치성 손실이 없는 경우에도 지각 평가 점수는 높게 유지(16.8%)되어, 구조적 정밀도 유지를 위해 사이클 손실이 이미지 품질 향상보다 더 핵심적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.