[논문 리뷰] TuiGAN: Learning Versatile Image-to-Image Translation with Two Unpaired Images
TuiGAN은 두 개의 쌍이 없는 이미지만을 사용하여 훈련하는 one-shot 비지도 이미지 간 번역 모델을 제안한다. 다중 척도의 생성적 적대적 네트워크를 사용하여 거시적 구조에서 미시적 세부 사항까지 점진적으로 개선하는 코arse-to-fine 생성 모델을 적용한다. 이 모델은 다양한 UI2I 작업에서 최신 기술 수준(SOTA) 성능을 달성하며, 대규모 데이터셋으로 훈련된 모델조차도 one-shot 환경에서 뛰어난 성능을 보인다.
An unsupervised image-to-image translation (UI2I) task deals with learning a mapping between two domains without paired images. While existing UI2I methods usually require numerous unpaired images from different domains for training, there are many scenarios where training data is quite limited. In this paper, we argue that even if each domain contains a single image, UI2I can still be achieved. To this end, we propose TuiGAN, a generative model that is trained on only two unpaired images and amounts to one-shot unsupervised learning. With TuiGAN, an image is translated in a coarse-to-fine manner where the generated image is gradually refined from global structures to local details. We conduct extensive experiments to verify that our versatile method can outperform strong baselines on a wide variety of UI2I tasks. Moreover, TuiGAN is capable of achieving comparable performance with the state-of-the-art UI2I models trained with sufficient data.
연구 동기 및 목표
- 도메인당 하나의 이미지만 이용 가능한 극도로 낮은 데이터 환경에서 비지도 이미지 간 번역(UI2I) 문제를 해결하기 위해.
- 쌍이거나 다량의 쌍이 없는 데이터가 필요 없이 다양한 UI2I 작업을 수행할 수 있는 모델을 개발하기 위해.
- 텍스처나 색상 패턴을 넘어서 스타일과 고수준 의미적 콘텐츠를 모두 전달할 수 있는 번역을 가능하게 하기 위해.
- one-shot 훈련이 대규모 데이터셋으로 훈련된 모델과 비교해도 유사한 성능을 낼 수 있음을 입증하기 위해.
제안 방법
- TuiGAN은 다중 척도에서 생성자와 판별자를 포함한 조건부 GAN의 두 개의 피라미드를 사용하여 전역적 구조에서 국소적 세부 사항까지 점진적으로 이미지를 개선한다.
- 각 척도에서는 이전 척도의 특징을 조합하고 척도 인식 주의 메커니즘을 활용해 다중 척도 표현을 융합하는 생성자가 사용된다.
- 콘텐츠 보존과 잡음 감소를 위해 사이클 일致 손실, 아이덴티티 손실, 총 변동 손실을 사용한다.
- 각 척도의 생성자는 점진적으로 이미지를 개선하며, 스케일 연결과 주의 모듈을 통해 고수준 특징이 저수준 세부 사항을 이끄는 방식으로 설계된다.
- 각 척도의 판별자는 해당 해상도에서 원본 도메인(원본 도메인의 실제 이미지)과 생성된 이미지를 구분한다.
- 다양한 척도에서 수용 영역을 조절함으로써 점진적인 번역을 가능하게 하며, 최소한의 데이터로 도메인 분포의 변화를 포착할 수 있다.
실험 결과
연구 질문
- RQ1각 도메인에서 한 장의 이미지만을 사용할 때 비지도 이미지 간 번역을 효과적으로 수행할 수 있는가?
- RQ2코어스-투-파인 다중 척도 GAN 아키텍처가 one-shot 환경에서 더 나은 특징 학습과 번역 정확도를 가능하게 하는가?
- RQ3모델이 낮은 수준의 스타일(예: 색상, 텍스처)과 높은 수준의 의미적 콘텐츠(예: 객체 형태, 구조)를 동시에 전달할 수 있는가? 특히 최소한의 데이터로도 가능한가?
- RQ4사이클 손실, 아이덴티티 손실, 주의 메커니즘과 같은 핵심 구성 요소들이 one-shot 번역 성능에 미치는 영향은 무엇인가?
- RQ5오직 두 장의 이미지로만 훈련된 모델이 대규모 데이터셋으로 훈련된 모델과 유사한 성능을 낼 수 있는가?
주요 결과
- TuiGAN은 말라리아↔기린, 페르마↔라벨, 항공 사진↔지도 등 다양한 one-shot 이미지 간 번역 작업에서 강력한 베이스라인을 능가한다.
- 말라리아↔기린 작업에서 TuiGAN은 SIFID 점수 1.03×10⁻⁴와 PD 점수 6.16을 기록하여 모든 변형 중에서 가장 낮은 점수를 기록했으며, 이는 높은 현실성과 콘텐츠 보존을 의미한다.
- 제거 실험 결과, 사이클 일치 손실이나 아이덴티티 손실을 제거할 경우 심각한 잡음과 색상 오류가 발생함을 확인하여 이 손실 항목의 중요성을 입증한다.
- N=4 척도를 가진 전체 모델이 최고의 성능을 보였고, N=0(즉, CycleGAN과 동일)일 경우 전역적 구조 보존이 어려우며 잡음이 발생함을 확인했다.
- 그림에서 이미지로의 번역 작업에서 TuiGAN은 PhotoWCT, FUNIT, SinGAN보다 더 정확하고 세밀한 결과를 생성했으며, 콘텐츠 보존과 세밀한 스타일 패턴 전달을 모두 유지했다.
- 오직 두 장의 이미지로만 훈련되었음에도 불구하고 TuiGAN는 대규모 데이터셋으로 훈련된 최신 기술 수준의 모델과 유사한 성능을 달성했으며, 낮은 데이터 환경에서 강력한 일반화 능력을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.