[논문 리뷰] Unpaired Multi-Domain Image Generation via Regularized Conditional GANs
이 논문은 쌍이 맞지 않는 다중 도메인 이미지 생성을 위한 Regularized Conditional GAN (RegCGAN) 프레임워크를 제안한다. 이 프레임워크는 훈련 데이터에 쌍이 맞는 예제가 없더라도 도메인 간의 대응 관계를 학습할 수 있다. 생성자 첫 번째 레이어에 정규화 항을 도입하여 공통된 고수준 의미를 강제하고, 구분자 최종 레이어에 정규화 항을 추가하여 불변 특징 표현을 생성함으로써, 엣지에서 사진으로, 속성 있는 얼굴, 모나르 스타일 이미지, 계절 변화와 같은 다양한 도메인 간에 정렬된 이미지 쌍을 생성하는 데 최신 기술 수준의 성능을 달성한다.
In this paper, we study the problem of multi-domain image generation, the goal of which is to generate pairs of corresponding images from different domains. With the recent development in generative models, image generation has achieved great progress and has been applied to various computer vision tasks. However, multi-domain image generation may not achieve the desired performance due to the difficulty of learning the correspondence of different domain images, especially when the information of paired samples is not given. To tackle this problem, we propose Regularized Conditional GAN (RegCGAN) which is capable of learning to generate corresponding images in the absence of paired training data. RegCGAN is based on the conditional GAN, and we introduce two regularizers to guide the model to learn the corresponding semantics of different domains. We evaluate the proposed model on several tasks for which paired training data is not given, including the generation of edges and photos, the generation of faces with different attributes, etc. The experimental results show that our model can successfully generate corresponding images for all these tasks, while outperforms the baseline methods. We also introduce an approach of applying RegCGAN to unsupervised domain adaptation.
연구 동기 및 목표
- 쌍이 맞는 훈련 데이터가 없을 때 다중 도메인 이미지 생성의 과제를 해결한다.
- 쌍이 맞는 예제가 없이도 표준 조건부 GAN이 도메인 간 대응 관계를 학습하지 못하는 문제를 해결한다.
- 도메인 간 공통된 고수준 의미를 학습하면서도 도메인 특화된 특징를 유지하는 방법을 개발한다.
- 불변 특징 표현을 통해 모델을 비지도 도메인 적응에 적용할 수 있도록 한다.
- 제로샷 이미지 번역 및 도메인 적응 과제에서 일반화 능력과 성능을 향상시킨다.
제안 방법
- 공통 잠재 코드로 공통 의미를 인코딩하면서 생성자와 구분자에 도메인 전용 변수를 조건으로 설정한다.
- 동일한 잠재 코드이지만 다른 도메인 코드를 사용할 경우 출력 간 L2 거리에 대한 정벌 항을 도입하여 의미 일관성을 강제한다.
- 해당 이미지 쌍에 대해 유사한 손실 출력을 유도함으로써 생성자가 정렬된 이미지를 생성하도록 하는 최종 레이어 구분자 정규화 항을 추가한다.
- 구분자의 마지막 히든 레이어를 불변 표현을 가진 특징 추출기로 사용하여 전이 학습을 가능하게 한다.
- 생성자와 구분자를 적대적 손실 및 두 정규화 항을 가중치 합으로 조합하여 함께 훈련한다.
- 구분자의 최종 레이어에 분류기를 부착하여 학습된 불변 특징를 비지도 도메인 적응에 적용한다.
실험 결과
연구 질문
- RQ1쌍이 맞는 훈련 데이터가 없이도 조건부 GAN을 정규화하여 도메인 간 대응 관계를 학습할 수 있는가?
- RQ2쌍이 맞는 예제가 없을 경우 서로 다른 도메인 간 공통된 고수준 의미를 어떻게 강제할 수 있는가?
- RQ3구분자의 최종 레이어가 도메인 간 일반화 가능한 표현을 생성할 수 있는가?
- RQ4제안된 정규화 프레임워크가 쌍이 맞지 않는 이미지 번역 및 도메인 적응에서 기존 방법을 능가하는가?
- RQ5학습된 특징가 최소한의 레이블 데이터로 비지도 도메인 적응에 얼마나 효과적으로 기여할 수 있는가?
주요 결과
- RegCGAN은 엣지에서 사진으로, 속성 있는 얼굴, 모나르 스타일 이미지, 계절 변화와 같은 다양한 도메인 간에 쌍이 맞는 훈련 데이터 없이도 대응하는 이미지 쌍을 성공적으로 생성한다.
- MNIST-to-USPS 및 USPS-to-MNIST 도메인 적응 과제에서 RegCGAN은 각각 샘플된 타겟 세트에서 93.1% 및 89.5%의 정확도를 달성하여 DANN, ADDA, CoGAN을 능가한다.
- 표준 테스트 세트에서 RegCGAN은 MNIST-to-USPS 및 USPS-to-MNIST 각각 90.1% 및 88.8%의 정확도를 기록하여 기존 베이스라인 대비 뛰어난 일반화 능력을 보였다.
- 모델은 잠재 공간에서 부드러운 보간을 생성하여 생성된 이미지 쌍 간에 내용과 스타일 모두 일관된 정서적 전이를 보였다.
- 구분자의 마지막 레이어에서 학습된 불변 특징 표현은 효과적인 전이 학습을 가능하게 하여, 이 방법의 비지도 도메인 적응에서의 유용성을 검증했다.
- 제거 실험 결과, 두 정규화 항 모두 필수적임을 확인하였으며, 둘 중 하나를 제거하면 이미지 번역 및 도메인 적응 과제에서 성능이 크게 떨어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.