[논문 리뷰] SingleGAN: Image-to-Image Translation by a Single-Generator Network using Multiple Generative Adversarial Learning
SingleGAN은 도메인 코드와 다중 생성 대비 학습을 사용하여 단일 생성자 GAN 프레임워크를 제안하며, 여러 도메인 간 이미지 간 번역을 효율적이고 효과적으로 수행한다. 이는 비쌍화된 데이터셋에서 최신 기술 수준의 성능을 달성하며, 하나의 출력에서 다수의 출력으로, 다수의 출력에서 다수의 출력으로, 다중 모odal 번역 작업으로의 일반화를 통해 뛰어난 정량적 및 정성적 결과를 제공한다.
Image translation is a burgeoning field in computer vision where the goal is to learn the mapping between an input image and an output image. However, most recent methods require multiple generators for modeling different domain mappings, which are inefficient and ineffective on some multi-domain image translation tasks. In this paper, we propose a novel method, SingleGAN, to perform multi-domain image-to-image translations with a single generator. We introduce the domain code to explicitly control the different generative tasks and integrate multiple optimization goals to ensure the translation. Experimental results on several unpaired datasets show superior performance of our model in translation between two domains. Besides, we explore variants of SingleGAN for different tasks, including one-to-many domain translation, many-to-many domain translation and one-to-one domain translation with multimodality. The extended experiments show the universality and extensibility of our model.
연구 동기 및 목표
- 기존의 다중 도메인 이미지 번역 방법이 각 쌍마다 별도의 생성자를 필요로 하여 효율성과 확장성 문제가 발생하는 문제를 해결하기 위해.
- 도메인 특화 제어를 통해 단일 생성자를 사용하여 효과적이고 효율적인 비쌍화된 이미지 간 번역을 가능하게 하기 위해.
- 일대다, 다대다, 다중 모달 번역과 같은 다양한 번역 작업으로의 프레임워크 일반화를 탐색하기 위해.
- 모든 학습 샘플에 대한 세부 카테고리 레이블이 필요로 하지 않는 약한 지도 학습을 통해 쌍화된 데이터나 세부 레이블에 대한 의존도를 줄이기 위해.
- 통합된 단일 생성자 아키텍처의 유연성과 확장성의 잠재력을 다양한 이미지 번역 시나리오에서 입증하기 위해.
제안 방법
- 특정 도메인 간 매핑을 조건화하기 위해 보조 입력으로 도메인 코드를 도입한다.
- 각 대상 도메인에 대해 생성 대비 학습을 강제하기 위해 다수의 판별자를 사용하며, 이는 여러 번역 작업을 동시에 학습할 수 있도록 한다.
- 쌍화되지 않은 데이터 학습을 위해 사이클 일致성 손실을 사용하여 번역 중 일치성과 구조를 유지한다.
- 다양한 출력을 가능하게 하기 위해 기본 모델에 속성 잠재 코드를 추가하여 단일 출력 번역을 초월한 일반화를 이룬다.
- 쌍화된 데이터에 적합하게 하기 위해 사이클 일치성 손실을 ℓ₁ 재구성 손실로 교체하여 정밀도를 향상시킨다.
- 모든 학습 샘플에 대한 세부 카테고리 레이블이 필요로 하지 않는 다수의 판별자를 통한 약한 지도 학습을 적용한다.
실험 결과
연구 질문
- RQ1각 쌍마다 별도의 생성자가 필요 없이 단일 생성자가 여러 도메인 간 매핑을 효과적으로 학습할 수 있는가?
- RQ2도메인 코드와 다수의 판별자는 비쌍화된 환경에서 이미지 번역의 성능과 일반화 능력을 어떻게 향상시킬 수 있는가?
- RQ3제안된 프레임워크는 쌍화된 데이터나 세부 레이블이 없이도 복잡한 작업, 예를 들어 일대다 및 다대다 이미지 번역을 처리할 수 있는가?
- RQ4속성 잠재 코드를 통합할 경우 이미지 번역에서 생성 다양성이 얼마나 향상되는가?
- RQ5다양한 번역 작업에서 비쌍화된 데이터 및 쌍화된 데이터 설정 모두에서 모델의 성능은 어떠한가?
주요 결과
- SingleGAN은 최신 기술 수준의 방법들과 비교하여 비쌍화된 이미지 간 번역 작업에서 뛰어난 성능을 달성하며, 뛰어난 정성적 및 정량적 결과를 보여준다.
- Photo ↔ Art 데이터셋에서 SingleGAN은 동일한 입력 이미지에서 서로 다른 예술 스타일을 생성함으로써 일대다 스타일 전이를 성공적으로 수행한다.
- Transient-Attributes 데이터셋에서 SingleGAN은 일치하지 않는 레이블이 있는 경우에도 겹치는 도메인(예: 낮, 밤, 여름, 겨울) 간의 일반화를 성공적으로 수행한다.
- 속성 잠재 코드의 도입으로 edge2shoes 데이터셋에서 다중 모달 번역이 가능해졌으며, 동일한 에지 입력에서 다양한 신발 스타일을 생성할 수 있었다.
- 쌍화된 데이터 설정에서는 ℓ₁ 재구성 손실을 사용하여 SingleGAN이 강력한 성능을 유지하였으며, DUTS-TR 및 BSDS500 데이터셋에서 검증되었다.
- 모델은 강건성과 확장성 모두를 보이며, 확장된 실험을 통해 다양한 이미지 번역 작업에 걸쳐 보편성을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.