[논문 리뷰] SDIT: Scalable and Diverse Cross-domain Image Translation
SDIT는 조건부 인스턴스 정규화(CIN)를 통해 다양성을 확보하고 도메인 조건부 인코딩을 통해 확장성을 달성함으로써 단일 생성자로 확장 가능하고 다양한 교차 도메인 이미지 번역을 위한 통합 생성 모델을 제안한다. 이로 인해 쌍화된 훈련 데이터가 필요 없으며, 얼굴, 색상, 장면 번역 작업에서 최신 기술 수준의 성능을 달성한다. 다중 생성자 기반 모델보다 다양성과 확장성 면에서 뛰어난 성능을 발휘한다.
Recently, image-to-image translation research has witnessed remarkable progress. Although current approaches successfully generate diverse outputs or perform scalable image transfer, these properties have not been combined into a single method. To address this limitation, we propose SDIT: Scalable and Diverse image-to-image translation. These properties are combined into a single generator. The diversity is determined by a latent variable which is randomly sampled from a normal distribution. The scalability is obtained by conditioning the network on the domain attributes. Additionally, we also exploit an attention mechanism that permits the generator to focus on the domain-specific attribute. We empirically demonstrate the performance of the proposed method on face mapping and other datasets beyond faces.
연구 동기 및 목표
- 기존의 쌍화되지 않은 이미지 간 번역 방법이 다양성이나 확장성 측면에서 부족함을 보이는 데 대비하여 이를 해결하고자 한다.
- 쌍화된 훈련 데이터가 필요 없이 단일이고 컴act한 딥 러닝 아키텍처에서 확장성과 다양성을 통합하고자 한다.
- 단일 모델이 여러 도메인에 걸쳐 다양한 출력을 생성하면서도 높은 번역 품질을 유지할 수 있도록 하고자 한다.
- 잠재 공간 내 주의 메커니즘을 통해 도메인 특화된 특징의 국소화를 향상시키고자 한다.
- 얼굴 번역을 넘어서 복잡한 장면(예: 사진에서 예술 스타일로의 변환)으로의 일반화 능력을 입증하고자 한다.
제안 방법
- 생성자는 조건부 인스턴스 정규화(CIN) 레이어를 사용하여 임의의 잠재 코드를 주입함으로써 단일 모델에서 다양한 출력을 생성한다.
- 확장성은 타겟 도메인 레이블에 따라 인코더를 조건부로 설정함으로써 달성되며, 이로써 하나의 생성자가 여러 도메인을 처리할 수 있다.
- 주의 메커니즘이 도메인 특화된 이미지 영역에 집중함으로써 특징 정렬과 번역 정확도를 향상시킨다.
- 내용 보존과 현실감 향상을 위해 사이클 일致성 및 아이덴티티 손실을 사용하는 GAN 프레임워크로 모델을 훈련시킨다.
- 잠재 공간은 콘텐츠와 스타일 성분으로 분리되며, 스타일은 정규 분포를 따르는 잠재 코드로 제어된다.
- 아키텍처는 엔드 투 엔드로 미분 가능하며, 쌍화되지 않은 이미지 컬렉션을 사용해 비지도 학습 방식으로 훈련된다.
실험 결과
연구 질문
- RQ1단일 딥 생성 모델이 교차 도메인 이미지 번역에서 동시에 확장성과 다양성을 달성할 수 있는가?
- RQ2비지도, 쌍화되지 않은 이미지 번역 환경에서 다양성을 효과적으로 제어할 수 있는가?
- RQ3도메인 조건부 조건부 조절을 통해 단일 생성자가 성능 저하 없이 여러 도메인을 처리할 수 있는가?
- RQ4주의 기반 특징 조절이 번역 과정에서 도메인 특화 속성의 국소화를 향상시키는가?
- RQ5제안된 방법이 다양한 데이터셋에서 다중 생성자 기반 기준과 정량적·정성적으로 비교해 볼 때 어떻게 성능을 내는가?
주요 결과
- 색상 데이터셋에서 SDIT는 평균 LPIPS 0.612를 기록했으며, CycleGAN(0.592)를 능가하고 MUNIT(0.608)와 유사한 성능을 내며 단일 생성자임에도 불구하고 뛰어난 성능을 보였다.
- 아트워크 데이터셋에서 SDIT는 평균 LPIPS 0.828을 기록했으며, StarGAN(0.678)을 뛰어넘고 실제 이미지 품질(0.869)에 가까워졌다.
- 색상 데이터셋에서 SDIT는 역분류 정확도 97.1%를 기록했으며, MUNIT(97.2%)와 유사하고 StarGAN(95.3%) 및 CycleGAN(93.5%)보다 뚜렷하게 높았다.
- 동일한 입력에 대해 다양한 도메인(예: 노란, 초록, 파란 색상의 신발)에서 다양한 출력을 생성하는 능력을 보였으며, 이는 정성적 결과에서 입증되었다.
- 주의 메커니즘이 도메인 특화 영역에 집중함으로써 번역 품질을 향상시켰으며, 정성적 비교 및 아블레이션 연구를 통해 검증되었다.
- SDIT는 복잡한 장면 번역(예: 사진에서 세잔 스타일로의 변환)에서도 뛰어난 성능을 유지했으며, 평균 분류 정확도 65.1%와 LPIPS 0.828을 기록했고, 단일 모델임에도 불구하고 StarGAN을 능가하고 MUNIT와 유사한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.