[논문 리뷰] Twin-GAN -- Unpaired Cross-Domain Image Translation with Weight-Sharing GANs
Twin-GAN은 쌍체가 없는 데이터를 사용하여 신뢰할 수 있고 신원을 유지하는 얼굴 이미지 번역을 가능하게 하는 새로운 비쌍체 교차 도메인 이미지 번역 프레임워크를 제안한다. 가중치 공유 생성기와 판별기를 사용하여, 쌍체가 없는 데이터에서도 현실성 있고 신원을 유지하는 번역을 실현한다. 사이클 일致성, 의미 일치성, 스킵 연결 U-Net 아키텍처를 결합하여, 기준 데이터셋에서 CycleGAN, UNIT, MUNIT를 능가하는 최신 기술 성능을 달성하며, 특징 정렬을 향상시키고 잡음 요소를 감소시킨다.
We present a framework for translating unlabeled images from one domain into analog images in another domain. We employ a progressively growing skip-connected encoder-generator structure and train it with a GAN loss for realistic output, a cycle consistency loss for maintaining same-domain translation identity, and a semantic consistency loss that encourages the network to keep the input semantic features in the output. We apply our framework on the task of translating face images, and show that it is capable of learning semantic mappings for face images with no supervised one-to-one image mapping.
연구 동기 및 목표
- 기존의 쌍체가 없는 이미지 번역 방법이 제한적인 공유 잠재 공간 가정에 의존하는 점을 해결하기 위해.
- 인간 얼굴과 애니메이션/고양이 얼굴 등 도메인 간에 쌍체가 없는 훈련 데이터 없이도 현실적이고 신원을 유지하는 이미지 번역을 가능하게 하기 위해.
- 의미 일치 손실과 생성기 내 스킵 연결을 도입하여 의미 특징의 유지 및 잡음 요소 감소를 향상시키기 위해.
- 공유 인코더 가중치를 사용하여 쌍체가 없는 데이터에서 의미 있는 교차 도메인 의미 대응 관계를 학습할 수 있는지 입증하기 위해.
- 모드 붕괴를 방지하고 구조적 충실도를 유지하면서도 제어 가능하면서 안정적인 교차 도메인 이미지 번역 프레임워크를 제공하기 위해.
제안 방법
- 도메인 간에 공유되는 가중치를 갖는 쌍체 생성기-판별기 아키텍처를 사용하여 파rameter 효율성과 도메인 불변성을 강화한다.
- 진행적 성장과 스킵 연결이 구현된 U-Net 기반의 인코더-생성기 구조를 사용하여 번역 과정에서 공간적 및 의미적 세부 사항을 유지한다.
- 이미지를 도메인 X에서 Y로 번역하고 다시 X로 복원했을 때 원래 입력을 회복하도록 보장하기 위해 사이클 일치 손실을 적용한다.
- 입력의 의미 특징을 번역된 출력에 유지하도록 유도하기 위해 의미 일치 손실을 도입한다.
- DRAGAN(Diverse Relativistic GAN)을 사용한 GAN 손실을 적용하여 훈련 안정성 향상과 더 빠른 수렴을 달성한다.
- 내용과 스타일을 분리하기 위해 특징 기반 인스턴스 정규화를 사용하며, 세부 스타일 속성 제어가 제한되어 있어 스타일 임bedding을 선택 사항으로 설정하였다.
실험 결과
연구 질문
- RQ1가중치 공유 GAN 프레임워크는 쌍체가 없는 훈련 데이터 없이도 고해상도이자 신원을 유지하는 이미지 번역을 달성할 수 있는가?
- RQ2사이클 일치성과 의미 일치성 손실의 조합이 쌍체가 없는 이미지 번역에서 특징 정렬을 향상시키고 잡음 요소를 감소시키는가?
- RQ3U-Net 아키텍처에 스킵 연결을 포함할 경우 국소적 의미 대응 관계 유지에 어떤 영향을 미치는가?
- RQ4공유 인코더를 사용하여 쌍체가 없는 데이터에서 의미 있는 교차 도메인 의미 임베딩을 학습할 수 있는가?
- RQ5모델은 인간 얼굴에서 고양이 얼굴 또는 게임 스타일에서 실제 도메인 이미지로의 매우 다를 수 있는 도메인 간 번역에 얼마나 일반화되는가?
주요 결과
- CelebA 데이터셋에서 Twin-GAN은 CycleGAN, UNIT, MUNIT를 능가하며, 모든 손실과 UNet을 사용할 경우 Sliced Wasserstein Score 14.84를 기록했고, 의미 일치 손실이 없는 경우 18.38로 낮아졌다.
- 제거 실험 결과, 사이클 손실을 제거하면 Sliced Wasserstein Score가 38.29로 떨어지며, 이는 신원 매핑 유지에 있어 사이클 손실의 핵심적 역할을 확인한다.
- 의미 일치 손실 도입으로 성능이 크게 향상되어, 의미 손실이 없는 경우 18.38에서 의미 손실이 있는 경우 14.84로 감소하였다.
- U-Net 아키텍처는 스킵 연결이 없는 모델에서 흔히 발생하던 거울 역행 얼굴 방향 등의 잡음 요소를 감소시켰으며, 인간에서 고양이로의 번역에서의 정성적 결과로 이를 입증하였다.
- 모델은 머리 스타일, 얼굴 방향, 옷차림과 같은 의미 있는 교차 도메인 의미 대응 관계를 학습했으며, 임베딩 공간 내 최근접 이웃 검색을 통해 이를 입증하였다.
- 얼굴 번역에서는 뛰어난 성능을 보였지만, 저해상도일지라도 Minecraft에서 실제 거리 풍경으로의 번역에서는 모드 붕괴 현상이 발생하여 3D 추론 및 시점 일반화 능력에 한계가 있음을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.