Skip to main content
QUICK REVIEW

[논문 리뷰] Unpaired Image-to-Image Translation using Adversarial Consistency Loss

Yihao Zhao, Ruihai Wu|arXiv (Cornell University)|2020. 03. 10.
Advanced Image Processing Techniques참고 문헌 34인용 수 4
한 줄 요약

이 논문은 사이클 일致성 손실 대신 적대적 일치성 손실을 사용하여 필수적인 특징을 유지하면서 형태 변화와 물체 제거가 가능한, 새로운 비쌍체 이미지 간 번역 프레임워크인 ACL-GAN을 제안한다. 픽셀 수준의 재구성 대신 소스 이미지와 번역된 이미지 간 분포 수준의 유사성을 유도함으로써, 안경 제거, 남성에서 여성으로의 번역, 스냅샷에서 애니메이션 스타일로의 번역 작업에서 최고 수준의 성능을 달성하며, 더 높은 현실감과 다양성을 확보한다.

ABSTRACT

Unpaired image-to-image translation is a class of vision problems whose goal is to find the mapping between different image domains using unpaired training data. Cycle-consistency loss is a widely used constraint for such problems. However, due to the strict pixel-level constraint, it cannot perform geometric changes, remove large objects, or ignore irrelevant texture. In this paper, we propose a novel adversarial-consistency loss for image-to-image translation. This loss does not require the translated image to be translated back to be a specific source image but can encourage the translated images to retain important features of the source images and overcome the drawbacks of cycle-consistency loss noted above. Our method achieves state-of-the-art results on three challenging tasks: glasses removal, male-to-female translation, and selfie-to-anime translation.

연구 동기 및 목표

  • 사이클 일치성 손실이 픽셀 수준의 재구성과 불필요한 특징(예: 안경, 수염)을 유지하도록 강제하는 한계를 해결하기 위해.
  • 쌍체 데이터가 필요 없이 형태 수정, 물체 제거, 다중 모달 출력을 지원하는 현실적인 이미지 번역을 가능하게 하기 위해.
  • 픽셀 수준의 일치성 대신 분포 수준의 정렬을 통해 소스 이미지와 타겟 이미지 간 도메인 공통 특징을 유지하는 방법을 개발하기 위해.
  • 기존의 사이클 일치성 기반 및 듀얼 생성자 기반 방법보다 더 높은 품질, 더 높은 다양성, 더 현실적인 번역 결과를 달성하기 위해.

제안 방법

  • 픽셀 수준의 재구성 없이도 공통 도메인 특징 측면에서 번역된 이미지가 소스 이미지와 유사하도록 유도하는 적대적 일치성 손실(ACL)을 도입한다.
  • 생성자와 판별자로 구성된 GAN 기반 프레임워크를 사용하며, 생성자는 소스 도메인에서 타겟 도메인으로 이미지를 번역하고, 판별자는 진짜 이미지와 생성된 이미지를 구분한다.
  • MUNIT에 영감을 받은 스타일 조건부 생성자 아키텍처를 사용하여 다중 모달 번역을 위한 콘텐츠와 스타일 표현의 분리된 표현을 가능하게 한다.
  • 적대적 일치성 손실을 표준 적대적 손실 및 아이덴티티 손실과 조합하여 학습 안정성과 특징 유지 성능을 향상시킨다.
  • 사전 훈련된 특징 추출기(예: VGG)를 통해 중간 레이어에서 소스 이미지와 번역된 이미지 간의 특징 수준의 유사성을 계산한다.
  • 사이클 일치성 또는 이중 생성자를 필요로 하지 않아 CouncilGAN과 같은 방법에 비해 모델 복잡성과 계산 비용을 감소시킨다.

실험 결과

연구 질문

  • RQ1적대적 일치성 손실이 사이클 일치성 손실을 효과적으로 대체할 수 있는가? 이는 필수적인 특징 유지와 형태 변화를 가능하게 하는가?
  • RQ2남성에서 여성으로의 얼굴 번역이나 스냅샷에서 애니메이션 스타일로의 전이와 같이 큰 구조적 변화가 필요한 작업에서 제안된 방법은 어떻게 성능을 내는가?
  • RQ3쌍체 데이터 없이도 사이클 일치성 기반 모델보다 더 높은 이미지 품질과 다양성을 달성할 수 있는가?
  • RQ4사이클 일치성의 부재로 인해 번역 품질에 악영향을 주는 아티팩트나 품질 저하가 발생하는가? 이 문제를 어떻게 완화하는가?

주요 결과

  • ACL-GAN은 안경 제거, 남성에서 여성으로의 얼굴 번역, 스냅샷에서 애니메이션 스타일로의 번역이라는 세 가지 도전적인 비쌍체 이미지 번역 작업에서 최고 성능을 기록한다.
  • 남성에서 여성으로의 번역 작업에서 ACL-GAN은 수염이 없고 더 긴 머리카락을 가진 더 여성스러운 얼굴을 생성하며, CycleGAN 및 MUNIT과 같은 사이클 일치성 기반 모델보다 정성적·정량적 평가에서 모두 뛰어난 성능을 보인다.
  • 스냅샷에서 애니메이션 번역 작업에서는 기존 모델보다 더 스타일리시하고 더 잘 정리된 얼굴 특징(예: 더 큰 눈)을 생성한다. 파라미터 수가 50퍼센트 미만이지만 U-GAT-IT의 경량 모드를 초월하는 성능을 기록한다.
  • 사이클 일치성 기반 모델이 픽셀 수준의 재구성으로 인해 이러한 특징을 유지하는 데 반해, ACL-GAN은 안경과 같은 큰 물체를 흔적 없이 효과적으로 제거한다.
  • 이중 생성자와 판별자를 사용하는 CouncilGAN보다도 더 높은 품질의 결과를 달성한다. 이는 적대적 일치성 손실을 통한 명시적 특징 정렬 덕분이다.
  • 실패 사례로는 눈에 띄지 않는 안경의 완전한 제거 실패와, 얼굴 크기가 작거나 가림이 있는 경우의 아티팩트가 있으며, 이는 드문 또는 복잡한 입력 분포를 다루는 데서의 한계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.