Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Open Domain Adaptation for Sketch-to-Photo Synthesis

Xiaoyu Xiang, Ding Liu|arXiv (Cornell University)|2021. 04. 12.
Advanced Vision and Imaging인용 수 5
한 줄 요약

이 논문은 새로운 프레임워크인 적대적 오픈 도메인 적응(AODA)을 제안하며, 실제 스케치와 합성 스케치 간의 도메인 갭을 줄이기 위해 무작위 혼합 샘플링 전략을 사용하면서도, 도메인 내 스케치-사진 쌍을 함께 학습하여 훈련 중에 존재하지 않는 클래스에 대해서도 스케치에서 사진으로의 변환을 가능하게 한다. 이 방법은 오픈 도메인 스케치-사진 번역에서 최신 기술 수준(SOTA)의 성능을 달성하며, 훈련 중에 포함되지 않은 클래스에 대해서도 256×256 해상도의 현실적이고 고해상도의 이미지를 생성한다.

ABSTRACT

In this paper, we explore open-domain sketch-to-photo translation, which aims to synthesize a realistic photo from a freehand sketch with its class label, even if the sketches of that class are missing in the training data. It is challenging due to the lack of training supervision and the large geometric distortion between the freehand sketch and photo domains. To synthesize the absent freehand sketches from photos, we propose a framework that jointly learns sketch-to-photo and photo-to-sketch generation. However, the generator trained from fake sketches might lead to unsatisfying results when dealing with sketches of missing classes, due to the domain gap between synthesized sketches and real ones. To alleviate this issue, we further propose a simple yet effective open-domain sampling and optimization strategy to "fool" the generator into treating fake sketches as real ones. Our method takes advantage of the learned sketch-to-photo and photo-to-sketch mapping of in-domain data and generalizes it to the open-domain classes. We validate our method on the Scribble and SketchyCOCO datasets. Compared with the recent competing methods, our approach shows impressive results in synthesizing realistic color, texture, and maintaining the geometric composition for various categories of open-domain sketches. Our code is available at https://github.com/Mukosame/AODA

연구 동기 및 목표

  • 훈련 데이터에 포함되지 않은 오픈 도메인 클래스에 대해 스케치에서 사진으로의 변환 문제를 해결하기 위해.
  • 훈련에 사용되는 실제 수동 스케치와 합성 스케치 간의 도메인 갭을 줄이기 위해.
  • 사진 데이터와 도메인 내 스케치-사진 쌍만을 사용하여 스케치-사진 번역의 일반화를 가능하게 하기 위해.
  • 정확도와 기하학적 일致성을 향상시키며 스케치-사진 번역과 사진-스케치 번역을 동시에 학습하는 통합 프레임워크를 개발하기 위해.

제안 방법

  • 도메인 내 스케치-사진 쌍을 사용하여 스케치-사진 생성자와 사진-스케치 생성자를 함께 학습하는 이중 사이클 GAN 프레임워크를 제안한다.
  • 훈련 중에 가짜 스케치(사진-스케치 번역 결과)와 실제 스케치를 무작위로 혼합하여 도메인 이탈을 줄이기 위한 오픈 도메인 샘플링 전략을 도입한다.
  • 사진-스케치 생성자를 활용해 오픈 도메인 클래스에 대해 신뢰할 수 있는 수동 스케치를 합성함으로써, 제로샷 스케치-사진 번역을 가능하게 한다.
  • 구조적이고 질감적인 세부 정보를 유지하기 위해 인스턴스 정규화와 잔차 블록을 사용한 적대적 학습을 수행한다.
  • 클래스 레이블을 포함한 조건부 GAN을 사용하여 다양체 계열 간의 의미 일致성을 향상시키고 생성 과정을 안내한다.
  • 적대적 손실, 사이클 일致성 손실, 아이덴티티 손실을 사용하여 종단 간(end-to-end)으로 모델을 학습함으로써 현실적이고 기하학적으로 정확한 출력을 보장한다.
Figure 1 : Illustration of open-domain sketch-to-photo synthesis problem. During the training stage of multi-class sketch-to-photo generation, sketches of some categories are missing. In the inference stage, our algorithm synthesizes photos from the input sketches for not only known classes, but als
Figure 1 : Illustration of open-domain sketch-to-photo synthesis problem. During the training stage of multi-class sketch-to-photo generation, sketches of some categories are missing. In the inference stage, our algorithm synthesizes photos from the input sketches for not only known classes, but als

실험 결과

연구 질문

  • RQ1훈련 데이터에 스케치가 존재하지 않는 오픈 도메인 클래스에 대해 스케치-사진 번역 모델이 일반화될 수 있는가?
  • RQ2실제 스케치와 합성 스케치 간의 도메인 갭을 어떻게 줄여야 생성 품질을 향상시킬 수 있는가?
  • RQ3스케치-사진 번역과 사진-스케치 번역을 함께 학습하면 오픈 도메인 스케치-사진 합성에서 제로샷 일반화 성능이 향상되는가?
  • RQ4가짜 스케치와 실제 스케치를 무작위로 혼합하는 샘플링 전략이 훈련되지 않은 클래스에 대해 생성된 사진의 강인성과 현실감을 향상시키는가?
  • RQ5제안된 방법은 정확한 질감과 기하학적 구성이 유지되는 고해상도(256×256) 사진-실사 이미지를 생성할 수 있는가?

주요 결과

  • QMUL-Sketch 데이터셋에서 AODA는 가장 높은 사용자 선호도 점수(74.80%)를 기록했으며, 오픈 도메인 샘플에 대해 두 번째로 낮은 FID(142.6)와 높은 분류 정확도(88.5%)를 달성했다.
  • SketchyCOCO에서 AODA는 사용자 연구에서 EdgeGAN과 조건부 CycleGAN을 앞서며, 오픈 도메인 클래스에서 경쟁적인 FID와 정확도를 확보했다.
  • 이 방법은 양면 스케치가 없는 클래스인 양과 기린과 같은 클래스에 대해서도 세밀한 질감과 기하학적 구성이 유지된 현실적인 256×256 이미지를 성공적으로 합성했다.
  • 사용자 연구 결과, AODA가 베이스라인 방법보다 유의미하게 더 선호되었으며, 특히 오픈 도메인 스케치에서 현실감과 구조적 정확도 향상이 두드러졌다.
  • 사진-스케치 생성자는 고품질의 스케치 추출을 수행했으며, 이는 기존의 스케치 추출 방법보다 뛰어난 성능을 보였다.
  • 전체 Scribble 데이터셋에서의 도메인 내 결과를 통해 AODA가 표준 다중 클래스 스케치-사진 생성에서도 경쟁력 있는 성능을 보이며, 이는 그 견고성을 확인한다.
Adversarial Open Domain Adaptation for Sketch-to-Photo Synthesis

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.