Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to generate line drawings that convey geometry and semantics

Caroline Chan, Frédo Durand|arXiv (Cornell University)|2022. 03. 23.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 쌍화된 훈련 데이터 없이도 사진에서 3D 기하학적 구조와 의미적 정보를 명시적으로 인코딩하여 선으로 된 그림을 생성하는 비지도 이미지 간 번역 방법을 제안한다. 깊이 예측을 기반으로 한 기하학적 손실과 CLIP 임베딩을 사용한 의미적 손실을 도입하여, 쌍이 없는 최신 기법들보다 형태와 정체성을 더 잘 전달하는 성능을 보였다.

ABSTRACT

This paper presents an unpaired method for creating line drawings from photographs. Current methods often rely on high quality paired datasets to generate line drawings. However, these datasets often have limitations due to the subjects of the drawings belonging to a specific domain, or in the amount of data collected. Although recent work in unsupervised image-to-image translation has shown much progress, the latest methods still struggle to generate compelling line drawings. We observe that line drawings are encodings of scene information and seek to convey 3D shape and semantic meaning. We build these observations into a set of objectives and train an image translation to map photographs into line drawings. We introduce a geometry loss which predicts depth information from the image features of a line drawing, and a semantic loss which matches the CLIP features of a line drawing with its corresponding photograph. Our approach outperforms state-of-the-art unpaired image translation and line drawing generation methods on creating line drawings from arbitrary photographs. For code and demo visit our webpage carolineec.github.io/informative_drawings

연구 동기 및 목표

  • 쌍화된 훈련 데이터가 없이도 사진에서 3D 형태와 의미적 정보를 효과적으로 전달하는 선으로 된 그림을 생성하는 것.
  • 기존의 지도 학습 및 쌍화된 방법의 한계를 해결하기 위해, 비용이 많이 드는 인간 주석 데이터셋이나 도메인 특화 데이터에 의존하지 않는 것.
  • 명시적인 기하학적 및 의미적 감독을 통합하여 비지도 이미지 번역의 성능을 향상시켜 선으로 된 그림 생성에 기여하는 것.
  • 기하학적 및 의미적 손실과 같은 작업 특화 손실을 도입함으로써 사이클 일致성과 외관 복원에 대한 의존도를 줄이는 것.
  • 도메인 특화 미세조정 없이도 다양한 주제와 예술 스타일에 걸쳐 스타일화된 선으로 된 그림 생성을 가능하게 하는 것.

제안 방법

  • 이 방법은 적대적 훈련과 사이클 일치를 사용하여 선으로 된 그림 생성을 비지도 이미지 번역 문제로 공식화한다.
  • 생성된 선으로 된 그림의 특징에서 깊이를 예측하는 기하학적 손실을 도입하여 3D 형태가 유지되도록 보장한다.
  • 입력 사진과 생성된 선으로 된 그림 간의 CLIP 임베딩 거리 최소화를 통해 의미적 내용을 유지하는 의미적 손실을 최소화한다.
  • 사이클 일치를 통해 외관 보존을 유지하여 재구성된 이미지가 원본에 충실하도록 보장한다.
  • 적대적 손실, 사이클 일치 손실, 기하학적 손실, 의미적 손실의 조합을 사용하여 종합적으로 엔드 투 엔드로 모델을 훈련한다.
  • 다양한 데이터셋(포트레이트, 일반적 풍경, 스타일화된 그림 포함)에서 평가하고, 손실 구성 요소에 대한 분석 실험을 수행한다.
Figure 2 : Given a photograph $a$ , our model trains network $G_{A}$ to synthesize line drawing $G_{A}(a)$ via four main losses. Adversarial style loss with discriminator $D_{B}$ encourages generated line drawings to match the style of the training set. The CLIP , appearance, and geometry losses enf
Figure 2 : Given a photograph $a$ , our model trains network $G_{A}$ to synthesize line drawing $G_{A}(a)$ via four main losses. Adversarial style loss with discriminator $D_{B}$ encourages generated line drawings to match the style of the training set. The CLIP , appearance, and geometry losses enf

실험 결과

연구 질문

  • RQ1쌍화된 감독 없이도 비쌍화된 사진에서 효과적으로 선으로 된 그림을 생성할 수 있는가?
  • RQ2명시적인 기하학적 및 의미적 감독이 생성된 선으로 된 그림의 품질과 정보성에 기여하는가?
  • RQ3깊이 예측과 CLIP 기반 의미 정렬이 선으로 된 그림의 정서적 품질에 어떤 기여를 하는가?
  • RQ4기하학적 및 의미적 손실과 같은 작업 특화 손실을 도입할 경우 사이클 일치의 역할은 어느 정도 감소할 수 있는가?
  • RQ5미세조정 없이도 다양한 주제와 예술 스타일에 걸쳐 일반화되는가?

주요 결과

  • 이 방법은 기하학적 구조와 의미적 정보를 동시에 잘 전달하는 데 있어 최신의 쌍이 없는 이미지 번역 및 선으로 된 그림 생성 기법을 능가한다.
  • 사용자 연구 결과, Helen 데이터셋에서 훈련하고 APDrawingGAN과 비교했을 때, 참가자들이 제안된 방법을 60.1%의 경우에서 선호했다.
  • 일반적인 데이터셋인 Helen에서 훈련해도 강력한 성능을 보였으며, 일부 설정에서는 지도 학습 기반 기준을 초월했다.
  • CLIP 특징를 사용한 의미적 손실은 입력의 의미적 정보와의 정렬을 크게 향상시켜 회색조처럼 보이는 출력을 줄이는 데 기여했다.
  • 절단 실험 결과, 기하학적 손실과 의미적 손실 모두 필수적임을 확인했으며, 기하학적 손실은 형태 일致성을 향상시키고 의미적 손실은 정체성 유지에 기여했다.
  • 모델은 스타일에 관계없이 잘 일반화되어 있으며, 포트레이트, 복잡한 풍경, 스타일화된 그림 등에서 도메인 특화 미세조정 없이도 고품질 결과를 생성했다.
Figure 3 : Results of our method in four different styles.
Figure 3 : Results of our method in four different styles.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.