Skip to main content
QUICK REVIEW

[논문 리뷰] SketchyCOCO: Image Generation from Freehand Scene Sketches

Chengying Gao, Qi Liu|arXiv (Cornell University)|2020. 03. 05.
Generative Adversarial Networks and Image Synthesis참고 문헌 39인용 수 6
한 줄 요약

이 논문은 자유롭게 그린 스케치에서 고해상도이자 현실적인 스케일의 이미지를 생성하기 위해 교차 도메인 속성 임bedding을 위한 공유 잠복 공간을 활용하는 조건부 GAN 프레임워크인 EdgeGAN을 제안한다. 이 방법은 이미지 생성을 전경과 배경 단계로 분해하여, 스케치-이미지 쌍의 훈련 데이터가 필요 없이 제어 가능하고 고품질의 합성 이미지를 가능하게 하며, 새로 제안된 SketchyCOCO 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

We introduce the first method for automatic image generation from scene-level freehand sketches. Our model allows for controllable image generation by specifying the synthesis goal via freehand sketches. The key contribution is an attribute vector bridged Generative Adversarial Network called EdgeGAN, which supports high visual-quality object-level image content generation without using freehand sketches as training data. We have built a large-scale composite dataset called SketchyCOCO to support and evaluate the solution. We validate our approach on the tasks of both object-level and scene-level image generation on SketchyCOCO. Through quantitative, qualitative results, human evaluation and ablation studies, we demonstrate the method's capacity to generate realistic complex scene-level images from various freehand sketches.

연구 동기 및 목표

  • 자신감 있고 완성되지 않은, 스타일이 다양하게 변하는 추상적인 스케치에서 현실적이고 복잡한 스케일의 이미지를 생성하는 데 도전하는 것.
  • 사용자가 텍스트나 의미 지도가 아닌 직관적인 자유스러운 스케치를 통해 자신의 의도를 표현할 수 있는 제어 가능한 이미지 생성을 가능하게 하는 것.
  • 스케치 기반 이미지 생성에 대한 데이터 부족 문제를 해결하기 위해 스케치-이미지 쌍의 훈련 데이터 없이, 에지 맵을 프록시 감시로 사용하여 훈련하는 것.
  • 객체 수준과 스케일 수준의 스케치-이미지 생성을 지원하는 대규모이고 다양한 데이터셋인 SketchyCOCO를 구축하는 것.
  • 스케치의 세부 사항을 정확히 반영하는 현실적인 전경을 생성하면서도, 타당하고 일관된 배경을 생성할 수 있는 모델을 개발하는 것.

제안 방법

  • 이미지와 에지 맵을 동일한 임베딩 공간에 통합하기 위해 공유 인코더를 사용하는 공유 잠복 공간을 갖춘 조건부 GAN인 EdgeGAN을 제안한다.
  • 다양한 스케치 스타일에서 고수준의 객체 속성(예: 자세, 형태, 외관)을 캡처하는 분리된 속성 벡터를 사용하여, 미훈련된 스케치 스타일에 대한 제로샷 일반화를 가능하게 한다.
  • 이미지 생성을 두 단계로 분해한다: (1) 세밀한 스케치에 조건부로 전경 생성, (2) 전경과 원시적인 배경 스케치에 조건부로 배경 생성.
  • 생성된 이미지와 해당 에지 맵 간의 일관성을 강제하기 위해 공동 판별자를 사용하여 해상도와 현실감을 향상시킨다.
  • 스케치-이미지 쌍이 아닌 이미지와 에지 맵 쌍만을 사용하여 엔드 투 엔드로 훈련하며, 공유 잠복 공간을 활용해 스케치-이미지 쌍의 훈련 데이터가 필요 없도록 한다.
  • 다중 척도 판별자를 사용하여 복잡한 스케일 영역에서 국소적이고 전반적인 이미지 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1딥 러닝 생성 모델이 스케치-이미지 쌍의 훈련 데이터 없이도 자유롭게 그린 스케치에서 현실적이고 고해상도의 스케일 이미지를 생성할 수 있는가?
  • RQ2다양한 스케치 스타일, 특히 추상적이고 완성되지 않은 그림에 대해 모델의 일반화 능력은 어느 정도인가?
  • RQ3공유 잠복 공간이 다양한 스케치 스타일과 이미지 도메인 간의 분리된 속성 학습을 어느 정도 가능하게 하는가?
  • RQ4전경부터 생성하고 나서 배경을 생성하는 점진적 생성 전략이 복잡한 스케일에서 현실감과 일관성을 향상시키는 데 얼마나 효과적인가?
  • RQ5시각적 품질, 해상도, 사용자 인식 측면에서 기존의 스케치-이미지 변환 방법과 비교해 모델의 성능은 어떠한가?

주요 결과

  • EdgeGAN은 객체 수준과 스케일 수준의 이미지 생성에서 모두 최신 기술 수준(SOTA)의 성능을 달성하였으며, 정성적 및 정량적 평가에서 기존 방법을 능가한다.
  • 사람의 평가 결과, FID 점수는 GauGAN에 약간 열등하지만, 특히 전경 객체의 현실감이 가장 높은 것으로 나타났다.
  • 모델은 훈련 데이터에 포함되지 않은 Canny, FDoG, Photocopy, Photo-sketch, XDoG 등 다양한 스케치 스타일에 대해서도 잘 일반화된다.
  • 배경 생성은 강력하고 제어 가능하다: 배경 스케치를 추가하거나 수정하면 의미적으로 일관되고 타당한 장면 변화가 발생한다.
  • 그림자(예: 기린 아래 그림자)와 같은 현실적인 스케일 세부 사항을 성공적으로 생성하여 강력한 공간적 및 구조적 이해 능력을 보였다.
  • 절단 실험 결과, 공유 잠복 공간과 속성 벡터가 고수준 속성의 분리 및 제로샷 스케치 일반화를 가능하게 하는 데 핵심 요소임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.