Skip to main content
QUICK REVIEW

[논문 리뷰] Interactive Sketch & Fill: Multiclass Sketch-to-Image Translation

Arnab Ghosh, Richard Zhang|arXiv (Cornell University)|2019. 09. 24.
Generative Adversarial Networks and Image Synthesis참고 문헌 61인용 수 16
한 줄 요약

이 논문은 부분적으로 그려진 윤곽선을 보완하고 실시간으로 클래스 기반 이미지를 생성하는 상호작용형 GAN 기반 스케치에서 이미지로의 시스템을 제안한다. 두 단계 프로세스를 통해 먼저 형상 보완 네트워크를 통해 형상을 보완하고, 그 다음으로 게이팅 기반 조건부 생성자에 의해 완성된 윤곽선과 클래스 레이블을 조건으로 삼아 사진처럼 생긴 이미지를 생성함으로써, 흐린 스케치에서 정확하고 다중 클래스 이미지 합성을 가능하게 한다. 이는 단순한 연결 방식보다 우수한 성능을 보이며, 단일 공유 생성자로 각 클래스별 성능에 근접한 성능을 달성한다.

ABSTRACT

We propose an interactive GAN-based sketch-to-image translation method that helps novice users create images of simple objects. As the user starts to draw a sketch of a desired object type, the network interactively recommends plausible completions, and shows a corresponding synthesized image to the user. This enables a feedback loop, where the user can edit their sketch based on the network's recommendations, visualizing both the completed shape and final rendered image while they draw. In order to use a single trained model across a wide array of object classes, we introduce a gating-based approach for class conditioning, which allows us to generate distinct classes without feature mixing, from a single generator network. Video available at our website: https://arnabgho.github.io/iSketchNFill/.

연구 동기 및 목표

  • 초보자 사용자가 점진적이고 상호작용적인 스케치를 통해 단순한 물체의 사진처럼 생긴 이미지를 생성할 수 있도록 하는 것.
  • 밀도 높은 에지 맵이 필요하지 않으면서도 불완전하고 흐린 스케치에서 다양하고 클래스 기반의 이미지를 생성하는 과제를 해결하는 것.
  • 특징 혼합을 방지하면서도 여러 물체 클래스를 지원할 수 있는 단일 확장 가능한 생성자를 개발하는 것. 이는 효과적인 클래스 조건화를 위한 새로운 게이팅 메커니즘을 사용한다.
  • 사용자 스케치 중 실시간 피드백을 제공함으로써 타당한 형상 보완과 해당하는 이미지 결과를 제안하는 것.

제안 방법

  • 두 단계 프레임워크: 첫째, 사용자 스토리크에서 흐린 스토리크로부터 타당한 완성된 윤곽선을 예측하는 형상 보완 네트워크.
  • 둘째, 완성된 윤곽선과 사용자가 제공한 클래스 레이블을 조건으로 삼아 다중 클래스 조건부 GAN이 사진처럼 생긴 이미지를 생성한다.
  • 특히 채널 기반 소프트 게이팅(예: ChannelGate)을 생성자에 적용하여 클래스 기반 특징 조절을 가능하게 하여 클래스 간 특징 혼합을 방지한다.
  • 게이팅 메커니즘은 레이어(예: 잔차 블록 내)에 걸쳐 적용되며, 학습 가능한 바이어스를 포함하여 네트워크가 클래스 관련 활성화에 집중할 수 있도록 한다.
  • 모든 클래스에서 단일 공유 생성자와 판별자 사용. 10개의 물체 클래스(둥근 형태와 복잡한 형태 포함)를 포함한 다양한 데이터셋으로 훈련.
  • 인터페이스는 실시간 시각적 피드백을 제공: 완성된 형상(grayscale), 합성된 이미지(color), 사용자 편집(녹색/빨간색)으로 상호작용적 보완을 가능하게 한다.

실험 결과

연구 질문

  • RQ1특징 혼합 없이 단일 조건부 GAN 생성자가 불완전한 스케치에서 다양하고 클래스 기반의 이미지를 효과적으로 생성할 수 있는가?
  • RQ2형상 보완 이후 이미지 생성을 거치는 두 단계 접근 방식이 직접 스케치에서 이미지로의 변환보다 훈련 안정성과 사용자 피드백 측면에서 개선되는가?
  • RQ3나이브 연결 또는 적응형 인스턴스 정규화보다 게이팅 기반 조건화 메커니즘이 다중 클래스 스케치에서 이미지로의 변환에 비해 얼마나 효과적인가?
  • RQ4모델이 예상치 못한 형상-클래스 조합(예: 원형 윤곽선이 파인애플이나cupcake를 생성하는 경우)으로 일반화할 수 있는가?
  • RQ5제안된 방법이 각 클래스별 생성자 성능에 근접하면서도 단일 배포 가능한 모델을 유지할 수 있는가?

주요 결과

  • 게이팅 기반 조건화 메커니즘(특히 ChannelGate)은 테스트 세트에서 99.6%의 분류 정확도를 달성하여 나이브 연결(64.5%)을 뛰어넘고, 각 클래스 생성자 성능(97.0%)에 가까워졌다.
  • 게이팅 기반의 SkinnyResNet 아키텍처는 인간 평가에서 23.4%의 속임수 비율을 기록했으며, 현실감 있는 정도에서 각 클래스 생성자(17.7%)를 능가하여 더 우수한 일반화 능력과 더 적은 아티팩트를 보였다.
  • 두 단계 접근 방식은 부분적인 윤곽선에서 직접 이미지로의 매핑보다 성능을 크게 향상시켰다. 중간 단계의 형상 보완이 중요한 기하학적 감독을 제공했기 때문이다.
  • 동일한 윤곽선(예: 원)에서 농구공, 수박,cupcake, 파인애플 등 다양한 클래스에 대해 구분되는 클래스 기반 이미지를 성공적으로 생성했으며, 코르너나 바닥 등의 부분에 대한 구조적 단서 없이도 가능했다.
  • 모델은 얼굴이나 신발과 같은 복잡한 형태로의 일반화도 성공적으로 보였으며, 단순한 둥근 물체를 넘어서 강건성을 보였다.
  • 게이팅 메커니즘은 클래스 간 명확한 분리를 가능하게 하여, 단일 생성자가 10개의 물체 클래스에서 고성능의 다양한 출력을 생성하면서도 성능 저하 없이 작동할 수 있도록 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.