Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Sketch with Shortcut Cycle Consistency

Jifei Song, Kaiyue Pang|arXiv (Cornell University)|2018. 05. 01.
Advanced Image and Video Retrieval Techniques참고 문헌 42인용 수 15
한 줄 요약

이 논문은 인간 스케치 쌍으로부터 노이즈가 많고 약한 지도 학습을 받는 상황에서도 강건성을 향상시키기 위해 단순 순환 일致성(Shortcut Cycle Consistency)을 활용하는 새로운 딥러닝 프레임워크를 제안한다. 지도 학습 번역과 도메인 내 재구성, 역도메인 재구성의 비지도 학습을 결합함으로써, 상태 최고 수준의 방법들보다도 인식 및 검색 벤치마크에서 뛰어난 성능을 보이며 의미적으로 유의미한 추상화된 스케치를 생성한다. 또한 이는 정교한 스케치 기반 이미지 검색(FG-SBIR)을 위한 효과적인 데이터 증강 기법으로도 기능한다.

ABSTRACT

To see is to sketch -- free-hand sketching naturally builds ties between human and machine vision. In this paper, we present a novel approach for translating an object photo to a sketch, mimicking the human sketching process. This is an extremely challenging task because the photo and sketch domains differ significantly. Furthermore, human sketches exhibit various levels of sophistication and abstraction even when depicting the same object instance in a reference photo. This means that even if photo-sketch pairs are available, they only provide weak supervision signal to learn a translation model. Compared with existing supervised approaches that solve the problem of D(E(photo)) -> sketch, where E($\cdot$) and D($\cdot$) denote encoder and decoder respectively, we take advantage of the inverse problem (e.g., D(E(sketch)) -> photo), and combine with the unsupervised learning tasks of within-domain reconstruction, all within a multi-task learning framework. Compared with existing unsupervised approaches based on cycle consistency (i.e., D(E(D(E(photo)))) -> photo), we introduce a shortcut consistency enforced at the encoder bottleneck (e.g., D(E(photo)) -> photo) to exploit the additional self-supervision. Both qualitative and quantitative results show that the proposed model is superior to a number of state-of-the-art alternatives. We also show that the synthetic sketches can be used to train a better fine-grained sketch-based image retrieval (FG-SBIR) model, effectively alleviating the problem of sketch data scarcity.

연구 동기 및 목표

  • 사람이 그린 스케치 쌍으로부터 매우 노이즈가 많고 변동성이 큰 지도 학습 조건에서도 사진에서 스케치로의 번역을 학습하는 데 도전하는 것.
  • 도메인 내 재구성과 역도메인 번역을 통한 비지도 자기지도 학습을 지도 학습과 융합하여 스케치 생성 품질을 향상시키는 것.
  • 사람의 스케치 습관을 모방하는 스트로크 수준의 생성 모델을 개발하여, 추상적이지만 의미적으로 충실한 객체 묘사를 생성하는 것.
  • 합성 스케치가 실제 사진-스케치 쌍을 훈련시키는 데 효과적으로 데이터 증강으로 기능할 수 있는지 평가하는 것.

제안 방법

  • 다중 작업을 위한 공유 파rameter를 갖는 인코더-디코더 아키텍처를 사용하여 다중 작업 학습을 가능하게 한다.
  • 입력 사진이 사진 도메인을 떠나지 않고도 인코더와 디코더를 통해 재구성되는 방식으로 단순 순환 일치를 도입한다. 즉, D(E(photo)) → photo.
  • 프레임워크는 세 가지 주요 작업을 통합한다: (1) 지도 학습 기반 사진-스케치 번역 D(E(photo)) → sketch, (2) 역스케치-사진 번역 D(E(sketch)) → photo, (3) 두 도메인 모두에 대한 도메인 내 재구성.
  • 잠재 공간에서 다수의 서로 다른 스케치를 동일한 입력에서 생성할 수 있도록, 사진 인코더에 변동형 오토인코더 스타일의 KL 손실을 적용한다.
  • 재구성, 순환 일치, 생성적 적대적 목적을 조합한 다중 작업 손실을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 미사용된 테스트 사진에서 합성 스케치를 생성하고, 이를 FG-SBIR 모델의 사전 훈련에 활용함으로써 후속 성능 향상을 이룬다.

실험 결과

연구 질문

  • RQ1매우 다양하게 변동하는 인간 스케치 지도 학습 조건에서도, 단일 사진으로부터 고품질의 추상적이고 의미적으로 유의미한 스케치를 생성할 수 있는가?
  • RQ2같은 도메인 내에서 입력을 재구성하는 단순 순환 일치를 도입할 경우, 전체 순환 일치 대비 스케치 생성 품질이 향상되는가?
  • RQ3모델이 생성한 합성 스케치가 정교한 스케치 기반 이미지 검색(FG-SBIR) 성능 향상에 효과적인 데이터 증강으로 기능할 수 있는가?
  • RQ4인식 및 검색 정확도 측면에서 인간 스케치와 최신 기술 대비 모델의 성능은 어떻게 비교되는가?

주요 결과

  • ShoeV2 데이터셋에서 제안된 모델은 스케치 인식에서 53.50%의 top-1 정확도와 스케치 기반 이미지 검색에서 6.00%의 top-1 정확도를 달성하여, 인간 스케치까지 포함한 모든 경쟁 모델을 앞서며 우수한 성능을 보였다.
  • 작은 ChairV2 데이터셋에서는 스케치 인식에서 13.00%의 top-1 정확도와 검색에서 8.00%의 top-1 정확도를 기록하여, 강력한 CycleGAN-S 기준선을 초월했다.
  • 모델의 성능는 우연의 경우(ShoeV2에서 0.5% acc.@1, ChairV2에서 1%)보다도 유의미하게 높아, 합성 스케치가 개체 식별 가능한 세부 정보를 유지하고 있음을 시사한다.
  • FG-SBIR에서 데이터 증강으로 사용했을 때, 합성 스케치는 모델의 top-1 정확도를 2.10%포인트 향상시켰다(30.33% → 32.43%).
  • 잠재 공간 샘플링을 통해 동일한 입력에서 다양한 전역 일관성을 갖춘 스케치를 생성함으로써, 모델이 동일한 객체에 대해 여러 가지 타당한 해석을 생성할 수 있음을 입증했다.
  • 스케치는 단순한 래스터화된 복제본과는 다르게 의미적으로 추상적이며, 실질적인 스트로크 수준의 렌더링(예: 양말 끈, 의자 다리 등)을 통해 시각적으로 구분 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.